Tin ngành
Sau Seed và Flow, ByteDance thành lập đơn vị AI chuyên trách về dữ liệu
(giờ Việt Nam)
Tóm tắt AI
ByteDance vừa thiết lập một bộ phận chuyên về dữ liệu và bảo mật AI nhằm tối ưu hóa quy trình vận hành dữ liệu nội bộ phục vụ việc huấn luyện các mô hình nền tảng.
Bản dịch AI

36Kr đã tìm hiểu từ nhiều nguồn độc lập rằng ByteDance vừa thành lập một đơn vị kinh doanh cấp cao mới chuyên về dữ liệu và bảo mật cho trí tuệ nhân tạo (AI). Đơn vị này có vị thế ngang hàng với các đơn vị kinh doanh lớn khác như Seed, Flow và Douyin, do Adam Wang lãnh đạo.
Đây là đơn vị cấp cao mới nhất của ByteDance tập trung vào AI, tiếp nối sự ra đời của Seed và Flow vào cuối năm 2023. Trước khi đảm nhận vai trò hiện tại, Wang từng là người đứng đầu bộ phận trách nhiệm nền tảng và phụ trách mảng phát trực tiếp (live streaming) tại TikTok. Một người thân cận với công ty cho biết: “Mảng kinh doanh live streaming mà Wang quản lý từng là một trong những nguồn doanh thu lớn nhất của TikTok, và ông ấy có bề dày thành tích ấn tượng tại ByteDance”.
36Kr đã liên hệ với ByteDance để yêu cầu bình luận, nhưng công ty chưa phản hồi tính đến thời điểm xuất bản.
Sau khi hoàn thiện các tổ chức về mô hình và sản phẩm, ByteDance hiện đang chuyển hướng tập trung trực tiếp hơn vào dữ liệu AI.
Theo 36Kr, tiền thân của đơn vị mới này là một nhóm dữ liệu được thành lập vào năm 2023 bởi Fu Yue, một thành viên trong đội ngũ sáng lập TikTok. Nhóm này ban đầu có khoảng 100 nhân viên, hỗ trợ các mảng kinh doanh ở nước ngoài như Dola (phiên bản quốc tế của Doubao) và TikTok, trước khi chịu trách nhiệm thu mua và kiểm soát chất lượng dữ liệu cho việc huấn luyện mô hình của Seed. Đội ngũ này bao gồm các quản lý sản phẩm, kỹ sư dữ liệu, chuyên viên thu mua, nhân viên kiểm soát chất lượng và vận hành, cùng các nhân sự về bảo mật và tuân thủ.
Ngoài nhóm đó, đơn vị dữ liệu và bảo mật AI đã hợp nhất một số nhóm dữ liệu AI vốn trước đây nằm rải rác trong công ty, bao gồm nền tảng DMC của tập đoàn và nhân sự từ nền tảng dữ liệu AI (AIDP) thuộc Flow.
Một số người am hiểu vấn đề chia sẻ với 36Kr rằng quá trình tích hợp và thành lập chính thức đơn vị mới bắt đầu từ đầu tháng 6. Do việc hợp nhất trải rộng trên nhiều bộ phận với các trách nhiệm chồng chéo, ByteDance vẫn đang trong quá trình làm rõ cơ cấu tổ chức và nhân sự.
Một số người thân cận với đơn vị mới cho biết tổ chức hợp nhất này sẽ là một đội ngũ dữ liệu lớn hỗ trợ cả các mô hình nền tảng (foundation models) lẫn các nhóm kinh doanh. Chức năng cốt lõi của đơn vị là cung cấp các dịch vụ dữ liệu đa phương thức cho tất cả các mô hình nền tảng của ByteDance. Trách nhiệm của họ sẽ bao gồm toàn bộ quy trình sản xuất dữ liệu, từ thiết lập tiêu chuẩn, tìm kiếm và thu mua, tổng hợp và làm sạch dữ liệu, cho đến đánh giá chất lượng.
Tại một cuộc họp toàn thể của Seed vào cuối tháng 7, Zhang Yiming, người hiếm khi xuất hiện trước công chúng trong những năm gần đây, khẳng định ByteDance sẽ “kiên quyết từ chối chưng cất” (distillation) trong nỗ lực phát triển các mô hình nền tảng.
Tại cuộc họp toàn thể của ByteDance vào ngày 5 tháng 8, CEO Liang Rubo cũng nhấn mạnh: “Các mô hình ngôn ngữ lớn của ByteDance sẽ kiên quyết giữ vững định hướng tự phát triển. Chúng ta cần xây dựng nền tảng thật tốt, chấp nhận tụt hậu trong ngắn hạn và tiếp tục tối ưu hóa cho dài hạn. Quan trọng nhất là không được mất phương hướng”.
Việc chú trọng phát triển mô hình nội bộ này có khả năng khiến dữ liệu trở nên quan trọng hơn nữa đối với các nỗ lực AI của ByteDance.
Ngoài ByteDance, động thái này cho thấy một sự chuyển dịch rộng lớn hơn trong ngành công nghiệp AI toàn cầu. Khi nguồn cung dữ liệu internet công cộng chất lượng cao ngày càng khan hiếm, các nhà phát triển mô hình đang đặt trọng tâm lớn hơn vào dữ liệu chất lượng cao được tạo ra thông qua các hoạt động và quy trình làm việc thực tế.
Bên trong hoạt động dữ liệu của ByteDance
ByteDance đã đầu tư mạnh mẽ vào dữ liệu AI so với nhiều công ty công nghệ lớn khác của Trung Quốc.
Một lý do là nguyên tắc “không chưng cất” của Seed. ByteDance đặt mục tiêu đưa hầu hết các mô hình của mình đạt đẳng cấp hàng đầu thế giới, hoặc thậm chí là hiệu suất tiên tiến nhất, một mục tiêu mà họ tin rằng không thể đạt được chỉ bằng cách chưng cất. Điều này làm tăng nhu cầu tìm kiếm, tổng hợp, làm sạch và đánh giá dữ liệu huấn luyện ngay trong nội bộ.
Quy mô là rất đáng kể. Theo 36Kr, hơn 1.000 người tại ByteDance đã tham gia vào việc đánh giá dữ liệu mô hình chỉ riêng cho Seedance. Với mỗi kỹ sư thuật toán Seedance, thường có hơn mười nhân viên dữ liệu hỗ trợ.
Điều này trái ngược với nhiều startup AI video, nơi các đội ngũ đánh giá nội bộ có thể chỉ có vài chục người.
Nhiều chuyên gia trong ngành đã mô tả thành công của Seedance 2.0 là “một thắng lợi của dữ liệu”.
ByteDance vẫn tiếp tục tăng cường đầu tư vào lĩnh vực này.
Sự gia tăng này thể hiện rõ trong ngân sách. 36Kr trước đó đã đưa tin rằng ngân sách dữ liệu của ByteDance cho việc huấn luyện các mô hình thế giới (world models) và mô hình lập trình đã đạt con số 8 chữ số USD vào đầu năm 2026, với chỉ thị rằng ngân sách có thể được tăng thêm nếu cần thiết.
36Kr cũng tìm hiểu được rằng các nhóm dữ liệu của ByteDance đã áp dụng hệ thống phân công các nhóm song song cùng giải quyết một vấn đề và so sánh kết quả. Nội bộ các nhóm được chia theo lĩnh vực, bao gồm mô hình thế giới, mã nguồn và các chuyên ngành nâng cao. Khi hiệu quả kinh tế của các mô hình trở nên rõ ràng hơn, ByteDance cũng yêu cầu các dự án dữ liệu cá nhân phải tính toán tỷ suất hoàn vốn (ROI).
Các công ty công nghệ lớn khác cũng đang tăng cường đầu tư vào dữ liệu. Tencent, đơn vị đã đẩy mạnh công việc về mô hình nền tảng vào năm ngoái, đã tuyển dụng nhân sự từ các nhóm dữ liệu của ByteDance trong sáu tháng qua, đưa ra mức lương cho một số ứng viên cao gấp ba lần thu nhập trước đó của họ.
Cả Alibaba và Tencent đều đã tăng ngân sách thu mua dữ liệu. Một người trong ngành chia sẻ với 36Kr rằng các công ty công nghệ lớn hiện đang áp dụng nhiều chiến lược độc quyền dữ liệu khác nhau, chẳng hạn như thiết lập thời hạn độc quyền cho các tập dữ liệu hoặc tạm thời đảm bảo quyền truy cập độc quyền vào các nhân sự chủ chốt từ phía nhà cung cấp.
Tuy nhiên, thị trường dữ liệu năm 2026 đang đối mặt với sự mất cân bằng cơ bản: các công ty AI có nhu cầu rất lớn, trong khi dữ liệu chất lượng cao vẫn còn hạn chế. Sự hạn chế này kéo dài từ giai đoạn tiền huấn luyện đến hậu huấn luyện.
Đối với ByteDance, thách thức trọng tâm sẽ là làm sao để một tổ chức dữ liệu khoảng 1.000 người luôn phản ứng kịp thời với những thay đổi nhanh chóng ở biên giới phát triển mô hình. Khi năng lực mô hình tiếp tục tiến hóa, những loại dữ liệu khan hiếm ngày nay có thể sẽ giảm giá trị đáng kể sau sáu tháng nữa.
Dữ liệu trở thành tâm điểm của cuộc cạnh tranh mô hình toàn cầu
Trong năm qua, các nhà phát triển mô hình nền tảng trên khắp thế giới đã phải đối mặt với một hạn chế chung: khi các phương pháp suy luận hội tụ và những cải tiến từ thay đổi kiến trúc trở nên khó đạt được hơn, dữ liệu đã đóng vai trò quan trọng hơn trong việc quyết định hiệu suất mô hình.
Các công ty mô hình nền tảng hàng đầu ở nước ngoài cũng đang chi tiêu cho dữ liệu nhiều gấp nhiều lần so với ByteDance và các công ty công nghệ lớn khác của Trung Quốc. Ngân sách dữ liệu bên ngoài tại các công ty mô hình hàng đầu ở Thung lũng Silicon đang tăng thêm hàng tỷ USD mỗi năm. Ví dụ, Anthropic đã phân bổ hơn 1 tỷ USD cho dữ liệu học tăng cường (reinforcement learning) chỉ riêng trong năm 2025.
Khoản chi tiêu đó đã góp phần thúc đẩy sự tăng trưởng nhanh chóng của các nhà cung cấp dữ liệu tại Thung lũng Silicon. Một ví dụ là Mercor, một startup có doanh thu hàng năm tăng từ 500 triệu USD năm ngoái lên 2 tỷ USD vào giữa năm nay. Khoảng 91% doanh thu của họ đến từ các công ty mô hình hàng đầu như OpenAI và Anthropic, trong khi định giá của công ty đã tăng lên 20 tỷ USD. Công ty này mới chỉ được thành lập cách đây ba năm.
Tại sao dữ liệu lại trở nên quan trọng như vậy? Một lý do là nguồn dữ liệu internet công cộng chất lượng cao, dễ tiếp cận đã ngày càng trở nên khan hiếm.
Trong ba năm qua, dữ liệu cần thiết cho việc huấn luyện mô hình đã chuyển dịch ngày càng nhiều từ phạm vi công cộng sang các nguồn riêng tư. Internet công cộng chứa một lượng lớn báo cáo và tài liệu, nhưng nó lại ghi lại ít hơn quá trình con người tạo ra các kết quả đó, chẳng hạn như cách xử lý các yêu cầu mơ hồ, thu thập bối cảnh, phạm sai lầm và sửa chữa chúng.
Ví dụ, ngoài lập trình, các mô hình đa năng vẫn gặp khó khăn với các tác vụ chuyên môn cao trong các lĩnh vực như y học, luật và nghiên cứu khoa học. Khi các nhà phát triển tìm cách cải thiện mô hình cho các tác vụ cấp chuyên gia, họ cần một lượng lớn “dữ liệu quy trình” được tạo ra một cách tự nhiên. Dữ liệu như vậy thường được nhúng trong các quy trình làm việc thực tế, bao gồm các kho lưu trữ mã nguồn nội bộ và các hồ sơ do nhân viên tạo ra trong công việc hàng ngày.
Kết quả là, quyền truy cập vào dữ liệu độc quyền đang trở thành một mặt trận cạnh tranh ngày càng quan trọng đối với các công ty mô hình nền tảng.
KrASIA giới thiệu các nội dung được dịch và chuyển thể từ 36Kr. Bài viết này do Deng Yongyi thực hiện cho 36Kr.
Bài viết được AI dịch và tổng hợp tự động từ KrASIA. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.