Sau 21 năm vận hành, Amazon thông báo đóng cửa nền tảng Mechanical Turk vào ngày 30/9. Sự kiện này đánh dấu bước chuyển dịch của ngành dữ liệu AI khi các công ty chuyên biệt như Scale AI đang dần thay thế mô hình gắn nhãn thủ công truyền thống.
Dù đẩy mạnh xây dựng các trung tâm huấn luyện, Trung Quốc đang thiếu hụt hơn 99% dữ liệu tương tác vật lý, khiến robot hình người khó thoát khỏi giai đoạn trình diễn.
Amazon thông báo đóng cửa nền tảng crowdsourcing Mechanical Turk (MTurk), nơi từng hỗ trợ đắc lực cho việc gắn nhãn dữ liệu và phản hồi của con người trong các mô hình AI.
Anthropic đã cung cấp 250.000 đoạn hội thoại từ Claude cho các viện nghiên cứu tại Stanford, Oxford và METR thông qua công cụ bảo mật Anthropic Insights để phục vụ các nghiên cứu độc lập.
Vì sao đáng đọc: Đây là bước đi minh bạch quan trọng trong việc nghiên cứu hành vi AI, giúp cộng đồng học thuật tiếp cận dữ liệu thực tế mà vẫn đảm bảo quyền riêng tư.
For the first time, we've given external researchers a way to study AI's impacts using real, privacy…
DịchAnthropic chính thức cung cấp dữ liệu sử dụng Claude đã được ẩn danh cho các nhà nghiên cứu bên ngoài, nhằm thúc đẩy việc đánh giá tác động của AI một cách minh bạch và khách quan hơn.
Tesla khẳng định thông tin rút đội ngũ và bỏ trống trung tâm dữ liệu FSD tại Thượng Hải là sai sự thật. Hãng vẫn đang tích cực đẩy mạnh quy trình tuân thủ dữ liệu và nội địa hóa để sớm đưa công nghệ tự lái FSD vào thị trường Trung Quốc.
Báo cáo cung cấp cái nhìn toàn diện về hệ sinh thái dữ liệu và hạ tầng thiết yếu cho sự phát triển của robot thông minh (AI hiện thân) trong giai đoạn tới, đánh dấu bước tiến quan trọng trong việc chuẩn hóa ngành công nghiệp này.
Satya Nadella nhấn mạnh doanh nghiệp cần làm chủ 'vốn Token' và dữ liệu nội bộ thay vì phụ thuộc hoàn toàn vào một nhà cung cấp AI, nhằm tránh rủi ro mất quyền kiểm soát tri thức và khả năng vận hành độc lập.
Dữ liệu từ OpenRouter chỉ ra rằng việc giảm giá mạnh các mô hình Terra và Luna đã khiến lưu lượng sử dụng token tăng lần lượt 5,6 và 13,8 lần, minh chứng cho nghịch lý Jevons trong lĩnh vực AI.
Vì sao đáng đọc: Bài viết cung cấp dữ liệu thực tế thú vị về hành vi người dùng và kinh tế học AI, giúp các nhà phát triển hiểu rõ hơn về tác động của giá cả đối với nhu cầu sử dụng.
OpenRouter went from roughly 10B tokens/week in Jan 2024, to now >90T/week in Aug 2026, a 9, 000x inc…
DịchLượng token xử lý trên OpenRouter tăng vọt từ 10 tỷ lên 900 nghìn tỷ mỗi tuần nhờ sự trỗi dậy của các tác nhân AI (AI agents), vốn tiêu thụ lượng token gấp 15 lần so với người dùng thông thường.
Noitom vừa công bố HiPHI, bộ dữ liệu chuyển động chất lượng cao với 617,5 giờ ghi hình từ 132 diễn viên, hỗ trợ huấn luyện robot thực hiện các tác vụ phức tạp như chạy, bò và bê vác vật nặng.
Dữ liệu mới từ OpenRouter cho thấy lượng Token tiêu thụ bởi AI Agent đã tăng gấp 14 lần kể từ tháng 2, hiện cao gấp 5 lần so với người dùng cá nhân. Sự bùng nổ này đánh dấu bước ngoặt khi nền kinh tế AI bắt đầu vận hành độc lập, không còn phụ thuộc vào giới hạn chú ý của con người.
Dữ liệu từ OpenRouter cho thấy lưu lượng token của AI Agent đã tăng gấp 14 lần, vượt xa mức tăng trưởng từ người dùng con người. Sự bùng nổ này chủ yếu nhờ vào việc tối ưu hóa bộ nhớ đệm (caching), đánh dấu bước ngoặt khi AI bắt đầu tự tiêu thụ tài nguyên tính toán của chính nó.
If you need one final proof that 2026 is the year of agents, here you have it. 2025 was the year o…
DịchSau năm 2025 tập trung vào suy luận, 2026 chính thức trở thành năm của AI Agent. Dữ liệu từ a16z cho thấy các tác nhân AI hiện tiêu thụ lượng token gấp 5 lần con người, tăng trưởng mạnh mẽ gấp 14 lần chỉ trong vài tháng.
Micro1 tăng trưởng thần tốc từ 100 triệu lên 500 triệu USD doanh thu nhờ cung cấp dữ liệu chuyên gia và dữ liệu tổng hợp chất lượng cao. Công ty hiện tập trung vào thị trường quốc tế và từ chối cung cấp dữ liệu cho các nhà phát triển mô hình tại Trung Quốc.
Nhóm nghiên cứu của Apple đã thực hiện hơn 2.000 thí nghiệm để tìm ra tỷ lệ tối ưu giữa dữ liệu chuyên biệt và dữ liệu phổ quát, giúp tránh tình trạng quá tải hoặc thiếu hụt dữ liệu khi huấn luyện mô hình.
🔥 Ultra-FineWeb-L1 is here -- 1T+ tokens of high-quality web data are now available! High-quality …
DịchOpenBMB vừa công bố Ultra-FineWeb-L1, bộ dữ liệu tiếng Anh tinh lọc với hơn 1 nghìn tỷ token, được tối ưu hóa qua quy trình lọc và khử trùng lặp nghiêm ngặt nhằm nâng cao hiệu suất cho các mô hình ngôn ngữ lớn.
Google đã chi 10 triệu USD mua dữ liệu nhân sự của Spirit Airlines để huấn luyện AI. Công đoàn tiếp viên hàng không lo ngại việc ẩn danh dữ liệu không đảm bảo quyền riêng tư và Google có thể tái định danh thông tin cá nhân của họ.
Dù xuất phát điểm khác nhau, OceanBase và Databricks đang dần hội tụ tại đích đến là nền tảng dữ liệu cho AI. OceanBase hiện đang gọi vốn vòng A với định giá kỳ vọng 2-3 tỷ nhân dân tệ để củng cố vị thế này.
Google đã mua lại kho dữ liệu khổng lồ từ Spirit Airlines, bao gồm hàng triệu email và bản ghi âm dịch vụ khách hàng, nhằm mục đích cải thiện các mô hình AI của mình.
Google đã bỏ ra 10 triệu USD để sở hữu kho dữ liệu nội bộ từ hãng hàng không Spirit Airlines, nhằm củng cố nguồn tài nguyên số phục vụ cho việc phát triển và huấn luyện các mô hình AI.
ConceptEdit là quy trình tự động tạo tập dữ liệu chỉnh sửa ảnh quy mô lớn thông qua ba bước: tạo lệnh bằng VLM, thực thi chỉnh sửa với FLUX và đánh giá bằng VQA, giúp tối ưu hóa việc huấn luyện các mô hình chỉnh sửa hình ảnh.
Vì sao đáng đọc: Đây là công cụ hữu ích cho cộng đồng nghiên cứu AI, giải quyết bài toán thiếu hụt dữ liệu chất lượng cao cho các mô hình chỉnh sửa ảnh, có tính ứng dụng thực tiễn cao.
Google đã vượt qua các đối thủ để sở hữu kho dữ liệu khổng lồ từ Spirit Airlines, bao gồm hàng tỷ hồ sơ giao dịch và thông tin định giá, nhằm phục vụ mục tiêu cải tiến sản phẩm và mô hình AI.
404 Media đã sử dụng AirTag gắn trong sách để phát hiện Amazon phá hủy các ấn bản quý hiếm tại cơ sở VGT3 nhằm quét dữ liệu huấn luyện mô hình AI. Sự việc này xác nhận nghi vấn của giới xuất bản về việc các công ty công nghệ đang hệ thống hóa việc thu thập sách toàn cầu.
Thông qua thiết bị định vị, 404 Media phát hiện Amazon thu mua hàng loạt sách quý để quét dữ liệu huấn luyện AI, sau đó vận chuyển đến trung tâm xử lý và tiêu hủy.
Vì sao đáng đọc: Tin tức điều tra độc quyền, vạch trần góc khuất về nguồn dữ liệu AI của các ông lớn công nghệ, có tính thời sự và tác động mạnh đến dư luận.
DịchNgười dùng báo cáo lượng tải xuống trên HuggingFace giảm 30% bất thường, nghi ngờ do thay đổi bộ lọc dữ liệu. Phía HuggingFace đã xác nhận và khắc phục sự cố này.
Số lượng câu hỏi trên Stack Overflow sụt giảm nghiêm trọng, làm dấy lên lo ngại về sự khan hiếm dữ liệu thực từ con người để huấn luyện các mô hình AI thế hệ tiếp theo.
Deta Robotics và Wuji Tech vừa ký kết hợp tác chiến lược nhằm thiết lập tiêu chuẩn chung cho việc thu thập dữ liệu vận động linh hoạt, giúp tối ưu hóa khả năng phối hợp toàn thân cho robot thế hệ mới.
i don't understand why people are bearish on data making companies what data is needed is super unc…
DịchGắn nhãn dữ liệu không chỉ là việc dùng sức người, mà đòi hỏi chuyên môn sâu, sự kết hợp giữa nhân lực quy mô lớn và quan hệ đối tác chiến lược với các phòng thí nghiệm AI, tạo nên rào cản gia nhập khó bị sao chép.
Elon Musk thông báo SpaceX sẽ sử dụng dữ liệu nội bộ và đóng góp của nhân viên để huấn luyện Grok AI, giúp mô hình này kế thừa tư duy và giá trị cốt lõi của công ty. Đồng thời, SpaceX cũng vừa ra mắt Grok Bot, một AI có khả năng tự thực thi tác vụ.
ByteDance vừa thiết lập một bộ phận chuyên về dữ liệu và bảo mật AI nhằm tối ưu hóa quy trình vận hành dữ liệu nội bộ phục vụ việc huấn luyện các mô hình nền tảng.
ByteDance vừa thiết lập một bộ phận cấp cao mới nhằm quản lý dữ liệu và an toàn cho AI, đặt dưới sự dẫn dắt của cựu giám đốc TikTok Wang Yinglei để củng cố cấu trúc vận hành công nghệ của tập đoàn.