🔥 Ultra-FineWeb-L1 is here -- 1T+ tokens of high-quality web data are now available! High-quality …
DịchOpenBMB vừa công bố Ultra-FineWeb-L1, bộ dữ liệu tiếng Anh tinh lọc với hơn 1 nghìn tỷ token, được tối ưu hóa qua quy trình lọc và khử trùng lặp nghiêm ngặt nhằm nâng cao hiệu suất cho các mô hình ngôn ngữ lớn.
Nghiên cứu giới thiệu khung làm việc mới giúp LLM vượt qua giới hạn của dữ liệu kể chuyện truyền thống, tạo ra 50.000 mẫu văn bản chất lượng cao thuộc 13 thể loại sáng tạo khác nhau như kịch bản, lời bài hát và thiết kế game.
SoftVTBench cung cấp 4.000 dữ liệu trình diễn đa phương thức, giúp robot thao tác vật thể mềm chính xác hơn thông qua chỉ số DSR (tỷ lệ thành công nhận thức biến dạng), khắc phục tình trạng các mô hình hiện nay bỏ qua sai số hình học.
Nghiên cứu đề xuất hạ tầng dữ liệu mới giúp tối ưu hóa khả năng tạo ảnh thông qua việc kết hợp giám sát chuyên biệt và lập lịch học tập, tạo ra kho dữ liệu khổng lồ để huấn luyện các mô hình khuếch tán đa phương thức từ con số không.
Amazon đang bị cáo buộc thu mua hàng loạt sách hiếm, cắt bỏ gáy để quét dữ liệu phục vụ huấn luyện AI. Dù hãng khẳng định đây là hoạt động thương mại hợp pháp, hành động này gây tranh cãi lớn về việc tiêu hủy tài liệu văn hóa quý giá để tránh rủi ro 'sụp đổ mô hình'.
404 Media phát hiện các đơn hàng sách lớn được chuyển đến cơ sở của Amazon tại Las Vegas, nơi nhân viên xác nhận sách bị phá hủy để quét dữ liệu phục vụ huấn luyện AI.
Điều tra từ 404 Media cho thấy Amazon đã cắt bỏ gáy sách để quét dữ liệu huấn luyện mô hình AI Nova, làm hư hại hoàn toàn các ấn phẩm gốc. Vụ việc làm dấy lên tranh luận về bản quyền khi tòa án trước đó từng coi hành vi này là 'sử dụng hợp lý'.
Điều tra từ 404 Media cho thấy Amazon thu mua và phá hủy hàng loạt sách quý để cắt gáy, quét dữ liệu phục vụ huấn luyện mô hình AI Nova, một hành vi gây tranh cãi về đạo đức và bản quyền.
Các nhà nghiên cứu giới thiệu LittleCurriculum, bộ dữ liệu 88 tỷ token giới hạn kiến thức ở trình độ tiểu học, nhằm tạo ra LittleLearner - mô hình AI có khả năng kiểm soát và giải mã quá trình tiếp thu kiến thức một cách minh bạch.
Twitch mặc định sử dụng nội dung của người sáng tạo để huấn luyện AI cho Amazon, buộc streamer phải tự tay tắt tính năng này. Động thái này gây tranh cãi lớn vì Twitch thừa nhận nếu không làm vậy, sẽ chẳng ai tự nguyện tham gia.
Giới buôn sách lo ngại các công ty AI đang mua gom sách hiếm rồi tháo rời để quét dữ liệu huấn luyện. Dù đây là cách số hóa nhanh nhất, cộng đồng yêu sách lo sợ nhiều ấn bản quý giá sẽ vĩnh viễn biến mất.
DịchDự án OpenCode Go chính thức ghi nhận ngày đầu tiên đạt ngưỡng huấn luyện 10 nghìn tỷ (10T) token, đánh dấu bước tiến quan trọng trong quy mô dữ liệu.