Sản phẩm
Adaption Labs ra mắt Invent a Dataset: Tự động tạo dữ liệu huấn luyện từ mô tả văn bản
(giờ Việt Nam)
Tóm tắt AI
Adaption Labs giới thiệu tính năng Invent a Dataset, cho phép tạo bộ dữ liệu huấn luyện trực tiếp từ mô tả nhiệm vụ mà không cần dữ liệu mẫu hay hướng dẫn gán nhãn phức tạp.
Bản dịch AI

Tuần này, Adaption Labs đã ra mắt Invent a Dataset. Tính năng này tạo ra một tập dữ liệu có cấu trúc, sẵn sàng cho việc huấn luyện từ mô tả về hành vi mà bạn muốn mô hình học được. Bạn không cần phải có sẵn kho dữ liệu gốc (seed corpus), lược đồ định nghĩa trước hay hướng dẫn gán nhãn.
Nó có thể triển khai được không? Có, với một lưu ý nhỏ. Invent a Dataset hiện đã hoạt động trên ứng dụng Adaption và thông qua Python SDK cũng như REST API. Các hàng dữ liệu được tạo ra có thể tải xuống dưới định dạng JSONL, JSON, CSV hoặc Parquet, vì vậy đây là một tệp di động mà bạn sở hữu và có thể sử dụng để huấn luyện ở bất cứ đâu. Bản thân quá trình tạo dữ liệu chạy trên nền tảng lưu trữ của Adaption và tiêu tốn tín dụng (credits). Hiện chưa có tài liệu nào về phương thức tự lưu trữ (self-hosted) cho quá trình tạo dữ liệu này.
Vấn đề được nhắm đến
Hầu hết các quy trình làm việc với tập dữ liệu đều bắt đầu bằng dữ liệu đã tồn tại sẵn. Sau đó, các nhóm phải mất hàng tuần để gán nhãn, lọc và định hình lại dữ liệu đó nhằm tiệm cận với tác vụ mục tiêu. Lập luận của Adaption là cách làm này giới hạn chất lượng mô hình ở mức độ tương thích giữa dữ liệu hiện có và hành vi dự kiến. Đối với các tác vụ chuyên biệt và độc quyền, tín hiệu liên quan thường nằm trong các hệ thống nội bộ, văn bản phi cấu trúc hoặc nhật ký quy trình làm việc. Nó hiếm khi chuyển đổi một cách trơn tru thành một tập dữ liệu huấn luyện tập trung.
Nhóm nghiên cứu cũng vạch ra ranh giới với các công cụ dữ liệu tổng hợp hiện có. Những công cụ đó tự động hóa việc tạo dữ liệu sau khi con người đã xác định lược đồ, phân bổ tác vụ và chiến lược tạo. Invent a Dataset bắt đầu sớm hơn một bước, ngay từ chính hành vi đó.
Cách thức hoạt động của API
Các cơ chế được ghi lại cụ thể và rõ ràng. Một lệnh gọi duy nhất tới datasets.invent sẽ tạo tập dữ liệu và bắt đầu quá trình tạo, trả về ngay lập tức trạng thái running. Sau đó, bạn thực hiện truy vấn datasets.get cho đến khi trạng thái hiển thị succeeded hoặc failed, rồi tải các hàng dữ liệu xuống.
Mã miền (domain codes) là công cụ kiểm soát chính. Bạn lấy các mã hiện tại bằng datasets.invent_domains thay vì mã hóa cứng (hardcoding) chúng. Sau đó, bạn truyền các giá trị như medical, tùy chọn thu hẹp bằng các mã miền phụ đủ điều kiện như medical.symptoms_diagnosis. Yêu cầu bắt buộc là phải có ít nhất một miền hoặc miền phụ. Nhiều miền có thể đóng góp vào cùng một lần chạy. Một miền được truyền mà không có miền phụ sẽ lấy dữ liệu từ toàn bộ phạm vi của nó.
Hai định dạng đầu ra được hỗ trợ. instruction_dataset là mặc định và tạo ra các cặp prompt-completion cho việc tinh chỉnh có giám sát (supervised fine-tuning). preference_pairs tạo ra các cặp hoàn thiện được chọn và bị từ chối cho việc huấn luyện dựa trên sở thích như DPO.
Ba tham số quan trọng cho việc sử dụng trong sản xuất. estimate=True định giá yêu cầu chính xác và trả về số tín dụng ước tính so với số tín dụng khả dụng mà không tạo hoặc tính phí bất cứ điều gì. prompt chấp nhận tối đa 10.000 ký tự để điều hướng nội dung thực tế của các hàng dữ liệu. idempotency_key chấp nhận tối đa 255 ký tự và giúp việc thử lại mạng an toàn bằng cách trả về tập dữ liệu gốc thay vì khởi chạy lần chạy thứ hai. Số lượng hàng dữ liệu phải tuân theo giới hạn mỗi lần khởi chạy được thiết lập bởi gói dịch vụ của bạn.
Mở rộng ngôn ngữ và ngôn ngữ địa phương (locale)
language_expansion chạy ở hai chế độ. translate tạo ra một biến thể hàng mới cho mỗi ngôn ngữ mục tiêu. localize tạo ra một biến thể cho mỗi cặp quốc gia và ngôn ngữ, sử dụng cách diễn đạt đặc thù của địa phương thay vì dịch trực tiếp. Tỷ lệ lấy mẫu (sample_rate) từ 0.01 đến 1 kiểm soát tỷ lệ phần trăm các hàng được tạo ra sẽ được mở rộng, và tín dụng được tính dựa trên số lượng hàng đầu ra đã mở rộng, không phải hàng gốc. Các mã không được hỗ trợ sẽ trả về lỗi 400 cùng với một mẫu các giá trị hợp lệ.
Vòng lặp không dữ liệu (zero-data loop)
Invent a Dataset là nửa đầu của một vòng lặp. ID tập dữ liệu được truyền trực tiếp tới autoscientist.create, giúp đồng tối ưu hóa dữ liệu và công thức huấn luyện dựa trên mục tiêu của bạn. AutoScientist ra mắt vào tháng 5 năm 2026 và là đối tác phía huấn luyện cho trụ cột Adaptive Data.
Adaption báo cáo rằng AutoScientist vượt trội hơn so với việc huấn luyện được cấu hình bởi chính đội ngũ nghiên cứu của họ, với mức trung bình là 35%. Tỷ lệ thắng tăng từ 48% lên 64%. Những con số đó đến từ các đánh giá chuyên môn nội bộ trên tám lĩnh vực. Quy mô tập dữ liệu dao động từ 5.000 đến 100.000 hàng, trên các kiến trúc được cung cấp để tinh chỉnh bởi Together AI.
Những điểm chính cần lưu ý
Xem chi tiết kỹ thuật tại đây. Ngoài ra, hãy thoải mái theo dõi chúng tôi trên Twitter và đừng quên tham gia SubReddit 150k+ ML của chúng tôi và Đăng ký Bản tin của chúng tôi. Khoan đã! bạn có dùng Telegram không? bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.
Cần hợp tác với chúng tôi để quảng bá GitHub Repo, Trang Hugging Face, Bản phát hành sản phẩm hoặc Hội thảo trực tuyến của bạn, v.v.? Hãy kết nối với chúng tôi.

Michal Sutter là một chuyên gia khoa học dữ liệu với bằng Thạc sĩ Khoa học Dữ liệu từ Đại học Padova. Với nền tảng vững chắc về phân tích thống kê, học máy và kỹ thuật dữ liệu, Michal xuất sắc trong việc chuyển đổi các tập dữ liệu phức tạp thành những thông tin chi tiết có thể hành động được.
Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.