Together AI Nghiên cứuSản phẩmBlog
85

Sản phẩm

Together AI nâng cấp dịch vụ tinh chỉnh: Hỗ trợ mô hình mới và công cụ theo dõi thời gian thực

(giờ Việt Nam)

Tóm tắt AI

Together AI bổ sung hỗ trợ cho các dòng mô hình mới như GLM-5.3, Kimi K2.7 và Qwen 3.5, đồng thời tích hợp tính năng theo dõi thử nghiệm trực tiếp và kiểm soát dữ liệu chuyên sâu.

Bản dịch AI

Together AI expands fine-tuning service with more models, live metrics, and finer controls

Việc biến một mô hình open-weight thành một mô hình hiệu năng cao cho tác vụ của bạn đòi hỏi một chuỗi các thử nghiệm được đo lường kỹ lưỡng. Các đội ngũ cần hiểu rõ mô hình sẽ được huấn luyện trên dữ liệu gì, theo dõi tiến độ của từng lần chạy, điều chỉnh công thức huấn luyện và xác định checkpoint nào mang lại hiệu quả tốt nhất.

Hôm nay, chúng tôi mở rộng Together Fine-Tuning trên toàn bộ quy trình làm việc đó. Bản phát hành này bổ sung hỗ trợ cho các mô hình open-weight mới nhất, theo dõi thử nghiệm trực tiếp, kiểm soát chi tiết hơn đối với quá trình huấn luyện và xử lý dữ liệu, cùng mức giá thấp hơn cho một số mô hình được chọn.

Bạn cũng có thể kiểm tra và xác thực tập dữ liệu trước khi huấn luyện, so sánh các lần chạy khi chúng đang diễn ra và dừng lại khi validation loss đạt trạng thái bão hòa.

Các mô hình mới

Các mô hình open-weight mới đang xuất hiện với tốc độ chưa từng có, với gần như mọi bản phát hành đều nâng cao tiêu chuẩn về chất lượng, hiệu quả hoặc cả hai. Các đội ngũ muốn đưa những tiến bộ này vào sản xuất một cách nhanh chóng mà không phải mất hàng tuần để giải quyết các thách thức kỹ thuật của từng kiến trúc mới.

Đối với các tác vụ cần hiệu năng tiên phong, bạn có thể chuyển sang các mô hình lớn và mạnh mẽ nhất như GLM-5.3 và Kimi K2.7. Ví dụ, GLM-5.3 đạt 88.2 điểm trên Terminal-Bench 2.1, chỉ cách các mô hình độc quyền hàng đầu chưa đầy một điểm. Các đội ngũ khác ưu tiên hiệu năng và chi phí, lựa chọn các mô hình như Qwen 3.8-27B hoặc Gemma 4. Đối với các ứng dụng cục bộ và trên thiết bị, dòng Qwen 3.5 cung cấp các tùy chọn từ 0.8B đến 9B tham số.

Together Fine-Tuning hỗ trợ tất cả các mô hình này trên nhiều quy mô khác nhau, với các tối ưu hóa hàng đầu về hệ thống và thuật toán được tích hợp sẵn. Chỉ cần gửi một tác vụ huấn luyện, chúng tôi sẽ xử lý sự phức tạp đặc thù của kiến trúc ở phía sau. Các bổ sung mới nhất bao gồm:

Xem danh sách đầy đủ các mô hình được hỗ trợ cùng với độ dài ngữ cảnh của chúng trong tài liệu của chúng tôi.

Theo dõi thử nghiệm

Quỹ đạo của một lần chạy càng sớm được hiển thị, thì quyết định tiếp theo càng sớm được đưa ra - điều chỉnh dữ liệu, thay đổi siêu tham số hoặc để nó hoàn tất. Các tác vụ fine-tuning hiện ghi lại các chỉ số tại mỗi bước huấn luyện và đánh giá, đồng thời hiển thị trực tiếp thông qua Together API, CLI và bảng điều khiển UI. Các chỉ số, trạng thái tác vụ và artifact đều nằm ở một nơi, vì vậy bạn có thể duy trì trên cùng một nền tảng trong suốt hành trình phát triển mô hình.

Mỗi lần chạy đều ghi lại các tín hiệu huấn luyện cốt lõi: loss, gradient norm, learning rate. Khi bạn thêm một tập validation, loss và các chỉ số đánh giá sẽ được theo dõi cùng với các chỉ số huấn luyện.

Trong bảng điều khiển, mỗi tác vụ đều có tab Metrics với các đường cong cập nhật ngay khi lần chạy đang diễn ra - và bạn có thể chọn nhiều tác vụ để vẽ chúng cùng nhau trên một hệ trục, giúp việc so sánh trở nên trực quan thay vì phải mở hàng chục tab trình duyệt. Bạn cũng có thể thực hiện tương tự thông qua Python SDK của chúng tôi: một lệnh, đường cong hiển thị ngay trong terminal, không cần chuyển đổi ngữ cảnh.

Metrics tab of a fine-tuning job showing live loss, gradient norm and learning rate curves for two runs.Comparison view charting the training loss of two fine-tuning jobs on one set of axes.Terminal running together fine-tuning list-metrics, plotting loss, gradient norm and learning rate in place.

API trả về chuỗi dữ liệu cơ bản - mọi bước được ghi lại, được lọc theo phạm vi hoặc downsampled. Bằng cách này, bạn có thể đưa các chỉ số vào notebook, các bảng điều khiển nội bộ hiện có hoặc bất kỳ đích đến nào khác.

Xem thêm chi tiết trong tài liệu của chúng tôi.

Kiểm soát huấn luyện tốt hơn

Expert LoRA

Trong một mô hình Mixture-of-Experts, hơn 90% tham số và hầu hết những gì mô hình thực sự biết đều nằm trong các lớp chuyên gia (expert layers). Fine-tuning bằng LoRA tiêu chuẩn không bao giờ tác động đến chúng: các adapter gắn vào cơ chế attention trong khi các chuyên gia vẫn bị đóng băng. Giờ đây, bạn có thể đặt các adapter LoRA trực tiếp lên các chuyên gia, để tác vụ của bạn có thể huấn luyện các lớp chứa tri thức đó.

Sự khác biệt thể hiện rõ ở bất cứ nơi nào tác vụ yêu cầu mô hình học một điều gì đó thực sự mới. Chúng tôi đã dạy các mô hình 200 sự kiện được tạo ra (vì các mô hình cơ sở không biết bất kỳ sự kiện nào trong số đó): các adapter bao gồm các lớp chuyên gia đã ghi nhớ tới 89% tri thức mới, trong khi các adapter chỉ tập trung vào attention chỉ đạt tối đa 15% trên cùng một mô hình. Chúng cũng giữ lại được nhiều tri thức hiện có của mô hình hơn và giành chiến thắng tuyệt đối trong MMLU-Pro, với tỷ lệ 75.3% so với 71.5%.

Bar chart: expert-touching LoRA beats attention-only adapters on knowledge injection, memorization and locality for gemma-4-26B-A4B and Qwen3.6-35B-A3B.Line chart of dead experts as a share of routed experts across training steps: attention-only training lets experts die while expert LoRA keeps them engaged.

Động lực huấn luyện giải thích cho khoảng cách này: với các adapter chỉ tập trung vào attention, một phần ngày càng tăng của các chuyên gia được định tuyến đơn giản là không còn được sử dụng trong quá trình fine-tuning, trong khi expert adapters giữ cho toàn bộ hỗn hợp (mixture) luôn hoạt động.

Việc kích hoạt expert adapters rất đơn giản: chỉ cần thêm các module chuyên gia vào lora_trainable_modules. Phần còn lại của quy trình fine-tuning vẫn giữ nguyên như bất kỳ tác vụ LoRA nào khác.

Dừng sớm (Early stopping)

Các tác vụ fine-tuning giờ đây có thể tự động kết thúc khi chúng không còn cải thiện thêm. Điều đó có nghĩa là bạn nhận được mô hình tốt nhất, không chỉ là mô hình cuối cùng, và bạn không phải trả tiền cho việc huấn luyện không còn mang lại hiệu quả. Hãy kích hoạt early stopping, cung cấp một tập validation, và chúng tôi sẽ theo dõi validation loss của bạn tại mỗi lần đánh giá. Khi đường cong bão hòa, chúng tôi sẽ dừng lần chạy, giữ lại checkpoint có validation loss tốt nhất làm mô hình cuối cùng của bạn và tự động hoàn tiền cho mọi bước huấn luyện bạn không sử dụng.

Độ kiên nhẫn (patience), độ nhạy với các cải tiến nhỏ và warmup đều có thể điều chỉnh khi bạn muốn kiểm soát chi tiết hơn. Tham khảo thông số đầy đủ có trong tài liệu.

Hỗ trợ kích thước batch tùy ý

Một số tác vụ cần kích thước batch không thể nằm vừa trong bộ nhớ GPU: các chuỗi dài, mô hình lớn hoặc công thức được tinh chỉnh cho một batch toàn cục lớn. Giờ đây, bạn có thể huấn luyện với bất kỳ kích thước batch hiệu dụng nào bạn muốn, bất kể nó có vừa trong một lần chạy hay không. Thiết lập gradient_accumulation_steps và các gradient sẽ tích lũy qua các micro-batch trước mỗi lần cập nhật bộ tối ưu hóa, tạo ra một batch hiệu dụng bằng batch_size x gradient_accumulation_steps. Chi tiết có trong tài liệu.

Giảm giá

Tại Together, chúng tôi tin rằng trí tuệ nên được phổ cập, và chúng tôi tận dụng tất cả các hệ thống và tối ưu hóa thuật toán hiện có để mang lại giá trị cao nhất cho khách hàng. Chúng tôi tiếp tục tối ưu hóa stack huấn luyện của mình và muốn chuyển các khoản giảm chi phí đến người dùng. Do đó, chúng tôi đang giảm giá huấn luyện cho hầu hết các mô hình mà chúng tôi hỗ trợ, với mức tiết kiệm từ 30% và lên đến 70% cho các mô hình như dòng gpt-oss.

Dưới đây là một số thay đổi về giá cho việc huấn luyện LoRA adapter trên mỗi 1 triệu token:

Bảng giá đầy đủ có sẵn trên trang định giá của chúng tôi.

Nghiên cứu điển hình: Cách Adaption tự động hóa việc huấn luyện cho các mô hình mở lên đến 1T trên Together

Adaption là một công ty nghiên cứu AI tiên phong xây dựng trí tuệ có khả năng học tập liên tục, phát triển thông qua dữ liệu và môi trường trực tiếp thay vì huấn luyện tĩnh và các chu kỳ huấn luyện lại tốn kém. Nghiên cứu của họ trải dài trên ba trụ cột:

AutoScientist, một phần của Adaptive Intelligence, tự động hóa toàn bộ vòng lặp nghiên cứu đằng sau việc huấn luyện mô hình. Trong khi Adaptive Data định hình các đầu vào, AutoScientist định hình chính mô hình: bạn đặt ra kết quả mong muốn, và vòng lặp sẽ tìm kiếm các công thức huấn luyện, tối ưu hóa dữ liệu, huấn luyện và đánh giá, xoay vòng qua cả bốn thay vì mặc định sử dụng các siêu tham số chung chung.

Nó tinh chỉnh các lựa chọn của mình sau mỗi lần chạy cho đến khi chất lượng hội tụ theo mục tiêu của bạn. Nó hỗ trợ cả LoRA và fine-tuning toàn diện trên các mô hình mở hàng đầu lên đến 1T tham số, với việc huấn luyện được cung cấp bởi nền tảng fine-tuning của Together và đánh giá được thực hiện trên các endpoint chuyên dụng của Together. Kết quả là một vòng lặp khép kín giúp mô hình không ngừng cải thiện mà không cần nỗ lực thủ công hoặc chi phí huấn luyện lại vốn dĩ sẽ rất tốn kém.

Xử lý dữ liệu linh hoạt và minh bạch

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Together AI Nghiên cứuSản phẩmBlog. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.