The Decoder: AI News
85

Mô hình

Google DeepMind ra mắt DiffusionGemma: Biến mô hình ngôn ngữ thành mô hình khuếch tán mà không cần đào tạo lại

(giờ Việt Nam)

Tóm tắt AI

Google DeepMind giới thiệu DiffusionGemma, cho phép chuyển đổi mô hình Gemma-4-26B-A4B thành mô hình khuếch tán văn bản với chi phí đào tạo chỉ bằng 10% so với cách truyền thống.

Bản dịch AI

Việc xây dựng một mô hình mới từ đầu là không cần thiết. Theo báo cáo, nhóm nghiên cứu đã bắt đầu với mô hình Gemma-4-26B-A4B hiện có và chuyển đổi nó thành một mô hình khuếch tán (diffusion model) bằng cách sử dụng chưa đến mười phần trăm ngân sách token huấn luyện ban đầu.

Scatter plot showing output speed in tokens per second on the x-axis and accuracy averaged across LiveCodeBench-v6 and GPQA-Diamond on the y-axis. DiffusionGemma 26B A4B sits at about 1,250 tokens per

Hai giai đoạn huấn luyện giúp cân bằng giữa chất lượng và tốc độ

Trong bước đầu tiên của quy trình gồm hai bước, mô hình học cách tái tạo các khối văn bản bị nhiễu từ dữ liệu mẫu. Tiếp theo là giai đoạn kết hợp giữa học tăng cường (reinforcement learning) và chưng cất bộ lấy mẫu (sampler distillation), mà Google gọi là SD·RL. Học tăng cường thường giúp nâng cao chất lượng câu trả lời, trong khi chưng cất bộ lấy mẫu cho phép mô hình hoạt động với ít bước tính toán hơn. Google đã hợp nhất cả hai vào một quy trình duy nhất.

Flow diagram showing the path from Gemma 4 26B A4B through a crossed-out pretraining step, supervised finetuning as step 1, and sampler distillation with reinforcement learning as step 2, resulting in

Theo báo cáo, phương pháp kết hợp này giúp tăng chất lượng trên các bài kiểm tra đánh giá khả năng suy luận trung bình mười điểm, đồng thời tăng gần gấp bốn lần số lượng token trên mỗi bước tính toán. Một tác dụng phụ là câu trả lời của DiffusionGemma ngắn hơn khoảng 50 phần trăm, điều này càng giúp tăng tốc độ xử lý.

Suy luận hai chiều cho phép mô hình tự sửa lỗi

Các mô hình ngôn ngữ tiêu chuẩn phải đưa ra chữ số đầu tiên của câu trả lời trước khi hoàn tất quá trình suy luận. Trong một bài toán từ báo cáo, Gemma 4 bắt đầu phản hồi bằng "-1", nhưng trong quá trình suy luận lại nhận ra "-25" mới là đáp án đúng và phải thêm phần sửa lỗi vào sau đó. DiffusionGemma phát triển câu trả lời và lập luận song song, vì vậy nó có thể sửa lỗi trước khi kết quả đầu ra được hoàn thiện.

Table showing five denoising steps for the first twelve tokens of a math problem. Color intensity indicates model confidence, while the initially wrong number 1 changes to 15 and then to the correct a

Việc giải Sudoku cũng hoạt động dựa trên nguyên tắc tương tự, vì mỗi ô đều phụ thuộc vào các ô xuất hiện sau đó. Sau khi tinh chỉnh tối thiểu, DiffusionGemma giải đúng gần 85 phần trăm các câu đố, trong khi mô hình cơ sở hoàn toàn thất bại với tác vụ này. Theo báo cáo, các đầu ra có cấu trúc như JSON hoặc sửa lỗi mã nguồn chỉ cần từ hai đến ba bước tinh chỉnh để hoàn tất, vì đầu vào đã xác định hầu hết các token.

DiffusionGemma vẫn giữ được khả năng tạo văn bản từng từ một như ban đầu, cho phép người dùng chuyển đổi giữa hai chế độ tùy theo tác vụ.

Four bar charts comparing DiffusionGemma, Gemma 4 AR with MTP, LLaDA 2.1 Flash, Nemotron Diffusion, and Mercury 2 across reasoning and knowledge, coding, instruction following and agentic behavior, an

Những khoảng trống trong suy luận và giới hạn đối với nhiều người dùng vẫn tồn tại

Hiệu suất tuyệt đối vẫn chưa bằng mô hình cơ sở tự hồi quy (autoregressive). Google chỉ ra một vài lý do cho điều này. DiffusionGemma không được huấn luyện như một mô hình khuếch tán ngay từ đầu mà được cải tiến sau đó. Giai đoạn huấn luyện tiếp theo tương đối ngắn và bước thứ hai, SD·RL, ưu tiên tốc độ hơn là chất lượng tối đa. Kiến trúc, dữ liệu huấn luyện và các cài đặt khác cũng được kế thừa từ mô hình Gemma 4 gốc, vốn không nhất thiết là lý tưởng cho mô hình khuếch tán.

Mô hình đôi khi bị mắc kẹt trong các vòng lặp lặp lại, tạo ra các từ riêng lẻ nhiều lần liên tiếp. Đây là một hệ quả của việc giảm mạnh các bước tính toán. Đối với các tác vụ đa phương thức, DiffusionGemma đôi khi quên đóng phần suy luận của mình một cách chính xác, điều này làm giảm điểm số trên các bài kiểm tra đánh giá một cách nhân tạo.

Lợi thế về tốc độ cũng chủ yếu chỉ duy trì trong các kịch bản đơn người dùng. Khi có khoảng 32 yêu cầu đồng thời gửi đến mô hình, các mô hình ngôn ngữ tiêu chuẩn sẽ bắt kịp về lưu lượng xử lý.

Google gọi DiffusionGemma là một mô hình thử nghiệm và cho biết việc phát hành này nhằm mục đích đẩy nhanh nghiên cứu về khuếch tán văn bản, đồng thời cung cấp cho cộng đồng một nền tảng cho các tùy chỉnh chuyên biệt và tiết kiệm tài nguyên.

Mô hình này hiện đang được startup Interfaze sử dụng cho nhận dạng giọng nói đa ngôn ngữ và trong một dự án nghiên cứu về tạo báo cáo chẩn đoán hình ảnh tương tác. Trước đó, Google đã cung cấp mô hình này theo giấy phép Apache 2.0 trên Hugging Face. Tiền thân của nó là Gemini Diffusion, được Google trình diễn vào tháng 5 năm 2025.

GoogleDiffusionGemmaMô hình khuếch tánTối ưu hóa AIGemma
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ The Decoder: AI News. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.