MarkTechPost
85

Mô hình

IBM ra mắt Granite 4.2: Bước tiến mới cho mô hình doanh nghiệp với khả năng suy luận và tác tử AI

(giờ Việt Nam)

Tóm tắt AI

IBM giới thiệu dòng mô hình Granite 4.2 mã nguồn mở với ba phiên bản 3B, 8B và 30B, tích hợp khả năng suy luận theo chuỗi tư duy và cơ chế điều khiển tư duy linh hoạt.

Bản dịch AI

IBM Releases Granite 4.2: Bringing Native Reasoning and Agentic RL to Open Enterprise Models

IBM đã phát hành Granite 4.2, một dòng mô hình ngôn ngữ suy luận mở với các kích thước 3B, 8B và 30B tham số. Khác với các phiên bản Granite trước đây vốn là các trợ lý tuân thủ chỉ dẫn, Granite 4.2 được xây dựng dựa trên khả năng suy luận tường minh. Mỗi mô hình đều có thể tạo ra chuỗi suy nghĩ (chain of thought) trước khi đưa ra câu trả lời, đồng thời cung cấp công tắc bật/tắt chế độ suy nghĩ cùng với chế độ nỗ lực thấp (low-effort mode) giúp tiết kiệm ngân sách suy luận cho các câu hỏi đơn giản. Các mô hình này là dạng decoder-only dense transformer, được tiền huấn luyện từ đầu trên khoảng 15 nghìn tỷ token, sau đó được hậu huấn luyện thông qua chuỗi học tăng cường (reinforcement learning) đa giai đoạn. Đối với phiên bản 8B và 30B, chuỗi này bao gồm một khối RL tác tử (agentic RL block), nơi mô hình học cách chỉnh sửa mã nguồn, điều khiển terminal và thực hiện tìm kiếm web trong các môi trường sandbox thực tế. Cả ba mô hình đều được phát hành theo giấy phép Apache 2.0. IBM cũng ra mắt hai mô hình Granite Speech 5.0 Turbo CTC với 470 triệu tham số cùng với các LLM này.

Có thể triển khai được không?

Có, cả ba mô hình ngôn ngữ Granite 4.2 đều được phát hành theo giấy phép Apache 2.0, vì vậy việc tải xuống, tinh chỉnh (fine-tuning) và sử dụng trong sản xuất thương mại không gặp bất kỳ rào cản nào về bản quyền.

Kiến trúc

Granite 4.2 là kiến trúc decoder-only dense transformer, không phải thiết kế lai hay MoE. Các thành phần cốt lõi bao gồm Grouped Query Attention với 8 KV heads, RoPE với θ = 10.000.000, SwiGLU MLPs, RMSNorm (ε = 1e-5), untied input/output embeddings và độ chính xác bfloat16.

Phiên bản 3B sử dụng 40 lớp với kích thước embedding là 2560. Phiên bản 8B sử dụng 40 lớp với kích thước 4096. Phiên bản 30B có 64 lớp với kích thước ẩn MLP là 32.768. Bảng kiến trúc được công bố liệt kê độ dài chuỗi là 131.072 token (128K), trong khi quá trình tiền huấn luyện năm giai đoạn bao gồm một giai đoạn ngữ cảnh dài mở rộng lên đến 512K token. Tiền huấn luyện bao phủ khoảng 15 nghìn tỷ token từ đầu.

Quy trình huấn luyện mới là điểm nhấn thực sự

Quá trình tinh chỉnh có giám sát (supervised fine-tuning) sử dụng khoảng 7,2 triệu mẫu, tương đương khoảng 100 tỷ token với ~65 tỷ token có thể huấn luyện. Tỷ lệ hỗn hợp là 31,6% tác tử (agentic) và 68,4% phi tác tử, trong đó kỹ thuật phần mềm chiếm 69% trong phần tác tử. Các quỹ đạo (trajectories) được tạo ra trên nhiều nền tảng bao gồm OpenHands, SWE-agent, Terminus-2, MiniSWE, Codex và Goose. Kiểm soát chất lượng sử dụng GPT-OSS-120B và Gemma 4 làm giám khảo, kết hợp với khử trùng lặp SHA-256 trên các trường công cụ và tin nhắn.

Hậu huấn luyện là một chuỗi RL đa giai đoạn, đa môi trường, không phải là một lần chạy duy nhất. Mỗi giai đoạn là một lần chạy GRPO bất đồng bộ riêng biệt, khởi động từ checkpoint trước đó, sử dụng đường cơ sở leave-one-out thay vì mạng giá trị (value network) và lấy mẫu quan trọng bị cắt cụt (truncated importance sampling) để giới hạn độ lệch off-policy. Thứ tự thực hiện là RLVR, sau đó là các bộ tăng cường kỹ năng (skill boosters), tiếp đến là SWE, Terminal, Search và cuối cùng là RLHF.

Khối RL tác tử chỉ chạy trên phiên bản 8B và 30B. Phiên bản 3B chỉ sử dụng RL nền tảng và căn chỉnh (alignment). Lựa chọn thiết kế đơn lẻ đó giải thích phần lớn khoảng cách về khả năng giữa các kích thước. Quá trình huấn luyện chạy trên NeMo-RL và NeMo-Gym trên cụm NVIDIA GB200 NVL72 do CoreWeave cung cấp.

Hai thành phần hỗ trợ quan trọng: 1 nghìn tỷ token mã nguồn tổng hợp từ pipeline CodeAlchemy của IBM và một lớp giải mã suy đoán (speculative decoding layer) để phục vụ nhanh hơn.

Kết quả được báo cáo

Các con số của IBM, theo kích thước (3B / 8B / 30B):

Speech: 470 triệu tham số, không có nền tảng LLM

Các mô hình Turbo CTC có 470 triệu tham số và loại bỏ hoàn toàn nền tảng LLM, sử dụng phân loại thời gian kết nối (connectionist temporal classification) để ánh xạ âm thanh sang văn bản. IBM báo cáo thông lượng RTFx gần 12.600 trên một GPU H200 duy nhất, so với khoảng 6.000 của các mô hình dẫn đầu về tốc độ hiện tại trên bảng xếp hạng Open ASR. Bản demo WebGPU hiện đã hoạt động.

Những điểm chính cần lưu ý

Hãy xem blog của IBM Research, bài viết kỹ thuật và kho lưu trữ GitHub. Ngoài ra, hãy theo dõi chúng tôi trên Twitter và đừng quên tham gia SubReddit 150k+ ML của chúng tôi cũng như đăng ký nhận bản tin. Khoan đã! Bạn có dùng Telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.

Asif Razzaq là CEO của Marktechpost Media Inc. Là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của ông là ra mắt nền tảng truyền thông về Trí tuệ nhân tạo, Marktechpost, nổi bật với việc đưa tin chuyên sâu về tin tức học máy và học sâu, vừa đảm bảo tính kỹ thuật vừa dễ hiểu đối với đông đảo khán giả. Nền tảng này tự hào với hơn 2 triệu lượt xem mỗi tháng, minh chứng cho sự phổ biến của nó đối với độc giả.

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.