Thủ thuật
Thinking Machines ra mắt Inkling: Mô hình MoE khổng lồ với 975 tỷ tham số
(giờ Việt Nam)
Tóm tắt AI
Thinking Machines vừa giới thiệu Inkling, mô hình được huấn luyện từ đầu với kiến trúc chuyên gia hỗn hợp (MoE), sở hữu 975 tỷ tham số nhưng chỉ kích hoạt 41 tỷ tham số cho mỗi token.
Bản dịch AI


Các AI coding agent có thể tạo mã nhanh chóng, nhưng các bước kiểm tra CI thường chỉ diễn ra sau khi các agent hoàn thành công việc. Sonar Vortex thay đổi mô hình này. Sonar Vortex hoạt động ngay bên trong vòng lặp lập trình của agent, cung cấp cho agent bối cảnh kiến trúc trước khi chúng viết mã và xác thực kết quả đầu ra theo thời gian thực ngay khi chúng đang tạo ra mã đó. Các thử nghiệm nội bộ cho thấy mức tiêu thụ token giảm 36% và số lỗi giảm 92%.
Khám phá Sonar Vortex
Thinking Machines đã phát hành một mô hình có tên là Inkling vào ngày 15 tháng 7 năm 2026. Một vài điểm thú vị được nêu trong phần giới thiệu của mô hình này như sau:
Inkling có 66 lớp, mỗi lớp chứa 256 chuyên gia (experts), trong đó chỉ có sáu chuyên gia được kích hoạt cho bất kỳ token nào [2].
Hầu hết các lớp chỉ có thể truy cập vào một cửa sổ văn bản gần đây ngắn, trong khi một vài lớp có thể truy cập toàn bộ văn bản [1].
Các vị trí từ được mã hóa bằng một phương pháp mà hầu hết các phòng thí nghiệm đã từ bỏ từ nhiều năm trước.
Thinking Machines, được thành lập bởi Mira Murati (cựu CTO của OpenAI), mô tả sứ mệnh của mình là xây dựng AI giúp mở rộng ý chí và khả năng phán đoán của con người. Công ty liệt kê bốn hướng làm việc, bao gồm: huấn luyện các mô hình mạnh mẽ, xây dựng các công cụ cho phép mọi người tùy chỉnh mô hình bằng kiến thức riêng của họ, phát triển các giao diện giúp mở rộng kênh giao tiếp giữa con người và máy móc, và công bố các nghiên cứu về cách tạo ra các mô hình [3].
Trước Inkling, công ty đã phát hành Tinker, một dịch vụ để tinh chỉnh (fine-tuning) các mô hình mở [4]. Inkling là mô hình đầu tiên của công ty được huấn luyện từ đầu (from scratch) [1]. Các trọng số (weights) được lưu trữ trên Hugging Face theo giấy phép Apache 2.0 [2], vì vậy bất kỳ ai cũng có thể tải xuống và huấn luyện lại mô hình trên dữ liệu của riêng họ.
Trong bài viết này, chúng ta sẽ tìm hiểu các lựa chọn khác nhau mà Thinking Machines đã thực hiện khi xây dựng Inkling. Dưới đây là những nội dung chúng ta sẽ đề cập:
Mixture of Experts (Hỗn hợp chuyên gia), và khoảng cách giữa 975 tỷ tham số và 41 tỷ.
Sự kết hợp giữa các lớp chú ý (attention layers) cục bộ và toàn cục đằng sau cửa sổ ngữ cảnh một triệu token.
Mã hóa vị trí (position encoding), và phương pháp cũ hơn mà Thinking Machines đã chọn thay vì tiêu chuẩn hiện tại.
Cách hình ảnh và âm thanh đi vào mô hình mà không cần một bộ mã hóa (encoder) được huấn luyện trước riêng biệt ở phía trước.
Nỗ lực tư duy (thinking effort), một thiết lập từ 0 đến 1 giúp điều chỉnh mức độ suy luận của mô hình trước khi đưa ra câu trả lời.
Tuyên bố miễn trừ trách nhiệm: Bài viết này dựa trên các chi tiết được chia sẻ công khai từ nhiều nguồn khác nhau. Tài liệu tham khảo ở cuối bài. Vui lòng bình luận nếu bạn phát hiện bất kỳ điểm nào không chính xác.
Sơ đồ dưới đây cho thấy vị trí của từng yếu tố trong năm điều này bên trong mô hình.

Trước tiên, hãy hiểu bốn thuật ngữ chính rất quan trọng để nắm bắt kiến trúc này:
Token: Một token là một đoạn văn bản. Các mô hình làm việc với các phần nhỏ hơn câu và thường nhỏ hơn từ một chút. Ví dụ, câu “Inkling was released in July” có thể trở thành sáu token, với các từ phổ biến được tính là một token mỗi từ và các từ không phổ biến được chia thành hai hoặc ba token.
Tham số (Parameter): Một tham số là một con số được lưu trữ bên trong mô hình, được học trong quá trình huấn luyện. Khi bạn đọc thấy một mô hình có 975 tỷ tham số, đó là tổng số các con số riêng lẻ nằm trong tệp. Mỗi con số bắt đầu như một nhiễu ngẫu nhiên và được điều chỉnh hàng triệu lần cho đến khi mô hình tạo ra văn bản hợp lý.
Huấn luyện (Training): Quá trình này hoạt động bằng cách hiển thị văn bản cho mô hình, để nó dự đoán token tiếp theo, so sánh dự đoán đó với token thực tế xuất hiện sau đó, và sau đó điều chỉnh nhẹ mọi tham số theo hướng giúp dự đoán tốt hơn. Kích thước và hướng của mỗi lần điều chỉnh được gọi là gradient, và quy trình tính toán tất cả chúng cùng một lúc được gọi là lan truyền ngược (backpropagation). Bằng cách lặp lại quá trình này qua hàng nghìn tỷ token, các tham số sẽ ổn định ở những giá trị tạo ra các dự đoán hữu ích.
Lớp (Layer): Đây là một giai đoạn xử lý trong hành trình của một token. Inkling có 66 lớp được xếp chồng theo thứ tự [2]. Biểu diễn của một token đi vào lớp 1, được biến đổi, chuyển sang lớp 2, và cứ tiếp tục như vậy cho đến lớp 66, sau đó mô hình dự đoán token tiếp theo. Mỗi lớp đều có hai phần giống nhau:
Một bước chú ý (attention step) thu thập thông tin từ các token khác trong chuỗi.
Một bước chuyển tiếp (feed-forward step) biến đổi kết quả.
Inkling tách biệt chi phí lưu trữ mô hình khỏi chi phí vận hành nó. Đây là lý do tại sao một mô hình lớn như vậy lại có chi phí sử dụng hợp lý.
Trong một transformer thông thường, bước chuyển tiếp trong mỗi lớp là một mạng duy nhất, và mọi token đều đi qua toàn bộ mạng đó. Nếu mạng đó chứa 5 tỷ tham số, thì mỗi token được xử lý sẽ liên quan đến tất cả 5 tỷ tham số đó.
Inkling thay thế mạng duy nhất đó bằng 256 mạng nhỏ hơn, gọi là các chuyên gia (experts). Đối với mỗi token, một bước lựa chọn sẽ chọn ra sáu trong số 256 chuyên gia. Chỉ sáu chuyên gia đó hoạt động, và 250 chuyên gia còn lại sẽ ở trạng thái nhàn rỗi đối với token đó trong khi xử lý các token khác [2]. Mô hình thiết kế này được gọi là Mixture of Experts, và Thinking Machines tuyên bố rằng phiên bản của họ phần lớn tuân theo phương pháp được DeepSeek công bố [1][8].
Xem sơ đồ dưới đây:

Hãy hiểu điều này qua một ví dụ đơn giản:
Giả sử bạn xây dựng một lớp với 10 chuyên gia, mỗi chuyên gia chứa 1 tỷ tham số, và bạn chạy 2 chuyên gia trên mỗi token.
Tệp trên đĩa chứa tất cả 10 tỷ tham số, và mọi tham số đều phải được tải vào bộ nhớ trước khi bạn có thể chạy mô hình.
Việc xử lý một token đơn lẻ liên quan đến 2 tỷ tham số, vì vậy mỗi token chỉ tốn khoảng một phần năm so với một lớp thông thường có cùng tổng kích thước.
Inkling thực hiện điều này ở quy mô lớn. Tổng số tham số trên toàn bộ mô hình là 975 tỷ, và số lượng tham số liên quan đến việc xử lý bất kỳ token đơn lẻ nào là khoảng 41 tỷ [1]. Đó là khoảng 4 phần trăm mô hình hoạt động tại một thời điểm.
Các yêu cầu về phần cứng làm cho mọi thứ rõ ràng hơn. Checkpoint là tệp đã lưu giữ tất cả các tham số đã được huấn luyện. Checkpoint độ chính xác đầy đủ (full-precision) của Inkling cần ít nhất 2 TB bộ nhớ GPU kết hợp, mà thẻ mô hình (model card) chỉ định là tám card NVIDIA B300 hoặc mười sáu card H200 [2].
Thinking Machines cũng đề cập đến một checkpoint đã được lượng tử hóa (quantised). Điều này có nghĩa là các tham số tương tự được lưu trữ với độ chính xác số thấp hơn, theo cách tương tự như việc viết 3.14 thay vì 3.14159265 sẽ tốn ít không gian hơn nhưng phải đánh đổi bằng một chút độ chính xác. Phiên bản đó cần khoảng 600 GB và vừa với bốn card B300 [2].

Các ứng viên sáng giá thường hoài nghi về các bài đăng tuyển dụng kỹ sư triển khai thực tế (forward deployed engineer) mơ hồ, và chỉ riêng tiêu đề thôi sẽ không chiếm được lòng tin của họ.
Bài viết được AI dịch và tổng hợp tự động từ ByteByteGo. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.