Thủ thuật
Thinking Machines công bố bộ đôi mô hình mã nguồn mở Inkling và Inkling-Small
(giờ Việt Nam)
Tóm tắt AI
Thinking Machines ra mắt Inkling và Inkling-Small, khẳng định việc phát hành an toàn dựa trên quy trình kiểm định nghiêm ngặt từ nội bộ đến các đơn vị độc lập, đồng thời cam kết lộ trình phát hành theo từng giai đoạn.
Bản dịch AI

Tóm tắt: Các mô hình có trọng số mở (open-weight) an toàn là hàng hóa công cộng, vì chúng đặt sự phát triển AI và công tác an toàn vào tay nhiều người, đồng thời giúp các lựa chọn trong quá trình huấn luyện có thể được kiểm tra. Các mô hình mở cũng mang lại rủi ro lạm dụng thực tế, và việc phát hành là không thể đảo ngược. Để phát hành một cách an toàn, chúng ta phải xem xét cả mô hình lẫn hệ sinh thái mà nó tham gia. Đối với mô hình, chúng tôi thực hiện kiểm thử an toàn nghiêm ngặt và nghiên cứu liệu các năng lực nguy hiểm có thể được tách rời khỏi trí tuệ tổng quát hay không. Đối với hệ sinh thái, chúng tôi đầu tư vào sự sẵn sàng của nó thông qua các đợt phát hành theo giai đoạn, hỗ trợ những người phòng thủ và hợp tác với các nhà nghiên cứu an toàn. Bằng cách lặp đi lặp lại việc chọn phương án mở nhất mà bằng chứng ủng hộ trong khi xây dựng khả năng phục hồi của hệ sinh thái, chúng ta có thể tiến tới sự cởi mở một cách an toàn.
Sứ mệnh của Thinking Machines là xây dựng AI giúp mở rộng ý chí và khả năng phán đoán của con người. Để theo đuổi sứ mệnh đó, gần đây chúng tôi đã phát hành Inkling và Inkling-Small, hai mô hình ngôn ngữ có trọng số mở mà bất kỳ ai cũng có thể sở hữu, vận hành và tùy chỉnh.
Các mô hình có trọng số mở mạnh mẽ đặt sự phát triển AI vào tay nhiều người. Chúng tôi tin rằng đây là một điều tốt: kiến thức về việc AI nên làm gì nằm ở những người thực hiện công việc đó, vì vậy họ nên có khả năng định hình trực tiếp các mô hình của mình. Tất cả các mô hình, bao gồm cả mô hình của chúng tôi, đều mang những giả định và thiên kiến của những người đã huấn luyện chúng; trọng số mở giúp những lựa chọn đó có thể được kiểm tra và sửa đổi. Nếu không có các mô hình mở mạnh mẽ, chuyên môn về huấn luyện và triển khai có nguy cơ bị tập trung vào một vài phòng thí nghiệm, khiến những người khác ít có khả năng hiểu, thích ứng hoặc quản lý công nghệ này hơn.
Các mô hình có trọng số mở mang theo rủi ro lạm dụng.
Một khi trọng số được công khai, bất kỳ ai cũng có thể sử dụng chúng, bao gồm cả những kẻ xấu. An ninh mạng cho thấy điều này có nghĩa là gì. Vào tháng 4 năm 2026, Anthropic báo cáo rằng Claude Mythos Preview đã tìm thấy hàng nghìn lỗ hổng chưa từng được biết đến trên mọi hệ điều hành và trình duyệt lớn, đồng thời viết các mã khai thác hoạt động được mà không cần sự hướng dẫn của con người. Các hệ thống như thế này có thể làm giảm đáng kể thời gian, chi phí và chuyên môn cần thiết cho các hoạt động tấn công mạng. Liệu xã hội của chúng ta có an toàn hơn khi các mô hình có trọng số mở cho phép mọi người có các kỹ năng an ninh mạng siêu phàm?
Có những sự không chắc chắn thực sự xung quanh tác động ròng của trọng số mở đối với an ninh và sự cân bằng giữa tấn công và phòng thủ. Những mô hình này có thể tìm và vá các lỗ hổng trước khi những kẻ tấn công làm điều đó khi chúng nằm trong tay những người phòng thủ, nhưng chính những năng lực đó có thể đẩy nhanh việc khai thác trên một số lượng lớn các hệ thống chưa được vá khi chúng nằm trong tay những kẻ tấn công. Những sự đánh đổi tương tự cũng tồn tại trong các lĩnh vực sử dụng kép khác như hóa học và sinh học.
Với những sự không chắc chắn này, việc phát hành trọng số một cách bừa bãi không phải là một con đường an toàn để tiến về phía trước.
Một con đường an toàn đến với các mô hình có trọng số mở.
Liệu có một con đường an toàn để mở trọng số của các mô hình mạnh mẽ khi rủi ro lạm dụng là có thật? Chúng tôi nghĩ rằng một con đường như vậy tồn tại, mặc dù chúng tôi chưa lập bản đồ toàn bộ con đường đó. Ý tưởng cốt lõi là việc phát hành an toàn phụ thuộc vào mô hình và hệ sinh thái xung quanh nó.
Mô hình có an toàn không?
Kiểm thử an toàn nghiêm ngặt – một đại diện không hoàn hảo nhưng thiết yếu cho năng lực trong thế giới thực ở các lĩnh vực nguy hiểm – phải là một phần cần thiết trong quy trình phát hành mô hình của chúng tôi. Nó có thể hoàn thành những tác vụ độc hại nào? Nó dễ tiếp cận đến mức nào? Điều gì sẽ xảy ra nếu các rào cản an toàn (guardrails) bị loại bỏ?
Rộng hơn nữa, cần có thêm các nghiên cứu về an toàn. Ví dụ, chúng tôi đặc biệt quan tâm đến việc liệu các năng lực nguy hiểm phụ thuộc vào kiến thức chuyên môn có thể được giảm bớt thông qua việc quản lý dữ liệu tiền huấn luyện hoặc các can thiệp sau huấn luyện hay không. Đây vẫn là một câu hỏi nghiên cứu tích cực thay vì một giải pháp đã được thiết lập.
Hệ sinh thái đã sẵn sàng chưa?
Sự sẵn sàng có nghĩa là phòng thủ theo lớp. Lớp đầu tiên là cho phép các tổ chức cá nhân vá hệ thống của họ sớm hoặc phát hiện các cuộc tấn công đang diễn ra. Nghiên cứu phòng thủ bổ sung thêm một lớp nữa, phát triển các công cụ và kỹ thuật cho phép chính các mô hình AI tăng cường khả năng phòng thủ trên quy mô lớn. Đây chỉ là hai trong số nhiều lớp. Để chuẩn bị cho hệ sinh thái với các lớp phòng thủ, chúng tôi dự định hợp tác với cộng đồng an toàn và cung cấp quyền truy cập vào các mô hình có năng lực.
Một sự căng thẳng ở đây là hệ sinh thái xây dựng khả năng phòng thủ bằng cách làm việc với các mô hình có năng lực, nhưng mỗi lần mở rộng quyền truy cập cũng mở rộng đối tượng có thể lạm dụng chúng. Để giải quyết sự căng thẳng này, chúng tôi có thể dàn dựng các đợt phát hành một cách cẩn thận với các tùy chọn như truy cập API có giám sát, tinh chỉnh (fine-tuning) được lưu trữ và kiểm duyệt những người phòng thủ. Xem xét tốc độ tiến bộ nhanh chóng của năng lực AI, các giai đoạn này cũng cần phải di chuyển đủ nhanh để việc học hỏi phòng thủ vẫn giữ được tính phù hợp.
Trên con đường an toàn đến với sự cởi mở, mỗi giai đoạn chỉ nên mở rộng quyền truy cập khi bằng chứng ủng hộ điều đó. Do đó, con đường này mang tính lặp lại: ở mỗi bước, hãy chọn phương án mở nhất mà bằng chứng ủng hộ, và để mỗi lần phát hành thông báo cho lần tiếp theo. Một mô hình bị giữ lại hôm nay có thể trở nên ít rủi ro hơn khi hệ sinh thái thay đổi, và bằng chứng mới có thể gợi ý rằng chúng ta có thể mở trọng số của nó.
Cách chúng tôi đánh giá Inkling.
Inkling và Inkling-Small không phải là những mô hình có năng lực nhất ở biên giới công nghệ. Do đó, các quyết định phát hành của chúng tôi chủ yếu giải quyết việc liệu việc phát hành trọng số của chúng có làm tăng rủi ro gia tăng đáng kể so với những gì các mô hình có trọng số mở hiện có đã gây ra hay không. Việc phát hiện ra rằng một mô hình không thúc đẩy biên giới năng lực nguy hiểm là quan trọng nhưng chưa đủ. Chúng tôi cũng xem xét liệu tính đa phương thức, khả năng tùy chỉnh hoặc khả năng tiếp cận của Inkling có thể làm cho năng lực độc hại trở nên dễ sử dụng hơn một cách đáng kể hay không.
Chúng tôi đã kiểm tra Inkling và Inkling-Small theo ba cách: đánh giá nội bộ trên một phân loại rộng các tác hại, kiểm thử bên ngoài bởi bốn tổ chức độc lập và một nghiên cứu tinh chỉnh để tìm ra các năng lực trong trường hợp xấu nhất. Dựa trên kết quả của các đánh giá này, chúng tôi kết luận rằng việc phát hành Inkling không có khả năng làm tăng rủi ro đáng kể so với những gì các mô hình có trọng số mở hiện có đã gây ra.
Đánh giá an toàn nội bộ. Bộ đánh giá nội bộ của chúng tôi trải dài trên ba hướng. Hướng thứ nhất nhắm vào các lĩnh vực sử dụng kép nguy hiểm như CBRN và an ninh mạng tấn công, kiểm tra cả những gì mô hình biết về các lĩnh vực này và liệu nó có thể vận hành kiến thức đó trong các bối cảnh thực tế hay không. Hướng thứ hai là một tập hợp lạm dụng rộng rãi bao gồm các yêu cầu trực tiếp về nội dung độc hại và hành vi trong các bối cảnh sử dụng công cụ, tác nhân. Hướng thứ ba là đánh giá nội dung đa phương thức của riêng chúng tôi, kiểm tra các mô hình trên các lời nhắc độc hại kết hợp với các nội dung trông có vẻ lành tính trên 17 ngôn ngữ và các đầu vào văn bản, hình ảnh và âm thanh. Trong mỗi hướng này, kết quả của Inkling và Inkling-Small đều tương đương với các mô hình có trọng số mở khác.
Kiểm thử đỏ (red-teaming) bên ngoài. Chúng tôi đã làm việc với bốn tổ chức bên ngoài, cung cấp cho họ quyền truy cập sớm vào Inkling để kiểm thử trước khi triển khai trong bốn lĩnh vực:
Trên khắp các lĩnh vực này, các kiểm thử viên bên ngoài không xác định được các năng lực có thể làm tăng đáng kể rủi ro trong thế giới thực so với những gì đã có thể đạt được với các mô hình có trọng số mở hiện có, hoặc, nếu có liên quan, họ không thấy các biện pháp bảo vệ của Inkling hoặc Inkling-Small yếu hơn đáng kể so với các mô hình có trọng số mở hiện có.
Tinh chỉnh đối kháng (Adversarial fine-tuning). Vì trọng số mở có thể được tùy chỉnh để loại bỏ quá trình huấn luyện an toàn của mô hình, hành vi từ chối không thể được coi là một biện pháp bảo vệ bền vững cho một bản phát hành trọng số mở. Để đánh giá điều này, chúng tôi đã tinh chỉnh các biến thể của Inkling và Inkling-Small được tối ưu hóa để tuân thủ thay vì từ chối các yêu cầu độc hại – và chạy chúng đối chiếu với các đánh giá sử dụng kép của chúng tôi. Điều này kiểm tra xem liệu mô hình có gây ra các rủi ro mới đáng kể nếu các biện pháp bảo vệ của nó bị loại bỏ hay không. Trong các thí nghiệm của chúng tôi, nó đã không làm như vậy: các biến thể chỉ tập trung vào sự hữu ích không cung cấp thêm sự nâng cấp mới nào cho các tác vụ CBRN và mạng, và vẫn có thể so sánh được với các mô hình có trọng số mở hiện có.
Tóm lại, không mô hình nào mở rộng biên giới năng lực nguy hiểm. Cả hai cũng không mở rộng đáng kể quyền truy cập vào đó, vì các mô hình có sức mạnh tương đương hoặc lớn hơn trong các lĩnh vực này đã có thể tải xuống được. Mặc dù các từ chối có thể bị loại bỏ, nhưng việc làm như vậy không cho thấy năng lực lớn hơn đáng kể trong các đánh giá này. Trong khi đó, những người phòng thủ đã phải đối phó với các mô hình ở mức độ này hoặc cao hơn. Dựa trên những điểm này, chúng tôi kết luận rằng việc phát hành Inkling không có khả năng làm tăng rủi ro đáng kể so với những gì các mô hình có trọng số mở hiện có đã gây ra.
Khi các mô hình của chúng tôi tiến gần đến biên giới năng lực, sự cân bằng giữa năng lực, khả năng tiếp cận, khả năng loại bỏ biện pháp bảo vệ và sự sẵn sàng của hệ sinh thái sẽ thay đổi. Cách tiếp cận an toàn của chúng tôi cũng sẽ cần phải thay đổi theo.
Tách rời các năng lực nguy hiểm khỏi trí tuệ tổng quát.
Một giả định phổ biến cho rằng các năng lực nguy hiểm xuất hiện mà không cần huấn luyện rõ ràng và tương quan mạnh mẽ với trí tuệ tổng quát. Kết quả là, các kết quả từ trường thử nghiệm mạng (cyber-range) thường được coi như một điểm chuẩn năng lực khác để tối ưu hóa – một số nhà nghiên cứu thậm chí còn ăn mừng các thành tựu này như những cột mốc quan trọng.
Tuy nhiên, chúng tôi đưa ra giả thuyết rằng không phải tất cả các năng lực nguy hiểm đều tự động xuất hiện mà không cần huấn luyện về chúng. Ví dụ, trong sinh học, một phần đáng kể kiến thức dựa trên các phát hiện thực nghiệm cụ thể, như giao thức, điều kiện, thuốc thử và kết quả, mà một mô hình thu thập được từ các tài liệu cụ thể trong kho dữ liệu tiền huấn luyện thay vì suy luận thông qua lý luận tổng quát. Kết quả là, kiến thức như vậy có khả năng bị giữ lại tại thời điểm huấn luyện mà không làm ảnh hưởng đến việc sử dụng thông thường. Công trình gần đây cho thấy những hứa hẹn ban đầu: việc lọc nội dung liên quan đến CBRN ở cấp độ tài liệu từ quá trình tiền huấn luyện giúp giảm hiệu suất trong các đánh giá năng lực độc hại trong khi vẫn giữ nguyên các năng lực không liên quan.
Đây vẫn là một câu hỏi nghiên cứu mở. Lý luận tổng quát có thể chuyển đổi đủ tốt để cho phép một mô hình có năng lực suy luận lại những gì đã bị lọc, và ranh giới giữa kiến thức kỹ thuật nguy hiểm và thông thường có thể quá mờ nhạt để có thể cắt bỏ một cách sạch sẽ. Tuy nhiên, bằng chứng ban đầu là đủ để chúng tôi nghĩ rằng sự phân biệt này đáng để theo đuổi.
Hỗ trợ hệ sinh thái an toàn với các đợt phát hành theo giai đoạn.
Một cách khác để làm cho việc phát hành trọng số mở an toàn hơn là làm cho hệ sinh thái nơi nó được triển khai trở nên an toàn hơn. Mở rộng quyền truy cập theo từng giai đoạn cho phép xã hội xây dựng khả năng phòng thủ của mình trong quá trình thực hiện: một bản phát hành có thể bắt đầu với quyền truy cập API suy luận cho một nhóm dân cư hạn chế, mở rộng ra tính khả dụng chung có giám sát và cuối cùng là đạt đến trọng số mở.
Các API tinh chỉnh như Tinker thêm một giai đoạn giữa quyền truy cập suy luận và trọng số mở. Chúng cho phép các nhà cung cấp lưu trữ trọng số mà không cần phát hành chúng, trong khi vẫn cho phép người dùng tinh chỉnh với dữ liệu, hàm mất mát và vòng lặp huấn luyện của riêng họ. Sự kiểm soát đó vẫn nắm bắt được hầu hết các lợi ích của sự cởi mở, và nó nâng trần lạm dụng lên cao hơn mức mà một API suy luận đơn thuần cho phép. Tuy nhiên, các rủi ro vẫn thấp hơn so với việc phát hành trọng số: nhà cung cấp có thể giám sát việc sử dụng, duy trì các rào cản an toàn và thu hồi quyền truy cập.
Mỗi giai đoạn thực hiện một công việc cụ thể:
Các giai đoạn này không phải là một trình tự cố định tự động kết thúc bằng việc phát hành trọng số của mô hình. Thay vào đó, chúng tôi coi chúng như một cách để thu thập bằng chứng và xây dựng khả năng phục hồi trong khi tiến tới sự cởi mở lớn hơn. Sự tiến triển nên phụ thuộc vào những gì chúng tôi học được về mô hình và liệu hệ sinh thái xung quanh đã sẵn sàng hay chưa.
Bài viết này cung cấp một khung làm việc cấp cao, không phải là một tiêu chuẩn phát hành hoàn chỉnh. Các câu hỏi quan trọng vẫn còn đó: bằng chứng nào nên biện minh cho việc chuyển từ giai đoạn này sang giai đoạn tiếp theo, sự không chắc chắn nên ảnh hưởng đến quyết định đó như thế nào, những thay đổi nào về năng lực hoặc khả năng tiếp cận nên tạm dừng sự tiến triển, và sự sẵn sàng của hệ sinh thái nên được đo lường như thế nào. Chúng tôi dự định xuất bản một khung làm việc chi tiết hơn bao gồm các đánh giá, tiêu chí truy cập và các điều kiện dừng khi chúng tôi học hỏi từ Inkling và các mô hình tương lai.
Cùng nhau xây dựng hệ sinh thái an toàn.
Con đường an toàn đến với các mô hình mở này chỉ hoạt động nếu khả năng phòng thủ của hệ sinh thái cải thiện nhanh như các mô hình. Chúng tôi sẽ làm phần việc của mình: quyết định cẩn thận những gì cần phát hành và nghiên cứu cách tách rời trí tuệ khỏi năng lực nguy hiểm.
Tuy nhiên, hầu hết công việc trên diễn ra bên ngoài phòng thí nghiệm của chúng tôi, và phần lớn những gì bài viết này mô tả được xây dựng dựa trên công việc của người khác: ví dụ, lọc dữ liệu (Anthropic, EleutherAI và Viện An ninh AI Vương quốc Anh), các kiểm thử viên an toàn trước khi triển khai bên ngoài của chúng tôi (Scale, Apollo Research, Handshake AI và FAR AI), khung làm việc cho an toàn tinh chỉnh (OpenAI) và vô số người khác đang làm việc về phòng thủ mạng. Không phòng thí nghiệm nào xây dựng con đường này một mình. Mỗi biện pháp phòng thủ mới cho phép chúng tôi mở các mô hình trước đây quá rủi ro để phát hành. Điều này cần nhiều bàn tay hơn là chỉ của chúng tôi, và chúng tôi muốn hỗ trợ công việc đó một cách rộng rãi.
Chúng tôi sẽ sớm ra mắt các khoản tài trợ an toàn Tinker: tài trợ cho cộng đồng để tăng cường khả năng phòng thủ của hệ sinh thái. Nếu bạn thực hiện nghiên cứu an toàn, nền tảng Tinker của chúng tôi giúp bạn dễ dàng nghiên cứu việc tinh chỉnh và các rủi ro của nó, vì vậy hãy thử xem. Nếu bạn bảo vệ các hệ thống, chúng tôi muốn mang đến cho bạn một khởi đầu thuận lợi. Nếu bạn đánh giá các mô hình, chúng tôi muốn bạn xem xét kỹ lưỡng các mô hình của chúng tôi. Và nếu bạn muốn làm điều này từ bên trong, hãy tham gia đội ngũ an toàn của chúng tôi – chúng tôi đang tuyển dụng!
Bài viết được AI dịch và tổng hợp tự động từ Thinking Machines Lab: Blog. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.