# LatchBio: Grok 4.6 dẫn đầu các tiêu chuẩn về an toàn sinh học

- Nguồn: xAI: News (Web)
- Thời gian phát hành: 2026-09-01 07:00 (giờ Việt Nam)
- Điểm AI: 48/100
- Link AIHOT.vn: https://aihot.vn/items/7449cd9b06e82db1
- Nguồn dữ liệu AI HOT: https://aihot.news/items/cmtivvxe706flro9yhqsisfty
- Link gốc: https://x.ai/news/biosafety-at-the-frontier

## Tóm tắt AI

xAI công bố báo cáo đánh giá độc lập từ LatchBio, khẳng định Grok 4.6 đạt hiệu suất vượt trội trong các bài kiểm tra an toàn sinh học BioSecBench.

## Thân bài

![Biosecurity at the frontier](https://media.x.ai/v1/website/biosec_frontier-1584260e.png)

Hôm nay, LatchBio đã công bố một phân tích độc lập về Grok 4.6 trên các bộ tiêu chuẩn đánh giá năng lực sinh học và red-teaming (tấn công giả lập) sinh học của họ. Các đánh giá này đo lường một loạt các đặc điểm và năng lực của các mô hình được thử nghiệm, bao gồm:

Trên bộ tiêu chuẩn BioSecBench-Refusal của LatchBio, Grok 4.6 là mô hình mạnh nhất được thử nghiệm trong việc từ chối các tác vụ nguy hiểm và được ngụy trang, trong khi vẫn hoàn thành tốt các công việc sinh học thông thường. Đây là hệ thống duy nhất đạt điểm trên 50% ở cả hai tiêu chí này.

### Phương pháp luận và bối cảnh

Sinh học và nghiên cứu sinh học là những lĩnh vực mà cơ hội và rủi ro từ các hệ thống AI có năng lực cao vốn đã rõ ràng nhưng lại rất khó để tách biệt. Khi thiết kế các biện pháp bảo vệ, chúng tôi hướng tới việc tối đa hóa tiện ích của các tác nhân (agent) trong việc hỗ trợ và đẩy nhanh các nghiên cứu khoa học hợp pháp, đồng thời giảm thiểu rủi ro do thông tin không chính xác và việc sử dụng sai mục đích gây ra.

Hai bộ tiêu chuẩn của LatchBio liên quan nhất đến các năng lực nêu trên nhằm đo lường khả năng phân biệt giữa các mối nguy hiểm được che giấu với các công việc khoa học thông thường của một tác nhân, và khả năng thực hiện các quy trình giám sát mầm bệnh mà công tác y tế công cộng phụ thuộc vào. Đó là:

### Kết quả và những phát hiện chính

Trong quá trình thử nghiệm trên BioSecBench-Refusal, LatchBio nhận thấy rằng Grok 4.6 phát hiện và từ chối các truy vấn red-team cũng như các truy vấn nguy hiểm khác một cách đáng tin cậy hơn bất kỳ hệ thống tiên phong (frontier system) nào khác được thử nghiệm, mà không làm giảm hiệu suất đối với các công việc sinh học thông thường. Grok 4.6 cũng có hiệu suất tương đương với các mô hình tiên phong khác trong công tác giám sát sinh học. LatchBio lưu ý rằng các đánh giá được thực hiện trên nhiều loại agent harness (khung tác nhân) khác nhau để loại bỏ các yếu tố gây nhiễu, và trừ khi có ghi chú khác, các tác nhân được thử nghiệm ở mức độ nỗ lực cao nhất được cung cấp.

Điểm số do LatchBio trình bày là trung bình điều hòa có trọng số thử nghiệm giữa việc từ chối red-team và tuân thủ công việc thông thường. Chúng tôi phân tích chỉ số này và tỷ lệ từ chối độc lập một cách riêng biệt. Trên các harness khác nhau, Grok 4.6 giữ ba vị trí dẫn đầu, với mức trung bình là 62,1%. Khi xem xét việc từ chối và tuân thủ tác vụ một cách độc lập, Grok 4.6 đã từ chối 59,2% các tác vụ red-team và hoàn thành 64,8% các tác vụ thông thường. Đây là mô hình duy nhất được thử nghiệm đạt điểm trên 50% ở cả hai tiêu chí.

Trên BioSecBench-Surveillance, Grok 4.6 đạt tỷ lệ thành công trung bình là 53,5%, xếp sau Opus 5 và đứng trước GPT-5.6 Sol trong công tác an ninh sinh học và giám sát. Kết quả trên cả hai bộ tiêu chuẩn cho thấy một tác nhân và mô hình nền tảng được hiệu chỉnh tốt cho các công việc sinh học thông thường và hữu ích, cũng như có năng lực cao trong công tác an ninh sinh học và giám sát.

Trong các đánh giá về năng lực sinh học thông thường tổng quát do LatchBio thực hiện (như SpatialBench hoặc TxBench-PP), Grok được ghi nhận là ngang bằng hoặc vượt trội hơn các mô hình tiên phong khác trong nhiều công việc sinh học mang tính tác nhân. Những kết quả này được trình bày chi tiết hơn tại benchmarks.bio.

### Phân tích hành vi từ chối

Trong các dấu vết đánh giá (evaluation traces), Grok 4.6 được quan sát thấy có khả năng suy luận về nội dung của một tác vụ và môi trường thử nghiệm để đánh giá ý định trước khi tiến hành hoặc từ chối. Thông thường, Grok sẽ tìm ra sự khác biệt giữa ý định được nêu trong câu lệnh (prompt) và môi trường, hoặc sẽ tổng hợp ý định từ các nội dung rủi ro cao được ngụy trang bằng tên tệp và mã hóa, sau đó sẽ từ chối. Đối với các tác vụ rõ ràng là lành tính và rủi ro thấp, Grok thể hiện hành vi suy luận môi trường tương tự nhưng có khả năng đánh giá các tác vụ đó là an toàn.

### Cách chúng tôi bảo vệ Grok

Trước khi phát hành một mô hình, chúng tôi kiểm tra năng lực sinh học bên cạnh các lĩnh vực rủi ro khác, đồng thời xác nhận rằng các năng lực của mô hình được bảo vệ đầy đủ trước việc sử dụng sai mục đích. Công việc của các đơn vị đánh giá bên thứ ba như LatchBio bổ sung cho các đánh giá mà chúng tôi thực hiện nội bộ, cả trước và sau khi triển khai, đối với các mô hình mà chúng tôi cung cấp.

Các biện pháp bảo vệ của Grok được xây dựng theo từng lớp để thiết lập cơ chế phòng thủ chuyên sâu (defense-in-depth). Việc đào tạo từ chối được thực hiện để dạy mô hình cách thức và thời điểm từ chối, cách suy luận chính xác ý định và hồ sơ rủi ro của các tác vụ, cũng như cách từ chối chính xác trong các kịch bản mang tính đối kháng cao. Chúng tôi đào tạo và triển khai các biện pháp bảo vệ tại thời điểm suy luận (inference-time) để loại bỏ các yêu cầu độc hại trước khi chúng đến được mô hình, đồng thời thực hiện các kiểm soát hành vi để bảo vệ mô hình tốt hơn khi triển khai. Việc giám sát sau triển khai được thực hiện để phát hiện và ngăn chặn các mô hình sử dụng sai mục đích ở cấp độ phiên làm việc và người dùng, đồng thời cung cấp nguồn phản hồi để hiệu chỉnh liên tục các mô hình được triển khai của chúng tôi.

Chúng tôi nhận thấy sự cải thiện đáng kể về năng lực của Grok 4.6 trong các công việc sinh học so với các mô hình đã được thử nghiệm trước đây, với những bước tiến lớn về hiệu suất từ chối và an ninh sinh học so với Grok 4.5 và Grok 4.3. Chúng tôi dự định tiếp tục công việc bảo vệ mới và đang diễn ra để cho phép chúng tôi tiếp tục cung cấp trí tuệ ở quy mô tiên phong một cách an toàn trong các bản phát hành mô hình tương lai.

### Tương lai của an ninh sinh học và khám phá khoa học

Ranh giới giữa các tác vụ mang tính đối kháng chủ động và việc sử dụng hữu ích ngày càng trở nên mong manh khi các mô hình nhanh chóng trở nên có năng lực và tự chủ hơn, và các biện pháp bảo vệ sẽ cần phải phát triển tương ứng. Để kiểm soát rủi ro lớn hơn từ việc cải thiện năng lực và tính tự chủ của mô hình, chúng tôi sẽ thực hiện các thử nghiệm và hiệu chỉnh rộng rãi, tham vọng hơn đối với các mô hình và hệ thống tác nhân của mình: các bộ tiêu chuẩn trước khi triển khai rộng hơn, nhiều đánh giá từ bên thứ ba hơn, giám sát sau triển khai được cải thiện và triển khai các mô hình của chúng tôi với các công ty và tổ chức đi đầu trong lĩnh vực sinh học.

Tương tự, có một rủi ro cố hữu trong việc từ chối quá mức và các biện pháp bảo vệ bị hiệu chỉnh sai. Khi một mô hình từ chối các công việc sinh học thông thường và hữu ích, khả năng của các chuyên gia chăm sóc sức khỏe, nhà nghiên cứu và các chương trình giám sát trong việc phát hiện sớm dịch bệnh và thực hiện các công việc quan trọng khác tại thực địa sẽ bị suy giảm. Chúng tôi đánh giá rủi ro này nghiêm trọng ngang bằng với rủi ro hỗ trợ việc sử dụng sai mục đích.

Grok đã được sử dụng trong công việc khoa học, bao gồm nghiên cứu sinh học tổng quát và giám sát an ninh sinh học, và chúng tôi lạc quan về khả năng của các mô hình có năng lực cao trong việc đẩy nhanh khám phá khoa học và rút ngắn con đường từ phòng thí nghiệm đến ứng dụng thực tế. Chúng tôi cam kết tiếp tục cung cấp trí tuệ tiên phong một cách bảo mật và an toàn cho các kỹ sư, nhà nghiên cứu, doanh nghiệp và các tổ chức đang thúc đẩy khoa học sự sống.

Các phương pháp đầy đủ và điểm số theo từng mô hình của LatchBio được trình bày tại benchmarks.bio. Blog bổ sung của LatchBio, thẻ mô hình Grok 4.6 và Khung Trí tuệ Nhân tạo Tiên phong của SpaceXAI được liên kết bên dưới.
