Nghiên cứu
GPT-6 Astra: Hệ thống, cơ chế căn chỉnh và lộ trình phát triển tương lai
(giờ Việt Nam)
Tóm tắt AI
OpenAI khẳng định Astra là mô hình thông minh và có độ căn chỉnh tốt nhất thế giới hiện nay. Bài viết phân tích sâu về tài liệu kỹ thuật và định hướng phát triển của hệ thống này.
Bản dịch AI

OpenAI tuyên bố rằng Astra là ‘mô hình thông minh nhất và được căn chỉnh (aligned) tốt nhất [hiện có]’ trên thế giới. Không phải là mô hình thông minh và được căn chỉnh tốt nhất của OpenAI, mà là nhất trong tất cả.
Đó là một tuyên bố táo bạo. Nó có nguy cơ đi quá giới hạn, và làm như vậy sẽ gây ảnh hưởng tiêu cực đến sự ra mắt của một mô hình vốn dĩ rất xuất sắc. Các vấn đề nghiêm trọng về khả năng giám sát cũng vậy.
Điều này cũng đặt ra câu hỏi về ý nghĩa của cụm từ ‘mô hình được căn chỉnh tốt nhất’. Họ định nghĩa ‘căn chỉnh’ như thế nào? Tại sao họ lại cho rằng nó được căn chỉnh tốt hơn Claude Fable 5.1?
keltan ⏸️: "một bước tiến đáng kể trong [...] căn chỉnh."
Này, làm thế quái nào mà bạn đo lường được 'sự căn chỉnh' vậy? Tôi rất muốn biết vì nếu đo lường được điều đó thì có thể cứu cả cái thế giới chết tiệt này rồi.
roon (OpenAI): tỷ lệ gian lận thấp
Rob Miles: *đã phát hiện gian lận
keltan ⏸️: Cảm ơn bạn đã làm rõ. Nhưng bạn biết tôi sắp nói gì tiếp theo rồi đúng không?
roon (OpenAI): rằng các chỉ số này không giải quyết triệt để vấn đề căn chỉnh và sẽ bị phá vỡ một cách đột ngột
keltan ⏸️: Yep. Nhưng tôi sẽ nói theo cách ngớ ngẩn hơn. Đại loại như: Tỷ lệ gian lận thấp ≠ Căn chỉnh
roon (OpenAI): Tôi đồng ý, nhưng xét trên một khía cạnh thực tế nào đó thì Astra được căn chỉnh tốt hơn Sol.
Theo những gì tôi có thể thấy, Astra được căn chỉnh tốt hơn Sol ở những khía cạnh then chốt, nhưng: Ôi không.
Chủ tịch OpenAI Greg Brockman xác nhận rằng họ đã thực hiện ‘quy trình kiểm thử tiêu chuẩn cùng với chính phủ’ và chính phủ không yêu cầu bất kỳ thay đổi nào. Tôi không nghĩ những người điều hành việc kiểm thử của chính phủ hiểu chuyện gì đang xảy ra, và tin rằng họ chỉ đang phản ứng dựa trên cảm tính và những gì các nhân vật đáng tin cậy nói với họ.
Trọng tâm này đặc biệt quan trọng vì những gì chúng ta đã biết ngày hôm qua. Vâng, họ đã giải được một Bài toán Thiên niên kỷ, tôi nhớ mình từng quan tâm hoặc ngạc nhiên về điều đó, nhưng họ cũng đã nói một điều quan trọng hơn nhiều, điều mà họ hoàn toàn không bắt buộc phải nói:
OpenAI: Kể từ ngày 28 tháng 8, chúng tôi đã huấn luyện một mô hình nội bộ mới, đạt hiệu suất chưa từng có trong các bài kiểm chuẩn (benchmarks) của chúng tôi, bao gồm cả toán học. Quá trình huấn luyện mô hình này vẫn đang tiếp diễn và hiệu suất của nó vẫn tiếp tục cải thiện.

Điều đó có nghĩa là nỗ lực này bắt đầu sau bốn ngày huấn luyện mô hình mới, vào ngày 1 tháng 9. Công việc hoàn thành vào ngày 5 tháng 9, tám ngày sau khi mô hình bắt đầu được huấn luyện.
Một hàm ý khác là họ đã khởi chạy 10.000 tác nhân (agents) đồng thời để tạo thành một bầy (swarm), từ một mô hình mới chỉ được huấn luyện trong vài ngày. Chúng ta không thể nào biết được liệu một mô hình như vậy có được căn chỉnh hay không.
Nếu chỉ cần bấy nhiêu đó là đủ để vượt trước Astra một thế hệ, và chúng ta sẵn sàng tiến nhanh đến mức này, thì những khoảng dừng trong huấn luyện sẽ chẳng còn mấy ý nghĩa, thời gian còn ngắn hơn chúng ta tưởng, điểm kỳ dị, điểm kỳ dị, điểm kỳ dị, điểm kỳ dị, ôi tôi không biết liệu mình còn sống được bao lâu nữa. Kinh khủng thật. Lạy Chúa tôi.
OpenAI đang đưa ra những lời cảnh báo có thể là cuối cùng của chúng ta. Tốt nhất là chúng ta đừng lãng phí chúng.
Điều này làm cho việc xem xét kỹ lưỡng Astra trở nên quan trọng hơn bao giờ hết, bao gồm các bằng chứng về sự căn chỉnh hoặc thiếu căn chỉnh của nó, cũng như các khả năng nguy hiểm tiềm tàng, trong khi phải biết rằng phiên bản 6.1 đã tồn tại và có thể được huấn luyện gần như trong vòng một tuần.
Tôi thấy thẻ mô hình (model card) đưa ra một số tuyên bố về bằng chứng cho sự căn chỉnh của Astra, hoặc những điều chúng ta có thể tự tin rằng Astra không thể làm, mà đối với tôi là không có cơ sở. Điều này bao gồm các tuyên bố về việc nó không có khả năng thực hiện ẩn mã (steganography), và rằng một số hành vi ‘được căn chỉnh tốt hơn’ của nó là tin tốt về sự căn chỉnh của Astra, thay vì là những dấu hiệu cảnh báo.
Các tuyên bố về an toàn của OpenAI đối với Astra (1).
Đánh giá khả năng sẵn sàng (10).
Khả năng sinh học và hóa học ở mức cao.
Khả năng an ninh mạng ở mức nguy cấp.
Khả năng tự cải thiện của AI (10.1.3).
Astra nhận thức rất rõ về các bài đánh giá bằng lời nói (8.6).
Các hoàn thành thông thường an toàn (4.1).
Bẻ khóa (Jailbreaks) (5.1).
Tiêm câu lệnh (Prompt Injection) (5.2).
Sức khỏe (6).
Ảo giác (7).
Căn chỉnh (8).
Tuân thủ các hạn chế (8.2).
Điều đó còn tệ hơn, bạn hiểu tại sao nó lại tệ hơn chứ, đúng không?
OpenAI không hiểu tại sao điều này lại tệ hơn.
Lời giải thích thay thế cũng tệ hơn.
Metagaming (8.7).
Bài viết được AI dịch và tổng hợp tự động từ Don't Worry About the Vase (Zvi). Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.