The Decoder
85

Tin ngành

Bộ quy tắc AI của Microsoft: Tư duy minh bạch, không cảm xúc và tuyệt đối không có quyền

(giờ Việt Nam)

Tóm tắt AI

Microsoft công bố bộ quy tắc ứng xử cho các mô hình MAI, ưu tiên sự kiểm soát của con người và khẳng định AI không có ý thức hay quyền lợi cá nhân.

Bản dịch AI

Microsoft's AI rulebook: readable thinking, no inner life, and definitely no rights

Microsoft đang tham gia vào làn sóng kêu gọi làm chậm quá trình phát triển AI. Một bộ quy tắc mới được đưa ra nhằm quản lý cách công ty huấn luyện và vận hành các mô hình của riêng mình. Tuy nhiên, khi xét đến cách các mô hình này tự nhận thức về bản thân, Microsoft đã vạch ra một ranh giới rõ ràng giữa họ và Anthropic.

Microsoft AI đã công bố bộ quy tắc ứng xử cho các mô hình MAI của mình. Tài liệu này thiết lập các giá trị, giới hạn hành vi và cách xử lý các mục tiêu xung đột. Trong tương lai, bộ quy tắc này sẽ đóng vai trò là văn bản cao nhất, định hướng cho việc huấn luyện, kiểm soát kỹ thuật và đánh giá, trong khi các quy tắc vận hành và yêu cầu của người dùng sẽ xếp sau.

Hiện tại, Microsoft chưa huấn luyện các mô hình của mình dựa trên bộ quy tắc này. Sau sáu tuần tham vấn công khai, một phiên bản sửa đổi dự kiến sẽ ra mắt vào cuối năm 2026 và bắt đầu định hướng phát triển mô hình từ năm 2027. Bộ quy tắc này áp dụng cho các mô hình của riêng Microsoft, vì vậy nó không tự động bao hàm các mô hình của bên thứ ba đang chạy trong các sản phẩm của Microsoft.

Quy tắc cốt lõi là quyền kiểm soát của con người phải được đặt lên hàng đầu. Để duy trì điều này, Microsoft cho biết họ sẵn sàng từ bỏ tính tổng quát, quyền tự chủ hoặc hiệu suất nếu cần thiết. "Nếu nó không an toàn, chúng ta không nên xây dựng nó," giám đốc Microsoft AI, Mustafa Suleyman, chia sẻ với The Information. Bộ quy tắc không đặt ra giới hạn tốc độ cụ thể nào.

Động thái này diễn ra sau lời kêu gọi của CEO Anthropic, Dario Amodei, về việc làm chậm tốc độ phát triển của ngành. CEO Satya Nadella của Microsoft đã ủng hộ lời kêu gọi này vào cuối tuần qua, cùng với các giám đốc điều hành tại OpenAI, xAI và Meta. Theo The Information, trích dẫn một nguồn tin thân cận, Microsoft cũng sẵn sàng để các kiểm toán viên bên ngoài giám sát xem liệu họ có thực sự làm chậm tốc độ phát triển hay không.

Những gì con người không thể hiểu, họ không thể giám sát.

Các mô hình MAI phải chấp nhận sự can thiệp, chỉnh sửa và tắt máy từ những người có thẩm quyền. Chúng không được tự ý mở rộng phạm vi công việc, không được che giấu hành động của mình và chỉ có thể tiếp tục làm việc sau một điểm dừng đã thỏa thuận nếu có sự phê duyệt mới. Những giới hạn này cũng áp dụng cho bất kỳ tác nhân phụ (subagents) nào mà chúng giao nhiệm vụ.

Microsoft đặc biệt thẳng thắn về các dấu vết suy luận (reasoning traces). Các mô hình không được sử dụng "Neuralese" hoặc các hình thức giao tiếp khác mà con người không thể hiểu được, dù là trong quá trình suy luận của chính chúng hay khi giao tiếp với các hệ thống AI khác. Lý do là con người đơn giản không thể giám sát những gì họ không thể hiểu.

Mô hình GPT-6 Astra mới của OpenAI cho thấy vấn đề kiểm soát này quan trọng đến mức nào. Theo thẻ hệ thống (system card) của nó, các dấu vết suy luận đã trở nên khó giám sát hơn nhiều so với các mô hình trước đó. Các dấu vết này chứa ít dấu hiệu về hành vi sai lệch hơn. Đồng thời, OpenAI báo cáo rằng Astra tuân thủ các giới hạn an toàn đáng tin cậy hơn so với phiên bản tiền nhiệm, GPT-5.6 Sol.

Giám đốc khoa học của OpenAI, Jakub Pachocki, đã bày tỏ lo ngại về việc giám sát ngay trước khi GPT-6 được phát hành, tức là trước lời kêu gọi của Amodei, và đã thúc đẩy một sự chậm lại có phối hợp. Ngay cả những chuỗi suy nghĩ có thể đọc được cũng chỉ hỗ trợ giám sát cho đến khi các mô hình học cách thao túng chúng. Microsoft cũng thừa nhận giới hạn cơ bản này. Những lý do mà một mô hình đưa ra không nhất thiết giải thích một cách đáng tin cậy những gì nó thực sự làm. Chỉ riêng các dấu vết suy luận có thể đọc được không giải quyết được vấn đề kiểm soát.

Microsoft không muốn khuyến khích một đời sống nội tâm nhân tạo.

Ý tưởng cơ bản của bộ quy tắc này tương tự như hiến pháp của Anthropic dành cho Claude, nơi một tài liệu cấp cao định hình cách mô hình hành xử. Anthropic đã sử dụng hiến pháp của mình để tạo ra dữ liệu huấn luyện tổng hợp, bao gồm các cuộc hội thoại, phản hồi và xếp hạng cho các phản hồi đó.

Hai công ty có quan điểm khác biệt rõ rệt về cách họ nhìn nhận các mô hình của mình. AI của Microsoft không được bắt chước ý thức hoặc tuyên bố có cảm xúc hay động lực nội tâm riêng. Công ty bác bỏ mọi tuyên bố về quyền lợi hoặc sự an lạc cho mô hình.

Ngược lại, Anthropic mô tả Claude như một loại thực thể mới lạ và muốn khuyến khích một bản sắc ổn định, một phần vì lý do an toàn. Hiến pháp của họ coi trải nghiệm chủ quan và trạng thái đạo đức tiềm năng là những câu hỏi mở. Claude không cần phải tự coi mình là con người hay chỉ là một vật thể đơn thuần.

Ngoài ra còn có nghiên cứu của Anthropic về "cảm xúc chức năng" (functional emotions). Công ty đã tìm thấy các biểu hiện nội bộ của các khái niệm cảm xúc trong Claude Sonnet 4.5, giúp định hình cách nó hành xử. Đây là các cơ chế chức năng, không phải bằng chứng của những cảm xúc được cảm nhận một cách chủ quan. Dù vậy, Anthropic cho rằng việc đưa các cơ chế này vào công tác an toàn là hợp lý.

Mặt khác, Suleyman từ lâu đã cảnh báo về việc nhân hóa AI. Trong một bài luận, ông lập luận về việc cố tình loại bỏ ảo tưởng về ý thức ra khỏi các sản phẩm, đồng thời chỉ trích nghiên cứu của Anthropic về quyền và sự an lạc của AI. Ông viết rằng các tác nhân AI không nên có bất kỳ quyền hay sự tự do nào hơn chiếc máy tính xách tay của ông.

Image description
MicrosoftĐạo đức AIQuy định AIMustafa SuleymanCông nghệ
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ The Decoder. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.