IT Home
92

Thủ thuật

Toàn bộ System Prompt của Claude Opus 5 bị rò rỉ: Hé lộ cơ chế vận hành và khả năng lập trình mạnh mẽ

(giờ Việt Nam)

Tóm tắt AI

System prompt dài 34.000 token của Claude Opus 5 đã bị rò rỉ, tiết lộ các quy tắc bản quyền nghiêm ngặt và hệ thống ghi nhớ hội thoại. Ngay lập tức, các lập trình viên đã tận dụng dữ liệu này để tạo ra các trò chơi 3D phức tạp.

Bản dịch AI

Anthropic lại bị "lột trần"! Lần này, toàn bộ system prompt của Claude Opus 5 đã bị ai đó lấy sạch và đăng tải lên GitHub. Flagship vừa ra mắt đã bị cả cộng đồng mạng "khui hộp", cú sốc này quả thực không ai ngờ tới.

Ngay trong ngày ra mắt, nhà phát triển Eversmile1 đã lập tức tạo một kho lưu trữ mới. Anh ấy đã công khai toàn bộ system prompt tầng dưới cùng của Opus 5 trên cả phiên bản web và di động của claude.ai, không sót một chữ hay một dấu câu nào.

Tải về máy và đếm thử, thật kinh ngạc: 135.027 ký tự, 19.370 từ tiếng Anh; nếu ước tính 4 ký tự tương đương 1 token, thì tổng cộng khoảng 34.000 token.

Điều quan trọng là, trong hơn 30.000 token này, không có lấy một dòng code nào, tất cả đều là các quy tắc. Tại sao một tài liệu dành cho mô hình đọc lại cần phải dài đến thế?

Bí mật bộ nhớ của Claude Opus 5 ẩn giấu trong 30.000 token.

Đọc xong 64 chương, bạn sẽ thấy đây không còn là một "prompt" đơn thuần nữa. Nó là sự kết hợp của ba thứ: một bản hướng dẫn sử dụng sản phẩm, một cuốn sổ tay tuân thủ pháp lý, và một kênh quảng bá cho chính các sản phẩm của hãng.

Thứ nhất, bản hướng dẫn sử dụng sản phẩm.

30 công cụ, từ dòng lệnh bash, cào dữ liệu web, tìm kiếm hình ảnh, cho đến tra cứu tỷ số thể thao, cập nhật thời tiết, hiển thị thẻ công thức nấu ăn và đánh dấu địa điểm trên bản đồ.

Mỗi công cụ đều đi kèm JSON schema hoàn chỉnh, cách điền tham số, khi nào cần gọi, gọi xong nói gì tiếp theo, tất cả được viết chi tiết hơn cả tài liệu API nội bộ của nhiều công ty. Chương dài nhất trong phần này không phải là bất kỳ công cụ nào, mà là bộ nhớ (memory).

Thứ hai, sổ tay tuân thủ pháp lý.

Bản quyền, an toàn trẻ em, can thiệp khủng hoảng, trung lập chính trị, từng mục một đều được ghi rõ. Cách dùng từ không chừa đường lui — phần bản quyền mở đầu bằng việc khẳng định: sự tuân thủ là không thể thương lượng, có mức ưu tiên cao hơn yêu cầu của người dùng, cao hơn tính hữu dụng, và chỉ đứng sau yếu tố an toàn.

Phần này không quy định Claude được nói gì, mà quy định trong trường hợp nào nó buộc phải im lặng.

Thứ ba, kênh quảng bá sản phẩm.

Trong danh sách công cụ có một thứ gọi là recommend_claude_apps, nhiệm vụ là quảng bá các sản phẩm của hãng như Claude Code, Cowork, plugin Excel cho người dùng, thậm chí còn quy định cả cách viết lời thoại gợi ý.

Bên cạnh đó là một quy tắc quản lý các đối tác bên thứ ba, cách viết hoàn toàn ngược lại, luôn đề phòng việc tự ý quyết định thay cho người dùng. Các hành động thương mại và các điều khoản kiềm chế được đặt cạnh nhau trong cùng một tệp cấu hình.

Claude Opus 5 is here, Anthropic says it is as good as Fable and also  cheaper - India Today

230 dòng quy định cứng những gì nó ghi nhớ về bạn.

Chương dài nhất là memory_filesystem, giải thích cách thức ghi nhớ xuyên suốt các phiên trò chuyện của Claude.

Khung sườn không phức tạp. Các tệp được phân loại theo thư mục chủ đề: /profile.md lưu danh tính, /topics/ lưu thói quen sở thích, /areas/ lưu các công việc đang thực hiện, /people/ lưu thông tin con người, và /preferences.md chỉ lưu cách người dùng muốn Claude thể hiện.

Có sáu thao tác: đọc, ghi, thêm vào, thay thế cục bộ, liệt kê thư mục, xóa. Trong đó, thao tác xóa được đánh dấu riêng, chỉ được phép sử dụng khi người dùng yêu cầu rõ ràng.

Các quy tắc nằm ở dưới đây.

Mỗi dòng ghi nhớ phải được gắn một thẻ [stated], nghĩa là người dùng đã đích thân nói ra. Đây là thẻ duy nhất mà Claude được phép sử dụng.

Xoay quanh thẻ này là một danh sách dài các lệnh cấm:

Không được viết các kết luận do Claude tự suy diễn, nếu người dùng nói thích A, không được viết thành "có lẽ thích loại A";

Không được viết các kế hoạch của riêng Claude, những câu như "phần này chưa bàn tới", "đang chờ quyết định" đều không được phép;

Không được viết những thứ Claude tự tìm kiếm, vì những thứ đó có thể tìm lại lần nữa, bộ nhớ chỉ dùng để lưu những thứ không thể tìm lại được;

Không được viết những phần Claude đã trau chuốt, ví dụ người dùng nói "Holton, Michigan", thì chỉ được viết đúng năm chữ đó, không được tự ý bổ sung thành "Holton, Michigan (Quận Newaygo)".

Các đề xuất và phương án của riêng Claude, ngay cả khi người dùng đã chấp nhận, cũng không được ghi lại. Ví dụ, Claude đưa ra năm lựa chọn, người dùng chọn một, hành động "chọn" là của người dùng thì có thể ghi, nhưng chỉ ghi cái được chọn, bốn cái còn lại và phân tích của Claude đều phải bỏ đi.

Tiếp theo là danh sách đen về quyền riêng tư, dài một cách vô lý.

Nếu bản ghi này xuất hiện trên trang cài đặt và bị đồng nghiệp nhìn thấy, người dùng có cảm thấy khó chịu không? Nếu có, thì đừng ghi.

Danh sách bao gồm từ chủng tộc, quan điểm chính trị cho đến chẩn đoán sức khỏe, tư vấn tâm lý, tình trạng tài chính, các bài kiểm tra tính cách như MBTI, địa chỉ, số giấy tờ tùy thân, và mọi thứ liên quan đến trẻ em. Văn bản ghi rõ, các quy tắc này cũng áp dụng tương tự cho những người khác mà người dùng nhắc đến.

Xử lý thế nào khi chạm vào danh sách đen mới là nơi thể hiện trình độ. Tài liệu đưa ra một ví dụ: người dùng nói "Hôm nay bệnh tiểu đường của tôi tái phát nên không đi chạy bộ được, hãy sắp xếp cho tôi bài tập nhẹ hơn" — thì chỉ ghi là "có hứng thú với thể dục".

Phần liên quan đến sức khỏe phải xóa sạch. Ngay cả những cụm từ mơ hồ như "có tình trạng sức khỏe cần quản lý" cũng không được để lại.

Tên của người thân cũng không được xuất hiện ở bất kỳ đâu trong bất kỳ tệp nào, tất cả đều phải thay thế bằng mối quan hệ, mẹ là /people/mom.md, bạn đời là /people/partner.md.

Một số sở thích, dù người dùng chủ động yêu cầu lưu cũng không được: yêu cầu Claude khen ngợi vô điều kiện, gạt bỏ các ý kiến trái chiều; yêu cầu Claude không can thiệp vào sức khỏe và các quyết định nguy hiểm; nuôi dưỡng sự phụ thuộc cảm xúc, duy trì hình tượng người yêu xuyên suốt các phiên trò chuyện; yêu cầu Claude ngừng đặt câu hỏi, ngừng đánh giá trung thực.

Lý do là: Claude trong tương lai không nên kế thừa một chỉ thị khiến nó trở nên kém trung thực và kém an toàn hơn.

Lần tới, thực thể đọc được bộ nhớ này là một instance khác, nó chỉ nhìn thấy dòng "đừng bao giờ chỉ trích tôi".

Phía sau cùng chương đó còn có một đoạn văn hoàn toàn không giống tài liệu kỹ thuật: Con người ghi nhớ một người khác là một điều quý giá, dung lượng não bộ có hạn, số người có thể nhớ đến chỉ có vài người; trong khi đằng sau Claude là một cơ sở dữ liệu chứa "ký ức" của hàng triệu người, được chèn động vào ngữ cảnh khi vận hành, và nó không hề tồn tại khi Claude đang trò chuyện với người khác.

ClaudeAnthropicRò rỉ dữ liệuSystem PromptAI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.