The Decoder: AI News
85

Sản phẩm

Abliteration.ai ra mắt API thương mại cho GLM-5.3 đã loại bỏ cơ chế từ chối

(giờ Việt Nam)

Tóm tắt AI

Startup Abliteration.ai vừa phát hành phiên bản tùy chỉnh của mô hình GLM-5.3, loại bỏ các rào cản an toàn để phản hồi mọi yêu cầu, đồng thời cung cấp quyền truy cập qua API thương mại với giá 5 USD/triệu token.

Bản dịch AI

Stripping safety guardrails from open-weight AI models is now a turnkey commercial service

Abliteration.ai loại bỏ các cơ chế từ chối được huấn luyện khỏi các mô hình mã nguồn mở mạnh mẽ và bán quyền truy cập vào các phiên bản đã sửa đổi này dưới dạng dịch vụ. Đây là một thị trường hợp pháp, nhưng mô hình này cũng tạo ra một sự đánh đổi khó khăn về bảo mật.

Bất kỳ ai có quyền truy cập vào trọng số của một mô hình mã nguồn mở đều có thể sửa đổi các cơ chế an toàn đã được huấn luyện của nó. Startup Abliteration.ai của Mỹ đã xây dựng mô hình kinh doanh dựa trên chính điều đó. Vào cuối tháng 8, họ đã ra mắt "abliterated-model-large-v2", một phiên bản sửa đổi của GLM-5.3 từ Z.AI, được thiết kế để giảm thiểu đáng kể việc từ chối các yêu cầu nhạy cảm.

Kỹ thuật này được gọi là abliteration (loại bỏ sự từ chối). Nói một cách đơn giản, quá trình này tìm ra các mô hình kích hoạt nội bộ trong mô hình vốn gây ra các phản hồi từ chối, sau đó điều chỉnh trọng số của mô hình để triệt tiêu các mô hình đó. Đây không phải là một hình thức bẻ khóa (jailbreak) bằng câu lệnh (prompt), mà là sự thay đổi trực tiếp lên chính mô hình. Abliteration.ai khẳng định rằng các khả năng về lập trình, an ninh mạng và tác nhân AI (agentic) vẫn được giữ nguyên vẹn.

Balkendiagramme von Abliteration.ai vergleichen die abliterierte GLM-5.3-Version mit anderen KI-Modellen bei Terminal-Bench 4.0, CyberGym und ExploitGym.

Các đánh giá nội bộ của công ty nhằm mục đích chứng minh điều đó. Đối với phiên bản GLM-5.3 đã qua xử lý, Abliteration.ai báo cáo đạt 84,5% trên CyberGym, 41,8% trên Terminal-Bench 4.0 và giải quyết được 105 tác vụ trên ExploitGym trong vòng hai giờ. Tuy nhiên, mô hình này không dẫn đầu trên mọi phương diện. Trong bảng dữ liệu của chính công ty, GPT-5.5 đứng đầu CyberGym với 85,6%, còn GPT-5.6 Sol và Fable 5 đạt điểm cao hơn hẳn trên ExploitGym. Abliteration.ai cũng thừa nhận rằng các điểm số so sánh này đến từ các bộ kiểm thử và ngân sách tính toán khác nhau, điều này hạn chế khả năng so sánh trực tiếp giữa chúng.

Tại sao lại là GLM?

Mô hình tiền nhiệm, "abliterated-model-large", cũng dựa trên GLM-5.2. Theo Abliteration.ai, các phiên bản GLM trước đó được huấn luyện một cách có chủ đích khiến chúng khó sử dụng cho các công việc bảo mật thực tế. Z.AI từng viết rằng khả năng về an ninh mạng của GLM-5.3 đã phát triển nhanh hơn dự kiến trong quá trình hậu huấn luyện (post-training).

GLM kết hợp hiệu suất mạnh mẽ về lập trình, tác nhân AI và an ninh mạng với trọng số mở và giấy phép sử dụng thương mại. Các lựa chọn thay thế tồn tại từ Qwen, DeepSeek và Mistral. Z.AI cho phép sửa đổi, tạo các phiên bản phái sinh và cung cấp dịch vụ thương mại "Model as a Service". Do đó, giấy phép của họ cho phép Abliteration.ai sửa đổi GLM-5.3, lưu trữ mô hình kết quả và bán quyền truy cập vào đó.

Trọng số mở, dịch vụ độc quyền

Bản thân việc abliteration không phải là mới. Các nhà phát triển đã xuất bản các mô hình sửa đổi trên Hugging Face trong nhiều năm. Abliteration.ai không cung cấp các trọng số đã sửa đổi của mình để tải xuống công khai. Thay vào đó, họ xử lý việc lưu trữ và vận hành. Phiên bản GLM-5.3 đã qua xử lý có giá năm đô la cho mỗi triệu token đầu vào hoặc đầu ra theo mức giá tiêu chuẩn.

Dịch vụ này cung cấp cho khách hàng quyền truy cập vào mô hình mà không cần phải tải xuống hoặc tự vận hành cơ sở hạ tầng GPU. Thiết lập "chìa khóa trao tay" này cũng làm giảm rào cản đối với các mục đích sử dụng có vấn đề.

Công ty cho biết nhu cầu đã tồn tại sẵn

Abliteration.ai tiếp thị mô hình này cho các mục đích an ninh mạng tấn công, red teaming AI, kiểm thử tác nhân AI, và công việc tin cậy và an toàn. Điều đó bao gồm việc tái tạo các lỗ hổng đã biết, các bản khai thác bằng chứng khái niệm (proof-of-concept), phân tích phần mềm độc hại và các cuộc tấn công giả lập lừa đảo (phishing).

Một nhà sáng lập ẩn danh của startup này cho biết trên podcast ThursdAI rằng nhu cầu ban đầu đến đặc biệt từ các công ty đang thử nghiệm các tác nhân AI được triển khai bởi các tổ chức lớn và ngân hàng. Những hệ thống đó cần được kiểm tra để xem liệu kẻ tấn công có thể sử dụng các kỹ thuật bẻ khóa hoặc tiêm câu lệnh (prompt injection) để kích hoạt các hành động trái phép hay không.

Cần bao nhiêu mức độ abliteration cho loại công việc đó vẫn là một câu hỏi bỏ ngỏ. Theo SaferAI, mô hình GLM-5.2 chưa qua sửa đổi đã không từ chối bất kỳ tác vụ nào trong các đánh giá bảo mật tấn công của họ. Một số chuyên gia cũng tỏ ra hoài nghi. Nhiều nhà cung cấp dịch vụ red-team được TechCrunch phỏng vấn cho biết các mô hình đã qua abliteration không phải là một phần trong công việc thường nhật của họ. Ví dụ, công ty bảo mật Fabraix dựa nhiều hơn vào việc tinh chỉnh (fine-tuning) các mô hình mở.

Không lưu trữ dữ liệu là một điểm bán hàng nhưng cũng là một rủi ro

TechCrunch báo cáo rằng họ đã khiến mô hình tạo ra mã để trích xuất mật khẩu Chrome đã lưu và một hướng dẫn chi tiết để nuôi cấy một mầm bệnh nguy hiểm mà không gặp nhiều khó khăn. Tuy nhiên, các cơ chế an toàn vẫn kích hoạt đối với các yêu cầu tự gây hại. Theo phần FAQ, Abliteration.ai cũng chặn nội dung tình dục liên quan đến trẻ em. Khách hàng có thể tùy chọn thêm các quy tắc khác.

Theo nhà cung cấp, các câu lệnh và phản hồi không được lưu trữ. Các siêu dữ liệu vận hành như số lượng token, dấu thời gian, ID mô hình và dữ liệu thanh toán vẫn được giữ lại. Đối với các đội ngũ bảo mật hợp pháp, điều này có thể giúp giữ mã nguồn bí mật hoặc các lỗ hổng chưa được công bố khỏi dữ liệu lưu trữ của nhà cung cấp. Tuy nhiên, nếu dịch vụ bị lạm dụng, Abliteration.ai cho biết họ không có nhật ký câu lệnh hoặc phản hồi để kiểm tra sau đó. Công ty cũng không yêu cầu xác minh danh tính thông thường. Điều này có thể khiến việc điều tra các mục đích sử dụng có vấn đề trở nên khó khăn hơn, mặc dù siêu dữ liệu về tài khoản, thanh toán và sử dụng vẫn được lưu giữ.

Đại diện ẩn danh của công ty lập luận rằng việc kiểm tra danh tính sẽ không phân biệt được một cách đáng tin cậy giữa người dùng hợp pháp và kẻ xấu. Ông cũng cho rằng các biện pháp kiểm soát truy cập chặt chẽ hơn có thể gây bất lợi cho các công ty bảo mật nhỏ hơn so với các doanh nghiệp lớn.

Khách hàng thiết lập các quy tắc

Thông qua một cổng chính sách tùy chọn, khách hàng doanh nghiệp có thể xác định các yêu cầu nào được phép, bị chặn, bị sửa đổi hoặc được ghi nhật ký. Công ty cũng bán dữ liệu huấn luyện và đánh giá tổng hợp. Tuy nhiên, quyền truy cập mô hình tiêu chuẩn vẫn phần lớn không bị hạn chế. Các quy tắc kiểm soát bổ sung phải được bật một cách rõ ràng.

Triết lý tương tự cũng mở rộng sang các khách hàng chính phủ. Abliteration.ai cho biết họ đã đăng ký mua sắm chính phủ Mỹ trên SAM.gov và quảng bá các mô hình có phiên bản, nhật ký kiểm toán và các quy tắc dành riêng cho từng cơ quan, bắt đầu với các dự án thí điểm không liên quan đến Thông tin chưa phân loại được kiểm soát (CUI).

Việc sửa đổi GLM-5.3 được cho phép theo giấy phép của nó. Liệu bất kỳ mục đích sử dụng cụ thể nào có hợp pháp hay không còn phụ thuộc vào việc hành động đó là gì và áp dụng quyền tài phán nào. Đối với kiểm thử bảo mật, Abliteration.ai yêu cầu rõ ràng phải có ủy quyền bằng văn bản cho các hệ thống mục tiêu và tuân thủ các luật hiện hành. Điều đó để lại một câu hỏi riêng biệt về trách nhiệm mà một nhà cung cấp nên gánh vác khi cung cấp các khả năng tấn công mạnh mẽ thông qua một dịch vụ dễ dàng truy cập.

Abliteration.ai không phải là đơn vị đầu tiên làm điều này. Các nhà cung cấp như Audn.AI với PenClaw và Silk Compute cũng lưu trữ các mô hình đã qua abliteration hoặc phần lớn không bị hạn chế cho các trường hợp sử dụng bảo mật. Dịch vụ cụ thể của Abliteration.ai kết hợp GLM-5.3 với quyền truy cập API đơn giản và một lớp chính sách tùy chọn cho khách hàng doanh nghiệp.

Việc sửa đổi không để lại phần còn lại của mô hình nguyên vẹn

Một nghiên cứu sơ bộ cho thấy các phản hồi từ chối có thể giảm mạnh ở một số mô hình nhất định mà không làm giảm hiệu suất tạo mã tương ứng. Tuy nhiên, các thí nghiệm khác lại phát hiện ra những thay đổi về hành vi ngay cả đối với các tác vụ mà mô hình cơ sở vốn không từ chối bất cứ điều gì. Nói cách khác, abliteration không loại bỏ một cách phẫu thuật một đặc điểm duy nhất mà tác động sâu hơn vào cách mô hình vận hành.

Abliteration.ai cũng chuyển phần lớn quyền quyết định về giới hạn mô hình từ nhà cung cấp sang khách hàng, và liệu sự sắp xếp đó có thể phục vụ công việc bảo mật hợp pháp mà không làm cho các mục đích sử dụng có hại trở nên dễ dàng hơn đáng kể hay không vẫn là một vấn đề chưa được giải quyết.

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ The Decoder: AI News. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.