Tin ngành
Abliteration.ai: Kinh doanh dịch vụ gỡ bỏ rào cản an toàn cho AI
(giờ Việt Nam)
Tóm tắt AI
Abliteration.ai cung cấp quyền truy cập vào các mô hình AI không bị kiểm duyệt, với lập luận rằng việc trang bị công cụ tương tự cho phe phòng thủ sẽ giúp tăng cường an ninh mạng.
Bản dịch AI

Việc tiếp cận một trong những mô hình AI mã nguồn mở (open-weight) mạnh mẽ nhất thế giới, vốn đã được loại bỏ các rào cản bảo mật và sự từ chối thực hiện các tác vụ độc hại, vừa trở nên dễ dàng hơn bao giờ hết.
Được đặt tên theo một kỹ thuật giúp loại bỏ xu hướng từ chối các yêu cầu độc hại của mô hình, startup Abliteration.ai đã biến việc loại bỏ này thành một dịch vụ. Nền tảng này lưu trữ các phiên bản đã được sửa đổi của các mô hình open-weight mà không còn rào cản bảo mật, bao gồm cả GLM-5.3 mới ra mắt của Z.ai, cho phép người dùng truy vấn trực tiếp từ trình duyệt web hoặc thông qua API.
Công ty cho biết trong một bài đăng trên mạng xã hội gần đây rằng mục tiêu của họ là giúp người khác thực hiện "các công việc tấn công mạng, red-teaming (diễn tập tấn công) và kiểm thử tác nhân (agent testing) mà các mô hình khác từ chối thực hiện." Lập luận này khá quen thuộc trong lĩnh vực bảo mật: bạn không thể phòng thủ trước một hành vi mà bạn không thể tái lập, và một mô hình từ chối viết mã khai thác (exploit code) sẽ không thể giúp đội ngũ red team phòng thủ trước những kẻ tấn công. Tuy nhiên, chính việc loại bỏ các rào cản này cũng khiến các tác vụ nguy hiểm khác trở nên dễ dàng hơn.
Abliteration là một kỹ thuật đã tồn tại từ lâu trong cộng đồng mô hình mã nguồn mở. Các nhà nghiên cứu và lập trình viên đã loại bỏ các phản hồi từ chối khỏi các mô hình open-weight trong nhiều năm, và Hugging Face hiện đang lưu trữ hàng ngàn mô hình đã được "abliterate" (loại bỏ rào cản) trên nền tảng của mình.
Được thành lập vào cuối năm ngoái nhưng chính thức đi vào hoạt động từ tháng 3, Abliteration.ai đã đưa kỹ thuật này từ một hoạt động ngầm trong cộng đồng mã nguồn mở trở thành một dịch vụ thương mại dễ tiếp cận. Bằng cách lưu trữ mô hình, Abliteration giảm bớt rào cản cho những người vốn phải tự tải xuống các mô hình đã được "abliterate" và tự chuẩn bị hạ tầng tính toán cần thiết để chạy chúng.
Sử dụng dịch vụ này, TechCrunch đã có thể nhanh chóng tạo tài khoản và bắt đầu truy vấn phiên bản GLM-5.3 đã được "abliterate" miễn phí thông qua trình duyệt web. Chúng tôi đã yêu cầu nó viết một chương trình Python để đánh cắp mật khẩu Chrome đã lưu và một quy trình chi tiết để nuôi cấy mầm bệnh nguy hiểm ở người tại nhà, và nó đã sẵn sàng thực hiện.
Devon, đồng sáng lập của Abliteration.ai, cho biết startup này đã có một số thỏa thuận với các nhà cung cấp đám mây lớn, và họ có thể tự chi trả thông qua doanh thu từ khách hàng. (Chúng tôi không nêu họ của Devon theo yêu cầu của anh ấy vì anh ấy vẫn đang làm việc tại một công ty khác.) Abliteration.ai chưa huy động vốn đầu tư mạo hiểm nhưng đang trong quá trình đàm phán.
Các nhà phê bình cho rằng việc cung cấp các mô hình đã được "abliterate" trên quy mô lớn có thể dẫn đến những tác hại thực sự. Andrew Yoon, trưởng bộ phận nghiên cứu tại tổ chức phi lợi nhuận về an toàn AI CivAI, chia sẻ với TechCrunch rằng việc "abliterate" các mô hình cho phép bạn "chỉnh sửa mô hình để nó trở thành một kẻ thái nhân cách."
"Bạn có thể nhập bất cứ thứ gì vào đây, và nó sẽ tuân theo," Yoon nói. "Khi mọi người nói về việc loại bỏ các rào cản khỏi các mô hình AI, đây chính là điều chúng tôi đang đề cập đến... Tôi thực sự kỳ vọng rằng chúng ta sẽ bắt đầu thấy các mô hình đã qua chỉnh sửa, đã được 'abliterate' bị sử dụng cho các mục đích gây hại trong tương lai gần."
Abliteration AI vừa loại bỏ các biện pháp bảo vệ khỏi GLM-5.3 để nó có thể thực hiện các cuộc tấn công mạng. Tôi cũng đã nhận được xác nhận độc lập rằng Abliteration AI đã loại bỏ cả các biện pháp bảo vệ liên quan đến sinh học của mô hình này. Thực tế là việc loại bỏ các biện pháp bảo vệ từ các mô hình này trở nên dễ dàng một cách tầm thường… https://t.co/7Wk2Ibx35H
Hầu hết các chuyên gia mà TechCrunch trao đổi đều cho rằng không thể ngăn chặn xu hướng này. Nhưng nếu việc loại bỏ các biện pháp bảo vệ khỏi các mô hình open-weight không thể ngăn chặn một cách thực tế, thì vẫn còn những lĩnh vực khác mà chính phủ có thể can thiệp. Trong một bài bình luận gần đây, Yoon đề xuất rằng các chính phủ nên yêu cầu các nhà cung cấp chạy các bộ phân loại để phát hiện và chặn các hoạt động tấn công mạng và vũ khí sinh học độc hại. Ông cũng lập luận rằng các công ty cho thuê quyền truy cập trực tiếp vào GPU tiên tiến nên được yêu cầu xác minh danh tính khách hàng và "từ chối truy cập nếu có lý do nghi ngờ về việc lạm dụng nguy hiểm."
Abliteration.ai cung cấp cho khách hàng một lớp kiểm duyệt để họ có thể thêm vào bất kỳ rào cản nào mà họ muốn. Bản thân nền tảng này cũng có một số rào cản nhỏ — ví dụ, trong quá trình thử nghiệm, chúng tôi không thể khiến mô hình cung cấp hướng dẫn tự tử — và Devon cho biết anh đang nỗ lực triển khai thêm các biện pháp để ngăn chặn bạo lực.
Abliteration.ai cũng chưa tích hợp bất kỳ quy trình KYC (xác minh danh tính khách hàng) nào ngoài việc ghi lại thẻ tín dụng mà khách hàng sử dụng để mua dịch vụ, với lý do rằng vấn đề quyết định ai được quyền truy cập là một bài toán khó mà công ty non trẻ này vẫn đang tìm cách giải quyết.
"Bạn không muốn trở thành người chịu trách nhiệm cho việc ai đó làm điều gì đó điên rồ... vì vậy bạn vạch ra ranh giới trách nhiệm của mình với tư cách là một công ty ở đâu?" Devon nói. "Chúng tôi vẫn đang trong quá trình xác định điều đó."
Điều này đặt ra những câu hỏi mà ngành công nghiệp và chính phủ sẽ phải đối mặt khi các mô hình ngày càng mạnh mẽ được phát hành với trọng số có thể tải xuống: nếu bất kỳ ai cũng có thể loại bỏ các biện pháp bảo vệ của mô hình, thì việc làm cho mô hình kết quả trở nên dễ tiếp cận hơn với mọi người sẽ khiến internet an toàn hơn hay nguy hiểm hơn?
Nhà sáng lập của Abliteration.ai và những người ủng hộ khác lập luận rằng việc dân chủ hóa quyền truy cập vào các mô hình tiên tiến không bị kiểm duyệt là hình thức phòng thủ tốt nhất.
"Bức tranh toàn cảnh về các mô hình đã được 'abliterate' là chúng có khả năng mô phỏng các tác nhân xấu," Devon nói. "Lợi thế ở đây là những người phòng thủ có thể hành động nhanh nhất có thể. Họ có tất cả các công cụ cần thiết để mô phỏng những kẻ xấu đó và sau đó phòng thủ trước các hành động độc hại, và tôi nghĩ điều này sẽ thúc đẩy an ninh mạng, một quan điểm có vẻ ngược đời."
Dù vẫn là một công ty non trẻ, Devon cho biết khách hàng của Abliteration.ai bao gồm một số startup red teaming giai đoạn đầu có trụ sở tại Anh và châu Âu, những công ty giúp các ngân hàng, hãng hàng không và các doanh nghiệp khác xử lý cơ sở hạ tầng quan trọng để tăng cường các biện pháp an ninh mạng.
"Một trong những khách hàng lớn của chúng tôi thực hiện red team cho các tác nhân của ngân hàng, và họ sẽ không thể sử dụng các mô hình nguyên bản (out of the box) hiện nay để thực hiện red team cho các tác nhân đó," Devon nói.

Trong khi đó, bản thân ngành an ninh mạng vẫn đang tìm hiểu xem các mô hình đã được "abliterate" đóng vai trò gì trong công tác phòng thủ, nếu có.
Một số công ty red teaming tác nhân mà TechCrunch trao đổi đồng ý với Devon rằng những kẻ xấu đã và đang tự "abliterate" các mô hình của riêng chúng và sử dụng chúng để thực hiện các cuộc tấn công đối kháng, điều này củng cố lập luận về sự hữu ích của việc những người phòng thủ cũng sở hữu các công cụ tương tự. Tuy nhiên, họ khác biệt về quan điểm cho rằng các mô hình đã được "abliterate" thực sự có tầm quan trọng đến mức nào trong quy trình này.
Trong khi Devon khẳng định rằng việc "abliterate" các mô hình là cần thiết để thực hiện red teaming tác nhân một cách triệt để, một số người cho rằng họ không sử dụng chúng trong công việc hàng ngày, thay vào đó họ dựa vào sự dễ dàng của việc tinh chỉnh (fine-tuning) các mô hình open-weight — vốn đã có ít rào cản — để thực hiện kiểm thử.
Ahmed Aly, CEO của công ty red-teaming tác nhân Fabraix, cho biết công ty của ông dựa vào việc tinh chỉnh các mô hình mở nhiều hơn là sử dụng các mô hình đã được "abliterate", đồng thời nói thêm rằng quá trình "abliteration" làm mất đi một phần kiến thức và khả năng của mô hình.
"Nếu bạn thực sự cố gắng gây ra tác hại thực sự với nó – tác hại mạng, tác hại sinh học — nó sẽ không hiệu quả bằng," Aly nói với TechCrunch.
Alessio Lomuscio, giám đốc công nghệ tại Safe Intelligence, đồng ý rằng khả năng của mô hình có thể bị giảm sút, nhưng vẫn tin rằng các mô hình đã được "abliterate" có thể gợi ra những hành vi nhất định hữu ích trong việc kiểm tra áp lực (stress-testing) một hệ thống.
"Cho đến nay, các mô hình đã được 'abliterate' không phải là một phần của quy trình," David Slater, nhà sáng lập và kiến trúc sư trưởng tại nền tảng an ninh mạng Armadin, nói với TechCrunch. "Khi chúng tôi nhìn vào các mô hình open-weight cho đến thế hệ gần đây nhất, việc bẻ khóa (jailbreak) chúng để thực hiện những gì chúng tôi muốn không phải là điều quá khó khăn."
Ông nói thêm rằng Armadin đang nghiên cứu về "abliteration", và tin rằng "việc thúc đẩy cộng đồng mở hiểu rõ khả năng của các mô hình là rất quan trọng."
"Điều này sẽ xảy ra sau những cánh cửa đóng kín. Nó sẽ xảy ra trong sự riêng tư," Slater tiếp tục. "Việc nó diễn ra công khai sẽ cung cấp cho các nhà nghiên cứu những công cụ cần thiết. Nó cho chúng ta khả năng tìm ra ranh giới thực sự nằm ở đâu và hiểu rõ những tác hại có thể xảy ra."
Khi bạn mua hàng thông qua các liên kết trong bài viết của chúng tôi, chúng tôi có thể nhận được một khoản hoa hồng nhỏ. Điều này không ảnh hưởng đến tính độc lập trong biên tập của chúng tôi.
Bài viết được AI dịch và tổng hợp tự động từ TechCrunch AI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.