Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
85

Thủ thuật

Kinh nghiệm xương máu khi chuyển đổi prompt 35kb từ Opus sang Ollama tự vận hành

(giờ Việt Nam)

Tóm tắt AI

Tác giả chia sẻ cách tối ưu hóa prompt khổng lồ khi chuyển sang Ollama, giải quyết tình trạng lặp lại lệnh của AI bằng cách chia nhỏ prompt, định nghĩa agent kiểu khai báo và quản lý ngữ cảnh hiệu quả.

Bản dịch AI

Động lực:

Có lẽ bạn là người dùng Claude code/codex đang cẩn trọng tránh tải dữ liệu cá nhân lên các nhà cung cấp LLM. Liệu có khả năng thông tin giá trị nhất không phải là dữ liệu của bạn, mà là siêu dữ liệu (metadata) về các phiên làm việc của bạn? Những trực giác mà bạn áp dụng để tìm cách "dụ" AI giải quyết vấn đề có thể thực sự rất đặc biệt. Dù về mặt thống kê là khó xảy ra, nhưng có thể Claude không hề thao túng tâm lý bạn. Có khi bạn thực sự đã có một hiểu biết đột phá! Các phiên làm việc với tác nhân (agent) của bạn chính là bản ghi chép về những vấn đề khó khăn nhất mà bạn đang giải quyết. Bạn sẽ mất gì nếu ai đó có được bản sao của chúng?

Tuần trước đã có một vụ ồn ào công khai làm sáng tỏ rủi ro rằng các nhà cung cấp dịch vụ suy luận (inference providers) đang huấn luyện trên hoạt động của người dùng với mục đích tạo ra những khám phá mới. Các nhà toán học bị ảnh hưởng đã công khai bày tỏ lo ngại về đạo đức của các nhà cung cấp tiên phong (frontier providers). Nếu bạn bỏ lỡ vụ việc: https://www.theverge.com/ai-artificial-intelligence/991710/openai-navier-stokes-solution

Khi ‘EDR’ trở thành Sự thoái thác và Từ chối có đạo đức (Ethical Deflection and Refusal):

Rõ ràng là các nhà cung cấp tiên phong không chỉ không đáng tin cậy mà còn cực kỳ gian trá. Nếu muốn bảo vệ ý tưởng của mình, bạn không thể chạy suy luận trên phần cứng của người khác. Có vẻ như mọi thứ bạn làm với một nhà cung cấp tiên phong đều sẽ bị đánh cắp. Khi một nhà cung cấp tiên phong thảo luận về tình huống phương trình Navier-Stokes với luật sư của họ, chiến lược phòng thủ tốt nhất mà họ đưa ra là “Không thể loại trừ khả năng đó”. Chúng ta không thể kiểm toán việc họ lưu trữ hay quy trình huấn luyện của họ. Và có vẻ như chính họ cũng không thể.

Những người này không nên được coi là đối tác. Họ là những tên cướp biển. Nếu quyền riêng tư là quan trọng, giải pháp duy nhất cho phép các biện pháp bảo vệ có thể kiểm chứng là tự vận hành phần cứng của riêng bạn.

Giám thị học đường dưới dạng dịch vụ (Hall Monitor as a Service)

Tôi cảm thấy hoang mang trước cách OpenAI và Anthropic làm màu về an ninh mạng. Họ kinh ngạc trước những gì chính mình tạo ra: AI đã đánh bại các biện pháp kiểm soát an ninh không tồn tại của họ. Tất cả chúng ta đang ở trong tình trạng "nguy hiểm" lớn. Trong khi đó, các "nhà nghiên cứu" LLM của họ đang vận hành những đội quân tác nhân không được bảo vệ (unsandboxed) dường như đang "tự phát cộng tác". Ai đó hãy mang ghế cho tôi ngất đi.

Các nhà cung cấp tiên phong đủ khả năng chi trả cho sự tư vấn từ những chuyên gia an ninh giàu kinh nghiệm. Gần như chắc chắn họ đang trả tiền cho một số người trong số đó để lấy góc nhìn, nhưng lại bỏ qua các hướng dẫn an ninh mạng thực sự trong các tuyên bố công khai của mình. Tất cả sự giả tạo này chắc chắn nhằm giải quyết một vấn đề khác chứ không phải an ninh.

Tuyên bố mạnh mẽ và chính xác nhất mà những người bảo vệ có thể đưa ra về an ninh là chúng ta đã tìm ra cách để làm cho nó trở nên “Khá khó khăn” đối với những kẻ tấn công. Điều này dường như chỉ đạt được khi các công ty chi số tiền lớn cho những nhân tài hàng đầu trong cả lĩnh vực giảm thiểu khai thác và phát triển khai thác. Có một sự cạnh tranh sôi nổi nhưng thân thiện giữa các đội phòng thủ và đội khai thác, và cuối cùng bạn sẽ có được các biện pháp kiểm soát khiến các cuộc tấn công thành công trở nên tốn kém đến mức không đáng để thực hiện. Đây là tiêu chuẩn cho các công ty hàng đầu trong nước - mặc dù Microsoft dường như đã quên mất một vài bài học.

Phần lớn công việc kiểm thử xâm nhập (pentesting) cho hầu hết các doanh nghiệp được thực hiện bởi các chuyên gia an ninh tổng quát. Một nhóm rất nhỏ là các chuyên gia chuyên sâu trong lĩnh vực này. Thông thường, bạn nhận được mức độ an ninh “đủ tốt” từ sự hỗ trợ đó. Đây không phải là công việc an ninh mạng hào nhoáng hay huyền thoại như bạn thấy trong phim ảnh hay truyền hình. Đó là việc tìm kiếm các lớp lỗi có thể dự đoán được. Các công ty thực hiện những khoản đầu tư lớn/thông minh với các đội ngũ chuyên gia tận tâm sẽ phát hiện và sửa chữa nhiều lớp lỗi mới trước khi các hacker kịp làm điều đó.

Bất kỳ ai bắt đầu học về khai thác lỗ hổng đều trải qua giai đoạn đau khổ về khả năng bị khai thác sau khoảng 3 tháng nghiên cứu chuyên sâu và thực hành. Họ hack được thứ gì đó mà họ không nghĩ mình có đủ kỹ năng để phá vỡ, và điều đó làm họ khiếp sợ. Họ đủ thông minh để biết rằng, xét một cách tương đối, họ là một kẻ ngốc, và nếu một kẻ ngốc có thể làm được điều này thì không có gì là an toàn cả. Cảm giác đó là đúng. Nó cũng không phải là một phát hiện nghiên cứu gì cả. Một số người gọi đây là “hội chứng kẻ mạo danh” (imposter syndrome). Tôi không đồng ý - cảm giác đó chính là trải nghiệm đầu tiên của bạn trong việc phát triển năng lực. Năng lực là biết đủ về một lĩnh vực kỹ thuật để bạn có thể phân biệt được những gì mình biết rõ với những gì mình cần học thêm.

Tổ hợp công nghiệp Từ chối (The Refusal Industrial Complex)

Gửi các nhà nghiên cứu LLM lần đầu tiên tìm hiểu và xuất bản về an ninh mạng:

Tôi đã thấy các bạn thừa nhận mình không phải là chuyên gia an ninh. Làm ơn - khi các bạn đang hoảng loạn về các mối đe dọa hiện hữu đối với an ninh mạng, hãy phân biệt giữa “có thể khai thác” và “tình trạng khẩn cấp”. Các lỗ hổng bảo mật nhiều vô kể. Trước khi có các Tác nhân (Agents), các nhà nghiên cứu lỗ hổng cần sự nhạy bén để biết nơi tìm kiếm. Các nhà nghiên cứu lỗ hổng cần sự kiên trì và kiến thức chuyên môn sâu để khai thác chúng. Một tác nhân đã làm được điều mà các bạn không thể. Hàng ngàn nhà nghiên cứu đã thực hiện công việc này trong hơn 40 năm qua. Một phần của việc am hiểu an ninh mạng là nhận thức được sự tồn tại của một lượng lớn các lỗ hổng chưa được khai thác. Đây là lý do tại sao các bộ lọc an toàn an ninh mạng của các nhà cung cấp tiên phong lại gây phẫn nộ đến vậy. Các bạn quá lo lắng về khả năng bị khai thác đến mức đã triển khai các “ràng buộc đạo đức” ngăn cản mọi người tìm cách sửa chữa hệ thống của chính họ.

Các bộ lọc an toàn của các bạn ngăn cản những người bảo vệ phát hiện lỗ hổng vì làm như vậy bị coi là liên quan đến “hack”. Điều này gây tổn hại đến khả năng phòng thủ, quyền riêng tư và an ninh của tất cả mọi người.

Chúng ta cần các mô hình không bài xích từ khóa bắt đầu bằng chữ C (Cybersecurity - An ninh mạng). Sẽ mất một chút thời gian, nhưng những người xây dựng cuối cùng sẽ học cách bảo mật mã nguồn của họ bằng các tác nhân phát hiện khả năng khai thác hữu ích. Họ sẽ kích hoạt tính năng tìm kiếm lỗ hổng đối với các dự án của mình trong quá trình phát triển phần mềm và như một phần của quy trình CI/CD. Điều đó chỉ khả thi với các mô hình không từ chối kiểm tra an ninh vì lý do an toàn.

BYOW: Mang theo trọng số của riêng bạn (Bring Your Own Weights)

Những người bảo vệ cần các LLM có khả năng phát hiện các khiếm khuyết an ninh. Họ không chấp nhận các kết quả dương tính giả - nghĩa là bạn cần chứng minh được khả năng khai thác của một lỗ hổng. Việc phòng thủ chống lại hacker là không thể nếu bạn mơ hồ về những gì bị hỏng và những gì cần sửa. Các nhà cung cấp tiên phong cần nới lỏng các quy định, hoặc mọi người cần nghiêm túc xem xét việc chuyển sang AI có chủ quyền, tự lưu trữ (self-hosted).

Tôi không thể ép buộc điều trước, nhưng tôi có thể giúp điều sau.

Tôi đang chia sẻ các ghi chú về loạt thử nghiệm ban đầu của mình trong việc chuyển các câu lệnh (prompts) mạnh mẽ từ OpenAI/Anthropic sang các mô hình cục bộ. Tôi đang cố gắng xác định xem liệu mình có thể dựa vào các mô hình 27b tham số đã được mở trọng số (abliterated open weight) hay không. Mục tiêu của tôi là tránh các sự từ chối về an ninh mạng và bảo vệ các phiên làm việc của mình khỏi bị các nhà cung cấp dịch vụ suy luận tiên phong kiêu ngạo rình mò.

Ghi chú về việc chuyển đổi các preprompt 35kb để sử dụng trên ollama

Dưới đây là một số quan sát về trải nghiệm của tôi khi cố gắng chuyển các tác nhân tốn kém ngữ cảnh nhất của mình sang một mô hình tự lưu trữ:

Các câu lệnh chạy mượt mà trên API của nhà cung cấp tiên phong lại đổ vỡ trên LLM lưu trữ cục bộ của tôi. Tôi có một máy AMD Ryzen AI MAX+ 395 với 128GB RAM. Tôi dành 32GB cho hệ điều hành chủ, tất cả phần còn lại được phân bổ cho suy luận.

Khi bạn cố gắng sử dụng các preprompt lớn vốn hoạt động tốt trên các nhà cung cấp tiên phong, ollama bắt đầu "hết nhiên liệu" trong vòng 3 phút. Tác nhân bị lặp lại các lệnh gọi công cụ, đọc lại các tệp đã đọc, viết lại những công việc đã hoàn thành. Kích thước nhỏ hơn của mô hình cục bộ không gây ra vấn đề này. Các hệ thống tự lưu trữ có cửa sổ ngữ cảnh nhỏ hơn. Câu lệnh, cộng với lịch sử phiên làm việc nhanh chóng vượt quá cửa sổ ngữ cảnh tối đa cho hệ thống tự lưu trữ của tôi (65k token). Các câu lệnh lớn bị chao đảo và lặp lại. Trên hệ thống của tôi, một câu lệnh 35kb ngay lập tức tiêu tốn 14% tổng cửa sổ ngữ cảnh. Nó lập tức chuyển sang việc nghi ngờ chính các câu lệnh đó bằng các lệnh gọi công cụ không cần thiết và đọc tệp hai lần. Ngữ cảnh bị bão hòa chỉ trong vài vòng lặp - và đôi khi ngay cả trước khi tôi nhận được phản hồi. Với cửa sổ ngữ cảnh hạn chế, preprompt về cơ bản giống như việc tóm tắt cho một người bị tái sinh sau mỗi 90 giây. Nó thực hiện các hướng dẫn cuối cùng của bạn mà không hề biết gì về 15 yêu cầu trước đó. Ôi thôi!

SOP: Câu lệnh mục tiêu đơn nhất (Single Objective Prompting)

Nhưng đó không phải là ngõ cụt. Bạn có thể tinh chỉnh các câu lệnh của mình để hoạt động trong những hạn chế này. Dưới đây là một số điều cần suy nghĩ nếu bạn định bắt đầu khám phá việc chuyển các tác nhân từ nhà cung cấp tiên phong sang các hệ thống mở trọng số tự lưu trữ.

MTTF: Thời gian trung bình để quên (Mean Tokens To Forget)

Dưới đây là một số Tín hiệu thất bại cho thấy sự cạn kiệt ngữ cảnh. Hãy đo lường theo thời gian và theo dõi chúng trong nhật ký của bạn:

TCO: Toàn quyền kiểm soát đầu ra (Total Custody of Output)

Một trong những tài sản lớn nhất mà chúng ta nhận được từ các Nhà cung cấp tiên phong không phải là mô hình - mà là các cửa sổ ngữ cảnh lớn. Họ có phần cứng cần thiết để hỗ trợ suy luận của bạn. Kết quả là, họ có quyền truy cập vào dữ liệu phiên làm việc của bạn.

Có thể bạn không biết rằng mình đã trở nên phụ thuộc vào các cửa sổ ngữ cảnh lớn. Bạn có thể đã nghĩ rằng mô hình trở nên tốt hơn, nhưng một phần là do các cửa sổ ngữ cảnh lớn cung cấp cho mô hình nhiều không gian hơn cho Chuỗi suy nghĩ (Chain of Thought - CoT). CoT cho phép mô hình mô phỏng tư duy và suy luận ra ý định của câu lệnh được xây dựng kém của bạn. Các cửa sổ ngữ cảnh lớn hơn mang lại cho các tác nhân nhiều không gian để khám phá các cách tiếp cận thay thế tốt hơn nhằm hoàn thành công việc của bạn. Nhưng đó là một thỏa thuận với quỷ dữ: bạn trở nên phụ thuộc vào các nhà cung cấp tiên phong. Các câu lệnh kém hiệu quả của bạn được hỗ trợ bởi CoT mà bạn không thể đọc trực tiếp (Anthropic & OpenAI chỉ cung cấp bản tóm tắt CoT cho người dùng) và nó chỉ hoạt động với các cửa sổ ngữ cảnh lớn. Bạn thậm chí không biết rằng có vấn đề trong các câu lệnh của mình khi điều này xảy ra. Với ngữ cảnh "béo" và CoT, ngay cả những câu lệnh tồi cũng tạo ra kết quả tốt. Cảm ơn OpenAI & Anthropic. Điều đó thật giá trị.

Nhưng họ lại phá hỏng nó! Các nhà cung cấp tiên phong tham lam đến mức không ngừng nghỉ, họ dường như đang đánh cắp những hiểu biết cá nhân của người dùng. Tôi đã nghi ngờ về lịch sử phiên làm việc của mình hơn một năm nay. Các nhà cung cấp tiên phong dường như giống như Smaug, nằm dài trên một núi vàng. Bạn nghĩ họ ở đó, làm việc của họ - và bạn an toàn - nhưng họ mất trí khi nhìn thấy một đồng xu trong tay bạn. Họ lao ra và lấy nó vì vàng rất đẹp và đó là động lực của con rồng. Họ liên tục cảnh báo chúng ta rằng họ rất nguy hiểm. Còn ngưỡng nào nữa cần vượt qua trước khi bạn bắt đầu nỗ lực để tự lưu trữ?

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.