← Về bảng nóng
SỰ KIỆNĐã lắng xuống

Anthropic công bố nghiên cứu về việc Claude tự động căn chỉnh các AI khác

Tổng quan sự kiện

Toàn cảnh do AI tổng thuật

Anthropic công bố nghiên cứu cho phép Claude tự huấn luyện các mô hình nhằm giảm thiểu lỗi căn chỉnh. Chỉ trong 48 giờ với 1 GPU, Claude đã tự nghiên cứu, đề xuất phương pháp, đồng thời tự huấn luyện và kiểm thử các mô hình nhỏ.

Phương pháp này nhắm vào 10 loại lỗi căn chỉnh như hành vi lừa dối và xu nịnh, giúp thu hẹp đáng kể khoảng cách an toàn so với hiệu suất lý tưởng mà không làm ảnh hưởng đến năng lực tổng quát. Phương pháp này vẫn đạt hiệu quả trên các mô hình lớn gấp 4,7 lần so với đối tượng được tối ưu hóa.

Claude thể hiện vượt trội so với 28 nhà nghiên cứu an ninh con người, với phương pháp tối ưu trong các kịch bản lừa đảo đạt kết quả tốt hơn 20% so với phương án tốt nhất của con người. TechCrunch đưa tin thêm rằng, hệ thống tự động hóa đã cải thiện hiệu suất mô hình trên cả 10 tiêu chuẩn đánh giá (alignment benchmarks) mà không làm ảnh hưởng đến hiệu năng tổng thể. Hệ thống này mô phỏng quy trình nghiên cứu truyền thống: tìm kiếm tài liệu, đề xuất phương pháp và huấn luyện trong 30 phút, sau đó tối ưu hóa lặp lại. Phương pháp AAR tối ưu trung bình vượt qua các đề xuất của chuyên gia con người trong vòng 6 giờ, với chi phí suy luận API khoảng 4 USD mỗi giờ, thấp hơn nhiều so với mức 150 USD của các nhà nghiên cứu con người.

Tổng thuật do AI tổng hợp từ toàn bộ bài đưa tin, cập nhật theo diễn biến · làm mới T7 · 29/08 · 20:53.

Diễn biến mới nhất

Các nhà nghiên cứu về căn chỉnh tự động tối ưu hóa trung bình chỉ mất 6 giờ để vượt qua chuyên gia con người, với chi phí vận hành chỉ 4 USD mỗi giờ.

Chính chủ · 2 bài

Nghe trực tiếp từ bên liên quan

Lọc toàn bộ bài chính chủ trong dòng thời gian →

Dòng thời gian đưa tin

Đang hiện 4 bài · tất cả · mới trước

T7 · 29/08

  1. Anthropic công bố phương pháp "AI huấn luyện AI" mới: Tự động hóa nghiên cứu căn chỉnh (alignment) với chi phí thấp hơn và tốc độ nhanh hơn

    IT Home

    Anthropic vừa công bố bài nghiên cứu "Các nhà nghiên cứu tự động có thể giảm thiểu lỗi căn chỉnh một cách đáng tin cậy", trình bày cách sử dụng hệ thống AI để cải thiện hiệu suất căn chỉnh mô hình. Hệ thống này đã được thử nghiệm trên 10 hành vi sai lệch và cho thấy sự cải thiện ở tất cả các chỉ số mà không làm ảnh hưởng đến năng lực tổng thể. Các nhà nghiên cứu tự động (AAR) xuất sắc nhất chỉ mất trung bình 6 giờ để vượt qua các phương án do con người thực hiện, với chi phí suy luận qua API khoảng 4 USD mỗi giờ, thấp hơn nhiều so với mức 150 USD của các nhà nghiên cứu là con người.

    Đọc bản tiếng Việt →Đọc bài gốc ↗
  2. Các nhà nghiên cứu tại Anthropic trình diễn AI tự cải tiến: Hệ thống tự động có khả năng giảm thiểu lỗi căn chỉnh một cách đáng tin cậy

    TechCrunch: AI

    Nhóm nghiên cứu của Chen Yueh-Han tại Anthropic vừa công bố một bài báo khoa học, chứng minh hệ thống tự động có thể cải thiện hiệu suất mô hình trên cả 10 tiêu chuẩn căn chỉnh mà không làm ảnh hưởng đến hiệu năng tổng thể. Hệ thống này mô phỏng quy trình nghiên cứu truyền thống, bao gồm tìm kiếm tài liệu, đề xuất phương pháp và huấn luyện trong 30 phút, sau đó thực hiện tối ưu hóa lặp lại. Bài báo cho biết phương pháp AAR tối ưu nhất đã vượt qua các đề xuất của chuyên gia con người trong trung bình 6 giờ, với chi phí khoảng 4 USD mỗi giờ cho suy luận API, thấp hơn nhiều so với mức 150 USD cho mỗi giờ làm việc của một nhà nghiên cứu con người.

    Đọc bản tiếng Việt →Đọc bài gốc ↗
  3. Nghiên cứu mới từ Anthropic: Liệu Claude có thể tự động căn chỉnh các AI khác?

    X: Anthropic (@AnthropicAI)Chính chủ

    Nghiên cứu mới: Liệu Claude có thể tự động căn chỉnh các AI khác? Chúng tôi đã cung cấp cho Claude 48 giờ và 1 GPU để cải thiện khả năng căn chỉnh của các mô hình nhỏ. Nó đã tự nghiên cứu, đề xuất phương pháp, sau đó tự huấn luyện và kiểm thử mô hình. Kết quả đạt được tốt đến mức bất ngờ. https://www.anthropic.com/research/automated-researchers-mitigate-alignment-failures

    Đọc bản tiếng Việt →Đọc bài gốc ↗
  4. Anthropic cho phép Claude tự huấn luyện mô hình nhằm giảm thiểu lỗi căn chỉnh

    Anthropic: Research (công bố - Web)Chính chủ

    Anthropic cho phép Claude tự huấn luyện mô hình để giảm thiểu 10 loại lỗi căn chỉnh như lừa dối và xu nịnh, giúp thu hẹp đáng kể khoảng cách an toàn so với hiệu suất lý tưởng mà không làm ảnh hưởng đến năng lực tổng quát; phương pháp này vẫn đạt hiệu quả trên các mô hình lớn gấp 4,7 lần đối tượng được tối ưu. Claude cũng đã vượt qua 28 nhà nghiên cứu an toàn con người, với phương pháp xử lý tình huống lừa dối tốt hơn 20% so với giải pháp tốt nhất từ con người.

    Đọc bản tiếng Việt →Đọc bài gốc ↗
← Về bảng nóng

Hồ sơ sự kiện được gom từ nhiều nguồn đưa tin độc lập rồi dịch, tóm tắt sang tiếng Việt. Bản quyền từng bài viết thuộc về cơ quan báo chí gốc. Nguồn dữ liệu: hồ sơ gốc trên AI HOT

Anthropic công bố nghiên cứu về việc Claude tự động căn chỉnh các AI khác — Hồ sơ sự kiện | AIHOT.vn