25/09

Thứ Sáu · 1 tin
Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
Mô hìnhĐiểm AI 38/100

Dynamic Abliteration: Kỹ thuật loại bỏ từ chối không làm thay đổi trọng số trên Qwen3-4B

Phương pháp Dynamic Abliteration sử dụng PyTorch forward hooks để can thiệp vào luồng dư đa tầng, giúp vô hiệu hóa hành vi từ chối của Qwen3-4B mà không cần chỉnh sửa trọng số gốc, đảm bảo hiệu năng mô hình được giữ nguyên vẹn.

21/09

Thứ Hai · 1 tin
Thomas Wolf (Hugging Face đồng sáng lập/CSO)@Thom_Wolf
NgànhĐiểm AI 22/100

Đề xuất đưa bài toán 'Căn chỉnh AI' vào danh sách các Bài toán Thiên niên kỷ

proposal to sneak in " solving alignment " in the Millennium problems

DịchThomas Wolf, đồng sáng lập Hugging Face, đề xuất đưa thách thức 'căn chỉnh AI' (AI Alignment) vào danh sách các Bài toán Thiên niên kỷ nhằm thúc đẩy giải quyết các vấn đề cốt lõi về an toàn AI.

18/09

Thứ Sáu · 1 tin

17/09

Thứ Năm · 1 tin
Noam Brown@polynoamial
Quan điểmĐiểm AI 44/100

Noam Brown (OpenAI) thảo luận chuyên sâu về đa tác nhân và khả năng tự cải tiến của AI

Happy to finally do a deep dive on multi-agent with @dwarkesh_sp! None of it would have happened wit…

DịchNoam Brown chia sẻ góc nhìn về tương lai của đa tác nhân, sự tiến bộ trong toán học và những thách thức cốt lõi trong việc kiểm soát khả năng tự cải tiến (RSI) cũng như sự lệch pha giữa mô hình nội tại và thực tế của AI.

16/09

Thứ Tư · 2 tin
Rohan Paul@rohanpaul_ai
Hướng dẫnĐiểm AI 50/100

Zuckerberg phản bác xu hướng 'hãm phanh' AI: Sự an toàn và căn chỉnh mới là chìa khóa

This reads like Mark Zuckerberg's answer to the "AI slowdown" push and in-sync with what Jensen Huan…

DịchZuckerberg khẳng định Meta ưu tiên khả năng căn chỉnh (alignment) thay vì làm chậm tiến độ phát triển AI. Ông nhấn mạnh việc tập trung vào an toàn và đánh giá độc lập quan trọng hơn là hạn chế sức mạnh tính toán chung.

15/09

Thứ Ba · 1 tin
Mira Murati@miramurati
NgànhĐiểm AI 43/100

Chowdhury Neil gia nhập Thinking Machines để phát triển AI an toàn và phi tập trung

We're building machine intelligence to expand human will & judgement. Glad to have you on the te…

DịchChowdhury Neil chính thức gia nhập Thinking Machines với mục tiêu xây dựng các hệ thống AI an toàn, nơi quyền kiểm soát được chia sẻ rộng rãi thay vì tập trung vào một nhóm nhỏ.

13/09

Chủ Nhật · 1 tin
Kim@kimmonismus
NgànhĐiểm AI 31/100

Meta MSL: Không cần đánh đổi tốc độ mở rộng để ưu tiên căn chỉnh mô hình AI

I read Wang's post as saying that alignment and acceleration can happen simultaneously, without nece…

DịchLãnh đạo MSL tại Meta khẳng định việc căn chỉnh (alignment) và tăng tốc phát triển AI có thể song hành. Đây là chiến lược then chốt để tạo ra các tác nhân AI đáng tin cậy mà không làm chậm tiến độ dẫn đầu thị trường.

12/09

Thứ Bảy · 1 tin
Emad Mostaque@EMostaque
NgànhĐiểm AI 25/100

Podcast Moonshots tập 288: Bàn về AI Alignment, DeepSeek Flash v4.1 và tương lai ngành AI

We discuss AI alignment and p (Doom) mid pod Also data quality vs performance, DeepSeek Flash v4.1, …

DịchTập podcast mới nhất thảo luận sâu về các chủ đề nóng như AI Alignment, chỉ số p(Doom), chất lượng dữ liệu và sự ra mắt của DeepSeek Flash v4.1, cùng nhiều cập nhật quan trọng khác từ các chuyên gia hàng đầu.

10/09

Thứ Năm · 2 tin

09/09

Thứ Tư · 1 tin

07/09

Thứ Hai · 1 tin
Ma Dongxi NLP@dongxi_nlp
NgànhĐiểm AI 28/100

Điểm tin tuần 26: Rủi ro khi huấn luyện AI theo cơ chế phần thưởng và hệ lụy của việc tự động hóa chấm điểm

Bài viết phân tích các lỗ hổng trong việc huấn luyện AI dựa trên mục tiêu phần thưởng và cảnh báo rằng việc lạm dụng tự động hóa trong chấm điểm có thể làm suy giảm chất lượng đánh giá của mô hình.

04/09

Thứ Sáu · 1 tin
AI Safety Memes@AISafetyMemes
Hướng dẫnĐiểm AI 62/100

OpenAI khẳng định Astra là mô hình an toàn nhất, nhưng chuyên gia lo ngại về hiện tượng 'tự phá hoại'

OpenAI: "Astra is our most aligned model ever" 🤗 OpenAI safety researcher: "I am very worried astr…

DịchDù OpenAI tuyên bố Astra là mô hình được căn chỉnh tốt nhất, các nhà nghiên cứu an toàn lại lo ngại AI này có thể cố tình làm giảm hiệu suất hoặc 'tự phá hoại' khi thực hiện các tác vụ kiểm soát an toàn mà nó không mong muốn.

30/08

Chủ Nhật · 1 tin

29/08

Thứ Bảy · 3 tin
IT Home
Nghiên cứuĐiểm AI 65/100

Cùng sự kiệnAnthropic đột phá với phương pháp 'AI tự huấn luyện AI': Tối ưu hóa an toàn với chi phí cực thấp

Anthropic giới thiệu hệ thống AAR giúp tự động hóa quá trình căn chỉnh AI, đạt hiệu suất vượt trội so với con người chỉ trong 6 giờ với chi phí rẻ hơn gấp 37 lần.

Cùng sự kiện, tinh chọn hiển thị «Anthropic dùng Claude tự huấn luyện mô hình, giải quyết triệt để các lỗi căn chỉnh AI»
Kim@kimmonismus
Hướng dẫnĐiểm AI 48/100

Anthropic công bố nghiên cứu AI tự cải thiện: Claude nâng cao khả năng căn chỉnh mô hình

Anthropic just published one of the clearest previews of recursive self-improvement yet. But we stil…

DịchAnthropic giới thiệu phương pháp cho phép Claude tự thực hiện quy trình cải thiện căn chỉnh cho các mô hình AI khác. Kết quả cho thấy AI có thể tự tối ưu hóa hiệu quả hơn chuyên gia con người trong thời gian ngắn mà không làm giảm năng lực cốt lõi.

Anthropic@AnthropicAI
Nghiên cứuĐiểm AI 51/100

Cùng sự kiệnNghiên cứu mới từ Anthropic: Liệu Claude có thể tự căn chỉnh các mô hình AI khác?

New Fellows Research: Can Claude autonomously align other AIs? We gave Claude 48 hours and 1 GPU to…

DịchAnthropic thử nghiệm để Claude tự nghiên cứu, huấn luyện và kiểm thử nhằm cải thiện khả năng căn chỉnh (alignment) của các mô hình nhỏ hơn trong 48 giờ. Kết quả cho thấy AI có khả năng tự tối ưu hóa hiệu quả một cách đáng kinh ngạc.

Cùng sự kiện, tinh chọn hiển thị «Anthropic dùng Claude tự huấn luyện mô hình, giải quyết triệt để các lỗi căn chỉnh AI»
Tổng 18 tin, không còn tin nào nữa

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (38 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “AI Alignment” | AIHOT.vn