smol.ai AI News
85

Mô hình

Claude Opus 5 ra mắt: Hiệu năng lập trình ấn tượng và những tranh luận về điểm số benchmark

(giờ Việt Nam)

Tóm tắt AI

Anthropic vừa trình làng Claude Opus 5 với khả năng lập trình vượt trội, đạt chỉ số ECI 159. Dù gây tranh cãi về độ chính xác của các bài kiểm tra benchmark, mô hình này vẫn nhận được nhiều lời khen ngợi từ cộng đồng nhờ khả năng điều khiển trình duyệt và sử dụng công cụ linh hoạt.

Bản dịch AI

Opus 5 | AINews

Một ngày yên ắng.

Tin tức AI từ 23/7/2026 đến 24/7/2026. Chúng tôi đã kiểm tra 12 subreddit, 544 tài khoản Twitter và không có thêm thông tin nào từ Discord. Trang web của AINews cho phép bạn tìm kiếm tất cả các số đã phát hành. Xin nhắc lại, AINews hiện là một chuyên mục của Latent Space. Bạn có thể tùy chọn bật/tắt tần suất nhận email!

Tóm tắt AI trên Twitter

Tin nổi bật: Ra mắt mô hình Claude Opus 5

Chuyện gì đã xảy ra

Việc Anthropic ra mắt Claude Opus 5 đã làm dấy lên nhiều luồng ý kiến, từ việc soi xét các bảng điểm chuẩn (benchmark), những lời khen ngợi thực tế về khả năng của các coding-agent, cho đến những cuộc tranh luận mới về cách đánh giá các mô hình tiên phong (frontier model).

Chi tiết kỹ thuật

Sự thật và quan điểm

Các tuyên bố mang tính thực tế / đo lường

Diễn giải / quan điểm

Các ý kiến khác biệt

Các quan điểm ủng hộ

Các quan điểm hoài nghi / chỉ trích

Các quan điểm trung lập / phân tích

Bối cảnh

Các chủ đề khác

Mô hình mở, chưng cất mô hình (distillation) và chủ quyền AI

Các sự cố an toàn, khung đe dọa và chính sách an ninh mạng

Phương pháp huấn luyện, mô hình thế giới (world models) và cơ sở hạ tầng

Hành vi mô hình, rò rỉ danh tính và so sánh hệ sinh thái

Doanh nghiệp/năng suất và các ghi chú kỹ thuật khác

Tóm tắt AI trên Reddit

Tóm tắt từ /r/LocalLlama + /r/localLLM

1. Chính sách về trọng số mở (Open-Weight) và Chiến lược AGI

Hơn 20 công ty bao gồm NVIDIA, Meta, Microsoft, Palantir và Hugging Face đã ký vào một bức thư kêu gọi các nhà hoạch định chính sách tránh đưa ra các hạn chế vội vàng đối với các mô hình có trọng số mở. (Hoạt động: 3449): Hình ảnh là danh sách logo của các bên ký kết bức thư ngỏ của Microsoft, "Open Weights and American AI Leadership", cho thấy một liên minh bao gồm NVIDIA, Meta, Microsoft, Palantir, Hugging Face, IBM, Mozilla, Mistral, a16z, Dell và Y Combinator đang phản đối các hạn chế chính sách quá rộng hoặc quá sớm đối với các mô hình AI có trọng số mở. Bài viết nhấn mạnh lập luận của bức thư rằng các nhà hoạch định chính sách nên phân biệt giữa việc chưng cất mô hình hợp pháp và việc chiếm đoạt trái phép, đồng thời lưu ý sự vắng mặt của các phòng thí nghiệm mô hình tiên phong đóng (closed frontier labs) lớn: OpenAI, Anthropic và Google. Những người bình luận coi đây là sự chia rẽ chính sách giữa các công ty trong hệ sinh thái trọng số mở và các phòng thí nghiệm mô hình tiên phong đóng, với một số hy vọng rằng NVIDIA/Microsoft/Meta có thể cân bằng lại ảnh hưởng của OpenAI/Anthropic/Google. Bản thân hình ảnh không phải là một meme; đó là một đồ họa ngữ cảnh về các bên ký kết nhằm nhấn mạnh sự ủng hộ rộng rãi của ngành.

Có vẻ như nhóm vận động hành lang chống AI mã nguồn mở đã bị áp đảo hoàn toàn (Hoạt động: 2293): Hình ảnh là một ảnh chụp màn hình không mang tính kỹ thuật từ một bài đăng trên X, không phải là bảng điểm chuẩn hay thông báo ra mắt mô hình: Elon Musk nói "Điều này có sự ủng hộ hoàn toàn của tôi. Jensen nói đúng" để đáp lại việc Jensen Huang/NVIDIA quảng bá bức thư ngỏ có tiêu đề "Open Weights and American AI Leadership." Trong bối cảnh này, bài đăng lập luận rằng các tác nhân lớn trong ngành bao gồm Microsoft, Meta, NVIDIA, YC và xAI/Elon Musk đang công khai ủng hộ AI trọng số mở, cho thấy liên minh ủng hộ trọng số mở có thể mạnh hơn về mặt chính trị so với các nỗ lực vận động hành lang của các mô hình đóng từ các công ty như OpenAI và Anthropic. Các bình luận chủ yếu coi đây là sự liên kết thực dụng về lợi ích: ngay cả những người dùng chỉ trích Elon Musk hay Jensen Huang cũng cho rằng họ "đúng về vấn đề này" vì trọng số mở mang lại lợi ích cho các nhà phát triển, những người đam mê và thị trường phần cứng của NVIDIA. Một quan điểm khác thường thấy là phần lớn hệ sinh thái muốn các mô hình SOTA (hiện đại nhất) mở, trong khi sự phản đối chỉ tập trung ở các phòng thí nghiệm mô hình đóng và các đồng minh của họ.

Cuộc họp nhà đầu tư kéo dài 4 giờ của nhà sáng lập DeepSeek: DeepSeek ưu tiên AGI hơn tăng trưởng người dùng và thương mại hóa (Hoạt động: 1191): Một bản tổng hợp đã dịch gồm 52 nhận xét được cho là của nhà sáng lập DeepSeek, Liang Wenfeng, cho thấy DeepSeek đang tối ưu hóa cho xác suất nghiên cứu AGI, thay vì tăng trưởng người dùng trong ngắn hạn, doanh số doanh nghiệp hay việc chiếm lĩnh nền tảng "siêu ứng dụng". Các tuyên bố quan trọng về lộ trình kỹ thuật: ưu tiên hiện tại là các tác nhân (agent) lập trình/đa năng, tiếp theo là học liên tục (continual learning), sau đó là khả năng tự lặp lại của AI và cuối cùng là trí tuệ hiện thân (embodied intelligence); các vấn đề về đa phương thức, giảm thiểu ảo giác, tạo 3D/video và mô hình thế giới được coi là vấn đề thứ yếu hoặc ở tầng sản phẩm. Liang cũng khẳng định các mô hình mở mà DeepSeek đã phát hành chính là các mô hình mà họ triển khai nội bộ, rằng khoảng cách AI giữa Trung Quốc và Mỹ chủ yếu là khoảng cách về tính toán/tài nguyên chứ không phải về nhân tài, và DeepSeek chấp nhận biên lợi nhuận thấp hơn thông qua mã nguồn mở và API giá rẻ vì hiệu quả mở rộng và sự ổn định của đội ngũ quan trọng hơn thương mại hóa. Những người bình luận phần lớn phản ứng tích cực với tư thế cởi mở, hướng tới sứ mệnh/mã nguồn mở hiếm thấy này. Một cuộc tranh luận thực chất đã đặt vấn đề AI mã nguồn mở của Trung Quốc như một mối đe dọa chiến lược đối với các phòng thí nghiệm của Mỹ, lập luận rằng định hướng lợi nhuận của các công ty Mỹ có thể buộc họ phải chọn giữa việc cấm mô hình hoặc duy trì vị thế dẫn đầu kỹ thuật của OpenAI/Anthropic/Google.

Vậy tại sao ông ấy không ký vào bức thư? (Hoạt động: 740): Hình ảnh là ảnh chụp màn hình cuộc trao đổi trên X/Twitter, nơi Sam Altman nói rằng ông muốn nước Mỹ chiến thắng trong lĩnh vực AI với cả mô hình mã nguồn mở và mô hình độc quyền, đồng thời ca ngợi Jensen Huang/NVIDIA vì đã ký vào bức thư có tiêu đề "Open Weights and American AI Leadership." Ý nghĩa về kỹ thuật/chính sách nằm ở sự mâu thuẫn rõ ràng được tiêu đề Reddit nhấn mạnh: Altman công khai ủng hộ thông điệp về vị thế dẫn đầu của AI trọng số mở, nhưng bài đăng ngụ ý rằng ông hoặc OpenAI đã không đích thân ký vào bức thư. Các bình luận chủ yếu mang tính hoài nghi hơn là kỹ thuật, cho rằng lập trường của Altman xuất phát từ tiền bạc, quyền kiểm soát hoặc sự miễn cưỡng trong việc hỗ trợ các mô hình thực sự mở; một người bình luận chỉ đơn giản hoan nghênh thông điệp ủng hộ trọng số mở.

2. Phát hành tập dữ liệu mã nguồn mở và mô hình MoE

Hugging Face phát hành The Stack v3 – tập dữ liệu mã nguồn mở lớn nhất từ trước đến nay (Hoạt động: 634): Hugging Face đã phát hành The Stack v3, một kho mã nguồn mở với hai chế độ truy cập: stack-v3-train, một tập dữ liệu đã được khử trùng lặp, lọc chất lượng, ẩn thông tin định danh cá nhân (PII) có thể sử dụng qua load_dataset, và stack-v3-full, một bộ lưu trữ 114 TB trên HF Storage Bucket giữ lại các bản sao cùng với ID cụm cộng với các đoạn mã cho các tệp bị loại trừ để tùy chỉnh khử trùng lặp/lọc/trộn. Thông báo được đưa ra bởi Anton Lozhkov trên X; những người bình luận lưu ý rằng kho dữ liệu này bao gồm 713 ngôn ngữ, với một người đùa rằng "từ ngữ tục tĩu" đứng đầu danh sách. Các bình luận tập trung vào ý nghĩa của việc mã nguồn kiểu GitHub công khai được đưa vào các tập dữ liệu huấn luyện: một số người dùng cảm thấy không thoải mái khi mã cá nhân chất lượng thấp có thể ảnh hưởng đến chất lượng mô hình, trong khi những người khác tỏ ra thờ ơ vì các tệp cấu hình dotfiles/NixOS/neovim của họ vốn đã công khai.

AntLing-3.0-flash hiện đã có trên OpenRouter và miễn phí sử dụng đến ngày 3/8/2026 (Hoạt động: 348): Bài đăng thông báo Ant Ling / InclusionAI Ling-3.0-flash đã có mặt trên OpenRouter và miễn phí đến ngày 03/08/2026; hình ảnh đính kèm là một đồ họa ra mắt kỹ thuật tuyên bố kiến trúc MoE suy luận lai với tổng cộng 124 tỷ tham số và chỉ 5,1 tỷ tham số hoạt động mỗi token cho các tác nhân ở quy mô sản xuất. Biểu đồ điểm chuẩn tuyên bố Ling-3.0-flash ngang bằng hoặc vượt qua mô hình hàng đầu 1T của Ant Ling trong một số tác vụ và so sánh nó với các mô hình như GPT-5.4-mini-high, Claude-Sonnet-4.6-maxthink và Deepseek-v4-flash-max, mặc dù chủ đề Reddit không cung cấp xác minh độc lập hoặc chi tiết phương pháp luận. Những người bình luận chủ yếu tập trung vào các câu hỏi về triển khai/truy cập mở: liệu các bản dựng lượng tử hóa GGUF hoặc trọng số mở có sẵn hay không. Một người bình luận cũng đặt mô hình này vào bối cảnh đến từ cùng một hệ sinh thái công ty rộng lớn hơn liên quan đến Qwen, nhưng thuộc một bộ phận khác.

Tóm tắt các Subreddit AI ít kỹ thuật hơn

/r/Singularity, /r/Oobabooga, /r/MachineLearning, /r/OpenAI, /r/ClaudeAI, /r/StableDiffusion, /r/ChatGPT, /r/ChatGPTCoding, /r/aivideo

1. Ra mắt Claude Opus 5, các bảng điểm chuẩn và thay đổi về Claude Code

Giới thiệu Claude Opus 5 (Hoạt động: 3654): Bài đăng thông báo Claude Opus 5 là một mô hình thuộc gói trả phí/API, được định vị gần với "trí tuệ tiên phong" của Fable 5 với mức giá chỉ bằng một nửa, cùng kết quả SOTA (hiện đại nhất) được tuyên bố trong các đánh giá về lập trình và công việc tri thức, đồng thời cải thiện chi phí trên mỗi tác vụ so với các mô hình trước đó. Anthropic cho biết Opus 5 có giá tương đương Opus 4.8, là mặc định trên Claude Max, mạnh nhất trên Claude Pro, bao gồm chế độ Fast chạy nhanh hơn khoảng 2,5 lần và đạt điểm cao nhất trong cuộc kiểm toán căn chỉnh tự động về hành vi ít liều lĩnh/lừa dối hơn và tuân thủ Hiến pháp của Claude tốt hơn; liên kết thông báo: anthropic.com/news/claude-opus-5. Các bình luận hàng đầu mang tính hoài nghi hơn là thực chất: một người coi việc ra mắt này là một sự trì hoãn khác đối với Gemini 3.5 Pro, trong khi người khác chỉ ra sự không nhất quán trong bảng điểm chuẩn nơi 53,4% > 53,5% được ngụ ý cho "Lập trình tác nhân", gọi đó là "Toán học kiểu Anthropic điển hình."

CÁC BẢNG ĐIỂM CHUẨN của Claude Opus 5! (Hoạt động: 1695): Bảng điểm chuẩn được liên kết (hình ảnh) trình bày các kết quả "Claude Opus 5" chưa được xác minh so với "Fable 5", "Opus 4.8" và "GPT-5.6 Sol" trên các tác vụ lập trình, suy luận, tìm kiếm, pháp lý, y tế và sinh học. Như đã thấy, Opus 5 được làm nổi bật là dẫn đầu nhiều bảng điểm chuẩn về tác nhân/lập trình và quy trình làm việc, bao gồm lập trình đầu cuối, công việc tri thức, giải quyết vấn đề mới, sử dụng máy tính, quy trình kinh doanh và sinh học, trong khi các mô hình khác được báo cáo là dẫn đầu trong một số danh mục y tế, pháp lý và lập trình nhất định; một người bình luận đặc biệt lưu ý về điểm số 30% đáng ngạc nhiên trên ARC-AGI-3. Những người bình luận tỏ ra hoài nghi và ngạc nhiên, với các phản ứng từ "?????" đến sự ngạc nhiên rằng "Opus 5 đánh bại Fable 5 gần như trên mọi mặt." Chủ đề không cung cấp nguồn gốc cho bảng điểm chuẩn, vì vậy các kết quả nên được coi là suy đoán hoặc chưa được xác minh.

Kết quả của Opus 5 thực sự gây sốc!! (Hoạt động: 1098): Bài đăng báo cáo thử nghiệm thực tế ban đầu về Anthropic Opus 5, tuyên bố đây là lựa chọn mạnh nhất cho các tác vụ dài hạn và Opus 5 ở mức nỗ lực Thấp (Low effort) vượt trội hơn Sonnet 5 ở mức nỗ lực Cao (High effort) trong khối lượng công việc của tác giả, ngụ ý hiệu suất/chi phí tốt hơn. Tác giả cũng cho biết nó tiệm cận hiệu suất của Fable 5 trong khi có các rào cản bảo vệ ít hạn chế hơn, nhưng không cung cấp điểm chuẩn, mô tả tác vụ, dữ liệu giá cả hoặc các đánh giá có thể tái lập. Những người bình luận thận trọng nhưng lạc quan, tuy nhiên họ mong đợi chu kỳ tuyên bố thông thường về việc mô hình bị "giảm sức mạnh" (nerfed) hoặc giới hạn sử dụng trở nên gây tranh cãi. Một người bình luận kỹ thuật lưu ý các kết quả ban đầu rất mạnh, nhưng cho rằng mức tăng có thể thoái lui về các mô hình quen thuộc sau các tối ưu hóa ban đầu, trích dẫn Opus 4.8 trên x-high vẫn là lựa chọn tuyệt vời về giá, tốc độ và suy luận.

Anthropic đã cắt giảm 80% lời nhắc hệ thống (system prompt) của Claude Code cho các mô hình Claude 5 và công bố những gì vẫn nên có trong CLAUDE.md và các kỹ năng của bạn (Hoạt động: 971): Bài đăng của Anthropic, "Các quy tắc mới của kỹ thuật ngữ cảnh cho các mô hình thế hệ Claude 5", cho biết họ đã cắt giảm hơn 80% lời nhắc hệ thống của Claude Code cho các mô hình Claude mới hơn mà không có sự suy giảm đáng kể nào trong đánh giá lập trình, lập luận rằng nhiều quy tắc cứng nhắc cũ trong CLAUDE.md, Kỹ năng, bộ nhớ và mô tả công cụ hiện đang hạn chế mô hình quá mức. Mô hình được khuyến nghị là tiết lộ lũy tiến: giữ ngữ cảnh bền vững ở mức tối thiểu, tránh các quy tắc cứng nhắc như "không bao giờ viết bình luận", chuyển chi tiết vào một cây tệp chỉ được tải khi cần thiết và sử dụng lệnh /doctor mới của Claude Code để kiểm tra các hướng dẫn cũ được viết cho các mô hình cũ/yếu hơn. Những người bình luận chủ yếu rút gọn hướng dẫn thành "sử dụng tiết lộ lũy tiến", nhưng nêu lên những lo ngại thực tế về quy trình làm việc hỗn hợp mô hình: nếu người dùng chuyển đổi giữa các mô hình Claude mới hơn, các biến thể Sonnet kém năng lực hơn hoặc các mô hình mở, việc cắt giảm hướng dẫn quá mức có thể làm giảm hành vi đối với các mô hình vẫn cần các ràng buộc rõ ràng hơn.

2. Chính sách về trọng số mở và Bảo mật tác nhân AI

ClaudeAnthropicOpus 5Lập trình AIBenchmark
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ smol.ai AI News. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.