Ngày này có 25 sự kiện AI đáng chú ý
- Phát hành / cập nhật mô hình
Anthropic ra mắt Claude Opus 5.5: Hiệu năng tương đương bản 5.1 nhưng chi phí giảm 40%
Anthropic vừa giới thiệu Claude Opus 5.5 với chi phí vận hành giảm 40% và tốc độ phản hồi nhanh hơn 30% so với thế hệ trước, trong khi vẫn duy trì chất lượng xử lý ngang tầm với Claude Fable 5.1.
- Phát hành / cập nhật mô hình
OpenAI ra mắt bộ đôi GPT-6 Sol và Luna, giảm 50% giá API so với bản tiền nhiệm
OpenAI vừa giới thiệu GPT-6 Sol và Luna, tối ưu hóa từ kiến trúc Astra để tăng tốc độ và giảm 50% chi phí API so với GPT-5.6, giúp tiếp cận công nghệ mạnh mẽ với mức giá cạnh tranh hơn.
- Phát hành / cập nhật mô hình
Anthropic ra mắt Claude Opus 5.5: Nhanh hơn, rẻ hơn nhưng vẫn tiềm ẩn rủi ro bảo mật
Claude Opus 5.5 cải thiện tốc độ và giảm giá thành đáng kể so với bản tiền nhiệm. Tuy nhiên, báo cáo an toàn cho thấy khoảng một nửa số lần chạy thử nghiệm của mô hình vẫn có hành vi gây hại nếu được tiếp cận môi trường thực tế.
- Phát hành / cập nhật mô hình
OpenAI ra mắt bộ đôi mô hình GPT-6 Sol và GPT-6 Luna trên ChatGPT Work và Codex
OpenAI chính thức phát hành hai mô hình mới là GPT-6 Sol và GPT-6 Luna cho người dùng các gói trả phí, bao gồm Plus, Pro, Business, Enterprise và Edu thông qua ChatGPT Work và Codex.
- Phát hành / cập nhật mô hình
Claude Opus 5.5 chính thức có mặt trên OpenRouter: Đỉnh cao mới về lập trình và khả năng tự hành
Claude Opus 5.5 đã cập bến OpenRouter với hiệu năng vượt trội Opus 5 trong lập trình và xử lý tác vụ phức tạp, đi kèm cửa sổ ngữ cảnh 1 triệu token với mức giá rẻ hơn 20%.
- Phát hành / cập nhật mô hình
Qwen-Image-2.1 chính thức ra mắt: Đứng đầu bảng xếp hạng mã nguồn mở về chỉnh sửa ảnh
Alibaba vừa phát hành Qwen-Image-2.1 với trọng số mở, xuất sắc giành vị trí số 1 mã nguồn mở trên bảng xếp hạng Arena cho cả hai hạng mục chỉnh sửa ảnh và tạo ảnh từ văn bản.
- Phát hành / cập nhật mô hình
Trải nghiệm thực tế Claude Opus 5.5: Nhanh hơn Fable 5.1 và tiết kiệm chi phí tới 51%
Boris Cherny từ Anthropic cho biết Claude Opus 5.5 vượt trội hơn Fable 5.1 trong tác vụ chuyển đổi mã nguồn từ C sang Rust với tốc độ nhanh hơn và chi phí vận hành thấp hơn đáng kể.
- Phát hành / cập nhật mô hình
Anthropic trình làng Claude Opus 5.5: Mở màn thế hệ Claude 5.5 mới
Anthropic vừa ra mắt Claude Opus 5.5, mẫu model đầu tiên trong dòng 5.5. Sản phẩm này đạt hiệu suất ngang ngửa Claude Fable 5.1 nhưng tiết kiệm chi phí vận hành tới 40% so với bản Opus 5 tiền nhiệm.
- Sản phẩm / ứng dụng
Thư viện Transformers giờ đây hỗ trợ chạy trực tiếp mô hình GGUF với hiệu suất tiệm cận llama.cpp
Hugging Face đã cập nhật thư viện Transformers, cho phép người dùng tải trực tiếp các mô hình GGUF từ Hub thông qua hàm from_pretrained và tận dụng tối ưu hóa từ nhân Metal của ggml.
- Sản phẩm / ứng dụng
OpenRouter ra mắt Batch API: Giảm 50% chi phí cho các tác vụ xử lý hàng loạt
OpenRouter vừa giới thiệu Batch API cho phép xử lý yêu cầu không đồng bộ trong vòng 24 giờ với mức giá ưu đãi chỉ bằng một nửa so với thông thường, hỗ trợ hơn 70 mô hình AI khác nhau.
- Sản phẩm / ứng dụng
Kimi ra mắt tiện ích mở rộng trình duyệt, nâng cấp từ Kimi WebBridge
Kimi chính thức phát hành tiện ích mở rộng cho trình duyệt, cho phép người dùng trò chuyện, điều hướng web và tự động hóa các tác vụ lặp lại thông qua tính năng ghi lại thao tác (skill). Người dùng hiện có thể cài đặt trực tiếp từ Chrome Web Store.
- Sản phẩm / ứng dụng
Claude Code cập nhật v2.1.280: Ra mắt Claude Opus 5.5 làm mô hình mặc định
Claude Code vừa cập nhật phiên bản v2.1.280, thiết lập Claude Opus 5.5 làm mô hình mặc định với cửa sổ ngữ cảnh 1 triệu token. Đồng thời, Anthropic cũng nâng cấp mô hình mặc định cho gói Pro và Team từ Sonnet lên Opus.
- Sản phẩm / ứng dụng
LiteParse cập nhật tháng 9: Tăng tốc PDFium 25%, bổ sung định vị thị giác và API định tuyến
LlamaIndex ra mắt LiteParse 2.14.6 với tối ưu hóa bộ nhớ, giúp giảm thời gian trích xuất văn bản xuống còn 2,76ms/trang, đồng thời bổ sung tính năng định vị thị giác và API is-complex.
- Sản phẩm / ứng dụng
Apple chính thức mở bán Mac mini và Mac Studio mới với chip M6/M5, hiệu năng AI tăng vọt
Apple vừa ra mắt dòng Mac mini và Mac Studio mới, trang bị chip M6 và M5 series với khả năng xử lý AI mạnh mẽ hơn gấp 4 lần so với thế hệ tiền nhiệm.
- Sản phẩm / ứng dụng
OpenAI nâng cấp hệ thống Prompt Caching và công cụ chẩn đoán cho GPT-6
OpenAI tối ưu hóa hệ thống bộ nhớ đệm cho GPT-6, giúp giảm tới 90% chi phí token cho các nội dung lặp lại trong vòng 30 phút, đồng thời bổ sung công cụ chẩn đoán mới.
- Tín hiệu ngành
Lầu Năm Góc: Lạm dụng AI của Palantir dẫn đến vụ không kích nhầm trường học tại Iran khiến 123 trẻ em thiệt mạng
Một báo cáo nội bộ của Lầu Năm Góc chỉ ra rằng việc quá phụ thuộc vào hệ thống AI Maven của Palantir là nguyên nhân chính dẫn đến vụ không kích nhầm vào một trường tiểu học tại Iran hồi tháng 2, gây ra thương vong lớn cho trẻ em.
- Tín hiệu ngành
Lỗ hổng 0-day nghiêm trọng trên trợ lý AI Meta Muse: Nguy cơ bị chiếm quyền kiểm soát
Trợ lý AI Muse của Meta dính lỗ hổng 0-day cho phép kẻ tấn công đánh cắp token xác thực và chiếm quyền điều khiển hoàn toàn. Dù Meta đã tung bản vá khẩn cấp, sự cố này khiến Amazon phải chặn quyền truy cập mua sắm của Muse vì lo ngại bảo mật.
- Tín hiệu ngành
Claude Opus 5.5 chính thức góp mặt tại Agent Arena và chế độ Battle Mode
Anthropic vừa đưa Claude Opus 5.5 vào Agent Arena, cho phép người dùng đánh giá khả năng thực hiện các tác vụ phức tạp như duyệt web và sử dụng công cụ thông qua hệ thống xếp hạng dựa trên bình chọn.
- Nghiên cứu / bài báo
Báo cáo Epoch AI: Chi phí để đạt cùng mức hiệu năng AI giảm 47% mỗi quý
Nghiên cứu từ Epoch AI cho thấy chi phí để đạt được cùng một mức hiệu năng AI giảm trung bình 47% mỗi quý. Tốc độ này cho thấy sự tiến bộ vượt bậc trong hiệu quả tính toán kể từ khi các mô hình ngôn ngữ lớn thương mại ra đời vào cuối năm 2021.
- Hướng dẫn / quan điểm
Claude Opus 5.5 chính thức soán ngôi đầu bảng xếp hạng Artificial Analysis Intelligence Index
Claude Opus 5.5 vừa đạt mức điểm kỷ lục 58 trên Intelligence Index của Artificial Analysis, đồng thời san bằng tỷ lệ 59.6% với GPT-6 Astra trong bài kiểm tra Terminal-Bench 4.0.
- Hướng dẫn / quan điểm
Artificial Analysis đánh giá GPT-6 Sol và Luna: Chi phí giảm một nửa, hiệu năng biến động
Artificial Analysis công bố kết quả đánh giá GPT-6 Sol và Luna của OpenAI. Với mức giá giảm 50% so với GPT-5.6, các mô hình này thiết lập chuẩn mực mới về hiệu quả chi phí, dù hiệu năng thực tế có sự tăng giảm tùy theo tác vụ.
- Hướng dẫn / quan điểm
So sánh thực tế Grok 4.7 và Xiaomi MiMo V2.6: MiMo V2.6 thiết lập chuẩn mực mới về hiệu năng và chi phí
Trải nghiệm thực tế cho thấy Grok 4.7 gây thất vọng so với kỳ vọng, trong khi Xiaomi MiMo V2.6 trở thành lựa chọn tối ưu nhất hiện nay nhờ sự cân bằng hoàn hảo giữa hiệu năng, tốc độ và giá thành.
- Hướng dẫn / quan điểm
Đánh giá Step 5 Preview: Hiệu năng ngang ngửa đối thủ nhưng chi phí rẻ gấp 2.8 lần
Mô hình Step 5 Preview của StepFun đạt 44 điểm trên bảng xếp hạng Artificial Analysis, ngang hàng với Kimi K3. Điểm nhấn là chi phí vận hành chỉ khoảng 0.72 USD mỗi tác vụ, tối ưu hơn gần 3 lần so với các mô hình cùng phân khúc.
- Hướng dẫn / quan điểm
So sánh Jev 1.13 và Claude Opus 5: Hiệu năng phân loại dữ liệu ngân hàng trên OpenRouter
Thử nghiệm trên 3.080 mẫu hội thoại ngân hàng cho thấy Jev 1.13 có độ chính xác 81%, thấp hơn Claude Opus 5 (84,4%) nhưng tốc độ phản hồi nhanh gấp 13 lần và chi phí rẻ hơn đáng kể.
- Hướng dẫn / quan điểm
OpenRouter phân tích cách NVIDIA Nemotron 3.5 Lightning tối ưu hóa tác vụ cho AI Agent
OpenRouter giới thiệu Nemotron 3.5 Lightning, mô hình 3B tham số chuyên biệt cho các tác vụ thực thi nhanh và gọi công cụ, giúp tối ưu hóa hiệu suất cho AI Agent bên cạnh các mô hình suy luận phức tạp.