Step 5 Preview đã tích hợp vào công cụ lập trình TRAE, hỗ trợ 33 ngôn ngữ với khả năng xử lý code phức tạp, sửa lỗi và tối ưu hiệu suất vượt trội, đạt 67.7 điểm DeepSWE và 80.5% tỷ lệ hoàn thành trên ProgramBench.
Xiaomi đang thực hiện huấn luyện hậu kỳ RL cho hai mô hình mimo-v2.6-pro và Flash. Hiện tại, mimo-v2.6-pro đạt 62 điểm DeepSWE, thấp hơn mức 74.2 của DeepSeek-v4.1-flash và vẫn đang trong giai đoạn đầu.
Here we go again: a new stealth model scores 74% on DeepSWE, beating GPT-5.6 Sol and most other mode…
DịchMô hình Union Alpha vừa xuất hiện với điểm số DeepSWE đạt 74%, vượt qua GPT-5.6 Sol trong các bài test lập trình thực tế như Terminal-Bench 2.1. Với chi phí tối ưu hơn, mô hình này đang gây chú ý và được dự đoán đến từ một đội ngũ phát triển tại Trung Quốc.
META 🔥: Muse Spark 1.3 has been officially announced, and it scored above GPT-5.6 and Opus 5 on Dee…
DịchMeta vừa phát hành Muse Spark 1.3 với khả năng lập trình và xử lý tác vụ thông minh vượt trội, đồng thời giới thiệu DeepSWE 1.1 với hiệu suất dẫn đầu thị trường cùng mức giá cực kỳ cạnh tranh.
wtf Muse Spark 1.3 It has achieved first place in DeepSWE with 75.4%, even ahead of GPT-5.6 Sol and …
DịchMuse Spark 1.3 vừa chính thức ra mắt, đạt điểm số kỷ lục 75.4% trên benchmark lập trình DeepSWE v1.1, vượt qua các đối thủ mạnh như GPT 5.6 Sol và Opus 5, đồng thời ghi nhận hiệu suất ấn tượng trên các bài kiểm tra MRCR và Terminal-Bench.
Gemini 3.8 Flash: 73% on DeepSWE at very good pricing! Google was cooking! Exciting for Gemini 4 Pro
DịchMô hình Gemini 3.8 Flash ghi dấu ấn với 73% điểm trong bài kiểm tra DeepSWE, đồng thời khơi gợi nhiều thảo luận từ cộng đồng về mô hình định giá đầy cạnh tranh của Google.
DịchPhó chủ tịch Google Labs Josh Woodward khẳng định Gemini 3.8 Flash đạt hiệu suất vượt trội trên benchmark DeepSWE V1.1, mang lại giá trị tối ưu về cả chất lượng lẫn chi phí cho người dùng.
DịchGemini 3.8 Flash ghi dấu ấn với 73,7% điểm số trên DeepSWE V1.1, khẳng định hiệu suất vượt trội về chi phí trên mỗi tác vụ theo dữ liệu từ Datacurve AI.
Ox Alpha has now been fully tested against the DeepSWE set by @davis7. Overall, it's performing mor…
DịchMô hình Ox Alpha gây chú ý khi đạt 63% trong bài kiểm tra DeepSWE, cho thấy khả năng lập trình mạnh mẽ. Nếu đây thực sự là GLM-5.3 Flash, khả năng chạy cục bộ trên DGX Spark sẽ tạo ra lợi thế lớn về chi phí.
Wtf! Ben ran this mystery model through 10 DeepSWE tasks and it scored over 80%, versus 65% for Fabl…
DịchMột mô hình AI chưa rõ danh tính vừa gây bất ngờ lớn khi đạt hơn 80% điểm trong 10 tác vụ DeepSWE, vượt xa các đối thủ như Fable (65%) và GPT-5.6-sol (52%). Cộng đồng đang đồn đoán đây có thể là một sản phẩm mới từ các công ty AI hàng đầu Trung Quốc như GLM hoặc Kimi.