Đánh giá năng lực Claude Mythos 5.1 và Fable 5.1: Một trải nghiệm kỳ lạ
Bài viết phân tích sâu về khả năng thực tế của hai mô hình mới nhất từ Anthropic trong bối cảnh ra mắt đầy bất ngờ và khó hiểu.
Bài viết phân tích sâu về khả năng thực tế của hai mô hình mới nhất từ Anthropic trong bối cảnh ra mắt đầy bất ngờ và khó hiểu.
swyx@swyxi am working on a massive Astra/Fable frontier model AEO report and it looks like Claude loves @late…
DịchChuyên gia Swyx vừa phát hành báo cáo tối ưu hóa trải nghiệm AI (AEO) cho các mô hình tiên phong như Astra và Fable, đồng thời ghi nhận việc Claude thường xuyên gợi ý nội dung từ podcast Latent Space.

Mô hình flagship GPT-6 Astra vừa được đưa lên nền tảng OpenRouter với mức giá 10 USD cho đầu vào và 50 USD cho đầu ra mỗi triệu token, hỗ trợ cửa sổ ngữ cảnh lên tới 1,05 triệu token.
Cùng sự kiện, tinh chọn hiển thị «OpenAI ra mắt GPT-6 Astra cho người dùng Pro, Enterprise và Business Premium»
Perplexity@perplexity_aiGPT-6 Astra is now available in Perplexity Computer for Pro and Max subscribers.
DịchPerplexity chính thức đưa mô hình GPT-6 Astra lên nền tảng, mang lại hiệu suất vượt trội với điểm số 0.682 trong các bài kiểm tra WANDR, tối ưu hơn so với các đối thủ như Fable 5.1 và Opus 5.
Thêm 1 nguồn khác đưa tinX: Aravind Srinivas (Perplexity CEO) (@AravSrinivas)
OpenRouter@OpenRouterAre you joining us? 👀
DịchOpenRouter phối hợp cùng a16z tổ chức buổi tọa đàm dành cho các nhà sáng lập AI vào ngày 18/9 tại San Francisco, thảo luận về bài toán lựa chọn giữa việc chuyển đổi hay tiếp tục sử dụng các mô hình AI hiện tại.
Testing Catalog@testingcatalogAstra testing time 👀 > This is GPT-6, a new generation of intelligence. Astra is state-of-the-art …
DịchTestingCatalog vừa chia sẻ hình ảnh giao diện thử nghiệm của GPT-6 (tên mã Astra), cho thấy tùy chọn model 6 Pro với khả năng vượt trội trong lập trình, thao tác máy tính và nghiên cứu khoa học.

Ant Ling@AntLingAGIToday, we're introducing Ling-3.0-flash-Sante - an MoE model enhanced for health and medicine, built…
DịchAnt Group vừa giới thiệu Ling-3.0-flash-Sante, một mô hình MoE được tối ưu hóa từ Ling-3.0-flash nhằm nâng cao khả năng xử lý thông tin trong lĩnh vực chăm sóc sức khỏe và y tế.

AI at Meta@AIatMetaMuse Spark 1.3 with max reasoning is now available on Muse Code and Meta Model API 👇
DịchMeta vừa phát hành phiên bản Muse Spark 1.3 Max trên Muse Code và Meta Model API. Bản cập nhật này mang lại hiệu suất vượt trội trong việc viết code và vận hành AI Agent, hứa hẹn trải nghiệm tốt hơn hẳn các phiên bản High trước đây.
karminski@karminski3Karminski thử nghiệm Hunyuan Hy4 qua trò chơi đa tác tử và lập trình, cho thấy khả năng phối hợp chiến thuật ấn tượng cùng bước nhảy vọt về hiệu suất lập trình từ 16 lên 10.779 điểm so với bản Hy3.
Ethan Mollick@emollickI had early access, and a longer post is coming, but GPT-6 is stunning & is good enough that it actu…
DịchEthan Mollick chia sẻ trải nghiệm sớm với GPT-6, khẳng định mô hình này có thể tự chủ thực hiện các công việc phức tạp kéo dài nhiều ngày. Ông cũng giới thiệu dự án mô phỏng Thư viện Alexandria do chính GPT-6 tạo ra.
Kim@kimmonismusI think I understand why they call it AGI. It really is general intelligence. Its abilities are trul…
DịchKIM chia sẻ kết quả đánh giá cho thấy GPT-6 Astra đạt hiệu suất ấn tượng 40,9% trong các tác vụ khoa học dữ liệu nội bộ. OpenAI được dự báo sẽ tiếp tục ra mắt thêm các mô hình mới trong năm nay.

Alexandr Wang (Scale AI nhà sáng lập/Meta Giám đốc AI)@alexandr_wangthis is a good graph
DịchAlexandr Wang, nhà sáng lập Scale AI, vừa chia sẻ biểu đồ cho thấy mô hình Muse Spark 1.3 đạt hiệu suất vượt trội trên đường biên Pareto của Artificial Analysis, khẳng định vị thế cạnh tranh mạnh mẽ trong lĩnh vực AI.
Ant Group giới thiệu Ling 3.0 flash Fin, mô hình AI tài chính đầu tiên trong dòng Ling với 124 tỷ tham số, hỗ trợ cửa sổ ngữ cảnh lên tới 256K, tối ưu hóa cho các tác vụ phân tích dữ liệu tài chính chuyên sâu.
Kim@kimmonismusThe Institute of Foundation Models released K2 Horizon: six models from 0.9B to 375B, with training …
DịchInstitute of Foundation Models vừa công bố K2 Horizon, bộ 6 mô hình từ 0.9B đến 375B tham số với mã nguồn, dữ liệu và quy trình huấn luyện được công khai hoàn toàn. Đây được coi là bước tiến lớn cho cộng đồng mã nguồn mở khi cung cấp minh bạch cả nhật ký huấn luyện chi tiết.
Cùng sự kiện, tinh chọn hiển thị «IFM ra mắt dòng mô hình nguồn mở K2 Horizon: Từ 0.9B đến 375B tham số»
Testing Catalog@testingcatalogThe Institute of Foundation Models has released K2 Horizon, a family of six open models spanning fro…
DịchViện Mô hình Nền tảng (IFM) vừa công bố dòng mô hình K2 Horizon, bao gồm 6 phiên bản với quy mô từ 0.9B đến 375B tham số, tất cả đều được phát hành dưới giấy phép Apache 2.0.
MiniMax@MiniMax_AIWe're proud to see MiniMax-M3 powering HUMAIN-M3. Built on the M3 foundation and further trained o…
DịchHUMAIN vừa giới thiệu HUMAIN-M3, mô hình ngôn ngữ được huấn luyện trên hơn 1 nghìn tỷ token tiếng Ả Rập, hỗ trợ đa dạng phương ngữ và hiện đã mở bản xem trước cho mục đích nghiên cứu.
Meta vừa phát hành Muse Spark 1.3 với phiên bản xhigh sẵn sàng sử dụng, trong khi bản max mạnh mẽ hơn hiện đang được cung cấp cho các đối tác chọn lọc.
Cùng sự kiện, bài đại diện «Meta ra mắt Muse Spark 1.3: Nâng cấp mạnh mẽ khả năng lập trình và tác tử AI»Nghiên cứu đề xuất phương pháp mới sử dụng phân phối nhúng từ mô hình ngôn ngữ để đo lường tương tác giữa các doanh nghiệp, giúp dự báo hiệu suất chính xác hơn so với các mô hình truyền thống.
Nghiên cứu đề xuất phương pháp mới đánh giá rủi ro danh mục bằng cách sử dụng đặc trưng phân phối từ mô hình ngôn ngữ thay vì hiệp phương sai truyền thống, giúp tối ưu hóa danh mục mà không cần dữ liệu tương quan phức tạp.
Testing Catalog@testingcatalogDAILY AI BRIEF 🗞 - Sept 3 GOOGLE 🔥: > Gemini 3.8 Flash is live - third Flash in six weeks. Workho…
DịchTestingCatalog tổng hợp các cập nhật AI mới nhất, nổi bật là sự ra mắt của Gemini 3.8 Flash với cửa sổ ngữ cảnh 1M và mức giá ưu đãi hấp dẫn đến cuối năm.
Cùng sự kiện, bài đại diện «Meta ra mắt Muse Spark 1.3, tích hợp vào Muse Code và Meta Model API»
Kim@kimmonismusIntelligence too cheap to meter. state of the art model is now free on openCode. I love competition…
DịchMeta Muse Spark 1.3 hiện đã có sẵn miễn phí trên OpenCode. Tác giả nhận định các mô hình AI tiên tiến đang trở nên rẻ đến mức khó tin, đồng thời bày tỏ sự hào hứng trước cuộc đua cạnh tranh khốc liệt này.
Cùng sự kiện, bài đại diện «Meta ra mắt Muse Spark 1.3: Nâng cấp mạnh mẽ khả năng lập trình và tác tử AI»Nghiên cứu giới thiệu AM-Bench để đánh giá liệu LLM hiểu bố cục không gian hay chỉ đơn thuần là chuyển đổi mô tả thành mã nguồn. Kết quả cho thấy khả năng tư duy không gian thực sự khác biệt đáng kể giữa các mô hình, vượt xa khả năng viết code đơn thuần.
Alibaba Cloud@alibaba_cloud🚀 A better AI shouldn't just be faster-it should get more real work done with less budget. Qwen3.8-…
DịchAlibaba Cloud vừa tích hợp Qwen3.8-Flash vào chế độ Standard của QwenWork, giúp tối ưu hóa hiệu suất vượt trội với tốc độ xử lý nhanh gấp đôi và tiết kiệm đáng kể chi phí token cho người dùng.

SimLoss tối ưu hóa mô hình ngôn ngữ thị giác bằng cách căn chỉnh biểu diễn ẩn với dữ liệu hình ảnh trực tiếp, giúp mô tả chi tiết vật thể mà không cần tăng độ trễ như các hệ thống đa giai đoạn hiện nay.
Qwen-Drive-1.0 là mô hình nền tảng đầu tiên tích hợp khả năng nhận diện 3D, hỏi đáp thị giác và lập kế hoạch di chuyển cho xe tự lái, dựa trên kiến trúc Qwen3.5-4B mà không cần thay đổi cấu trúc tiền huấn luyện.
Google vừa tung ra Gemini 3.8 Flash với lợi thế cạnh tranh cực lớn về chi phí và tốc độ xử lý, bỏ xa các đối thủ từ OpenAI và Anthropic.
Thêm 1 nguồn khác đưa tinCafeF Kinh tế sốCông ty AI Tây Ban Nha Multiverse Computing vừa trình làng mô hình suy luận Quasar 438B với 438 tỷ tham số, đạt điểm số cao nhất trong số các mô hình châu Âu trên bảng xếp hạng Artificial Analysis.
Ethan Mollick@emollickPrinz has been running legal benchmarks against AI systems and the latest models are very good… bu…
DịchEthan Mollick dẫn chứng trường hợp một bản ghi nhớ pháp lý do AI soạn thảo dù trình bày đẹp mắt nhưng lại sai lệch hoàn toàn về kết luận và bỏ sót các rào cản pháp lý quan trọng, nhấn mạnh sự kém hiệu quả của các mô hình suy luận thấp trong lĩnh vực đòi hỏi độ chính xác cao.
Rohan Paul@rohanpaul_aiCurrent agent benchmarks may be ending before the real failures start. FM-Bench shows that a model …
DịchNghiên cứu FM-Bench đánh giá khả năng ra quyết định dài hạn của 15 mô hình AI hàng đầu thông qua việc quản lý câu lạc bộ bóng đá trong 20 mùa giải, bao gồm các nhiệm vụ phức tạp như chuyển nhượng, hợp đồng và đầu tư tài chính.

Kim@kimmonismusA 753B model reads the problem: A 4B model writes the answer. Mostik reports that its latent bridge…
DịchMostik giới thiệu giao thức cầu nối không gian ẩn cho phép mô hình 4B nhận dữ liệu trực tiếp từ mô hình 753B mà không cần tinh chỉnh. Giải pháp này giúp tăng tốc độ xử lý gấp 20 lần và tiết kiệm 2,5 lần tài nguyên tính toán trong khi vẫn duy trì 80% độ chính xác của mô hình lớn.
Alexandr Wang (Scale AI nhà sáng lập/Meta Giám đốc AI)@alexandr_wangi really hate to say it, but… gemini who? 🏎️💨
DịchMeta vừa trình làng Muse Spark 1.3, phiên bản thứ tư trong vòng 5 tháng. Đáng chú ý, phiên bản xhigh đã đạt 61 điểm trên bảng xếp hạng Artificial Analysis Intelligence Index.
Cùng sự kiện, bài đại diện «Meta ra mắt Muse Spark 1.3: Nâng cấp mạnh mẽ khả năng lập trình và tác tử AI»Google vừa phát hành Gemini 3.8 Flash với khả năng suy luận phức tạp và sử dụng công cụ linh hoạt hơn. Dù giữ nguyên giá niêm yết, Google cảnh báo người dùng có thể tốn nhiều token hơn do mô hình thực hiện nhiều bước xử lý hơn.
Elvis Saravia@omarsar0Các mô hình AI mới cho thấy khả năng vượt trội trong việc viết code và giải quyết các nhiệm vụ phức tạp đòi hỏi tư duy logic kéo dài nhờ được huấn luyện chuyên biệt.
OpenRouter@OpenRouterMuse Spark 1.3 is now available on OpenRouter! Built for long-running agentic, multi-agent, and cod…
DịchMuse Spark 1.3 đã cập bến OpenRouter, được thiết kế chuyên biệt cho các tác vụ chạy dài, hệ thống đa tác nhân và quy trình lập trình. Mô hình này nổi bật với khả năng ghi nhớ ngữ cảnh, xử lý xung đột dữ liệu và chủ động tương tác để làm rõ yêu cầu từ người dùng.
Cùng sự kiện, bài đại diện «Meta ra mắt Muse Spark 1.3, tích hợp vào Muse Code và Meta Model API»
AI at Meta@AIatMetaWe're excited to release Muse Spark 1.3 with improved performance on agentic and coding tasks, and a…
DịchMeta vừa phát hành Muse Spark 1.3 với khả năng xử lý tác vụ phức tạp tốt hơn, giảm 20% số lần gọi công cụ và tiết kiệm 25% token. Phiên bản này tập trung vào tính thực dụng, giúp AI chủ động đặt câu hỏi và giảm thiểu tình trạng ảo giác khi thực hiện các dự án lập trình.

Testing Catalog@testingcatalogMETA 🔥: Muse Spark 1.3 has been officially announced, and it scored above GPT-5.6 and Opus 5 on Dee…
DịchMeta vừa phát hành Muse Spark 1.3 với khả năng lập trình và xử lý tác vụ thông minh vượt trội, đồng thời giới thiệu DeepSWE 1.1 với hiệu suất dẫn đầu thị trường cùng mức giá cực kỳ cạnh tranh.

Mark Zuckerberg@finkdMuse Spark 1.3 vừa được phát hành với hiệu năng tiệm cận các mô hình tiên tiến nhất, nhưng sở hữu mức giá vận hành cực kỳ tối ưu, gần như không đáng kể.

Meituan LongCat@Meituan_LongCatLongCat-2.0 is now live and free to use in @CommandCodeAI! 🐱
DịchMeituan vừa phát hành LongCat-2.0 với 1.6 nghìn tỷ tham số và cửa sổ ngữ cảnh 1 triệu token. Người dùng có thể cài đặt và trải nghiệm miễn phí mô hình này thông qua công cụ Command Code.
Google vừa giới thiệu Gemini 3.8 Flash, bao gồm phiên bản tiêu chuẩn và phiên bản chuyên dụng cho an ninh mạng (Cyber), đánh dấu bước đi chiến lược trong việc phổ cập các mô hình AI hiệu năng cao.
Cùng sự kiện, tinh chọn hiển thị «Google DeepMind ra mắt bộ đôi mô hình mới: Gemini 3.8 Flash và 3.8 Flash Cyber»Google DeepMind vừa chính thức giới thiệu Gemini 3.8 Flash cùng phiên bản chuyên biệt 3.8 Flash Cyber, hứa hẹn cải thiện hiệu suất và khả năng xử lý cho người dùng.
Diễn biến sự kiện · 20 bài →Thêm 26 nguồn khác đưa tinArs Technica: AIX: Google AI (@GoogleAI)MarkTechPostX: Google DeepMind (@GoogleDeepMind)The Decoder: AI NewsX: Demis Hassabis (@demishassabis)X: fofr (@fofrAI)X: Sundar Pichai (@sundarpichai)IT HomeCafeF Kinh tế sốX: AI Notes (@AYi_AInotes)GenK AIX: Ma Dongxi NLP (@dongxi_nlp)The Verge: AIX: Rohan Paul (@rohanpaul_ai)Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)X: OpenRouter (@OpenRouter)X: Elvis Saravia (@omarsar0, DAIR.AI)X: Josh Woodward (@joshwoodward, Google Labs VP)X: Artificial Analysis (@ArtificialAnlys)X: Ammaar Reshi (@ammaar)X: Gemini (@GeminiApp)X: Logan Kilpatrick (@OfficialLoganK)X: Alexandr Wang (Scale AI nhà sáng lập/Meta Giám đốc AI) (@alexandr_wang)X: Google AI for Developers (@googleaidevs)X: Testing Catalog (@testingcatalog)