14/08

Thứ Sáu · 68 tin
cb_doge@cb_doge
Hướng dẫnĐiểm AI 42/100

Cùng sự kiệnGrok 4.6 soán ngôi đầu bảng xếp hạng GPQA Diamond

Grok 4.6 wins again. 👑 Grok 4.6 takes the #1 spot on GPQA Diamond with a score of 94.9%, beating G…

DịchGrok 4.6 vừa thiết lập cột mốc mới với 94,9% điểm số trên GPQA Diamond, vượt qua hàng loạt đối thủ sừng sỏ như GPT-5.6, Gemini 3.1 Pro và Claude Opus 5 để dẫn đầu thị trường.

Cùng sự kiện, bài đại diện «Grok 4.6 chính thức dẫn đầu bảng xếp hạng GDPVal-AA»

13/08

Thứ Năm · 45 tin
Artificial Analysis@ArtificialAnlys
Sản phẩmĐiểm AI 60/100

Artificial Analysis ra mắt Optima: Nền tảng tùy chỉnh đánh giá hiệu năng AI

We're launching Optima. Now anyone can create a custom benchmark for their use case, leveraging Arti…

DịchOptima cho phép người dùng xây dựng bộ tiêu chuẩn đánh giá riêng dựa trên dữ liệu cá nhân hoặc HuggingFace, giúp so sánh chính xác chi phí, tốc độ và hiệu suất giữa các mô hình AI hàng đầu để tối ưu hóa lựa chọn.

Thêm 1 nguồn khác đưa tinThe Decoder: AI News
SiliconFlow@SiliconFlowAI
Sản phẩmĐiểm AI 67/100

Tinh chọnAlibaba ra mắt mô hình mã nguồn mở Qwen3.8-2.4T-A95B, SiliconFlow hỗ trợ ngay lập tức

🚀 Day-0 Support! @Alibaba_Qwen has open-sourced Qwen3.8-2.4T-A95B - and it's now live on SiliconFlo…

DịchAlibaba vừa công bố mô hình Qwen3.8-2.4T-A95B với 2,4 nghìn tỷ tham số, tập trung vào lập trình và tác vụ thông minh. SiliconFlow đã tích hợp sẵn API với mức giá cạnh tranh cho người dùng.

Diễn biến sự kiện · 6 bài →Thêm 5 nguồn khác đưa tinX: Qwen (@Alibaba_Qwen)X: Rohan Paul (@rohanpaul_ai)IT HomeX: Clément Delangue (Hugging Face CEO) (@ClementDelangue)Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)

Vì sao đáng đọc: Đây là bước tiến lớn trong lĩnh vực mô hình ngôn ngữ lớn mã nguồn mở, có tác động trực tiếp đến cộng đồng lập trình và phát triển ứng dụng AI tại Việt Nam.
Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 36/100

Toàn cảnh rủi ro từ LLM: Phân loại 5 giai đoạn nguy hại trong vòng đời mô hình

This study builds a simple map of all the main ways large language models can cause harm. Using abo…

DịchNghiên cứu tổng hợp từ 200 tài liệu đã xây dựng bản đồ phân loại rủi ro toàn diện cho LLM, từ khâu dữ liệu đầu vào, quá trình vận hành đến các tác động xã hội, đồng thời đề xuất chiến lược phòng thủ đa tầng.

AI Notes@AYi_AInotes
Mô hìnhĐiểm AI 67/100

Cùng sự kiệnDeepSeek-V4-Pro ra mắt: Hiệu năng đỉnh cao với chi phí vận hành cực thấp

DeepSeek vừa trình làng phiên bản V4-Pro 0813 với khả năng xử lý tác vụ Agent ngang hàng các mô hình hàng đầu, đặc biệt là sự bứt phá ngoạn mục của DeepSWE từ 12.8 lên 62.7 điểm.

Cùng sự kiện, bài đại diện «DeepSeek chính thức ra mắt phiên bản V4 Pro»
Testing Catalog@testingcatalog
Mô hìnhĐiểm AI 52/100

Cùng sự kiệnDeepSeek-V4-Pro ra mắt: Nâng cấp mạnh mẽ cho tác vụ Agent

DeepSeek announced DeepSeek-V4-Pro! The model is now available on DeepSeek Chat under "Expert Mode…

DịchDeepSeek vừa trình làng DeepSeek-V4-Pro với khả năng tùy chỉnh cường độ suy luận linh hoạt và hỗ trợ chuẩn OpenAI Responses API, tối ưu hóa đặc biệt cho các tác vụ lập trình.

Cùng sự kiện, bài đại diện «DeepSeek chính thức ra mắt phiên bản V4 Pro»
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

SkillZip: Nén đồ thị bảo toàn hợp đồng cho thư viện kỹ năng AI có khả năng mở rộng

SkillZip là khung trừu tượng hóa thủ tục giúp nén các thư viện kỹ năng của AI dưới dạng đồ thị, cho phép tái sử dụng hiệu quả các đoạn mã mà vẫn đảm bảo tính thực thi và khả năng mở rộng trong bối cảnh hạn chế của LLM.

Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 35/100

Nghiên cứu từ DeepMind: LLM có thể suy luận, nhưng khó lòng 'phát minh' ra thuyết tương đối

Could a language model derive General Relativity yet still be unable to invent it? This Google Deep…

DịchDeepMind chỉ ra rằng LLM gặp khó khăn trong việc tạo ra các đột phá khoa học như thuyết tương đối vì thiếu khả năng 'suy luận ngược' (abduction). Dù giỏi xử lý dữ liệu, mô hình ngôn ngữ vẫn bị giới hạn bởi cơ chế nén dữ liệu thay vì tư duy sáng tạo vượt bậc.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 47/100

Ready Cohorts: Tối ưu hóa GPU cho LLM Agent bằng cách giảm thiểu độ trễ giao tiếp

Nghiên cứu giới thiệu phương pháp 'ready-cohort' nhằm xác định ranh giới thực thi trên GPU cho các tác nhân LLM, giúp giữ quyết định tại thiết bị và tăng tốc độ xử lý lên tới 2,39 lần so với cách tiếp cận truyền thống.

Francois Chollet@fchollet
NgànhĐiểm AI 54/100

ARC Prize 2024: Bước tiến đột phá của kỹ thuật huấn luyện tại thời điểm kiểm thử (TTT)

Test-time training was popularized during the ARC Prize 2024 competition, after being explored in pa…

DịchFrançois Chollet đánh giá cao tiềm năng của TTT khi giúp ARC Prize 2024 đạt mức tăng trưởng kỷ lục lên 55,5%. Đây được xem là bước nhảy vọt lớn nhất về khả năng tổng quát hóa của AI kể từ khi học trong ngữ cảnh (in-context learning) xuất hiện.

Rohan Paul@rohanpaul_ai
Mô hìnhĐiểm AI 52/100

Cùng sự kiệnDeepSeek-V4-Pro: Hiệu năng tiệm cận GPT-5.6 với chi phí rẻ hơn 31 lần

DeepSeek-V4-Pro (Max) is expected to shift the Pareto frontier DeepSeek-V4-Pro (Max) reached 1607 i…

DịchDeepSeek-V4-Pro đạt 1607 điểm trên Code Arena, chỉ kém GPT-5.6 15 điểm nhưng có giá thành chỉ bằng 1/31. Với mức giá 0,435 USD/triệu token, mô hình này đang định nghĩa lại tiêu chuẩn hiệu năng trên giá thành trong phân khúc cao cấp.

Cùng sự kiện, bài đại diện «DeepSeek chính thức ra mắt phiên bản V4 Pro»
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 88/100

Tinh chọnMô hình hóa tác nhân AI 'bình dân': Giả lập xã hội LLM quy mô lớn ngay trên laptop

Nghiên cứu đề xuất phương pháp thay thế các tác nhân LLM phức tạp bằng mô hình tham số thấp, cho phép giả lập xã hội hàng nghìn tác nhân trên máy tính cá nhân mà vẫn đảm bảo độ chính xác về hành vi vĩ mô.


Vì sao đáng đọc: Giải pháp đột phá giúp giảm chi phí tính toán cho các mô phỏng xã hội AI phức tạp, có tính ứng dụng cao cho giới nghiên cứu và phát triển hệ thống đa tác nhân.
Rohan Paul@rohanpaul_ai
Mô hìnhĐiểm AI 52/100

Cùng sự kiệnMô hình MoE mã nguồn mở Qwen3.8-2.4T-A95B chính thức có mặt trên HuggingFace

So Qwen3.8-2.4T-A95B, the 2.4T-parameter open-weight mixture-of-experts model dropped on Huggingface…

DịchQwen3.8-2.4T-A95B, mô hình ngôn ngữ lớn kiến trúc MoE với 2,4 nghìn tỷ tham số, vừa được phát hành mã nguồn mở trên nền tảng HuggingFace.

Cùng sự kiện, tinh chọn hiển thị «Alibaba ra mắt mô hình mã nguồn mở Qwen3.8-2.4T-A95B, SiliconFlow hỗ trợ ngay lập tức»
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

Ảo tưởng về công cụ thị giác: Đánh giá nhân quả khả năng 'tư duy bằng hình ảnh' của LLM

Nghiên cứu chỉ ra rằng các thao tác thị giác như cắt/phóng ảnh trong LLM đa phương thức thường không cải thiện hiệu suất đáng kể mà lại gây tốn kém tài nguyên. Tác giả đề xuất mô hình đồ thị nhân quả để kiểm chứng liệu các công cụ này có thực sự hỗ trợ tư duy hay chỉ là sự ngẫu nhiên.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

Liệu AI có giữ vững kịch bản? Đánh giá khả năng duy trì tính nhất quán trong kể chuyện tương tác

Nghiên cứu giới thiệu NCP-Bench, bộ tiêu chuẩn đánh giá khả năng duy trì tính logic và nhất quán của LLM khi đối mặt với các tình huống kể chuyện tương tác phức tạp, nơi AI thường gặp khó khăn trong việc bám sát kịch bản gốc.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

NeuPAT: Tối ưu hóa phân bổ độ dẻo thần kinh giúp mô hình đa phương thức giữ vững khả năng ngôn ngữ

NeuPAT là phương pháp mới giúp bảo vệ các neuron quan trọng trong LLM khi huấn luyện đa phương thức, ngăn chặn tình trạng suy giảm khả năng ngôn ngữ vốn có bằng cách phân bổ mức độ cập nhật linh hoạt cho từng neuron.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 61/100

ToolHazard: Khung tổng hợp môi trường đối kháng giúp kiểm thử bảo mật cho AI Agent

ToolHazard là khung làm việc tự động tạo ra các môi trường giả lập có trạng thái để tấn công và kiểm thử lỗ hổng của AI Agent, giúp phát hiện các điểm yếu trong quy trình làm việc phức tạp và khả năng thực thi tác vụ dài hạn.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 54/100

Spark-to-Paper: Giải pháp tự động viết bài nghiên cứu khoa học thông qua các kỹ năng mô-đun

Spark-to-Paper tích hợp 13 kỹ năng có thể kết hợp vào các trợ lý lập trình để tự động hóa quy trình viết bài nghiên cứu từ đầu đến cuối, đạt độ chính xác trích dẫn 99,5% với chi phí tối ưu.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 92/100

Tinh chọnAn toàn cho AI Agent: Tại sao cần chuyển dịch sang cơ chế kiểm soát thời gian thực?

Thay vì chỉ dựa vào huấn luyện mô hình, bài viết đề xuất an toàn cho AI Agent cần được thực thi thông qua các hợp đồng thời gian thực, bao gồm cơ chế ngăn chặn hành vi nguy hiểm và yêu cầu bằng chứng xác thực cho mọi tác vụ.


Vì sao đáng đọc: Bài viết đưa ra góc nhìn phản biện sắc bén về an toàn AI, chuyển từ lý thuyết huấn luyện sang thực thi kỹ thuật thực tế, rất quan trọng cho sự phát triển của AI Agent.
Elon Musk@elonmusk
Hướng dẫnĐiểm AI 36/100

Cùng sự kiệnGrok 4.6 chính thức dẫn đầu bảng xếp hạng đánh giá của Databricks

Grok 4.6 reaches #1 on @databricks

DịchElon Musk xác nhận mô hình Grok 4.6 của xAI đã vươn lên vị trí số 1 trên bảng xếp hạng hiệu năng của Databricks, khẳng định bước tiến vượt bậc về năng lực xử lý.

Cùng sự kiện, bài đại diện «Grok 4.6 chính thức dẫn đầu bảng xếp hạng GDPVal-AA»
cb_doge@cb_doge
Hướng dẫnĐiểm AI 42/100

Cùng sự kiệnGrok 4.6 chính thức soán ngôi đầu bảng xếp hạng suy luận InferenceEval

Grok 4.6 takes the #1 spot on InferenceEval 🔥 🥇 Grok 4.6 - 46.9% 🥈 GPT-5.6 Sol - 44.1% 🥉 Opus 5…

DịchGrok 4.6 vừa vươn lên dẫn đầu bảng xếp hạng InferenceEval với 46,9% điểm số, vượt qua GPT-5.6 Sol và Opus 5. Phiên bản này cho thấy bước tiến vượt bậc trong khả năng giải quyết các tác vụ lập trình và suy luận thực tế.

Cùng sự kiện, bài đại diện «Grok 4.6 chính thức dẫn đầu bảng xếp hạng GDPVal-AA»
cb_doge@cb_doge
Hướng dẫnĐiểm AI 37/100

Cùng sự kiệnGrok 4.6 soán ngôi đầu bảng xếp hạng trí tuệ nhân tạo pháp lý Harvey

Grok 4.6 is officially #1 on the Harvey Legal Agent Benchmark 🥇 It scored 22.0% on realistic, mult…

DịchGrok 4.6 chính thức dẫn đầu bảng xếp hạng Harvey với 22% điểm số trong các tác vụ pháp lý đa bước, vượt xa các đối thủ như Fable 5 và phiên bản tiền nhiệm Grok 4.5.

Cùng sự kiện, bài đại diện «Grok 4.6 chính thức dẫn đầu bảng xếp hạng GDPVal-AA»
cb_doge@cb_doge
Hướng dẫnĐiểm AI 28/100

Cùng sự kiệnGrok 4.6 soán ngôi đầu bảng xếp hạng OfficeQA Pro, vượt mặt GPT-5.6

Grok 4.6 ranks #1 on OfficeQA Pro with 63.2% accuracy, outperforming Opus 5, Fable 5, and GPT-5.6 So…

DịchGrok 4.6 vừa thiết lập cột mốc mới trên OfficeQA Pro với độ chính xác 63,2%, vượt qua các đối thủ sừng sỏ như Opus 5 và GPT-5.6 trong việc xử lý tài liệu văn phòng thực tế.

Cùng sự kiện, bài đại diện «Grok 4.6 chính thức dẫn đầu bảng xếp hạng GDPVal-AA»
Eric Zakariasson@ericzakariasson
Hướng dẫnĐiểm AI 18/100

Cùng sự kiệnTổng hợp video so sánh hiệu năng Grok 4.5 và 4.6

here are sevent grok 4.5 vs 4.6 comparison videos! age of empires clone

DịchBộ sưu tập 7 video so sánh trực quan sự khác biệt giữa Grok 4.5 và 4.6, bao gồm cả thử nghiệm mô phỏng trò chơi Đế chế (Age of Empires).

Cùng sự kiện, tinh chọn hiển thị «Cursor hợp tác cùng SpaceXAI ra mắt Grok 4.6: Bước tiến mới trong lập trình AI»
Nathan Lambert@natolambert
Hướng dẫnĐiểm AI 17/100

Shoggoth: Biểu tượng văn hóa và ẩn dụ sâu sắc trong giới huấn luyện AI

I made a short video covering the history of Shoggoths, as used as a post-training meme and also dee…

DịchNathan Lambert chia sẻ về nguồn gốc của 'Shoggoth' - một meme kinh điển trong cộng đồng hậu huấn luyện AI, đồng thời là ẩn dụ đầy ám ảnh về bản chất của các mô hình ngôn ngữ hiện đại.

OpenRouter: Announcements
Hướng dẫnĐiểm AI 61/100

Hướng dẫn gọi công cụ trên OpenRouter: Viết code một lần, chạy đa mô hình chỉ với một dòng thay đổi

OpenRouter ra mắt hướng dẫn giúp lập trình viên sử dụng chung một cấu trúc code để gọi công cụ (tool calling) trên nhiều mô hình như Claude, GPT và các mô hình mã nguồn mở, chỉ cần thay đổi tên mô hình trong yêu cầu.

SemiAnalysis@SemiAnalysis_
Mô hìnhĐiểm AI 64/100

Cùng sự kiệnDeepSeek v4 Pro 1.5T ra mắt: Vượt xa Nemotron3 Ultra về hiệu suất

Congrats to @deepseek_ai for their release of DeepSeekv4 Pro 0813 1.5T🔥 It massively beats Nemotron…

DịchDeepSeek vừa trình làng phiên bản v4 Pro 1.5T với khả năng xử lý tác vụ thông minh vượt trội so với Nemotron3 Ultra, đồng thời bản Flash cũng tối ưu hóa hiệu năng đáng kể với số lượng tham số ít hơn nhiều.

Cùng sự kiện, bài đại diện «DeepSeek chính thức ra mắt phiên bản V4 Pro»
Rohan Paul@rohanpaul_ai
Hướng dẫnĐiểm AI 38/100

So sánh chi phí 26 mô hình LLM thương mại: Grok 4.6 dẫn đầu về hiệu năng trên giá thành

Blended cost per 1M tokens across 26 commercial LLMs, ordered low to high.

DịchPhân tích 26 LLM cho thấy Grok 4.6 đạt chỉ số thông minh 61 điểm, gần bằng Claude Fable 5 Max nhưng tiết kiệm tới 80-88% chi phí token, trở thành lựa chọn tối ưu nhất về kinh tế.

Artificial Analysis@ArtificialAnlys
Hướng dẫnĐiểm AI 62/100

Cùng sự kiệnGrok 4.6 dẫn đầu bảng xếp hạng AA-Briefcase với chi phí vận hành cực thấp

Grok 4.6 made large gains on AA-Briefcase, our agentic knowledge work benchmark and cost substantial…

DịchGrok 4.6 vừa đạt vị trí dẫn đầu trong bài kiểm tra năng lực tác vụ trí tuệ AA-Briefcase, sánh ngang với Claude Fable 5 nhưng có chi phí thực hiện chỉ 4,42 USD, thấp hơn đáng kể so với các đối thủ cạnh tranh.

Cùng sự kiện, bài đại diện «Grok 4.6 chính thức dẫn đầu bảng xếp hạng GDPVal-AA»
Kim@kimmonismus
Hướng dẫnĐiểm AI 39/100

Cuộc chiến giá khốc liệt giữa Grok 4.6 và DeepSeek 4 Pro GA

One thing became very clear today: performance and, above all, price are becoming increasingly impor…

DịchGrok 4.6 và DeepSeek 4 Pro GA đang đẩy mạnh cuộc đua về hiệu năng và giá thành. Với mức giá chỉ từ $0.435/M token và hỗ trợ ngữ cảnh 1 triệu token, DeepSeek đang tạo áp lực lớn lên thị trường AI.

Thêm 1 nguồn khác đưa tinWeChat: Khazix
Đã tải 40 tin

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (65 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “LLM” — Trang 31 | AIHOT.vn