HP ra mắt ZBook Ultra G3a 16: Laptop workstation chạy được LLM 300 tỷ tham số
HP giới thiệu ZBook Ultra G3a 16 trang bị chip AMD Ryzen AI Max PRO, hỗ trợ bộ nhớ thống nhất 192GB, cho phép chạy cục bộ các mô hình ngôn ngữ lớn quy mô 300 tỷ tham số.
HP giới thiệu ZBook Ultra G3a 16 trang bị chip AMD Ryzen AI Max PRO, hỗ trợ bộ nhớ thống nhất 192GB, cho phép chạy cục bộ các mô hình ngôn ngữ lớn quy mô 300 tỷ tham số.
Gavel là phương pháp mới giúp LLM tự chọn kỹ năng phù hợp thông qua các ánh xạ tuyến tính thay vì nhồi nhét metadata vào ngữ cảnh, giúp mở rộng thư viện kỹ năng mà không làm giảm hiệu suất của mô hình.
Nghiên cứu giới thiệu bài toán ghi nhớ dài hạn, nơi mô hình phải học 100 tác vụ liên tiếp mà không bị quên kiến thức cũ. Nhóm tác giả đề xuất kết hợp các cơ chế bổ trợ để tối ưu hóa việc lưu giữ thông tin qua nhiều lần cập nhật trọng số.
Tác giả lập luận rằng việc LLM giải được toán học thuần túy không đồng nghĩa với khả năng tự động hóa tri thức, vì các mô hình hiện nay vẫn dễ thất bại ngoài phạm vi huấn luyện và thiếu tính kiểm chứng nghiêm ngặt như các định lý toán học.
Google vừa giới thiệu Gemini 3.8 Live và phiên bản Extended Thinking, hỗ trợ 97 ngôn ngữ. Trong đó, bản tiêu chuẩn tối ưu chi phí, còn bản Extended tập trung vào các tác vụ suy luận đa bước phức tạp.
Cùng sự kiện, tinh chọn hiển thị «Google DeepMind ra mắt Gemini 3.8 Live và bản Extended Thinking: Đột phá mới cho trợ lý giọng nói»
karminski@karminski3IFM vừa trình làng mô hình 7B K2-Horizon với điểm số AA Bench ấn tượng, đạt 21 điểm, gần bằng mức 22 điểm của Qwen3.6-27B. Mô hình này còn gây chú ý khi vượt qua cả GPT-5 và DeepSeek-V4 trong một số bài kiểm tra chuyên biệt.

Elvis Saravia@omarsar0I agree. MCP is clearly better than CLI for most integrations. It felt that way early on, and it sti…
DịchElvis Saravia khẳng định MCP ưu việt hơn CLI nhờ khả năng gọi công cụ mạnh mẽ, hỗ trợ tải chậm và kiến trúc không trạng thái, đồng thời khuyến nghị sử dụng MCP cho các hệ thống tùy chỉnh.
Đội ngũ vLLM đã sử dụng hệ thống GB300 NVL72 để huấn luyện mô hình DSpark cho Kimi K3, giúp tăng tốc độ suy luận toán học lên gấp 4 lần và cải thiện thông lượng đầu ra tới 3,5 lần.
Rohan Paul@rohanpaul_aiGoogle released Gemini 3.8 Live and Gemini 3.8 Live Extended Thinking And now it takes the #1 overa…
DịchGoogle vừa trình làng Gemini 3.8 Live và bản Extended Thinking, chính thức soán ngôi đầu bảng xếp hạng Artificial Analysis về khả năng tương tác giọng nói, vượt qua GPT-Live-1 Astra với hiệu suất ấn tượng 82,6%.

Rohan Paul@rohanpaul_aiAnother brilliant launch for developers: and its 20-200x faster than LLMs because it skips token-by-…
DịchTypeSafe AI vừa giới thiệu Jev, mô hình AI đột phá bỏ qua cơ chế tạo token tuần tự, giúp tăng tốc độ phản hồi lên gấp 200 lần và giảm chi phí vận hành tới 400 lần so với các LLM hiện nay.
Modal bổ sung hỗ trợ cho các mô hình mới như Kimi K3 (2.8T tham số, 1M token context) cùng nhiều cải tiến về hạ tầng và giao diện quản lý.
Nghiên cứu chỉ ra rằng RL hiện nay thường lãng phí tài nguyên vào các bài toán dễ. Phương pháp Never Give Up (NGU) đề xuất cơ chế lấy mẫu thích ứng, giúp phân bổ lại tài nguyên tính toán để giải quyết hiệu quả các bài toán khó mà mô hình chưa làm tốt.
Nathan Lambert@natolambertAn basic idea in scaling RL: Can we allocate more compute to the harder problems? We did this: If …
DịchNghiên cứu mới giải quyết 'hiệu ứng Matthew' trong học tăng cường (RL) bằng cách buộc mô hình tiếp tục lấy mẫu khi gặp câu trả lời sai, giúp GRPO vượt qua giới hạn ở các bài toán phức tạp.

Blog kỹ thuật của NVIDIA phân tích sự khác biệt giữa kiến trúc Dense và MoE. Điểm nhấn là cơ chế định tuyến của MoE giúp tối ưu hóa hiệu suất, ví dụ như mô hình Nemotron 3.5 Lightning 30B chỉ kích hoạt 3B tham số cho mỗi token.
Nghiên cứu đề xuất phương pháp tự động hóa việc tìm kiếm nguyên nhân gây lỗi cho các AI Agent hoạt động dài hạn, khắc phục hạn chế của LLM khi phải xử lý dữ liệu log khổng lồ và rời rạc.
LangChain tích hợp Baseten Loops nhằm tối ưu hóa quy trình huấn luyện và tinh chỉnh mô hình cho LangSmith, cho phép triển khai trực tiếp lên nền tảng suy luận của Baseten thông qua API.
Nghiên cứu mới từ IBM chỉ ra rằng các mạch lượng tử độ sâu thấp có thể giải quyết những bài toán tính toán phức tạp mà các mô hình Transformer như GPT hay Llama cần nguồn lực khổng lồ mới xử lý được, khẳng định ranh giới lý thuyết giữa hai công nghệ.
Bộ dữ liệu 4.0 với dung lượng 120GB vừa được công bố tại Diễn đàn Quản trị An toàn AI, được xây dựng bởi các đơn vị hàng đầu như Baidu, iFlytek và Zhihu dưới sự chỉ đạo của cơ quan chức năng Trung Quốc.
Nghiên cứu chỉ ra rằng các mô hình AI hiện nay thường thất bại khi đối mặt với các biến thể tương đương về mặt cấu trúc của cùng một bài toán, cho thấy tư duy của chúng thiếu tính hệ thống so với nhận thức con người.
AI Notes@AYi_AInotesBản báo cáo kỹ thuật 13 trang đề xuất mô hình bộ nhớ 5 tầng cho AI Agent, bao gồm bộ nhớ làm việc, tình huống, ngữ nghĩa, thủ tục và cơ chế tự xóa dữ liệu thừa, giúp tối ưu hóa hiệu suất và tiết kiệm tài nguyên đáng kể.

Các nhà nghiên cứu đã kiểm chứng phương pháp giải mã suy luận của Orthrus và phát hiện rằng ở định dạng BF16, tỷ lệ khớp hoàn toàn chỉ đạt khoảng 40%, trong khi độ chính xác tuyệt đối chỉ đạt được khi sử dụng FP32.
Qiyin Wu, cựu kỹ sư cấp cao tại Google DeepMind và là tác giả chủ chốt của Gemini 2.5, đã gia nhập Baidu để phụ trách mảng huấn luyện mô hình ngôn ngữ lớn. Cô sẽ làm việc tại Mỹ, mang theo kinh nghiệm dày dặn từ các dự án AI cốt lõi của Google.
Cùng sự kiện, bài đại diện «DeepMind thành lập viện nghiên cứu chuyên sâu về tác động của AGI»Jasmine và Nathan Lambert cùng thảo luận chuyên sâu về tốc độ phát triển và những thách thức trong việc định hình tương lai của các mô hình ngôn ngữ lớn hiện nay.
Testing Catalog@testingcatalogGOOGLE 🔥: Gemini 3.8 Live and Gemini 3.8 Live Extended Thinking model names have started appearing …
DịchHai tên gọi Gemini 3.8 Live và Extended Thinking vừa xuất hiện trên trang hạn mức của Google Cloud, hứa hẹn là bước tiến lớn dựa trên nền tảng Gemini 3.8 Flash thay thế cho bản 3.1 hiện tại.

ESRL là khung làm việc mới giúp tối ưu hóa việc lựa chọn chuyên gia trong mô hình MoE, tăng cường sự đa dạng của kết quả đầu ra mà không làm giảm chất lượng mô hình như các phương pháp nhiễu thông thường.
GVA là phương pháp mới giúp giảm 45-47% dung lượng bộ nhớ KV cache bằng cách tái tạo khóa nội dung thông qua ánh xạ tuyến tính, thay vì lưu trữ toàn bộ, giúp tăng hiệu suất giải mã cho các mô hình Transformer.
Ma Dongxi NLP@dongxi_nlpTốc độ phản hồi của LLM phụ thuộc vào TTFT (thời gian chờ token đầu tiên) và ITL (độ trễ giữa các token). Hiểu rõ hai chỉ số này giúp tối ưu hóa quá trình xử lý Prefill và Decode, mang lại trải nghiệm mượt mà hơn.
Tencent Hunyuan@TencentHunyuan🚀 EvolveScaler is here. Read a 40-day RPG log. Now answer one question: if you skip the mini-boss …
DịchTencent Hunyuan giới thiệu EvolveScaler, bộ tiêu chuẩn mới mô phỏng các kịch bản thông tin phức tạp như chỉnh sửa, thu hồi và cập nhật dữ liệu. Công cụ này giúp kiểm tra khả năng suy luận logic của AI và cải thiện đáng kể hiệu suất trên nhiều tác vụ thực tế.

Kim@kimmonismusRumors are increasingly circulating that Opus is already being routed to Opus 5.2. It's also said to…
DịchCác nguồn tin cho biết Anthropic chuẩn bị tung ra Opus 5.2 với nhiều cải tiến đáng kể về hiệu suất. Cộng đồng kỳ vọng phiên bản này sẽ khắc phục tình trạng phản hồi dài dòng và lười biếng của các thế hệ trước.
Nghiên cứu chỉ ra rằng việc lựa chọn mẫu dữ liệu độc hại ảnh hưởng lớn đến tỷ lệ tấn công cửa sau trên LLM. Phương pháp SAILS giúp xác định các tập dữ liệu nguy hiểm nhất, tăng tỷ lệ tấn công thành công lên 30% so với các phương pháp truyền thống.
Alibaba Cloud@alibaba_cloudDeepSeek-V4.1-Flash is now on Alibaba Cloud Token Plan. Built for agentic workloads with a 1M-token …
DịchDeepSeek-V4.1-Flash đã cập bến Alibaba Cloud với khả năng xử lý 1 triệu token, tốc độ suy luận vượt trội và tối ưu cho các tác nhân AI (AI Agents), với giá khởi điểm chỉ từ 6 USD/tháng.

Ma Dongxi NLP@dongxi_nlpBài viết giải thích hai giai đoạn suy luận của LLM: Prefill xử lý song song đầu vào quyết định tốc độ phản hồi ban đầu (TTFT), trong khi Decode tạo văn bản từng token một và thường bị nghẽn băng thông bộ nhớ.
Ethan Mollick@emollickI just remembered this thread where I was playing with GPT-3.5 (text-davinci-003) the day it was rel…
DịchEthan Mollick nhìn lại hành trình thần tốc của LLM, từ lúc GPT-3.5 ra mắt đến khi trở thành trụ cột định hình nền kinh tế và chính trị Hoa Kỳ chỉ trong chưa đầy 4 năm.
Một nhóm nghiên cứu sinh đã huy động hàng trăm AI Agent để tự động hóa quy trình phát triển, đánh dấu bước tiến mới trong việc dùng AI để tạo ra AI.
Nghiên cứu chỉ ra rằng các chiến lược có thể nén vào ít token sẽ không bị quá khớp. Phương pháp nén này giúp kiểm chứng hiệu năng thực tế của tác nhân AI, đồng thời là công cụ hiệu quả để phát hiện tình trạng quá khớp trong quá trình huấn luyện.
Tác giả chia sẻ cách tối ưu hóa prompt khổng lồ khi chuyển sang Ollama, giải quyết tình trạng lặp lại lệnh của AI bằng cách chia nhỏ prompt, định nghĩa agent kiểu khai báo và quản lý ngữ cảnh hiệu quả.
Nhiều lập trình viên phản ánh Claude thường xuyên phớt lờ các chỉ dẫn cụ thể trong file cấu hình, từ việc tự ý thêm chú thích code đến thay đổi phong cách viết. So với các đối thủ như DeepSeek hay OpenAI, sự 'cứng đầu' này đang gây khó chịu cho người dùng chuyên nghiệp.
Arena@arenaDeepSeek-V4.1-Flash (Max) is a breakthrough in performance to cost efficiency. With +4.87% net impro…
DịchDeepSeek-V4.1-Flash (Max) vừa ghi danh vào bảng xếp hạng Agent Arena, đạt vị trí thứ 3 trong nhóm mô hình nguồn mở với chi phí chỉ 0,07 USD mỗi tác vụ, thiết lập chuẩn mực mới về hiệu suất trên chi phí.
Thay vì để AI tự tính toán dễ sai sót, nghiên cứu này đề xuất mô hình viết mã Python để thực thi các phép tính y khoa một cách chính xác. Phương pháp này giúp đảm bảo tính tin cậy cho các công cụ hỗ trợ quyết định lâm sàng.
Rohan Paul@rohanpaul_ai"If you're an analytical SaaS company, it's over. It's over." - Palo Alto Networks CEO Nikesh Arora…
DịchNikesh Arora khẳng định các ứng dụng SaaS phân tích dữ liệu truyền thống đang dần lỗi thời, khi LLM có thể trực tiếp xử lý và phân tích dữ liệu thay vì cần đến các module phần mềm bổ trợ đắt đỏ.