23/09

Thứ Tư · 1 tin
Aravind Srinivas (Perplexity CEO)@AravSrinivas
Nghiên cứuĐiểm AI 40/100

Perplexity tối ưu hóa AI Agent: Giảm 21% lỗi gọi công cụ nhờ phương pháp hậu huấn luyện mới

We're sharing new research on our post-training approach, which teaches the Perplexity Computer agen…

DịchPerplexity giới thiệu kỹ thuật hậu huấn luyện mới cho AI Agent, kết hợp mô phỏng hành vi tối ưu và tinh chỉnh RFT, giúp giảm 21% tỷ lệ lỗi khi gọi công cụ trong các thử nghiệm thực tế.

22/09

Thứ Ba · 2 tin
Clément Delangue (Hugging Face CEO)@ClementDelangue
Sản phẩmĐiểm AI 34/100

CEO Hugging Face tiến cử Halo: Khung hậu huấn luyện mô hình AI hiệu năng vượt trội

Training models is becoming easier and easier - just look at this and TRL - especially with agents! …

DịchHalo là khung hậu huấn luyện mã nguồn mở mới, cho phép tăng tốc độ xử lý gấp 2,8 lần so với TRL truyền thống mà vẫn tiết kiệm bộ nhớ và giữ nguyên định dạng Hugging Face.

Rohan Paul@rohanpaul_ai
Sản phẩmĐiểm AI 50/100

White Circle ra mắt Halo: Framework hậu huấn luyện mã nguồn mở hiệu suất cao

White Circle just unveiled Halo, an open-source, distributed post-training framework for models that…

DịchHalo là framework hậu huấn luyện phân tán giúp tối ưu hóa hiệu suất vượt trội so với HuggingFace TRL, đạt tốc độ nhanh gấp 2.8 lần và tiết kiệm 25% bộ nhớ mà vẫn giữ nguyên định dạng mô hình gốc.

16/09

Thứ Tư · 1 tin
JiQiZhiXin
Mô hìnhĐiểm AI 85/100

Làm sao để tối ưu AI cục bộ? Trò chuyện cùng CTO của StartLux

Trong bối cảnh giới toán học lo ngại về việc AI 'đánh cắp' ý tưởng trên đám mây, StartLux gây chú ý khi đạt hiệu suất vượt trội với mô hình 27B. Chúng tôi thảo luận về cách họ tối ưu hóa hậu huấn luyện để đạt kết quả ấn tượng dù quy mô tham số nhỏ.

15/09

Thứ Ba · 1 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
NgànhĐiểm AI 43/100

Không phải prompt nào cũng như nhau: Khung hướng dẫn khám phá cho hậu huấn luyện RL đa phương thức

Nghiên cứu giới thiệu khung 'Exploration-Guided Prompt Scaffolding' giúp tối ưu hóa hậu huấn luyện RL cho mô hình đa phương thức (MLLM) thông qua chỉ số EPS, giúp đánh giá tiềm năng khám phá mà không tốn thêm chi phí tính toán.

12/09

Thứ Bảy · 1 tin

11/09

Thứ Sáu · 1 tin

09/09

Thứ Tư · 1 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 51/100

Ra mắt Miles v0.1: Hệ thống RL mã nguồn mở chuyên dụng cho hậu huấn luyện cấp sản xuất

Miles v0.1 là hệ thống hậu huấn luyện toàn diện, tối ưu cho môi trường sản xuất, giúp chuẩn hóa quy trình huấn luyện RL với thiết kế linh hoạt, dễ tùy chỉnh và kiểm chứng.

07/09

Thứ Hai · 1 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 88/100

Tinh chọnRISE: Cải thiện mô hình ngôn ngữ thông qua chưng cất chính sách tự suy diễn

RISE là phương pháp mới giúp mô hình tự tạo ra 'giáo viên' từ quá trình huấn luyện RLVR của chính nó. Bằng cách ngoại suy các thay đổi tham số, phương pháp này chuyển đổi các phản hồi thưa thớt thành mục tiêu học tập dày đặc ở cấp độ token mà không cần mô hình bên ngoài.


Vì sao đáng đọc: Đây là một bước tiến kỹ thuật quan trọng trong việc tối ưu hóa hậu huấn luyện (post-training) cho LLM, giải quyết hiệu quả bài toán phụ thuộc vào mô hình giáo viên bên ngoài.

02/09

Thứ Tư · 1 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 37/100

Nghiên cứu mới: Hợp nhất 200+ ứng dụng nội bộ vào một LLM tự lưu trữ bằng dữ liệu thực tế

Bài báo đề xuất phương pháp hậu huấn luyện dựa trên lưu lượng truy cập thực tế, giúp tối ưu hóa hiệu suất LLM tự lưu trữ trên các tác vụ phức tạp như gọi hàm và tuân thủ chỉ dẫn, đảm bảo bảo mật dữ liệu doanh nghiệp.

28/08

Thứ Sáu · 1 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 51/100

Giải mã chiến lược tiến hóa (ES) trong suy luận LLM: Vượt trội hơn GRPO về khả năng tư duy

Nghiên cứu chỉ ra rằng chiến lược tiến hóa (ES) giúp tối ưu hóa suy luận LLM hiệu quả hơn GRPO, tránh được hiện tượng suy giảm entropy và cải thiện đáng kể tỷ lệ thành công (Pass@K) nhờ các cập nhật trọng số chọn lọc.

27/08

Thứ Năm · 1 tin

26/08

Thứ Tư · 1 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 55/100

OPDVR: Phương pháp chưng cất chính sách không giám sát kết hợp phần thưởng kiểm chứng

OPDVR là phương pháp mới kết hợp học tăng cường dựa trên phần thưởng kiểm chứng (RLVR) với chưng cất chính sách trực tuyến (OPD) mà không cần thêm siêu tham số, giúp tối ưu hóa mô hình hiệu quả hơn.

22/08

Thứ Bảy · 1 tin
Rohan Paul@rohanpaul_ai
NgànhĐiểm AI 34/100

Chuyên gia Tang Jie: Mô hình nghìn tỷ tham số là bước đi sai lầm, hậu huấn luyện mới là chìa khóa

Today's edition of my newsletter just went out. 🔗 https://www.rohan-paul.com/p/study-finds-1-in-3-...

DịchGiáo sư Tang Jie nhận định việc chạy đua mô hình nghìn tỷ tham số là hướng đi lệch lạc, thay vào đó, tối ưu hóa giai đoạn hậu huấn luyện (post-training) mới là yếu tố quyết định sự đột phá của AI.

20/08

Thứ Năm · 4 tin
Rohan Paul@rohanpaul_ai
Hướng dẫnĐiểm AI 42/100

Nhà sáng lập Zhipu AI: Scaling Law không chỉ nằm ở số lượng tham số

Brilliant piece by Zhipu Founder Tang Jie. AI scaling is moving past parameter growth. "How many …

DịchĐường cong tăng trưởng mô hình không còn phụ thuộc vào tham số, mà nằm ở dữ liệu, tính toán và hậu huấn luyện. Zhipu chứng minh GLM-5.3 dù cùng cấu trúc với bản cũ nhưng nhờ tối ưu hóa suy luận và RL, hiệu suất đã vượt trội đáng kể.

Thomas Wolf (Hugging Face đồng sáng lập/CSO)@Thom_Wolf
Hướng dẫnĐiểm AI 39/100

Cùng sự kiệnTang Jie chia sẻ về Scaling Law: Thử nghiệm hậu huấn luyện trên GLM-5.3

I wish every neolab had a professor as cofounder of the level of @jietang and so able to put in pers…

DịchTang Jie từ Zhipu AI khẳng định chi phí suy luận đang dần chiếm ưu thế trong vòng đời mô hình. Thử nghiệm trên GLM-5.3 cho thấy việc tối ưu hóa hậu huấn luyện bằng RL có thể nâng cao năng lực đáng kể mà không cần thay đổi kiến trúc hay tham số.

Cùng sự kiện, bài đại diện «Tang Jie (Zhipu AI) bàn về Scaling Law: GLM-5.3 là bước tiến trong tối ưu hóa mô hình»

19/08

Thứ Tư · 3 tin
Ma Dongxi NLP@dongxi_nlp
Mô hìnhĐiểm AI 44/100

Tang Jie bàn về Scaling Law: Thử nghiệm hậu huấn luyện trên GLM-5.3

Tang Jie phản biện Scaling Law, khẳng định hiệu năng không chỉ phụ thuộc vào số lượng tham số mà còn ở dữ liệu và tối ưu hóa hậu huấn luyện. Thử nghiệm trên GLM-5.3 cho thấy chỉ cần tinh chỉnh RL trong một tháng đã mang lại bước tiến lớn mà không cần thay đổi kiến trúc.

Thêm 1 nguồn khác đưa tinLatent Space
Tang Jie@jietang
Mô hìnhĐiểm AI 56/100

Cùng sự kiệnTang Jie chia sẻ về Scaling Law: Thử nghiệm hậu huấn luyện trên GLM-5.3

Thoughts About Scaling Law Scaling, but not only of parameters. Every model release now ends with t…

DịchTang Jie khẳng định Scaling Law không chỉ nằm ở quy mô tham số mà còn ở dữ liệu và tính toán. Thử nghiệm GLM-5.3 cho thấy việc tối ưu hóa hậu huấn luyện (RL) giúp cải thiện hiệu suất vượt trội mà không cần thay đổi kiến trúc hay tăng tham số.

Cùng sự kiện, bài đại diện «Tang Jie (Zhipu AI) bàn về Scaling Law: GLM-5.3 là bước tiến trong tối ưu hóa mô hình»
OpenRouter@OpenRouter
Mô hìnhĐiểm AI 50/100

GLM-5.3 chính thức lên sóng OpenRouter: Hiệu năng đột phá nhờ tối ưu hóa hậu huấn luyện

GLM-5.3 from @Zai_org is live on OpenRouter! The same base model as GLM-5.2, with gains entirely fr…

DịchGLM-5.3 đã có mặt trên OpenRouter. Dù dùng chung nền tảng với bản 5.2, mô hình này đạt bước tiến lớn về khả năng lập trình và giải quyết vấn đề nhờ quy trình hậu huấn luyện chuyên sâu.

18/08

Thứ Ba · 1 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 52/100

StreamOPD: Giải pháp hậu huấn luyện tối ưu hóa hiểu video trực tuyến với cơ chế cổng tín hiệu không gian-thời gian

StreamOPD giới thiệu phương pháp hậu huấn luyện không cần bộ nhớ suy luận, giúp cải thiện đáng kể hiệu suất hiểu video trên các bộ dữ liệu chuẩn, tiệm cận kết quả của các mô hình lớn hơn.

15/08

Thứ Bảy · 1 tin
SemiAnalysis@SemiAnalysis_
Hướng dẫnĐiểm AI 56/100

Cùng sự kiệnGLM-5.3 vượt mặt các mô hình mã nguồn mở Mỹ nhờ kỹ thuật hậu huấn luyện

Congrats to @Zai_org on GLM-5.3. It massively beats every American open model: Nemotron, Laguna, Ink…

DịchGLM-5.3 vừa ra mắt đã cho thấy hiệu suất vượt trội so với các đối thủ từ Mỹ như Nemotron. Điểm đáng chú ý là sự cải tiến này hoàn toàn đến từ quy trình hậu huấn luyện (post-training) trên cùng một nền tảng với phiên bản cũ.

Cùng sự kiện, tinh chọn hiển thị «GLM-5.3 ra mắt: Bước tiến đột phá trong năng lực an ninh mạng và phòng thủ tự động»

14/08

Thứ Sáu · 2 tin
Emad Mostaque@EMostaque
Hướng dẫnĐiểm AI 41/100

GLM-5.3 bứt phá nhờ hậu huấn luyện, thống trị bảng xếp hạng phòng thủ mạng

Something has happened with post-training as shown by DeepSeek flash & GLM-5.3 updates. Same ba…

DịchZhipu ra mắt GLM-5.3 với khả năng lập trình và tác tử vượt trội. Các chuyên gia nhận định mô hình này chứng minh sức mạnh của kỹ thuật hậu huấn luyện trong việc đưa hiệu suất lên tầm cao mới, vượt xa các phương pháp chưng cất truyền thống.

MarkTechPost
Mô hìnhĐiểm AI 61/100

Cùng sự kiệnZ.ai ra mắt GLM-5.3: Đột phá khả năng lập trình và xử lý tác vụ dài mà không cần huấn luyện lại

Z.ai vừa trình làng GLM-5.3, phiên bản nâng cấp dựa trên nền tảng 743B cũ thông qua kỹ thuật hậu huấn luyện chuyên sâu. Mô hình đạt hiệu suất ấn tượng trong lập trình và các tác vụ phức tạp, vượt qua nhiều đối thủ sừng sỏ như Mythos 5 và GPT-5.6 Sol.

Cùng sự kiện, tinh chọn hiển thị «GLM-5.3 ra mắt: Bước tiến đột phá trong năng lực an ninh mạng và phòng thủ tự động»

13/08

Thứ Năm · 1 tin
Nathan Lambert@natolambert
Hướng dẫnĐiểm AI 17/100

Shoggoth: Biểu tượng văn hóa và ẩn dụ sâu sắc trong giới huấn luyện AI

I made a short video covering the history of Shoggoths, as used as a post-training meme and also dee…

DịchNathan Lambert chia sẻ về nguồn gốc của 'Shoggoth' - một meme kinh điển trong cộng đồng hậu huấn luyện AI, đồng thời là ẩn dụ đầy ám ảnh về bản chất của các mô hình ngôn ngữ hiện đại.

Tổng 26 tin, không còn tin nào nữa

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (44 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “Hậu huấn luyện” | AIHOT.vn