24/09

Thứ Năm · 3 tin
Elvis Saravia@omarsar0
Nghiên cứuĐiểm AI 52/100

Harness-Zero: Nghiên cứu mới về phương pháp chưng cất khả năng điều khiển Agent vào mô hình

Super interesting paper from Google and colleagues. It studies where it's possible to distill an ag…

DịchNhóm nghiên cứu từ Đại học Bắc Kinh, Google và HKUST giới thiệu Harness-Zero, phương pháp chưng cất khả năng 'agent-as-harness' để tối ưu hóa phản hồi của mô hình trong không gian hành động mục tiêu thông qua dữ liệu huấn luyện tinh chỉnh.

22/09

Thứ Ba · 1 tin
Nathan Lambert@natolambert
Quan điểmĐiểm AI 53/100

Nathan Lambert tranh luận cùng Epoch AI về tác động thực sự của kỹ thuật chưng cất mô hình đối với các phòng lab Trung Quốc

The biggest disagreement JSD and I had in this podcast was on the impact of distillation. In our res…

DịchTrong podcast mới nhất, Nathan Lambert và chuyên gia từ Epoch AI đã có những bất đồng quan điểm sâu sắc về việc liệu kỹ thuật chưng cất (distillation) có thực sự giúp các phòng thí nghiệm AI tại Trung Quốc vượt qua rào cản hạn chế chip hay không.

21/09

Thứ Hai · 1 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

Cal-OPD: Tối ưu hóa chưng cất mô hình thông qua hiệu chỉnh sai lệch giữa giáo viên và học sinh

Cal-OPD giải quyết vấn đề mô hình học sinh vô tình học phải các sai lệch nội tại của giáo viên trong quá trình chưng cất (distillation), bằng cách tách biệt và loại bỏ các nhiễu này để cải thiện khả năng suy luận.

18/09

Thứ Sáu · 1 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 44/100

Khi token kết thúc không đồng nhất: Giải mã hiện tượng 'phình' độ dài trong chưng cất chính sách trực tuyến

Nghiên cứu chỉ ra rằng sự lệch pha giữa token kết thúc (EOS) của mô hình giáo viên và học sinh trong chưng cất chính sách trực tuyến (OPD) khiến mô hình phản hồi quá dài hoặc cạn kiệt tài nguyên tính toán.

17/09

Thứ Năm · 1 tin
Apple Machine Learning Research
NgànhĐiểm AI 45/100

Cùng sự kiệnApple ra mắt TS-DFM: Tối ưu hóa mô hình ngôn ngữ với 'la bàn năng lượng' siêu tốc

Apple giới thiệu TS-DFM, kỹ thuật chưng cất mô hình sử dụng 'la bàn năng lượng' để chọn lọc bước nhảy hiệu quả thay vì ngẫu nhiên. Kết quả cho thấy mô hình 8 bước vượt trội hơn mô hình 1024 bước tới 32% về độ chính xác, đồng thời tăng tốc độ suy luận gấp 128 lần.

Cùng sự kiện, bài đại diện «DACA-GRPO: Apple tối ưu hóa học tăng cường cho mô hình ngôn ngữ khuếch tán»

15/09

Thứ Ba · 1 tin
QbitAI
Nghiên cứuĐiểm AI 88/100

Tinh chọnNghiên cứu mới từ Meta: Chưng cất mô hình Byte giúp phá vỡ giới hạn hiệu năng

Meta vừa công bố phương pháp chưng cất mô hình mới giúp các mô hình Byte vượt qua giới hạn hiệu suất truyền thống, mở ra hướng đi đột phá cho việc tối ưu hóa AI.


Vì sao đáng đọc: Đây là bước tiến kỹ thuật quan trọng trong lĩnh vực nén và tối ưu hóa mô hình ngôn ngữ, có tính ứng dụng cao cho cộng đồng nghiên cứu AI.

12/09

Thứ Bảy · 1 tin
Zhao Chunxiang@chunxiangai
NgànhĐiểm AI 40/100

Góc nhìn về 'tuyên ngôn chưng cất' của OpenAI: Khi dữ liệu trở thành vũ khí chiến lược

Chuyên gia Zhao Chunxiang phân tích hai khía cạnh của việc OpenAI tố cáo các bên lạm dụng mô hình cho mục đích quân sự, đồng thời cảnh báo về sự khan hiếm dữ liệu toàn cầu và hệ quả từ chiến lược 'đốt sách' của các ông lớn AI.

11/09

Thứ Sáu · 3 tin
Lan Xi@foxshuo
Hướng dẫnĐiểm AI 61/100

Lan Tịch bình luận về cáo buộc 'chưng cất' mô hình của Anthropic: Sự thật khó chối cãi, tranh cãi về giá trị

Lan Tịch cho rằng các mô hình nội địa Trung Quốc khó phủ nhận việc 'chưng cất' dữ liệu từ mô hình khác. Vấn đề hiện nay không nằm ở kỹ thuật mà ở góc độ đạo đức và pháp lý, khi đây được coi là thông lệ phổ biến trong ngành thay vì vi phạm pháp luật.

Rohan Paul@rohanpaul_ai
NgànhĐiểm AI 45/100

Cùng sự kiệnAnthropic cảnh báo: Kỹ thuật chưng cất mô hình có thể làm gia tăng rủi ro từ AI

Anthropic latest "misuse of AI" report claims distillation can improve general reasoning enough to i…

DịchBáo cáo mới từ Anthropic chỉ ra rằng kỹ thuật chưng cất tri thức (knowledge distillation) có thể giúp mô hình nhỏ đạt khả năng suy luận nguy hiểm vượt ngoài phạm vi huấn luyện ban đầu, dù các rào cản an toàn hiện tại vẫn khó bị sao chép qua phương pháp này.

Cùng sự kiện, bài đại diện «Báo cáo an toàn Anthropic: Ngăn chặn yêu cầu chế tạo vũ khí sinh học và phát hiện 7 phòng lab Trung Quốc vi phạm»
Nathan Lambert@natolambert
NgànhĐiểm AI 43/100

Chưng cất mô hình: Không chỉ là sản phẩm phụ của SFT

Big W for people saying that distillation was mostly an SFT artifact, and how its unclear how it wou…

DịchMột góc nhìn mới khẳng định tầm quan trọng của kỹ thuật chưng cất mô hình trong kỷ nguyên học tăng cường (RL), bác bỏ quan điểm cho rằng đây chỉ là sản phẩm phụ của quá trình tinh chỉnh có giám sát (SFT).

09/09

Thứ Tư · 1 tin
Rohan Paul@rohanpaul_ai
Hướng dẫnĐiểm AI 54/100

Jensen Huang: Học hỏi từ AI khác là nền tảng của trí tuệ

Jensen Huang on "distillation" In this interview with axios, he was asked this question: "Should op…

DịchJensen Huang khẳng định việc AI học hỏi từ các mô hình khác (chưng cất tri thức) là bản chất của trí tuệ, đồng thời nhấn mạnh các mô hình thông minh hơn cũng sẽ an toàn hơn.

08/09

Thứ Ba · 1 tin

04/09

Thứ Sáu · 1 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 51/100

Tái tư duy về chưng cất mô hình On-Policy: Chỉ cần một mẫu dữ liệu là đủ?

Nghiên cứu khám phá vai trò của dữ liệu trong chưng cất mô hình (OPD), chứng minh rằng chỉ với một truy vấn duy nhất, mô hình có thể cải thiện hiệu suất liên tục qua hàng trăm bước và đạt được phần lớn lợi ích so với việc dùng toàn bộ tập dữ liệu.

03/09

Thứ Năm · 1 tin

02/09

Thứ Tư · 1 tin
AK@_akhaliq
Nghiên cứuĐiểm AI 21/100

Nghiên cứu mới đặt dấu hỏi về cơ chế chưng cất On-Policy và đề xuất phương pháp OPSA không cần giám sát

Does On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement paper: https: /…

DịchNghiên cứu này phân tích bản chất thực sự của quá trình chưng cất On-Policy và giới thiệu OPSA, một phương pháp mới giúp tối ưu hóa mà không cần dữ liệu giám sát.

01/09

Thứ Ba · 1 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 48/100

Nghiên cứu cơ chế chưng cất On-Policy và đề xuất phương pháp không giám sát OPSA

Nghiên cứu chỉ ra rằng hiệu quả của chưng cất On-Policy (OPD) chủ yếu đến từ việc ức chế các token có xác suất thấp thay vì phụ thuộc vào giáo viên. Từ đó, nhóm tác giả đề xuất OPSA, phương pháp không cần giám sát giúp tối ưu hóa mô hình hiệu quả hơn.

30/08

Chủ Nhật · 1 tin
Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 45/100

Nghiên cứu chưng cất mô hình: Cách suy luận của giáo viên quan trọng hơn điểm số

Interesting study on model distillation. A distilled student model copies how its teacher reasons …

DịchNghiên cứu chỉ ra rằng mô hình học sinh ưu tiên bắt chước cách suy luận của giáo viên thay vì kiến thức thuần túy. Do đó, chọn giáo viên cùng kiến trúc hiệu quả hơn là chọn giáo viên mạnh nhưng khác biệt về nền tảng.

27/08

Thứ Năm · 2 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

Open-MOPD: Giải mã và khắc phục sự mất cân bằng năng lực trong chưng cất mô hình đa giáo viên

Nghiên cứu chỉ ra rằng phương pháp chưng cất đa giáo viên (M-OPD) hiện nay gặp hạn chế lớn trong việc tích hợp năng lực, chỉ đạt 35,6% hiệu suất tối ưu. Nhóm tác giả đề xuất giải pháp khắc phục tình trạng suy giảm chất lượng khi huấn luyện mô hình tổng quát từ các chuyên gia RL.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

D^3-MOPD: Tối ưu hóa chưng cất đa giáo viên bằng lập lịch miền động

D^3-MOPD là phương pháp lập lịch động giúp tối ưu hóa quá trình chưng cất kiến thức từ nhiều giáo viên bằng cách tự động điều chỉnh tỷ lệ dữ liệu theo tốc độ hội tụ của từng miền, giúp tiết kiệm tài nguyên và nâng cao hiệu quả huấn luyện.

26/08

Thứ Tư · 1 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 55/100

OPDVR: Phương pháp chưng cất chính sách không giám sát kết hợp phần thưởng kiểm chứng

OPDVR là phương pháp mới kết hợp học tăng cường dựa trên phần thưởng kiểm chứng (RLVR) với chưng cất chính sách trực tuyến (OPD) mà không cần thêm siêu tham số, giúp tối ưu hóa mô hình hiệu quả hơn.

25/08

Thứ Ba · 1 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

Vượt xa bắt chước: Tối ưu hóa chưng cất mô hình ngôn ngữ dựa trên tiến trình suy luận

Nghiên cứu đề xuất phương pháp R2-OPD giúp lọc phản hồi từ giáo viên trong quá trình chưng cất mô hình, đảm bảo việc học tập tập trung vào tiến trình suy luận thực tế thay vì chỉ bắt chước đầu ra của giáo viên.

24/08

Thứ Hai · 1 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

Hai mặt của sự khái quát hóa trong chưng cất mô hình ngôn ngữ lớn theo chính sách (On-policy Distillation)

Nghiên cứu chỉ ra rằng chưng cất mô hình (OPD) giúp truyền tải tư duy thay vì chỉ là đáp án. Hiệu quả phụ thuộc lớn vào mối quan hệ nguồn gốc giữa mô hình giáo viên và học sinh, thay vì độ khó của bài toán.

17/08

Thứ Hai · 2 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

SimpleOPD: Phương pháp chưng cất mô hình tối ưu cho suy luận ngữ cảnh dài

SimpleOPD giải quyết các thách thức khi chuyển giao khả năng suy luận từ mô hình ngữ cảnh dài sang mô hình ngữ cảnh ngắn, thông qua việc đồng bộ hóa không gian văn bản và tối ưu hóa quá trình huấn luyện để tránh lỗi độ dài và mất ổn định.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

S^2VOPD: Phương pháp chưng cất mô hình thị giác tự giám sát không cần dữ liệu đặc quyền

Nghiên cứu giới thiệu S^2VOPD, phương pháp tạo tín hiệu học tập bằng cách lược bỏ thông tin từ mô hình học sinh thay vì bổ sung dữ liệu cho giáo viên, giúp huấn luyện mô hình thị giác hiệu quả mà không cần nhãn hay mô hình giáo viên mạnh.

16/08

Chủ Nhật · 1 tin
Hongming@hongming731
NgànhĐiểm AI 36/100

Cùng sự kiệnCơ chế chống chưng cất của 3 ông lớn AI bị bẻ khóa: Lộ lỗ hổng bảo mật nghiêm trọng

Nghiên cứu mới chỉ ra lỗ hổng cho phép trích xuất chuỗi tư duy ẩn từ các mô hình AI hàng đầu của Anthropic, OpenAI và Google với chi phí thấp, đặt ra thách thức lớn về bảo mật mô hình.

Cùng sự kiện, bài đại diện «Lỗ hổng bảo mật nghiêm trọng: Chuỗi tư duy ẩn của các mô hình AI lớn bị giải mã»

15/08

Thứ Bảy · 1 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 46/100

Context-Matched Distillation: Khung căn chỉnh nhân quả cho mô hình tạo video tự hồi quy

CMD giới thiệu khung làm việc DMD nhân quả, giúp đồng bộ hóa sự giám sát của giáo viên với quá trình tạo video của học sinh, từ đó tối ưu hóa hiệu suất tạo video ngắn và dài, đồng thời cải thiện khả năng kiểm soát camera theo thời gian.

12/08

Thứ Tư · 1 tin
Ma Dongxi NLP@dongxi_nlp
Hướng dẫnĐiểm AI 58/100

Nghiên cứu mới: Lỗ hổng chưng cất cho phép trích xuất suy luận ẩn từ các mô hình AI tiên tiến

Một nghiên cứu mới chỉ ra phương pháp khai thác lỗ hổng API để trích xuất các bước suy luận ẩn của AI. Dữ liệu cho thấy các mô hình như Kimi và GLM có dấu hiệu bị ảnh hưởng khi chưng cất từ các mô hình mạnh hơn như Opus, làm dấy lên tranh cãi về việc sao chép công nghệ.

Tổng 29 tin, không còn tin nào nữa

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (45 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “chưng cất mô hình” | AIHOT.vn