09/09

Thứ Tư · 8 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

CVRR: Ép mô hình AI suy luận hình ảnh thông qua trạng thái ẩn thay vì văn bản

Nghiên cứu giới thiệu Causal Visual Recurrent Reasoning (CVRR), phương pháp buộc mô hình AI phải sử dụng các trạng thái ẩn để suy luận hình ảnh thay vì dựa vào các chuỗi suy nghĩ văn bản, giúp tăng độ chính xác và tính minh bạch trong xử lý đa phương thức.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 88/100

Tinh chọnKalman Delta Networks: Mạng bộ nhớ liên kết có khả năng nhận thức độ bất định

Kalman Delta Networks (KDNs) cải tiến cơ chế attention tuyến tính bằng cách áp dụng bộ lọc Kalman để quản lý độ bất định trong bộ nhớ, giúp mô hình tối ưu hóa việc ghi nhớ thông tin dựa trên bằng chứng tích lũy thay vì chỉ dựa vào token hiện tại.


Vì sao đáng đọc: Đây là một bước tiến kỹ thuật quan trọng trong kiến trúc mô hình ngôn ngữ, giải quyết bài toán tối ưu hóa bộ nhớ dài hạn bằng phương pháp toán học xác suất, rất có giá trị cho giới nghiên cứu AI.

08/09

Thứ Ba · 1 tin
JiQiZhiXin
Nghiên cứuĐiểm AI 85/100

Looped Transformer có thực sự mạnh hơn? Câu trả lời từ nghiên cứu của Thanh Hoa và ByteDance

Nghiên cứu SMELT từ Đại học Thanh Hoa và ByteDance giải mã hiệu năng của Looped Transformer bằng cách so sánh công bằng về chi phí tính toán, tham số và KV cache, khẳng định tiềm năng của việc tái sử dụng các lớp mạng thay vì chỉ tăng quy mô mô hình.

07/09

Thứ Hai · 5 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 88/100

Tinh chọnGiải mã tư duy của LLM: Cấu trúc hình học ẩn sau các chuỗi suy luận

Nghiên cứu này khám phá cách các mô hình ngôn ngữ lớn tổ chức các thao tác suy luận như phân tích mục tiêu và suy diễn trong không gian biểu diễn ẩn, chứng minh rằng các thao tác này có cấu trúc hình học riêng biệt và không phụ thuộc vào từ vựng.


Vì sao đáng đọc: Nghiên cứu chuyên sâu về cơ chế nội tại của LLM, giúp hiểu rõ cách mô hình 'tư duy' thực sự, rất quan trọng cho việc cải thiện khả năng suy luận của AI.
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

ShallowStream: Tối ưu hóa xử lý video trực tuyến bằng cách phân tầng độ sâu mô hình

ShallowStream là khung làm việc mới giúp giảm chi phí tính toán khi xử lý video trực tuyến bằng cách kết hợp xử lý nông (shallow) cho các khung hình đầu vào và chỉ đi sâu (deep) khi cần thiết, giúp tối ưu hóa bộ nhớ KV cache.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

Khi lượng tử hóa làm hỏng bộ nhớ: Vấn đề ghi đè trạng thái hồi quy trong suy luận độ chính xác thấp

Nghiên cứu chỉ ra rằng việc lượng tử hóa trạng thái trong mạng hồi quy (RNN) có thể gây sai số nghiêm trọng khi dự đoán các thông số sinh học. Việc lưu trữ trạng thái 4-bit làm tăng sai số dự báo lên gấp hàng trăm lần so với mô hình gốc.

04/09

Thứ Sáu · 1 tin

03/09

Thứ Năm · 4 tin
JiQiZhiXin
Mô hìnhĐiểm AI 92/100

Tinh chọnOpenAI Astra lộ diện với công nghệ 'độ sâu tuần hoàn': Bước tiến đột phá hay mối đe dọa an ninh?

OpenAI Astra đạt ngưỡng năng lực an ninh mạng 'cấp độ quan trọng', có khả năng tự phát hiện lỗ hổng zero-day nhờ kỹ thuật 'độ sâu tuần hoàn' mới, khiến giới chuyên gia lo ngại về khả năng kiểm soát AI.


Vì sao đáng đọc: Tin tức nóng hổi về bước tiến công nghệ của OpenAI, tác động trực tiếp đến an ninh mạng và tranh luận về đạo đức AI, có giá trị thông tin cao cho độc giả công nghệ.
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

Giải mã nguyên lý thiết kế mô hình học biểu diễn văn bản từ điểm ảnh (Pixel)

Nghiên cứu này xác định bốn yếu tố then chốt để tối ưu hóa khả năng đọc và hiểu văn bản trực tiếp từ điểm ảnh, giúp khắc phục các hạn chế về độ phân giải và khả năng đa ngôn ngữ của các mô hình hiện nay.

02/09

Thứ Tư · 1 tin
Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
Nghiên cứuĐiểm AI 54/100

Nghiên cứu mới: Mạng thần kinh nhân tạo tự hình thành cấu trúc ký hiệu bên trong

Nghiên cứu chỉ ra rằng các mô hình ngôn ngữ lớn (LLM) ẩn chứa cấu trúc ký hiệu Tensor Product Representation. Bằng phương pháp DISCOVER, các tác giả đã thay thế biểu diễn vector của 7 mô hình (như Llama-3.1, Qwen3) bằng các phương trình ký hiệu mà vẫn giữ nguyên hành vi của mô hình.

31/08

Thứ Hai · 2 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

ABot-Recon: Tái định nghĩa bối cảnh cục bộ cho tái dựng 3D trực tuyến dài hạn

ABot-Recon là mô hình tái dựng 3D trực tuyến đột phá, chỉ sử dụng bộ nhớ đệm 11 khung hình gần nhất để duy trì độ ổn định mà không cần bộ nhớ dài hạn phức tạp, giúp tối ưu hóa tài nguyên tính toán cho các video cực dài.

28/08

Thứ Sáu · 2 tin
Francois Chollet@fchollet
Hướng dẫnĐiểm AI 19/100

Giải mã nguồn gốc tia vũ trụ bằng Deep Learning với Keras

Figuring out the origins of cosmic rays (e.g. supernova, black hole…) from ground-based detector a…

DịchCác nhà vật lý thiên văn đang ứng dụng Keras để thay thế phương pháp trích xuất đặc trưng thủ công, cho phép mô hình hóa trực tiếp các dạng sóng không-thời gian nhằm truy vết nguồn gốc tia vũ trụ từ siêu tân tinh và hố đen.

27/08

Thứ Năm · 1 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

Gated Recurrent Transformer: Tối ưu hóa bộ nhớ và hiệu suất cho mô hình ngôn ngữ

Gated Recurrent Transformer giải quyết bài toán cân bằng giữa khả năng biểu đạt và bộ nhớ bằng cách sử dụng các khối lặp lại có kiểm soát, cho phép mô hình chuyên biệt hóa dữ liệu đầu vào mà không cần tăng số lượng tham số đáng kể.

26/08

Thứ Tư · 2 tin

25/08

Thứ Ba · 1 tin

24/08

Thứ Hai · 4 tin
Microsoft Research@MSFTResearch
Mô hìnhĐiểm AI 40/100

Microsoft cập nhật Skala 1.1: Bước tiến mới trong độ chính xác của hóa học tính toán

Skala 1.1, the updated deep-learning exchange-correlation functional from Microsoft Research, provid…

DịchMicrosoft Research vừa ra mắt Skala 1.1, bản cập nhật hàm trao đổi-tương quan dựa trên học sâu, giúp nâng cao độ chính xác và khả năng tiếp cận trong nghiên cứu hóa học tính toán.

Francois Chollet@fchollet
Hướng dẫnĐiểm AI 43/100

Học cách xây dựng LLM từ con số 0 với chương 15-16 sách Deep Learning with Python

If you're 17 (or any age) and you want to learn to build LLMs from scratch, read chapters 15-16 of D…

DịchTác giả Francois Chollet gợi ý chương 15-16 trong cuốn 'Deep Learning with Python' là tài liệu tuyệt vời để hiểu cách xây dựng LLM, đặc biệt là giải thích sâu sắc về cơ chế chú ý (attention).

20/08

Thứ Năm · 2 tin
Microsoft Research@MSFTResearch
Mô hìnhĐiểm AI 47/100

Microsoft nâng cấp Skala 1.1: Đột phá độ chính xác trong hóa học tính toán

Skala 1.1, the updated deep-learning exchange-correlation functional from Microsoft Research, provid…

DịchMicrosoft Research vừa cập nhật Skala 1.1, hàm trao đổi-tương quan dựa trên học sâu, giúp tăng độ chính xác và khả năng tiếp cận trong nghiên cứu hóa học tính toán cùng hệ thống theo dõi hiệu suất thời gian thực.

19/08

Thứ Tư · 2 tin
Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
Sản phẩmĐiểm AI 64/100

ModelMap: Công cụ trực quan hóa kiến trúc mô hình AI từ Hugging Face chỉ bằng một cú click

ModelMap cho phép bạn xem sơ đồ cấu trúc động của bất kỳ mô hình nào trên Hugging Face mà không cần tải xuống trọng số. Công cụ hỗ trợ các mô hình phổ biến như Qwen, DeepSeek và Kimi, giúp việc phân tích kiến trúc trở nên trực quan và nhanh chóng.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 50/100

MoE-ViE: Bước tiến mới cho bộ mã hóa thị giác hiệu suất cao

MoE-ViE tối ưu hóa khả năng hiểu hình ảnh và video bằng kiến trúc chuyên gia hỗn hợp (MoE), đạt hiệu suất vượt trội với độ trễ thấp hơn 24% so với các mô hình cùng kích thước, thiết lập chuẩn mực mới cho các mô hình đa phương thức.

18/08

Thứ Ba · 2 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 53/100

HiFi-BRep: Bước tiến mới trong tạo mô hình CAD với độ trung thực cao

HiFi-BRep giới thiệu khung làm việc đột phá giúp loại bỏ nhiễu trong thiết kế CAD, cho phép dự đoán đồng thời hình học và cấu trúc liên kết với độ chính xác vượt trội so với các phương pháp hiện nay.

Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 27/100

Hiện tượng kích hoạt cực đại trong LLM lai: Điểm nóng trước lớp Attention và sự ổn định giữa các tầng

Some newer efficient LLMs (using "hybrid Transformer") are cutting back on expensive attention layer…

DịchCác mô hình LLM kiến trúc lai sử dụng lớp tuần hoàn giá rẻ thay thế phần lớn lớp Attention, nhưng các lớp Attention còn lại đóng vai trò quyết định. Nghiên cứu chỉ ra sự xuất hiện của các giá trị nội tại cực đại trước các lớp này, ảnh hưởng trực tiếp đến hiệu suất và cấu trúc mô hình.

17/08

Thứ Hai · 2 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 88/100

Tinh chọnMarionette: Mô hình thế giới game đột phá bằng cách tách biệt trạng thái 3D và kết xuất hình ảnh

Marionette cải thiện tính nhất quán trong game bằng cách tách biệt việc dự đoán trạng thái 3D của nhân vật với quá trình kết xuất hình ảnh, giúp kiểm soát chuyển động và hình học chính xác hơn so với các mô hình tạo ảnh pixel truyền thống.


Vì sao đáng đọc: Phương pháp tiếp cận mới lạ, giải quyết vấn đề tích tụ lỗi trong mô hình thế giới game bằng cách kết hợp tư duy đồ họa truyền thống với AI, có tính ứng dụng cao.

16/08

Chủ Nhật · 1 tin

15/08

Thứ Bảy · 3 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 85/100

Maglev: Kiến trúc Transformer hồi quy với bộ nhớ cố định giúp tối ưu hóa xử lý chuỗi dài

Maglev giới thiệu kiến trúc Transformer hồi quy mới sử dụng bộ nhớ cố định, kết hợp ưu điểm của cơ chế chú ý cửa sổ trượt và khả năng huấn luyện song song, giúp cải thiện hiệu suất dự đoán token so với các mô hình truyền thống.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 46/100

Context-Matched Distillation: Khung căn chỉnh nhân quả cho mô hình tạo video tự hồi quy

CMD giới thiệu khung làm việc DMD nhân quả, giúp đồng bộ hóa sự giám sát của giáo viên với quá trình tạo video của học sinh, từ đó tối ưu hóa hiệu suất tạo video ngắn và dài, đồng thời cải thiện khả năng kiểm soát camera theo thời gian.

Đã tải 40 tin

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (65 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “Deep Learning” — Trang 2 | AIHOT.vn