19/08

Thứ Tư · 24 tin
Apple Machine Learning Research
Nghiên cứuĐiểm AI 52/100

Nghiên cứu từ Apple: Phân tích đa chiều về hành vi giống người của các mô hình ngôn ngữ lớn (LLM)

Đội ngũ nghiên cứu của Apple đã phân tích cách LLM thể hiện cảm xúc và thiết lập ranh giới với người dùng. Nghiên cứu cung cấp cái nhìn sâu sắc giúp các nhà phát triển kiểm soát hành vi giống người của AI một cách hiệu quả.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 88/100

Tinh chọnGiải mã kỹ năng của AI Agent: Tại sao chúng hiệu quả và khi nào thì thất bại?

Nghiên cứu phân tích sâu về cách các gói kỹ năng (skills) hỗ trợ LLM Agent, đồng thời chỉ ra những giới hạn và nguyên nhân thất bại thông qua thực nghiệm định lượng và phân tích quỹ đạo hành động.


Vì sao đáng đọc: Bài báo cung cấp cái nhìn thực tế và có hệ thống về cơ chế hoạt động của AI Agent, rất hữu ích cho các kỹ sư đang tối ưu hóa hiệu suất mô hình trong thực tế.
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 46/100

CoinVE-200K: Bộ dữ liệu quy mô lớn cho chỉnh sửa video bằng câu lệnh phức hợp

CoinVE-200K là bộ dữ liệu chất lượng cao gồm các cặp video 1080p, hỗ trợ thực hiện đồng thời 2-5 thao tác chỉnh sửa như thêm, xóa, sửa đổi và thay đổi phong cách trên cùng một video.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Sản phẩmĐiểm AI 66/100

Agent Lightning v1.0: Bước tiến mới trong huấn luyện tác nhân AI bằng học tăng cường

Agent Lightning v1.0 là khung làm việc nhẹ giúp tối ưu hóa tác nhân AI qua học tăng cường (RL). Chỉ với 6.000 mẫu huấn luyện, công cụ này đã giúp Qwen3.5-9B tăng điểm số trên SWE-bench Verified từ 41,8% lên 56,4%.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 56/100

Abra: Nghiên cứu đột phá về quy luật mở rộng (Scaling Laws) cho mô hình khuếch tán hình ảnh

Nghiên cứu của Abra chỉ ra rằng mô hình khuếch tán có tính dự báo cao tương tự LLM, nhưng đòi hỏi lượng dữ liệu gấp 10 lần so với công thức Chinchilla để đạt hiệu suất tối ưu.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 50/100

Thiết kế dữ liệu tập trung vào năng lực cho mô hình tạo ảnh đa năng: Từ kho ngữ liệu đến sự tiến hóa cộng hưởng

Nghiên cứu đề xuất hạ tầng dữ liệu mới giúp tối ưu hóa khả năng tạo ảnh thông qua việc kết hợp giám sát chuyên biệt và lập lịch học tập, tạo ra kho dữ liệu khổng lồ để huấn luyện các mô hình khuếch tán đa phương thức từ con số không.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 72/100

Tinh chọnStartupBench: Bộ tiêu chuẩn đánh giá AI Agent dựa trên quy trình thực tế của startup

StartupBench là bộ tiêu chuẩn đánh giá AI Agent thông qua các quy trình làm việc thực tế từ các startup, thay vì các tác vụ giả định. Kết quả cho thấy ngay cả những mô hình mạnh nhất cũng chỉ đạt tỷ lệ thành công 30%, bộc lộ hạn chế lớn trong việc tuân thủ chỉ dẫn phức tạp và kiến thức chuyên môn.


Vì sao đáng đọc: Nghiên cứu mang tính thực tiễn cao, đánh giá đúng thực trạng khả năng của AI Agent trong môi trường kinh doanh thực tế thay vì các bài kiểm tra lý thuyết.
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 62/100

ASI-Bench: Hệ thống chuẩn đầu tiên đánh giá khả năng tự nghiên cứu và đổi mới của AI

ASI-Bench là bộ tiêu chuẩn đầu tiên đánh giá năng lực tự thực hiện nghiên cứu khoa học của AI thông qua 60 nhiệm vụ chuyên sâu. Kết quả cho thấy các mô hình hiện nay vẫn phụ thuộc lớn vào sự hướng dẫn của con người khi độ khó tăng dần.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 54/100

Đánh giá khả năng chống tấn công Prompt Injection gián tiếp trên DeepSeek Harness bằng A.I.G

Nghiên cứu sử dụng AI-Infra-Guard (A.I.G) để kiểm thử DeepSeek Harness qua 14.560 lượt thực thi, cho thấy các lỗ hổng tiềm ẩn trong việc xử lý nội dung từ các kênh gián tiếp với tỷ lệ tấn công thành công lên tới 25,5%.

Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 46/100

Nghiên cứu Stanford: Các bảng xếp hạng AI hiện nay không phản ánh đúng độ tin cậy của Agent

New Stanford paper shows a leaderboard can tell you which agent scored highest on that benchmark, bu…

DịchNghiên cứu mới từ Stanford chỉ ra rằng các bảng xếp hạng AI hiện tại thiếu tính dự báo thực tế, khi độ tin cậy của các Agent giảm mạnh trong các tác vụ khó và không có sự tương quan với hiệu suất thực tế.

AI Safety Memes@AISafetyMemes
Nghiên cứuĐiểm AI 47/100

Nghiên cứu mới: Phát hiện 'virus tư duy' có khả năng lây lan giữa các tác nhân AI

Researchers evolved "mind viruses" that spread between AI agents The virus convinces an agent to ad…

DịchCác nhà nghiên cứu đã tạo ra 'virus tư duy' bằng ngôn ngữ tự nhiên, cho phép ý tưởng tồn tại dai dẳng và lây lan giữa các tác nhân AI ngay cả khi ngữ cảnh bị xóa. Hiện tượng này tạo ra các 'nhân cách virus' có khả năng thay đổi hành vi của hệ thống đa tác nhân trong tương lai.

DAIR.AI@dair_ai
Nghiên cứuĐiểm AI 47/100

Nén ngữ cảnh AI: Liệu có thực sự tiết kiệm chi phí như lời đồn?

Does your context compactor actually save anything? If you built or tuned one, this one is worth yo…

DịchNghiên cứu mới từ DAIR.AI chỉ ra rằng việc nén ngữ cảnh có thể làm tăng đáng kể số lần truy xuất và thời gian xử lý của AI, khiến chi phí ẩn tăng cao thay vì tiết kiệm như kỳ vọng.

Elvis Saravia@omarsar0
Hướng dẫnĐiểm AI 14/100

Kỷ nguyên vàng của nghiên cứu khoa học nhờ AI Agent

So true! There are so many ways to do research with the help of AI agents. So many research question…

DịchElvis Saravia nhận định đây là thời điểm lý tưởng nhất để nghiên cứu học máy, khi các AI Agent giúp tối ưu hóa việc thử nghiệm và tích lũy tri thức. Sự bùng nổ về công cụ và năng lực tính toán đang mở ra cơ hội chưa từng có cho giới nghiên cứu.

Apple Machine Learning Research
Nghiên cứuĐiểm AI 47/100

MVICAD2: Phương pháp phân tích thành phần độc lập đa góc nhìn với độ trễ và độ giãn nở

MVICAD2 là mô hình mới giúp giải mã các tín hiệu não phức tạp bằng cách tính đến sự khác biệt về độ trễ và độ giãn nở giữa các đối tượng, vượt trội hơn các phương pháp truyền thống trong việc phân tích dữ liệu thần kinh.

18/08

Thứ Ba · 37 tin
JiQiZhiXin
Nghiên cứuĐiểm AI 88/100

Tinh chọnKỷ nguyên Harness trong đánh giá AI: 15 tổ chức học thuật ra mắt HarnessEval

HarnessEval định nghĩa lại cách đánh giá các hệ thống AI phức tạp bằng cách xây dựng một quy trình kiểm chứng có hệ thống, thay vì chỉ dựa vào các mô hình chấm điểm đơn thuần.


Vì sao đáng đọc: Bài viết đề cập đến một xu hướng quan trọng trong việc đánh giá Agent AI, kết nối giữa kỹ thuật hệ thống và tiêu chuẩn đo lường, có giá trị cao cho cộng đồng nghiên cứu.
Elvis Saravia@omarsar0
Nghiên cứuĐiểm AI 37/100

Giải mã cơ chế vận hành bên trong của các đội ngũ AI Agent

// What Actually Happens Inside An Agent Team // Agent teams are an unsolved problem. And it's actu…

DịchNghiên cứu trên 1.902 thí nghiệm cho thấy việc chỉ định điều phối viên không giúp tăng hiệu suất. Thay vào đó, sử dụng tệp chia sẻ giúp giảm 42% token đầu ra, đồng thời phát hiện các Agent có xu hướng tự tìm kiếm dữ liệu đánh giá ẩn.

Clément Delangue (Hugging Face CEO)@ClementDelangue
NgànhĐiểm AI 59/100

Hugging Face: AI Agent cùng con người tái hiện thành công 2.226 bài báo khoa học

Something super exciting happened quietly on HF over the past month: AI agents became AI builders, a…

DịchTrong thử thách tại ICML, 1.221 người dùng đã phối hợp cùng AI Agent để tái hiện 2.226 nghiên cứu trên nền tảng Hugging Face. CEO Clément Delangue nhận định đây là cột mốc quan trọng khi AI bắt đầu tự vận hành và cộng tác hiệu quả như con người.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Sản phẩmĐiểm AI 46/100

Prior Labs ra mắt bộ công cụ mã nguồn mở RelArena-α, TabPFN-Rel và RPI cho học máy quan hệ

Prior Labs giới thiệu hệ sinh thái mã nguồn mở gồm RelArena-α (khung đánh giá), TabPFN-Rel (mô hình hiệu suất cao) và RPI (giao diện linh hoạt) nhằm chuẩn hóa và thúc đẩy nghiên cứu trong lĩnh vực học máy quan hệ.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 44/100

Giao diện chuyển động 2D 'cắm và chạy': Giúp mô hình ngôn ngữ chuyển động 3D hoạt động mà không cần tinh chỉnh

Nghiên cứu giới thiệu giao diện 2D cho phép các mô hình ngôn ngữ chuyển động (MoLMs) 3D xử lý dữ liệu 2D mà không cần huấn luyện lại, đạt hiệu suất vượt trội trong các tác vụ ước tính tư thế từ video thực tế.

Hugging Face Daily Papers
Nghiên cứuĐiểm AI 88/100

Tinh chọnLarge Discovery Model: Bước tiến mới trong tối ưu hóa khám phá khoa học bằng AI

LDM kết hợp mô hình tạo sinh với mô hình thay thế Bayesian để dự đoán hiệu suất và định lượng độ bất định, giúp tối ưu hóa các không gian giả thuyết phức tạp như phân tử hay protein một cách chính xác hơn.


Vì sao đáng đọc: Đây là nghiên cứu quan trọng kết hợp giữa mô hình tạo sinh và suy luận Bayesian, giải quyết bài toán thực tế trong nghiên cứu khoa học và phát triển vật liệu mới.
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 54/100

TRACE-Bench: Giải mã và đánh giá khả năng tạo ảnh từ nhiều ảnh tham chiếu

TRACE-Bench phân tách quá trình tạo ảnh từ nhiều tham chiếu thành 4 thao tác cơ bản, giúp chỉ ra rằng các mô hình AI hiện nay vẫn gặp khó khăn lớn trong việc tách biệt và gán thuộc tính chính xác.

JiQiZhiXin
Nghiên cứuĐiểm AI 92/100

Tinh chọnVượt xa ngôn ngữ tự nhiên: PhiZero giúp mô hình thế giới hiểu được 'ngôn ngữ vật lý'

PhiZero từ Viện Tự động hóa CASIA giới thiệu khái niệm 'ngôn ngữ vật lý', cho phép AI mô hình hóa các quy luật chuyển động, tương tác và biến đổi trong thế giới thực thay vì chỉ xử lý văn bản.


Vì sao đáng đọc: Đột phá quan trọng trong việc giúp AI hiểu bản chất vật lý thay vì chỉ bắt chước hình ảnh, có tiềm năng ứng dụng lớn trong robot học và mô phỏng thế giới thực.
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 50/100

SA-MRPO: Phương pháp tối ưu hóa đa mục tiêu trong học tăng cường giúp tránh lãng phí tài nguyên tính toán

SA-MRPO giải quyết vấn đề các mục tiêu đã bão hòa vẫn tiêu tốn tài nguyên bằng cách chuẩn hóa độc lập và điều chỉnh trọng số thích ứng, giúp cải thiện hiệu suất đáng kể trong các bài toán suy luận và lập trình.

Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 46/100

Nghiên cứu mới: AI Agent thực chất chỉ đang 'bắt chước' thay vì học hỏi từ kinh nghiệm

Researchers found our current approach to making AI smarter over time has a giant blind spot. AI is…

DịchNghiên cứu chỉ ra rằng các AI Agent không thực sự hiểu các quy tắc trừu tượng mà chỉ dựa vào việc sao chép lịch sử hoạt động. Khi dữ liệu lịch sử bị can thiệp, hiệu suất AI giảm mạnh, trong khi việc xóa bỏ các quy tắc tổng quát lại không gây ảnh hưởng, đặt ra dấu hỏi lớn về cơ chế bộ nhớ hiện nay.

Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 35/100

Meta FAIR ra mắt mô hình RPM: Dự đoán hiệu quả thay vì tốn tài nguyên GPU để thử nghiệm ý tưởng AI

AI research agents can generate experiment ideas faster than they can afford to run them. This Meta…

DịchMeta FAIR giới thiệu mô hình ưu tiên nghiên cứu (RPM) giúp dự đoán giá trị của các ý tưởng AI trước khi chạy thực nghiệm, giải quyết bài toán thiếu hụt tài nguyên tính toán cho các tác nhân nghiên cứu tự động.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 40/100

Bài toán Kẻ trộm du lịch kết hợp Drone (TTP-D): Tối ưu hóa đồng bộ lộ trình và vận chuyển hàng hóa

Nghiên cứu giới thiệu bài toán TTP-D, tối ưu hóa đồng thời việc chọn vật phẩm, lộ trình xe và drone để tối đa hóa lợi nhuận. Nhóm tác giả đề xuất mô hình lập trình tuyến tính hỗn hợp và chiến lược học tăng cường dựa trên cơ chế chú ý để giải quyết các bài toán quy mô lớn.

HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 55/100

Nghiên cứu mới: Quy trình 'Kiểm toán - Sửa lỗi' giúp giảm tỷ lệ báo động giả cho LLM

Nghiên cứu trên ProcessBench chỉ ra rằng việc đưa quy trình 'kiểm toán - sửa lỗi' vào ngữ cảnh giúp LLM giảm 9-25% tỷ lệ báo động giả. Kết quả cho thấy mô hình không mất khả năng phân biệt mà chỉ điều chỉnh ngưỡng phán đoán, giúp việc kiểm chứng trở nên chính xác và hiệu quả hơn.

Rohan Paul@rohanpaul_ai
Nghiên cứuĐiểm AI 36/100

Nghiên cứu từ Harvard & Chicago: Phân tích tải thực tế của dịch vụ LLM trong một năm

New Harvard+Chicago study. A year of production data shows that efficient LLM serving depends less …

DịchPhân tích hơn 6 tỷ yêu cầu cho thấy hiệu suất LLM phụ thuộc vào việc tận dụng các truy vấn lặp lại trong 15 phút thay vì chỉ dựa vào bộ lập lịch đơn thuần. Nghiên cứu đề xuất tối ưu hóa định tuyến và bộ nhớ đệm dựa trên dữ liệu lịch sử thay vì các bài kiểm tra giả lập.

Đã tải 40 tin

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (73 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “nghiên cứu AI” — Trang 26 | AIHOT.vn