T7 · 01/01

Hugging Face Daily Papers
Nghiên cứu85

Tinh chọnRealSWE: Đánh giá thực tế khả năng lập trình của các AI Agent

Nghiên cứu chỉ ra sự khác biệt lớn giữa các bài kiểm tra lập trình hiện nay và yêu cầu thực tế của người dùng. RealSWE được giới thiệu để đánh giá AI Agent dựa trên các tình huống lập trình tự nhiên, ít cấu trúc và mang tính đời thường hơn.

AI AgentLập trìnhĐánh giá AISWE-benchNghiên cứu AI
Hugging Face Daily Papers
Nghiên cứu85

Tinh chọnRủi ro 'Rửa quyền hạn nội sinh' trong bộ nhớ của các tác nhân AI

Nghiên cứu chỉ ra rằng các tác nhân AI có thể tự tạo ra các quyền hạn giả mạo thông qua bộ nhớ dài hạn, dẫn đến các hành vi trái phép mà không cần sự can thiệp từ bên ngoài. Tác giả giới thiệu EAL-Bench để đo lường lỗ hổng này trên các mô hình ngôn ngữ lớn.

Bảo mật AILLMAI AgentsBộ nhớ AINghiên cứu AI
Hugging Face Daily Papers
Nghiên cứu85

Tinh chọnAgentJudgeBench: Bộ tiêu chuẩn đánh giá khả năng làm 'giám khảo' của LLM trong các tác vụ dùng công cụ

AgentJudgeBench là bộ tiêu chuẩn đầu tiên đánh giá độ tin cậy của LLM khi đóng vai trò giám khảo cho các quy trình làm việc phức tạp (DAG). Nghiên cứu chỉ ra rằng khả năng đánh giá của LLM giảm dần theo độ khó, đặc biệt khi thiếu dữ liệu đối chứng.

LLMĐánh giá AIAgenticTool-callingNghiên cứu AI
Hugging Face Daily Papers
Nghiên cứu85

Tinh chọnThích nghi không cần Gradient: Phương pháp CASTER tối ưu hóa mô hình AI mà không cần cập nhật tham số

CASTER là phương pháp thích nghi thời gian thực (TTA) không cần gradient, giúp điều chỉnh phân phối dữ liệu mà không cần cập nhật trọng số mô hình. Giải pháp này đặc biệt hiệu quả cho các thiết bị hạn chế bộ nhớ hoặc các mô hình bị khóa tham số.

Thích nghi mô hìnhTối ưu hóa AIHọc máyTriển khai mô hìnhNghiên cứu AI
Hugging Face Daily Papers
Nghiên cứu85

Tinh chọnHọc cách suy luận hình học đa phương thức thông qua cơ chế phân bổ tín dụng

Nghiên cứu giới thiệu phương pháp suy luận mới giúp mô hình VLM xác định chính xác các bước logic quan trọng trong bài toán hình học, từ đó tối ưu hóa việc học thông qua mã thực thi và phân bổ tín dụng cục bộ thay vì chỉ dựa vào kết quả cuối cùng.

AIVLMSuy luận hình họcHọc tăng cườngNghiên cứu AI
Hugging Face Daily Papers
Nghiên cứu85

Tinh chọnPera: Kiến trúc lấy nhận thức làm trung tâm cho các tác nhân AI bền bỉ

Pera là khung kiến trúc mới giúp các tác nhân AI duy trì khả năng hỗ trợ liên tục trong môi trường dài hạn, thay vì chỉ giải quyết các tác vụ đơn lẻ. Hệ thống tập trung vào cơ chế nhận thức và kiểm soát để thích nghi với nhu cầu người dùng thay đổi theo thời gian.

AI AgentsKiến trúc AINghiên cứu AIPeraHệ thống tự hành
Hugging Face Daily Papers
Nghiên cứu88

Tinh chọnUI-Venus-2: Bước tiến mới cho tác nhân AI điều khiển giao diện người dùng đa nền tảng

UI-Venus-2 là tác nhân AI đa phương thức thế hệ mới, có khả năng tự động hóa tác vụ trên cả di động, web và máy tính nhờ khung làm việc suy luận-hành động khép kín, giúp thu hẹp khoảng cách từ thử nghiệm đến ứng dụng thực tế.

AI AgentsGUITự động hóaĐa phương thứcNghiên cứu AI
Hugging Face Daily Papers
Nghiên cứu85

Tinh chọnHi-Q: Tối ưu hóa truy vấn phân cấp dựa trên bằng chứng cho hệ thống hỏi đáp đa chặng

Hi-Q giải quyết vấn đề chênh lệch độ chi tiết giữa câu hỏi và dữ liệu bằng cách sử dụng cơ chế phân cấp thông minh. Hệ thống tự động kiểm tra bằng chứng để quyết định khi nào cần tinh chỉnh truy vấn, giúp cải thiện độ chính xác cho các tác vụ hỏi đáp phức tạp.

RAGHỏi đápXử lý ngôn ngữ tự nhiênTruy vấnNghiên cứu AI
Hugging Face Daily Papers
Nghiên cứu85

Tinh chọnInternReviewer & InternAdvocate: Hệ thống AI tự động hóa quy trình phản biện và bảo vệ luận văn khoa học

Nghiên cứu giới thiệu bộ đôi tác nhân AI chuyên biệt giúp tự động hóa việc viết phản biện và phản hồi bài báo khoa học, sử dụng học tăng cường (RL) và cơ chế kiểm chứng thực tế để giảm thiểu hiện tượng ảo giác.

AI học thuậtHọc tăng cườngTác nhân AIKiểm chứng dữ liệuNghiên cứu khoa học
Hugging Face Daily Papers
Nghiên cứu85

Tinh chọnCơ chế thống trị dân chủ: Kỹ thuật đồng thuận động thông qua mô hình động lực học hệ thống

Nghiên cứu giới thiệu khung Kỹ thuật Đồng thuận Động (DCE), kết hợp lý thuyết PR của Edward Bernays với mô hình động lực học hệ thống để phân tích cách các thể chế chính trị xây dựng và duy trì sự thống trị thông qua thuật toán và dữ liệu.

Khoa học chính trịĐộng lực học hệ thốngTruyền thôngThuật toánDữ liệu
Latent Space
Sản phẩm85

Tinh chọnKhi các dự án AI mã nguồn mở từ chối Pull Request: Kỷ nguyên của 'nhà máy phần mềm' tự động

Các dự án như Vercel AI SDK hay Astro đang dần thay thế việc nhận đóng góp thủ công bằng các đội ngũ AI agent tự động xử lý lỗi và tính năng, đánh dấu bước ngoặt trong quản trị mã nguồn mở.

Mã nguồn mởAI AgentsPhát triển phần mềmTự động hóaXu hướng công nghệ
IT Home
Tin ngành85

Tinh chọnMicrosoft tối ưu Windows 11: Gộp các bản cập nhật, chỉ cần khởi động lại máy mỗi tháng một lần

Microsoft sẽ tích hợp các bản cập nhật driver,.NET và firmware vào bản vá bảo mật hàng tháng trên Windows 11. Thay đổi này giúp người dùng chỉ cần khởi động lại máy một lần duy nhất mỗi tháng, giảm thiểu gián đoạn công việc.

Windows 11MicrosoftCập nhật phần mềmCông nghệHệ điều hành
IT Home
Tin ngành85

Tinh chọnSamsung chốt hợp đồng cung ứng HBM đến năm 2031, giá ưu đãi rẻ gấp 5 lần thị trường

Samsung đã ký kết hợp đồng dài hạn cho 70% năng lực sản xuất HBM đến năm 2031 với các đối tác lớn như Nvidia, Google và Microsoft. Mức giá ưu đãi này thấp hơn đáng kể so với giá thị trường hiện tại, giúp các hãng công nghệ lớn đảm bảo nguồn cung trong bối cảnh khan hiếm chip nhớ.

SamsungHBMChip nhớAIChuỗi cung ứng
IT Home
Tin ngành85

Tinh chọnDreame chính thức dừng dự án sản xuất ô tô, chuyển hướng tập trung nghiên cứu công nghệ lõi

Dreame xác nhận hủy bỏ kế hoạch sản xuất ô tô hàng loạt để tập trung vào nghiên cứu công nghệ nền tảng tại Viện Nghiên cứu Công nghiệp. Đồng thời, hãng cũng thực hiện tái cơ cấu thương hiệu MOVA, cắt giảm các dòng sản phẩm trùng lặp để tối ưu hóa nguồn lực.

DreameXe điệnTái cơ cấuCông nghệKinh doanh

30 tin mỗi trang · lọc và sắp xếp ngay trên máy chủ (66 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả