Startup Sakana AI tại Tokyo vừa bổ nhiệm Jürgen Schmidhuber làm Cố vấn Khoa học trưởng, kỳ vọng các nghiên cứu nền tảng của ông về học sâu và mô hình thế giới sẽ thúc đẩy các dự án như The AI Scientist.
Nikon Z5ⅡC sở hữu cảm biến 24.5MP và chip EXPEED 7, nổi bật với khả năng lấy nét tự động dựa trên học sâu, hỗ trợ nhận diện 10 loại chủ thể và chế độ chụp AUTO thông minh, giá khởi điểm từ 9.999 Nhân dân tệ.
StableVQ giới thiệu ba cải tiến kỹ thuật giúp giải quyết vấn đề mất ổn định khi huấn luyện bộ mã hóa-giải mã và codebook, từ đó nâng cao chất lượng tái tạo hình ảnh mà không cần thêm tham số học tập.
Nghiên cứu đề xuất khung mã hóa thưa tích chập (CSC) có khả năng tự học hệ số thưa thông qua thuật toán FISTA, giúp cân bằng hiệu quả giữa việc nén dữ liệu và bảo toàn thông tin quan trọng cho các tác vụ thị giác máy tính.
WeVisDoc là khung phân tích tài liệu end-to-end tối ưu hóa dữ liệu qua hai giai đoạn: mở rộng độ bao phủ ngữ nghĩa và tinh chỉnh cấu trúc thông qua cơ chế dò lỗi thông minh, giúp nâng cao độ chính xác vượt trội.
RelateAnything là mô hình đột phá cho phép dự đoán quan hệ giữa các đối tượng dựa trên từ vựng tùy chỉnh tại thời điểm suy luận, vượt qua giới hạn của các tập dữ liệu huấn luyện cố định trước đây.
Bài viết hướng dẫn chi tiết cách sử dụng cuDNN Frontend API để xây dựng đồ thị tính toán, cho phép cuDNN tự động tối ưu hóa và quản lý các kế hoạch thực thi nhằm đạt hiệu suất cao nhất.
ReMoMask-2 cải thiện việc tạo chuyển động từ văn bản bằng cách tích hợp cấu trúc không gian-thời gian của cơ thể người, giúp khắc phục sự thiếu hụt trong các mô hình RAG hiện tại.
Nghiên cứu từ MMLab NTU phân tích sâu về sự tương tác giữa khả năng hiểu và tạo hình ảnh trong các mô hình đa phương thức thống nhất (UMM), làm rõ liệu chúng thực sự bổ trợ hay gây xung đột về tài nguyên học tập.
Nghiên cứu phân tích cơ chế 'tam giác chú ý' trong các mô hình khuếch tán, chỉ ra cách thông tin ngữ nghĩa bị rò rỉ giữa âm thanh và hình ảnh, dẫn đến các kết quả sai lệch so với yêu cầu người dùng.
Scal3R tối ưu hóa tái tạo 3D trực tuyến bằng cách sử dụng các token học được để tinh chỉnh mô hình nền, kết hợp tối ưu hóa đồ thị tư thế giúp giảm thiểu sai số tích lũy trong các video dài.
Nghiên cứu mô hình hóa quá trình SGD như một hiện tượng thấm, giải thích cách các mạng thần kinh hội tụ về các mạng con thông qua những bước nhảy vọt về cấu trúc tương tự chuyển pha vật lý.
KAIST-VICLab giới thiệu ReFlowSET, khung khớp luồng không gian ẩn giúp tối ưu hóa việc chuyển đổi ảnh SAR sang quang học (EO) bằng cách căn chỉnh đặc trưng mà không làm tăng chi phí suy luận. Phương pháp này đạt kết quả SOTA trên các tập dữ liệu chuẩn và đã công khai mã nguồn.
Google và NASA JPL giới thiệu MAPL-EMIT, khung học sâu dựa trên Swin-S Transformer giúp tự động phát hiện, định lượng và xác định nguồn phát thải khí methane từ dữ liệu vệ tinh siêu phổ.
Bài viết giải thích cách xây dựng mô hình ngôn ngữ khuếch tán, từ cơ chế khuếch tán Gaussian, mặt nạ đến kỹ thuật tinh chỉnh lặp lại, giúp đạt hiệu suất ngang bằng mô hình tự hồi quy truyền thống.
MoTE tối ưu hóa mô hình ngôn ngữ lớn bằng cách chuyển đổi các lớp feed-forward thành các chuyên gia đặc thù cho từng nhiệm vụ, giúp tăng độ chính xác trong hiểu video mà vẫn tiết kiệm tài nguyên tính toán.
Nghiên cứu đề xuất một phương trình lớp thống nhất cho các kiến trúc GNN, giúp tách biệt cơ chế truyền tin và nội dung thông tin, từ đó đơn giản hóa việc phân tích các mô hình đồ thị phức tạp.
Nghiên cứu đề xuất chiến lược huấn luyện mới bằng cách tận dụng tiền đề từ không gian tiềm ẩn (latent) trước khi chuyển sang không gian pixel, giúp mô hình đạt hiệu suất vượt trội và tăng tốc độ suy luận đáng kể so với các phương pháp truyền thống.
Google Research giới thiệu PhotoScan, mô hình học sâu giúp phân tích thành phần cơ thể từ ảnh 2D trên smartphone, hỗ trợ dự đoán nguy cơ kháng insulin với độ chính xác tiệm cận phương pháp quét DXA chuyên dụng.
Nghiên cứu chỉ ra rằng các mô hình dự báo tài chính thường cho kết quả phẳng và thiếu chính xác do sự đánh đổi giữa hiệu chuẩn điểm và xếp hạng tương quan. Hiện tượng này phụ thuộc vào khả năng dự đoán của dữ liệu mục tiêu.