New MIT paper introduces a new mathematical framework for representing, manipulating, and compiling …
DịchCác nhà nghiên cứu MIT vừa giới thiệu một khung toán học cho phép biểu diễn, thao tác và biên dịch kiến trúc Deep Learning thành mã PyTorch hoặc sơ đồ tự động. Công nghệ này hứa hẹn tối ưu hóa quy trình thiết kế mô hình, giảm thiểu đáng kể sự can thiệp thủ công.
Nghiên cứu chỉ ra hai dạng kích hoạt đặc thù (PAS và ISP) trong các mô hình LLM lai, giúp hiểu rõ cách chúng vận hành và chuyển đổi trạng thái khi kết hợp giữa cơ chế chú ý đầy đủ và chú ý tuyến tính.
PGE là mô hình end-to-end đột phá cho phép xác định đối tượng mà con người đang nhìn vào thông qua các câu lệnh văn bản hoặc hình ảnh linh hoạt, loại bỏ sự phụ thuộc vào các bước tiền xử lý phức tạp.
Phương pháp Latent Dynamics Reasoning (LDR) cải thiện độ chính xác vật lý cho mô hình video bằng cách tích hợp các quy luật chuyển động thay vì chỉ khớp pixel, giúp dự đoán các kịch bản ngoài phân phối tốt hơn.
Hand Visibility Detector là hệ thống đầu tiên chuyên biệt hóa việc ước tính độ hiển thị của từng khớp tay, giúp tối ưu hóa độ chính xác cho các tác vụ 3D và thực tế ảo (AR/VR). Công cụ này hiện đã được phát hành dưới dạng mã nguồn mở để cộng đồng dễ dàng tích hợp.
Tencent giới thiệu phương pháp Hidden Decoding giúp mở rộng mô hình WeLM lên 617 tỷ tham số mà không cần tăng kích thước cấu trúc Transformer cốt lõi, tối ưu hóa hiệu suất tính toán.
Nghiên cứu giới thiệu Power Law Graph Attention (PLGA), một cơ chế chú ý mới thay thế tích vô hướng truyền thống bằng toán tử song tuyến tính học được, giúp tối ưu hóa khả năng biểu diễn và suy luận của các mô hình ngôn ngữ lớn.
iFAN giải quyết sự lệch pha giữa quá trình huấn luyện và suy luận trong các mô hình Mask Transformer bằng cách điều chỉnh thứ hạng xác suất và chưng cất tri thức giữa các lớp, giúp cải thiện độ chính xác của phân đoạn hình ảnh.