Nghiên cứu
Giải mã bí ẩn 'đỉnh' và 'nền' trong mô hình ngôn ngữ lớn lai: Cách Full Attention định hình lại tính toán
(giờ Việt Nam)
Tóm tắt AI
Nghiên cứu từ StartLux và các đại học danh tiếng đã khám phá cách các lớp Full Attention ảnh hưởng đến mô hình lai, xác định hai trạng thái kích hoạt đặc trưng là 'đỉnh trước chú ý' và 'nền giữa các đỉnh', giúp tối ưu hóa hiệu năng cho các kiến trúc LLM thế hệ mới.
Bản dịch AI
Nội dung sau đây được lấy từ nền tảng WeChat Official Accounts.
Mẹo nhỏ: Sogou hỗ trợ truy vấn tối đa 40 ký tự, các văn bản từ "" trở đi sẽ bị bỏ qua.
Tiến triển nghiên cứu mới của StartLux: Cơ chế Linear Attention hỗn hợp định hình lại tính toán của các mô hình ngôn ngữ lớn (LLM) như thế nào.
Lần đầu tiên mô tả một cách hệ thống cách một số ít lớp Full Attention để lại dấu vết trong các mô hình LLM sử dụng Linear Attention hỗn hợp... Công khai quỹ đạo MA trong các mô hình hỗn hợp. Các đỉnh và nền tảng (plateaus) đã được ghi lại ngay từ giai đoạn đầu của quá trình huấn luyện...
StartLux
Tác phẩm mới nhất của Kimi - Attention Residuals: Khi AI bắt đầu đặt dấu hỏi về "quy tắc vàng" suốt 10 năm qua.
"Linear Attention theo chiều sâu", và Kimi... Tuy nhiên, trong quá trình triển khai kỹ thuật các mô hình lớn, nó đã đụng phải một bức tường than thở: chi phí bộ nhớ video (VRAM) và chi phí truyền thông...
Xingke Technology (Hành Khách Khoa Kỹ)
Chúng ta có còn cần cơ chế Attention trong Transformer nữa không?
Nathan Lambert, biên dịch bởi Machine (Jiqizhixin), biên tập bởi Ban biên tập Machine. Các mô hình không gian trạng thái (State Space Models) đang trỗi dậy... Attention trong Transformer, đồng thời loại bỏ cả MLP vốn chiếm phần lớn tham số. Điều này...
Machine (Jiqizhixin)
Các mô hình không gian trạng thái đang trỗi dậy, liệu chúng ta còn cần cơ chế Attention trong Transformer?
Hình dưới đây so sánh biểu đồ tính toán của Attention và RNN: Khi thảo luận về các mô hình này, chúng ta sẽ gặp... //www.interconnects.ai/p/llms-beyond-attention trích từ "Machine"...
Viện Nghiên cứu Thị giác Máy tính (Computer Vision Research Institute)
Hướng dẫn chuyên sâu về ngăn xếp công nghệ và thực tiễn kỹ thuật cho các mô hình lớn: Từ nền tảng lý thuyết đến các tác nhân thông minh cấp sản xuất.
Cơ chế Self-Attention cho phép mỗi token trong chuỗi tương tác với tất cả các token khác... (Mixture of Experts - MoE) chỉ kích hoạt một phần tham số để tính toán, giúp giảm chi phí suy luận. Phần tám...
Nhật ký xông pha của Tiểu Z
Thảo luận lý thuyết | Sự chuyển đổi mô hình tường thuật lưu trữ được thúc đẩy bởi các mô hình ngôn ngữ lớn: Tái cấu trúc nhận thức từ cấu trúc tuyến tính sang mạng lưới ngữ nghĩa đa chiều.
Tường thuật lưu trữ tuyến tính (Linear Archival Narrative) đề cập đến việc sắp xếp theo trình tự thời gian, nguyên nhân... Thông qua phân tích ma trận trọng số của cơ chế Attention trong kiến trúc Transformer, mô hình có thể hiểu chính xác...
Diễn đàn Giới Lưu trữ
3.31-1 | Tạo video và mô hình thế giới động: Bộ nhớ hỗn hợp cho mô hình video động; tạo đa góc quay tương tác dạng luồng; mở rộng huấn luyện video ngắn sang suy luận video dài.
Khi tính toán Attention, một "cửa sổ thời gian cục bộ" được áp đặt bắt buộc. "Ngắn hạn và dài hạn" này... đảm bảo logic thời gian của mô hình luôn ổn định trong quá trình tạo chuỗi dài. 4. Mô hình huấn luyện:...
Tiền cảnh nghiên cứu AI
Công nghệ huấn luyện và triển khai hiệu quả cho các mô hình lớn đã đạt đến một tầm cao mới!
Các mô hình lớn với kiến trúc Mixture of Experts có số lượng tham số khoảng 1,7 nghìn tỷ; đầu năm 2021... tính toán attention score, điều này sẽ dẫn đến các thao tác truyền thông p2, gây ra... rất cao.
DataFunSummit
Kỹ thuật hệ thống ẩn sau hàng tỷ tham số: Thông tin nội bộ về huấn luyện mô hình lớn từ 7 phòng thí nghiệm hàng đầu.
Các mô hình suy luận hỗn hợp dễ dàng nhận được phần thưởng thông qua việc kéo dài chuỗi tư duy (Chain of Thought) trong giai đoạn RL, do đó dẫn đến... Sau khi thay thế định danh assistant trong template Llama 3 bằng me, Hermes 4 bắt đầu...
Thuật toán Học máy và Xử lý Ngôn ngữ Tự nhiên
Cắt giảm 75% KV Cache, tốc độ giải mã tăng vọt gấp 6 lần! Kimi Linear đã lật đổ cơ chế Attention bằng "gating hạt mịn" như thế nào?
Cơ chế Linear Attention sử dụng kỹ thuật kernel để giảm độ phức tạp xuống... Kimi Linear đã chỉ ra hướng đi rõ ràng cho kiến trúc mô hình lớn thế hệ tiếp theo: hỗn hợp, hiệu quả...
Tiên phong công nghệ AIGC
1 2 3 4 5 6 7 8 9 10 Trang tiếp theo
Tìm thấy khoảng 154 kết quả
Bài viết được AI dịch và tổng hợp tự động từ Jiqizhixin. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.