MarkTechPost
75

Tin ngành

Mô hình ngôn ngữ ruồi giấm (FLM): Kết nối bản đồ não bộ vào LLM nhưng không mang lại hiệu quả vượt trội

(giờ Việt Nam)

Tóm tắt AI

Fly Language Model (FLM) tích hợp bản đồ kết nối thần kinh của ruồi giấm vào mô hình LiquidAI 1.2B. Kết quả thực nghiệm cho thấy việc bổ sung cấu trúc kết nối này không giúp cải thiện hiệu suất so với các mô hình đối chứng.

Bản dịch AI

Fly Language Model (FLM) Wires the Full Fruit Fly Connectome Into a Frozen 1.2B LLM, and Its Own Controls Show the Wiring Does Not Help

Fly Language Model (FLM) là một chatbot công khai kết hợp toàn bộ connectome (bản đồ kết nối thần kinh) của ruồi giấm MaleCNS v1.0 đã được giữ lại với nền tảng LiquidAI LFM2.5-1.2B-Instruct đã đóng băng. Nhà phát triển tạo ra FLM gọi đây là Fly Language Model đầu tiên trên thế giới, được xây dựng trên kiến trúc có tên là GPF (Generative Pre-trained Fly). Hệ thống này không sử dụng nhãn GPF, tuyên bố rõ ràng rằng không phải là mô hình ngôn ngữ connectome đầu tiên, đồng thời báo cáo rằng một mô hình đối chứng có cùng số lượng tham số nhưng không sử dụng đồ thị ruồi lại cho hiệu suất tốt hơn một chút.

Khả năng triển khai: Có, triển khai cục bộ. Kho lưu trữ nftechie/flm được cấp phép theo MIT và chạy trên Python 3.12 (macOS hoặc Linux, MPS, CUDA hoặc CPU) mà không cần khóa API.

Những gì đã thực sự được xây dựng

Hệ thống này là một máy tính hồ chứa (reservoir computer) được gắn vào một mô hình ngôn ngữ. Tất cả 166.700 nút được giữ lại và 25.582.938 cạnh có hướng của đồ thị MaleCNS đều tham gia. Đồ thị, nền tảng (backbone), cùng các phép chiếu đầu vào và đầu ra ngẫu nhiên đều được cố định. Chỉ có phần đọc ra (readout) với 278.528 tham số được huấn luyện, chiếm khoảng 0,0238% trong tổng số 1.170.340.608 tham số của nền tảng.

Tại mỗi token, một phép chiếu Gaussian cố định nén embedding của token 2.048 chiều thành 128 kênh. Mỗi nút hồ chứa nhận một kênh với dấu ngẫu nhiên. Sau đó, toàn bộ đồ thị cập nhật theo công thức x = tanh(W(0.6x + 0.4Bc)), trong đó W chứa các số lượng tiếp xúc giải phẫu đã được chuẩn hóa đầu vào. Các trạng thái được gộp vào 128 thùng (bins), đi qua hai ma trận không thiên kiến đã được huấn luyện (U kích thước 128x128, V kích thước 2.048x128), và được chiếu qua đầu từ vựng (vocabulary head) đã đóng băng dưới dạng một phần dư giới hạn được thêm vào các logit của nền tảng. Phần dư này được giới hạn ở mức RMS là 0,25 trên các tọa độ từ vựng.

Kết quả

Trên một tập hợp gồm 32 đoạn hội thoại hàng ngày SmolTalk vừa được đóng băng (1.236 token mục tiêu), ba hạt giống (seeds) phù hợp đã cho kết quả:

Phần đọc ra từ ruồi đã cải thiện nền tảng thêm 0,0222 nats mỗi token (độ phức tạp - perplexity giảm từ 3,98 xuống 3,90). Tuy nhiên, một mô hình đối chứng đầu vào trực tiếp, vốn đưa cùng phép chiếu token 128 kênh thẳng vào phần đọc ra tương tự mà không có đồ thị, lại cho kết quả tốt hơn ở cả 3 hạt giống với mức 0,000488 nats mỗi token. Khoảng bootstrap ghép cặp (+0,00000502 đến +0,00104) không ủng hộ giả thuyết về sự cải thiện đặc thù từ ruồi.

Hai mô hình đối chứng khác cũng rất quan trọng. Việc đặt W bằng 0 sẽ loại bỏ chính xác phần dư, tái tạo lại các tổn thất trên mỗi token của nền tảng, do đó đồ thị thực sự có tham gia. Việc dán nhãn lại các danh tính nút mà không cần huấn luyện lại sẽ đưa NLL về gần mức cơ sở, điều này cho thấy phần đọc ra phụ thuộc vào sự căn chỉnh giao diện đã học được, chứ không phải do cấu trúc liên kết của ruồi vượt trội hơn so với kết nối ngẫu nhiên.

Báo cáo nghiên cứu cũng chứng minh rằng tính tái phát làm giảm sự khác biệt của trạng thái ban đầu tối đa 0,6 mỗi token. Sau 10 token, giới hạn đó là 0,00605; sau 20 token là 0,0000366. Việc nhồi nhét 166.700 tế bào không mang lại bộ nhớ dài hạn. Ngữ cảnh vẫn đến từ nền tảng.

Các công trình trước đây và tuyên bố về sự 'đầu tiên'

Báo cáo nghiên cứu trích dẫn ngxson/fly-hf, một nguyên mẫu trước đó đã sử dụng tập hợp con 49.393 tế bào não trung tâm của MaleCNS làm hồ chứa được huấn luyện trên TinyStories mà không có nền tảng được huấn luyện trước, và tuyên bố rõ ràng rằng họ không khẳng định là mô hình ngôn ngữ dựa trên connectome đầu tiên. Điểm khác biệt của FLM nằm ở quy mô (toàn bộ đồ thị được giữ lại) và thiết kế nền tảng đóng băng giúp giữ cho nguồn gốc của năng lực ngôn ngữ có thể xác định được.

Giải thích tương tác

Những điểm chính cần lưu ý

Hãy xem Bài báo, kho lưu trữ GitHub và bản demo trực tiếp. Ngoài ra, đừng ngần ngại theo dõi chúng tôi trên Twitter, đừng quên tham gia SubReddit ML với hơn 150 nghìn thành viên của chúng tôi và Đăng ký Bản tin của chúng tôi. Khoan đã! Bạn có dùng Telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.

Cần hợp tác với chúng tôi để quảng bá Kho lưu trữ GitHub, Trang Hugging Face, Phát hành sản phẩm hoặc Hội thảo trực tuyến của bạn, v.v.? Hãy kết nối với chúng tôi.

LLMThần kinh họcNghiên cứu AIRuồi giấmKiến trúc mô hình
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.