Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
85

Thủ thuật

Dự án mã nguồn mở jevlike: Tái tạo mô hình chấm điểm lựa chọn Jev thông qua kỹ thuật đảo ngược

(giờ Việt Nam)

Tóm tắt AI

Dự án jevlike trên GitHub cung cấp một mô hình độc lập có khả năng tính toán xác suất cho các lựa chọn văn bản chỉ trong một lần truyền, mô phỏng chính xác kiến trúc của mô hình thương mại Jev từ TypeSafe.

Bản dịch AI

GitHub - vinnylarouge/jevlike

Huấn luyện một mô hình nhỏ có khả năng lựa chọn giữa một danh sách các tùy chọn văn bản thay đổi liên tục.

Một mô hình dạng Jev sẽ nhận một đoạn văn bản và một danh sách gồm N tùy chọn văn bản. Nó trả về một xác suất cho mỗi tùy chọn. Mô hình thực hiện việc này trong một lượt duy nhất thay vì viết câu trả lời từng từ một. Jev là mô hình thương mại của TypeSafe cho loại tác vụ này. TypeSafe chưa công bố thiết kế của nó. Kho lưu trữ này là một mô hình khởi đầu độc lập với cùng cấu trúc đầu vào và đầu ra.

Bản demo

Cùng một đầu chú ý tùy chọn (option-attention head) có thể chấm điểm các nút điều khiển từ các mảng hình ảnh. Đoạn phim dài mười giây này kết hợp hai cửa sổ năm giây được chọn: chiến đấu trực tiếp trong deadly_corridor trên bảy nút Doom, sau đó là một bộ điều khiển cờ vua di chuyển và thực hiện các nước đi với năm phím. Sơ đồ hiển thị các tensor được sử dụng cho mỗi quyết định. Cửa sổ Doom lấy từ checkpoint chung được cung cấp, đạt trung bình 0,60 lượt tiêu diệt và -97,50 điểm thưởng qua mười tập được ghi lại. Cửa sổ cờ vua lấy từ checkpoint chuyên cờ vua mạnh hơn, đạt 4 thắng, 46 hòa và 0 thua trong 50 ván đấu mẫu trước đối thủ di chuyển ngẫu nhiên, nhưng đạt 0 thắng, 2 hòa và 48 thua trước Stockfish cấp độ 0. Các cửa sổ được chọn dựa trên hoạt động và không phải là tuyên bố về lối chơi điển hình hay năng lực.

Cài đặt các phần bổ sung của trò chơi và ghi lại một trace Doom mới kích thước 640x480 từ checkpoint chung đã phát hành:

Kết xuất (render) trace trong cùng một bố cục hình ảnh. Việc này tạo ra một bộ phim câm vì nguồn nhạc nền thuộc sở hữu của tác giả không nằm trong kho lưu trữ.

Bản phát hành bao gồm ví dụ về Doom, ví dụ về cờ vua, các checkpoint cho từng trò chơi và checkpoint 12 tùy chọn dùng chung. Cả hai trò chơi đều nhập trình chấm điểm hình ảnh từ jevlike.vision; không có bản sao mô hình thứ hai nào trong cả hai ví dụ.

Kiến trúc

Mỗi tùy chọn trở thành một vector truy vấn (query vector), là một danh sách ngắn các số đại diện cho văn bản của nó. Truy vấn gán trọng số chú ý cho các token ngữ cảnh. Các trọng số đó tạo thành một vector ngữ cảnh cho tùy chọn đó. Một tích vô hướng dùng chung biến mỗi cặp tùy chọn và ngữ cảnh thành một điểm số. Một hàm softmax, chuyển đổi điểm số thành xác suất có tổng bằng một, được chạy trên các tùy chọn.

Bộ mã hóa mặc định học các byte embedding từ đầu. Bộ mã hóa là phần chuyển đổi văn bản thành các vector. Đường dẫn tùy chọn Hugging Face sử dụng một bộ mã hóa tiền huấn luyện đóng băng (frozen pretrained encoder), với các trọng số hiện có được giữ cố định trong khi trình chấm điểm nhỏ học tập.

Định dạng dữ liệu

Sử dụng một đối tượng JSON trên mỗi dòng:

label là chỉ số bắt đầu từ 0 của tùy chọn đúng. Mỗi hàng có thể có số lượng tùy chọn khác nhau, với tối thiểu là hai.

Bắt đầu nhanh

Chạy các lệnh này từ thư mục gốc của kho lưu trữ. Chúng tạo dữ liệu tổng hợp cục bộ, huấn luyện trên đó, đánh giá mô hình đã lưu và chấm điểm một menu mới.

Quá trình đánh giá in ra độ chính xác top-1, là tỷ lệ các lựa chọn đầu tiên đúng. Độ chính xác top-3 là tỷ lệ có câu trả lời đúng nằm trong ba điểm số cao nhất. Sai số hiệu chuẩn kỳ vọng (expected calibration error) so sánh độ tin cậy với độ chính xác quan sát được. Lệnh này cũng in ra một kiểm soát ngữ cảnh bị xáo trộn, ghép mỗi menu với ngữ cảnh sai. Một mô hình hữu ích cần phải vượt qua kiểm soát đó.

Sử dụng dữ liệu của riêng bạn

Bộ mã hóa byte mặc định cắt bớt ngữ cảnh xuống 192 byte và mỗi tùy chọn xuống 32 byte. Hãy tăng --context-tokens hoặc --option-tokens khi văn bản của bạn cần nhiều không gian hơn. Quá trình huấn luyện hỗ trợ CPU, Apple MPS cho GPU Mac và CUDA cho GPU NVIDIA thông qua --device.

Sử dụng bộ mã hóa tiền huấn luyện đóng băng

Cài đặt phần phụ thuộc tùy chọn và đặt tên cho bất kỳ bộ mã hóa tương thích nào từ Hugging Face:

Checkpoint lưu trữ đầu chấm điểm đã huấn luyện và tên bộ mã hóa. Nó không sao chép các trọng số của bộ mã hóa đã đóng băng. Do đó, việc tải checkpoint cần quyền truy cập vào cùng một mô hình Hugging Face.

--rank thiết lập độ rộng của đầu chấm điểm nhỏ. Một đầu rộng hơn có nhiều trọng số có thể huấn luyện hơn và sử dụng nhiều bộ nhớ hơn.

Ví dụ Wikispeedia

scripts/get_wikispeedia.sh tải xuống các kho lưu trữ SNAP công khai và xây dựng các tệp JSONL cho lượt nhấp tiếp theo. Dữ liệu nằm ngoài kho lưu trữ này.

Trích dẫn Robert West và Jure Leskovec, Human Wayfinding in Information Networks, WWW 2012. Xem lại các điều khoản dữ liệu nguồn trên trang tập dữ liệu SNAP.

Những gì cần mong đợi

Trong các thí nghiệm dẫn đến mô hình khởi đầu này, trình chấm điểm một lượt đạt khoảng 98% độ chính xác trên các menu tổng hợp. Trên dữ liệu lượt nhấp tiếp theo của Wikispeedia, một bộ mã hóa Qwen2.5-0.5B đóng băng cộng với trình chấm điểm đạt 26%, so với khoảng 8% đối với các kiểm soát xáo trộn và bộ mã hóa ngẫu nhiên. Một mô hình nhỏ được huấn luyện từ đầu trên 40.000 lượt nhấp đạt 29%. Với tám tùy chọn, một lượt nhanh hơn khoảng 100 lần so với một bộ giải mã nhỏ bị buộc phải viết 400 token.

Những con số này mô tả các thí nghiệm cục bộ, không phải kết quả chạy nhanh này. Chúng tôi không thể hiện chất lượng tương đương với Jev hoặc tái tạo phương pháp huấn luyện riêng của TypeSafe.

Hạn chế

Giấy phép

Mã nguồn được phát hành theo Giấy phép MIT. Các tập dữ liệu và mô hình tiền huấn luyện được tải xuống vẫn giữ các điều khoản riêng của chúng.

Mã nguồn mởKỹ thuật đảo ngượcMô hình AIJevPhát triển AI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.