Sản phẩm
Soup v0.72.4: Tối ưu hóa fine-tune mô hình 8B trên GPU laptop chỉ với 4GB VRAM
(giờ Việt Nam)
Tóm tắt AI
Phiên bản Soup v0.72.4 cho phép người dùng fine-tune các mô hình 8B thông qua QLoRA ngay trên GPU laptop có 4GB VRAM mà không cần dùng đến cloud hay SSH.
Bản dịch AI
Tinh chỉnh (fine-tune) và hậu huấn luyện (post-train) các LLM chỉ với một câu lệnh. Không cần SSH, không còn nỗi lo cấu hình phức tạp.
Website · Khởi động nhanh · Cấu hình · Tài liệu · Câu lệnh · Các mô hình · Discord
Soup biến quá trình tinh chỉnh LLM đầy khó khăn thành một quy trình làm việc đơn giản. Một cấu hình, một câu lệnh, xong.
Tinh chỉnh mô hình 8B trên GPU laptop 4 GB. Công nghệ layer streaming giúp giữ mô hình cơ sở (frozen base) bên ngoài VRAM và nạp từng lớp decoder vào GPU. Đo lường trên RTX 3050 Laptop 4 GB: Llama-3.1-8B-Instruct + NF4 đạt 119,6 tok/s, mức sử dụng đỉnh 3,32 GB — chính xác từng bit so với cách chạy thông thường. Tính năng tùy chọn (stream_layers: true) và vẫn đang trong giai đoạn BETA — cách thức hoạt động · tất cả các phép đo · bài báo nghiên cứu.
Tại sao lại là Soup?
Việc huấn luyện LLM vẫn còn rất đau đầu. Ngay cả các đội ngũ giàu kinh nghiệm cũng dành 30-50% thời gian để xử lý cơ sở hạ tầng thay vì cải thiện mô hình. Soup giải quyết vấn đề đó.
Có gì mới
v0.72.4 — căn chỉnh trên laptop: DPO, ORPO, SimPO và KTO thông qua layer streaming. Layer streaming giữ mô hình cơ sở bên ngoài VRAM và nạp từng lớp decoder vào GPU. Trước đây chỉ hỗ trợ tinh chỉnh có giám sát (supervised fine-tuning); giờ đây đã chạy được cả các hàm mất mát ưu tiên (preference losses).
Đã huấn luyện với stream_layers: true trên v0.72.0? Adapter đó không hoạt động — các tensor của nó đã được lưu dưới các khóa có thêm phân đoạn.inner., vì vậy mọi trình tải đều trả về mô hình cơ sở chưa được tinh chỉnh. Đã sửa trong v0.72.1; hãy chạy lại hoặc lưu lại. Kiểm tra bằng: python -c "from safetensors.torch import load_file; print([k for k in load_file('adapter_model.safetensors') if '.inner.' in k][:3])"
Trỏ soup reward synth vào một tệp JSONL chứa các đầu ra tham chiếu, nó sẽ suy luận ra một trình xác minh tất định, viết một hàm phần thưởng (reward function).py dễ đọc/có thể commit, và — phần mà không ai khác làm được — từ chối xuất ra hàm không thể phân biệt được tham chiếu của bạn với các câu trả lời kém chất lượng (bốn nhóm: numeric / json_schema / regex / tool_call; báo cáo hiệu chuẩn bắt buộc là rào cản bảo vệ). Các tập hợp phần thưởng (reward ensembles) (reward_fn: "accuracy,format") hiện cũng đã có thể huấn luyện. (#311)
Phán quyết của soup ship giờ đây có thể xuất ra, có thể commit và gắn liền với nguồn gốc: --emit-evidence giúp phát lại một lần chạy thành một phán quyết giống hệt, eval.ship trong soup.yaml + --config giúp chính sách kiểm duyệt có thể xem xét lại, và --config gắn bằng chứng vào đúng công thức đã tạo ra nó (bằng chứng cũ → thoát 3). soup ship --push owner/repo#N đăng thẻ SHIP / DON'T-SHIP lên PR.
Giai đoạn hồi quy của soup ship đã trở thành hiện thực: một trình chấm điểm cố định dựa trên trích xuất qua bảy bộ kiểm thử ngoại tuyến đi kèm (MCQ · số học · gọi công cụ · tính hợp lệ của JSON · an toàn/từ chối). Một bản tinh chỉnh thắng được tác vụ của bạn nhưng vô tình làm hỏng tính năng gọi công cụ giờ đây sẽ nhận kết quả DON'T SHIP. Không cần thêm phụ thuộc mới.
soup draft measure báo cáo tỷ lệ chấp nhận của mô hình dự thảo + tốc độ tok/s thực tế (thường so với hỗ trợ) (thoát 0/2/1 cho CI); soup draft distill chưng cất mục tiêu của bạn thành một bản dự thảo nhỏ gọn, tự động kết nối vào soup serve --auto-spec. Kết quả trung thực trên một cặp cùng họ nhỏ: chưng cất không làm thay đổi tỷ lệ chấp nhận (69,3% → 69,3%) và giải mã có hỗ trợ (assisted decoding) thực tế làm chậm hệ thống — đó chính xác là con số bạn cần biết trước khi triển khai speculative decoding.
Lịch sử đầy đủ: CHANGELOG.md · GitHub Releases.
Khởi động nhanh
1. Cài đặt
Bảng các tính năng bổ sung đầy đủ (fast, mlx, serve, eval, ui, vision, audio, …) nằm trong docs/models.md.
Sử dụng dấu ngoặc kép cho các tính năng bổ sung. Đó là cách viết duy nhất hoạt động trong mọi shell — cmd.exe, PowerShell, bash và zsh.
Các hướng dẫn và video cũ (bao gồm cả một số của chúng tôi) hiển thị lệnh pip install 'soup-cli[train]' với dấu ngoặc đơn. Đó là cú pháp của bash / zsh / PowerShell, và nó sẽ lỗi trên Windows cmd.exe, vốn không hỗ trợ dấu ngoặc đơn và truyền thẳng dấu ngoặc đó vào pip:
Nếu bạn gặp lỗi đó, hãy đổi ' thành " — pip đang từ chối ký tự ngoặc đơn, không có gì sai với gói cả. (Bỏ hoàn toàn dấu ngoặc kép cũng hoạt động trên Windows, nhưng zsh sẽ đọc [train] như một glob và gây lỗi.)
soup init, soup data …, và các câu lệnh kiểm tra/dữ liệu khác hoạt động trên bản cài đặt nhẹ. Tinh chỉnh (soup train) cần tính năng bổ sung [train].
2. Tạo cấu hình
Các mẫu: chat, code, tool-calling, medical, reasoning, vision, kto, orpo, simpo, ipo, bco, rlhf, pretrain, moe, longcontext, embedding, audio.
3. Huấn luyện, kiểm thử, xuất xưởng
Nhiều mục tiêu xuất (ONNX, TensorRT, AWQ, GPTQ, BitNet) và các tùy chọn triển khai nằm trong docs/serving-and-export.md.
Cấu hình
Một tệp soup.yaml hoàn chỉnh:
config/schema.py là nguồn sự thật duy nhất cho mọi trường. Các tùy chọn nâng cao về dữ liệu, huấn luyện và PEFT được ghi lại trong phần Tài liệu.
Tài liệu
Tham chiếu tính năng đầy đủ nằm trong docs/. Bắt đầu tại đây:
Định dạng dữ liệu
Tất cả các định dạng đều được tự động phát hiện từ JSONL, JSON, CSV, Parquet hoặc TXT:
Các lược đồ đầy đủ và đường ống dữ liệu tương thích với Axolotl/LlamaFactory (URI từ xa, streaming, sharding, interleaving, mở rộng từ vựng, nhập tài liệu) nằm trong docs/data.md.
Các câu lệnh phổ biến
Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.