Sản phẩm
Convai ra mắt Laya: Mô hình quyết định mã nguồn mở nhanh gấp 7.8 lần Jev
(giờ Việt Nam)
Tóm tắt AI
Convai vừa giới thiệu Laya, dòng mô hình quyết định phi tự hồi quy với tốc độ suy luận vượt trội, đạt 32.8ms mỗi truy vấn và được phát hành dưới giấy phép Apache 2.0.
Bản dịch AI

Mọi người trong lĩnh vực AI hiện nay đều đang bàn tán về một loại mô hình mới: một kiến trúc không tự hồi quy (non-autoregressive), không tạo văn bản và đưa ra các dự đoán xác suất cực nhanh trên các lược đồ (schema) có cấu trúc.
Việc chứng kiến sự cường điệu trên mạng mang lại cảm giác vừa được công nhận nhưng cũng vừa vô cùng thất vọng.
Tôi đã thực sự làm việc này từ một năm trước, vào tháng 3 năm 2025. Tôi đã dành hàng tháng trời làm việc chăm chỉ, đổ mồ hôi và những đêm không ngủ để xây dựng nó, xuất bản một bài báo trên arXiv (arXiv:2503.23303), phát hành trọng số mô hình trên Hugging Face (sales-conversion-model-reinf-learning), công bố tập dữ liệu mở (saas-sales-conversations), xây dựng gói PyPI và đăng toàn bộ phương pháp lên Reddit (thảo luận r/LocalLLaMA).
Sau đó vào tháng 9 năm 2025, tôi xuất bản bài báo thứ hai (arXiv:2510.01237), chính thức hóa khung làm việc cho các quyết định dựa trên lược đồ được dẫn dắt bởi học tăng cường (reinforcement learning). Bộ não điều hướng trong hệ thống của tôi luôn là học tăng cường, chứ không chỉ là một mô hình nhúng (embedding model) hay một LLM tự hồi quy.
Và rồi vào tháng 9 năm 2026, một phòng thí nghiệm tiên phong được tài trợ tốt có tên TypeSafe AI (do Diogo Almeida, đồng phát minh ra ChatGPT tại OpenAI, sáng lập) đã ra mắt Jev. Họ đề xuất chính xác khái niệm quyết định không tự hồi quy đó như thể đó là một bước đột phá khoa học hoàn toàn mới. Chỉ có điều họ ra mắt mà không có bài báo kỹ thuật, không có trọng số mở và không có tập dữ liệu huấn luyện mở nào cả.
Mô hình trước đây của tôi sử dụng PPO trên các biểu diễn chuỗi để xuất ra các quỹ đạo chuyển đổi từng bước (xác suất từ 0.0 đến 1.0) trong các cuộc hội thoại bán hàng theo chiều dọc. Jev đã tổng quát hóa việc lấy mẫu song song bằng cách sử dụng cái mà họ gọi là RLCD (Reinforcement Learning for Calibrated Decisions) để xuất ra các phân phối độ tin cậy và lựa chọn lược đồ theo chiều ngang, với mức phí 0,042 USD cho mỗi triệu token đầu vào và thời gian phản hồi điển hình khoảng 150 ms.
Thay vì giữ sự cay đắng, tôi quyết định tận dụng mọi thứ mình đã học được, khắc phục mọi hạn chế về kiến trúc của phương pháp cũ và xây dựng một dòng mô hình quyết định System 1 hoàn toàn mở, theo chiều ngang: Laya.
Và vì chúng tôi xây dựng nó một cách bài bản trên các bộ mã hóa hai chiều (bidirectional encoders), các mô hình của chúng tôi chạy trong 32,8 mili giây trên một GPU đơn lẻ (7,2 ms/câu hỏi khi xử lý theo lô), giúp nó nhanh hơn từ 6 đến 8 lần so với Jev, hỗ trợ đầy đủ hơn 100 ngôn ngữ, không tốn phí đăng ký API và có trọng số mã nguồn mở 100% theo giấy phép Apache 2.0.
1. Nhận thức cốt lõi: System 1 so với System 2
Mọi pipeline AI hiện đại đều có một nút thắt cổ chai khổng lồ: chúng ta sử dụng các LLM tạo sinh cho các quyết định phản xạ đơn giản.
Khi một phiếu hỗ trợ khách hàng đến, hoặc một email rơi vào hộp thư đến của bạn, hoặc một người dùng gửi prompt đến API của bạn, bạn thường chỉ cần trả lời các câu hỏi đơn giản, có cấu trúc:
Việc gọi một LLM tạo sinh 8B, 70B hoặc các mô hình tiên phong cho việc này là hoàn toàn lãng phí. Bạn phải đợi từ 500 ms đến 2.000 ms để các token được truyền ra, tốn tiền thật cho việc suy luận (inference), và sau đó phải viết regex hoặc trình phân tích cú pháp JSON để trích xuất một nhãn sạch từ văn bản tự do. Tệ nhất là, các LLM rất thích "ảo tưởng" (hallucinate) và tạo ra sự tự tin giả tạo. Khi một LLM xuất ra "độ tin cậy: 0.95", nó chỉ đang dự đoán các token nghe có vẻ tự tin. Không hề có sự hiệu chuẩn toán học nào đằng sau đó cả.
Chúng ta cần một mô hình hoạt động giống như System 1 của não người: các quyết định phản xạ tức thì với các xác suất trung thực, đã được hiệu chuẩn, chỉ mất từ 30 đến 35 mili giây trên phần cứng phổ thông.
2. Ba nguyên lý quyết định
Laya đánh giá các câu hỏi có kiểu dữ liệu trên bất kỳ trạng thái nào (văn bản thô, email, phiếu hỗ trợ hoặc tài liệu JSON) trong một lần truyền tiến (forward pass) duy nhất. Nó dựa trên ba nguyên lý:
Vì không gian đầu ra chỉ bao gồm các xác suất và con số, mô hình không bao giờ tạo văn bản, không thể ảo tưởng, và việc vi phạm lược đồ hoặc JSON bị lỗi là điều không thể xảy ra về mặt vật lý.
3. Ba điểm kiểm tra (Checkpoint) & Kiến trúc Hub tích hợp
Một mô hình không thể tối ưu cho mọi tác vụ và ngôn ngữ. Chúng tôi đã phát hành ba điểm kiểm tra chuyên biệt, hiện được hợp nhất dưới một hub lưu trữ duy nhất trên Hugging Face:
Tải xuống thư mục con có chọn lọc
Thay vì buộc người dùng phải quản lý ba kho lưu trữ riêng biệt hoặc tải xuống 2,5 GB trọng số tổng hợp, kho lưu trữ chính convaiinnovations/laya tích hợp cả ba. Sử dụng allow_patterns của Hugging Face, SDK của Laya chỉ tải xuống thư mục con cụ thể được yêu cầu:
4. Tại sao định tuyến (Routing) là thiết yếu: Thực tế đa văn tự
Một trong những phát hiện đáng kinh ngạc nhất từ cuộc khảo sát 51 ngôn ngữ của chúng tôi trên benchmark MASSIVE (20 tùy chọn, baseline ngẫu nhiên = 0.050) là cách các mô hình tiếng Anh thất bại khi nằm ngoài hệ chữ Latinh.
Từ vựng BPE tiếng Anh 50.000 token của ModernBERT-large đơn giản là phá vỡ các bảng chữ cái không phải Latinh:
Đây là bài học quan trọng: độ tin cậy của chính mô hình không đưa ra cảnh báo nào khi nó không thể đọc được văn tự đầu vào. Trên 51 ngôn ngữ, độ tin cậy trung bình của điểm kiểm tra tiếng Anh không bao giờ giảm xuống dưới 0,885, bất kể độ chính xác của nó là 82% hay 0%.
Do đó, việc kiểm soát bằng độ tin cậy (confidence gating) không thể bảo vệ bạn. Quyết định sử dụng mô hình nào phải được đưa ra trước khi thực hiện truyền tiến.
Định tuyến bằng Python thuần dưới một mili giây
Laya bao gồm một Router tích hợp sẵn giúp kiểm tra các văn tự Unicode của văn bản đầu vào trên 22 bảng chữ cái (Devanagari, CJK Han, Cyrillic, Arabic, Hebrew, Tamil, Thai, v.v.) và phân tích các phân phối từ dừng (stopword) tiếng Latinh:
So với một lần truyền tiến 33 ms, chi phí định tuyến là không đáng kể (<2%). Và với Router(preload=True), tất cả các mô hình cần thiết vẫn nằm trong VRAM/RAM, loại bỏ hoàn toàn hình phạt 7 đến 10 giây khi chuyển đổi lạnh (cold-swap) giữa các ngôn ngữ.
5. Đối đầu trực tiếp: Laya (có định tuyến) so với TypeSafe Jev
Chúng tôi đã benchmark Laya trực tiếp với TypeSafe Jev trên các tập dữ liệu công khai và các benchmark tiêu chuẩn. Mọi con số của Laya đều được đo lường; các con số của Jev được công bố bởi các nghiên cứu độc lập của bên thứ ba (AbdelStark, nibzard) và TypeSafe AI.
Quy trình làm việc ứng dụng thực tế
Trên 9 quy trình làm việc doanh nghiệp được đánh giá, Laya thể hiện chất lượng quyết định sẵn sàng cho sản xuất:
6. Những hạn chế trung thực: Nơi Laya có giới hạn
Quá nhiều thông báo về AI che giấu điểm yếu của họ. Chúng tôi tin vào sự trung thực trong kỹ thuật:
7. Khởi động nhanh: Chạy Laya trong 30 giây
Đây là một ví dụ hoàn chỉnh về việc chạy các quyết định đa lược đồ với định tuyến ngôn ngữ tự động:
8. Tài nguyên & Cộng đồng
Kết luận
Phải mất một năm nghiên cứu, từ bài báo arXiv tháng 3 năm 2025 của chúng tôi đến hôm nay, nhưng nhận thức cốt lõi vẫn còn đó: không phải mọi vấn đề AI đều cần một chatbot tự hồi quy.
Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.