Mô hình
Harvey ra mắt Tenet: Mô hình AI chuyên biệt cho ngành luật dựa trên nền tảng Kimi K3
(giờ Việt Nam)
Tóm tắt AI
Harvey vừa giới thiệu Tenet, mô hình hậu huấn luyện tối ưu hóa cho các tác vụ pháp lý phức tạp dựa trên nền tảng Kimi K3, giúp cải thiện đáng kể hiệu suất xử lý hợp đồng và tài liệu chuyên ngành.
Bản dịch AI

Harvey vừa phát hành Harvey Tenet, mô hình hậu huấn luyện (post-trained model) đầu tiên của họ, dưới dạng bản xem trước nghiên cứu kể từ hôm nay. Tenet là mô hình cơ sở Kimi K3 được hậu huấn luyện thông qua Fireworks bằng phương pháp học tăng cường bất đồng bộ (asynchronous reinforcement learning) trên các tác vụ pháp lý dài hạn. Tập dữ liệu huấn luyện kết hợp giữa dữ liệu tổng hợp, dữ liệu pháp lý công khai và dữ liệu từ chuyên gia con người. Harvey khẳng định không có dữ liệu khách hàng nào được sử dụng. So với mô hình cơ sở K3, Tenet hoàn thành số lượng tác vụ kiểm thử (held-out tasks) trên bộ tiêu chuẩn Legal Agent Benchmark (LAB) của Harvey nhiều gần gấp đôi và nhiều hơn 20% trên LAB: Contracts, giúp nâng tỷ lệ vượt qua tất cả (all-pass rate) lần lượt thêm 9 và 2 điểm phần trăm. Harvey báo cáo đạt trạng thái tốt nhất (state-of-the-art) trên LAB: Contracts và đứng thứ hai trên LAB. Những cải tiến này cũng được chuyển giao mà không cần huấn luyện thêm sang các hệ thống APEX Agents của Mercor và Redline Bench của Crosby. Mục tiêu đặt ra là kép: xây dựng trí tuệ pháp lý tiên phong trên các mô hình mở (open-weight) và cung cấp cho các công ty luật lộ trình để sở hữu các mô hình chuyên biệt của riêng họ.
Liệu mô hình này đã có thể triển khai chưa?
Chưa, Harvey Tenet là một bản xem trước nghiên cứu được công bố vào ngày 20 tháng 8 năm 2026. Harvey chưa công bố trọng số (weights), thẻ mô hình (model card) hay điểm cuối API. Mô hình cơ sở là mô hình mở; bản thân Tenet là một checkpoint của riêng Harvey, và công ty cho biết công trình này sẽ dần chuyển từ "nghiên cứu sang sản xuất" bên trong các sản phẩm của Harvey theo thời gian. Những gì được phát hành hôm nay là công thức, không phải sản phẩm hoàn thiện.
Các con số nói lên điều gì
So với mô hình cơ sở K3, Tenet hoàn thành số lượng tác vụ kiểm thử trên bộ tiêu chuẩn Legal Agent Benchmark (LAB) của Harvey nhiều gần gấp đôi và nhiều hơn 20% trên LAB: Contracts, giúp nâng tỷ lệ vượt qua tất cả lần lượt thêm 9 và 2 điểm phần trăm. Harvey báo cáo đạt trạng thái tốt nhất trên LAB: Contracts và đứng thứ hai trên LAB, sử dụng điểm số mô hình cơ sở từ Vals.
Kết quả thú vị hơn nằm ở khả năng chuyển giao. Tenet cũng cải thiện đáng kể trên APEX Agents của Mercor (luật doanh nghiệp) và Redline Bench của Crosby — những thứ chưa từng xuất hiện trong quá trình huấn luyện — trong khi vẫn duy trì hiệu suất trên các bộ tiêu chuẩn kiến thức bao gồm LegalBench, CUAD, MAUD và PRBench của Scale. Việc huấn luyện tác tử (agentic training) không làm suy giảm khả năng suy luận pháp lý cơ bản.
Chi phí được đồng tối ưu hóa thay vì bị đánh đổi. Trọng số mở giúp giảm giá mỗi token; việc định hình phần thưởng (reward shaping) ưu tiên các quỹ đạo ngắn hơn với chất lượng tương đương giúp giảm lượng token tiêu thụ. Harvey báo cáo mức tăng chất lượng đáng kể với chi phí ổn định.
Cách thức huấn luyện
Quá trình huấn luyện sử dụng học tăng cường bất đồng bộ trong các môi trường pháp lý biệt lập (sandboxed) được xây dựng giống như các tác vụ LAB: một hướng dẫn kiểu đối tác dài khoảng 50 từ, một hồ sơ khách hàng gồm các tài liệu chính và phụ, cùng một bộ tiêu chí đánh giá chuyên gia (expert rubric) gồm các tiêu chí đạt/không đạt nguyên tử — khoảng 50 tiêu chí mỗi tác vụ, lên đến hàng trăm ở mức độ cực đoan. Một lần triển khai (rollout) có thể vượt quá 1.000 lượt tương tác.
Các lượt triển khai được chấm điểm bởi LLM-as-a-judge; các thử nghiệm cắt bỏ (ablations) đã chọn Kimi 2.6. Phần thưởng kết hợp giữa tỷ lệ các tiêu chí trong rubric được đáp ứng, số lượng các vấn đề pháp lý được giải quyết và tiền thưởng cho việc vượt qua tất cả. Chính sách được tối ưu hóa với GSPO sử dụng LoRA rank-64 trên toàn bộ mạng lưới K3, tám nhóm tác vụ với tám lượt triển khai mỗi bước tối ưu hóa, trên khoảng 1.750 môi trường và hơn 10.000 lượt triển khai mỗi epoch. Fireworks đã đồng xây dựng bộ huấn luyện và triển khai lượt chạy ở cấp độ nhân (kernel level), với cơ chế token-in-token-out và router replay, để giữ cho một mô hình MoE lớn được căn chỉnh về mặt số học trong suốt quá trình huấn luyện và suy luận.
Ba khả năng được huấn luyện riêng biệt
Nhóm Harvey cũng hậu huấn luyện các mô hình chuyên gia mà Tenet có thể điều hướng tới như các công cụ hoặc tác tử phụ:
Sự thật kiểm chứng độc lập từ Marktechpost
78Điểm lạm phát
19Yêu cầu xác nhận
1Đã xác minh
10Tự báo cáo
6Đã gắn cờ
2Không thể xác minh
Không có thông tin nào Harvey công bố bị phản bác. Điểm số cao vì Tenet không xuất hiện trên bảng xếp hạng công khai nào — không phải Vals, không phải Artificial Analysis, cũng không phải Mercor. Công thức tính điểm: (8 × 6 cờ) + (15 × 0 phản bác) + (3 × 10 tự báo cáo) = 78.
Bảng yêu cầu xác nhận
Giải thích các cờ (Flags)
F1 · Trò chơi mẫu số: Blog báo cáo tăng +9 và +2 điểm phần trăm. Luồng X báo cáo kết quả tương tự là +82% và +22%. Cả hai đều đúng; con số trên mạng xã hội nghe có vẻ lớn gấp chín lần.
F2 · Tự báo cáo là sự thật: "SOTA trên LAB: Contracts" là một chiến thắng trên chính bộ tiêu chuẩn của Harvey. Harvey tuyên bố không có bảng xếp hạng công khai cho nó và tất cả điểm số đều là các lượt chạy nội bộ của Harvey. LAB ra mắt mà cố tình không có bảng xếp hạng.
F3 · Không khớp thiết lập: Harvey đã tiết lộ điều này một cách rõ ràng: Tenet chạy trong bộ công cụ (harness) công khai tiêu chuẩn cộng với một công cụ hoàn thiện được mang từ quá trình huấn luyện, trong khi điểm số của đối thủ đến từ Vals. Cờ này nói về khả năng so sánh, không phải sự che giấu — Harvey chưa bao giờ công bố LAB với và không có công cụ đó, vì vậy giá trị của nó chưa được định lượng. Các số liệu APEX của chính Harvey cho thấy việc thay đổi bộ công cụ làm thay đổi K3 cơ bản 8,7 điểm, và tuyên bố LAB là một thứ hạng nơi các đối thủ dẫn đầu của Vals nằm trong khoảng từ 12% đến 20%.
F4 · Không khớp thiết lập: Trên APEX Agents, Tenet chạy trong bộ công cụ bash nội bộ của Harvey trong khi các đối thủ sử dụng các con số đã công bố của Mercor. Harvey tiết lộ bộ công cụ này nâng K3 cơ bản từ 58,8% lên 67,5% — trong phạm vi 0,1 điểm so với đối thủ dẫn đầu Fable 5 ở mức 67,4%, trước khi thực hiện bất kỳ quá trình huấn luyện nào.
F5 · Cách đặt vấn đề: "Open-weight" mô tả mô hình cơ sở Kimi K3, không phải Tenet. Không có trọng số, thẻ mô hình hay API nào được công bố, nhưng nhiều trang tin vẫn giật tiêu đề gọi Tenet là một bản phát hành open-weight.
F6 · Trò chơi mẫu số: "Chi phí mỗi ô thấp hơn khoảng một phần mười" được đo lường so với các "đường cơ sở mạnh nhất" không được nêu tên, không có cấu hình phục vụ, độ chính xác hoặc phần cứng nào được cung cấp cho cả hai bên.
F7 · Trò chơi mẫu số: "Chi phí thấp hơn một phần tư so với các mô hình nền tảng hàng đầu" chỉ xuất hiện trên X. Các đối tượng so sánh không được nêu tên và giá niêm yết không được tách biệt khỏi mức tiêu thụ token đo lường được.
Ghi nhận xứng đáng: Harvey đã để Mercor chạy APEX v1 một cách mù (blind), không tiết lộ các lượt chạy, tác vụ hoặc điểm số cấp tác vụ cho Harvey — phương pháp xác minh mạnh nhất trong bài viết, mặc dù nó chứng minh khả năng lưu giữ kiến thức hơn là kỹ năng tác tử. Harvey cũng tự nguyện đưa ra kết quả không đạt trên PRBench, ghi lại những khác biệt của mình với Artificial Analysis và Vals, đồng thời tiết lộ hiệu ứng bộ công cụ trong F4 vốn làm giảm chính cách đặt vấn đề về APEX của họ.
Kiểm chứng thực tế bởi Marktechpost · đã xác minh 2026-08-23. Chế độ mặc định: chấp nhận các con số từ nhà cung cấp với nhãn tự báo cáo. Điểm số thay đổi; hãy xác minh lại trước khi trích dẫn.
Những điểm chính cần lưu ý
Xem CHI TIẾT KỸ THUẬT tại đây. Ngoài ra, hãy thoải mái theo dõi chúng tôi trên Twitter và đừng quên tham gia SubReddit ML 150k+ của chúng tôi và Đăng ký Bản tin của chúng tôi. Khoan đã! bạn có dùng telegram không? bây giờ bạn cũng có thể tham gia với chúng tôi trên telegram.
Cần hợp tác với chúng tôi để quảng bá GitHub Repo HOẶC trang Hugging Face HOẶC Bản phát hành sản phẩm HOẶC Hội thảo trực tuyến, v.v.? Hãy kết nối với chúng tôi.

Asif Razzaq là CEO của Marktechpost Media Inc.. Là một doanh nhân và kỹ sư có tầm nhìn, Asif cam kết khai thác tiềm năng của Trí tuệ nhân tạo vì lợi ích xã hội. Nỗ lực gần đây nhất của ông là ra mắt Nền tảng truyền thông Trí tuệ nhân tạo, Marktechpost, nổi bật với việc đưa tin chuyên sâu về tin tức học máy và học sâu, vừa đảm bảo tính kỹ thuật vừa dễ hiểu đối với đông đảo khán giả. Nền tảng này tự hào với hơn 2 triệu lượt xem hàng tháng, minh chứng cho sự phổ biến của nó đối với độc giả.
Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.