Tomer Tunguz Blog (phân tích VC)
92

Thủ thuật

Khi AI tự học trong lúc chạy: Công nghệ Test-time Training thay đổi cuộc chơi về bộ nhớ và chi phí

(giờ Việt Nam)

Tóm tắt AI

Thay vì đóng băng trọng số sau khi huấn luyện, Test-time Training cho phép mô hình cập nhật liên tục khi sử dụng, giúp tăng tốc độ suy luận gấp 2.7 lần và mở rộng ngữ cảnh hiệu quả mà không cần huấn luyện lại.

Bản dịch AI

When Models Learn

Tóm tắt: Giải thích về test-time training (huấn luyện tại thời điểm kiểm thử) thông qua phép ẩn dụ về một thiết bị GPS học cách tìm đường tắt cố định để tránh tắc đường hàng ngày thay vì chỉ định tuyến lại một lần: mô hình thực hiện một bước gradient trên chính câu lệnh (prompt) mà nó đang phản hồi, do đó trọng số của nó thay đổi trong quá trình làm việc. Bài viết chỉ ra ba hệ quả: bộ nhớ phẳng thay vì KV-cache tăng tuyến tính, chi phí của nhà cung cấp khi phải phục vụ một mô hình riêng biệt cho mỗi người dùng, và tốc độ suy luận nhanh hơn; sau đó nêu ra sự căng thẳng như một sự đánh đổi giữa việc phục vụ ngữ cảnh dài và phục vụ nhiều người, đồng thời đặt nó vào các trường hợp sử dụng cụ thể, như một coding agent có thể bù đắp chi phí trên mỗi người dùng trong một phiên làm việc dài so với một truy vấn dùng một lần mà một mô hình dùng chung cố định có thể xử lý tốt không kém.

Mọi mô hình bạn từng sử dụng đều "đóng băng" kể từ ngày quá trình huấn luyện kết thúc. Các câu trả lời vẫn như cũ ngay cả khi bạn sử dụng nó mỗi ngày.

Sẽ ra sao nếu một mô hình tiếp tục học hỏi khi bạn sử dụng nó?

Một thiết bị GPS học cách tìm đường tắt cố định để tránh tắc đường hàng ngày trên đường cao tốc Highway 101 hướng Bắc, chứ không chỉ là định tuyến lại một lần. Test-time training thực hiện điều đó với một mô hình khi nó đang hoạt động. Khi bạn sử dụng AI, mô hình sẽ thay đổi các trọng số của nó, thay đổi cách nó tư duy về các bộ nhớ của mình để phản hồi bạn tốt hơn.

Two-part diagram. Top: standard inference, three colored users send queries into one shared gray frozen model with a lock icon, which answers all three from the same unchanged weights, one batched cop

Những thay đổi này sâu sắc hơn nhiều so với việc tìm một lối thoát ra đường nhánh để vượt qua điểm nghẽn tại nút giao cao tốc.

Yêu cầu về bộ nhớ giảm mạnh. Một transformer tiêu chuẩn duy trì một KV-cache, một bản ghi liên tục của mọi token trước đó, vì vậy bộ nhớ của nó tăng tuyến tính theo ngữ cảnh, mỗi token bổ sung đều thêm vào bản ghi đó. Test-time training gộp lịch sử đó vào một tập hợp trọng số có kích thước cố định thay vì một bộ nhớ đệm đang tăng dần, vì vậy bộ nhớ vẫn giữ nguyên trạng thái phẳng bất kể cuộc trò chuyện kéo dài bao lâu.

Nhà cung cấp mô hình giờ đây phải phục vụ một mô hình riêng biệt cho mỗi người. Một khi mô hình cập nhật dựa trên prompt của bạn, nó không còn là mô hình đã trả lời người hàng xóm của bạn nữa, vì vậy một checkpoint duy nhất phục vụ hàng triệu người dùng trở thành hàng triệu mô hình hơi khác biệt, mỗi mô hình được định hình bởi chính người đang sử dụng nó. Sự phân tách đó là vấn đề mà nhà cung cấp phải giải quyết: một nhà cung cấp GPU cần một bản sao đang chạy cho mỗi người dùng thay vì một bản sao dùng chung cho tất cả mọi người, điều đó có nghĩa là cần nhiều tài nguyên tính toán hơn, nhiều chip hơn để phục vụ cùng một số lượng người.

Nó nhanh hơn nhiều. Nghiên cứu của Stanford về các mô hình nhỏ chỉ ra rằng nó có thể nhanh hơn tới 2,7 lần, vì độ trễ suy luận của một mô hình test-time trained giữ nguyên không đổi bất kể ngữ cảnh kéo dài bao lâu, điều mà một transformer tiêu chuẩn không làm được. In-Place TTT cũng có thể triển khai ngay lập tức (drop-in), nâng hiệu suất của một mô hình 4b lên mức cạnh tranh với ngữ cảnh 128k mà không cần huấn luyện lại.

Đây chính là sự căng thẳng. AI tiêu chuẩn bị giới hạn bởi bộ nhớ, AI test-time bị giới hạn bởi tài nguyên tính toán và chip, vì vậy nhà cung cấp phải lựa chọn dựa trên việc họ đang phục vụ ngữ cảnh dài hay phục vụ nhiều người.

Chi phí đó chỉ đáng giá khi việc cá nhân hóa mang lại hiệu quả tương xứng. Một coding agent học được các quy ước trong codebase của bạn, các lỗi dai dẳng, cuối cùng sẽ tạo ra một dạng "khóa chặt" (lock-in) thông qua bộ nhớ, giúp chi phí trên mỗi người dùng tự bù đắp. Một câu hỏi hỗ trợ khách hàng dùng một lần không cần đến những điều đó. Một mô hình dùng chung, cố định, có thể đã được tinh chỉnh (fine-tuned) sẽ trả lời tốt không kém và chi phí phục vụ cho nhà cung cấp thấp hơn nhiều.

Test-time training sẽ là một phần quan trọng trong các cuộc thảo luận trong suốt cuối năm 2026 và xa hơn nữa. Nó có tiềm năng thay đổi nền kinh tế hiện tại của AI.

Sun và cộng sự, Học cách (Học tại thời điểm kiểm thử): RNN với các trạng thái ẩn biểu cảm ↩︎

Huấn luyện tại thời điểm kiểm thử đầu cuối (End-to-End) cho ngữ cảnh dài ↩︎

Huấn luyện tại thời điểm kiểm thử tại chỗ (In-Place Test-Time Training) ↩︎

Nhận bài viết tiếp theo trong hộp thư đến của bạn

Bài đọc 1 phút biến dữ liệu công nghệ thành lợi thế chiến lược. Được đọc bởi hơn 150 nghìn nhà sáng lập và nhà điều hành.

Tổng giám đốc (GP) tại Theory Ventures. Cựu Giám đốc sản phẩm (PM) tại Google. Chia sẻ những hiểu biết dựa trên dữ liệu về AI, web3 và đầu tư mạo hiểm.

Bloomberg • WSJ • Economist

AITest-time TrainingTối ưu hóaTransformerCông nghệ mới
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Tomer Tunguz Blog (phân tích VC). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.