Thủ thuật
Tomer Tunguz: Hệ thống Harness giúp cắt giảm 71% chi phí vận hành AI Agent
(giờ Việt Nam)
Tóm tắt AI
Nghiên cứu từ Berkeley cho thấy hệ thống Harness có thể tối ưu hóa AI Agent, giúp giảm chi phí thực thi tác vụ từ 1,54 USD xuống còn 0,44 USD mà không làm giảm độ chính xác.
Bản dịch AI
Tóm lại: Một nghiên cứu của UC Berkeley cho thấy "harness" (hệ thống điều phối) quyết định giá thành của một câu trả lời: GPT-5.6 Sol có chi phí thấp hơn 71% trên Pi so với trên Claude Code, dù cùng một mô hình trả về kết quả như nhau, và không có bất kỳ so sánh nào trong số 42 thử nghiệm harness cho thấy sự khác biệt đáng kể về chất lượng. Hai startup cùng đấu thầu một hợp đồng trị giá 250.000 USD đạt biên lợi nhuận gộp lần lượt là 38% và 75% tùy thuộc vào cách họ xây dựng xung quanh mô hình, và bên có chi phí thấp hơn thu hồi vốn bán hàng nhanh gấp đôi. Những harness hiệu quả đòi hỏi sự thấu hiểu khách hàng sâu sắc, các đánh giá (evals) phù hợp và một "nhà máy" để tự động hóa việc tối ưu hóa (hill climbing).
Harness càng tốt, doanh nghiệp càng mạnh.
Tuần này, Berkeley đã công bố một nghiên cứu cho thấy các harness – những hệ thống kiểm soát các tác nhân AI – quyết định giá thành của một câu trả lời. Một harness phù hợp giúp cắt giảm 71% chi phí cho cùng một kết quả mà không làm giảm độ chính xác.
Dữ liệu chỉ ra cơ hội cho thế hệ ứng dụng phần mềm tiếp theo: đó chính là các harness. Đúng, chúng ta có thể sử dụng AI để làm hầu hết mọi việc mình muốn trong công việc. Nhưng không, chúng ta không đủ khả năng để cung cấp cho mọi người quyền truy cập vào các mô hình hiện đại nhất cho mọi tác vụ.
Các harness hợp nhất những quy trình làm việc phổ biến thành các mô hình có thể lặp lại: mã nguồn hoặc kỹ năng mang tính tất định. Harness càng tốt, khả năng nén càng cao, chi phí AI càng thấp.
Hãy tưởng tượng Theory mua một hợp đồng trị giá 250.000 USD mỗi năm cho một trợ lý AI để đánh giá 5.000 công ty. Hai startup tham gia đấu thầu. Inferno gọi một mô hình hiện đại nhất cho mọi bước. Inferefficient vận hành một harness hợp nhất công việc thành mã nguồn tất định, chỉ dành riêng mô hình đắt tiền cho một vài bước thực sự cần thiết.
Inferno "đốt" 131.000 USD cho suy luận (inference). Inferefficient chỉ tốn 37.000 USD. Cả hai đều chịu cùng mức chi phí cho lưu trữ, đánh giá và nhân sự kiểm tra công việc. Doanh thu giống hệt nhau, biên lợi nhuận gộp là 38% so với 75%.
Inferno không thể sao chép Inferefficient. Việc định tuyến sang một mô hình giá rẻ chỉ an toàn nếu bạn biết rõ những tác vụ nào nó có thể xử lý, và kiến thức đó đến từ việc quan sát mười nghìn phiên bản của cùng một công việc. Lợi thế chi phí và "con hào kinh tế" chính là cùng một tài sản.
Sau 8.600 đánh giá, Inferno bắt đầu thua lỗ trên mỗi đánh giá bổ sung. Họ buộc phải hạn chế sử dụng, điều này khiến sản phẩm trở nên tệ hơn ngay tại thời điểm khách hàng thấy nó giá trị nhất. Inferefficient thì đáp ứng mọi yêu cầu.
Lợi nhuận gộp tạo ra sự tăng trưởng. Với hợp đồng 250.000 USD tốn 150.000 USD chi phí giành được, Inferno mất mười chín tháng để thu hồi vốn bán hàng. Inferefficient chỉ mất mười tháng. Một trong hai doanh nghiệp này có thể tuyển dụng nhanh gấp đôi doanh nghiệp kia.
Biên lợi nhuận sẽ không tăng lên 100%. Khi chi phí suy luận ngày càng rẻ, người mua sẽ yêu cầu nhiều hơn ở các tác nhân của họ, làm thay đổi trạng thái cân bằng theo thời gian để đáp ứng cạnh tranh. Khoảng cách giữa hai công ty mới là thứ tồn tại bền vững.
Các harness hiệu quả không phải là những hỗn hợp của các thành phần kỳ lạ: đó là sự thấu hiểu khách hàng sâu sắc, tập hợp các đánh giá phù hợp và một "nhà máy" để tự động hóa việc tối ưu hóa.
Đó là công thức cho một công ty phần mềm có giá trị và có khả năng phòng thủ.
Melissa Z. Pan, Shuo Yang, Negar Arabzadeh, Wei-Lin Chiang, Ion Stoica, & Matei Zaharia, “HarnessTax: How Much Does the Harness Matter for Coding Agents?”, 2026. Hai mươi mốt cặp mô hình-harness, mỗi cặp thực hiện 30 tác vụ từ SWE-bench Lite & Terminal-Bench 2.0, ba lần thử mỗi tác vụ, tính phí theo bảng giá cố định ngày 1 tháng 9 năm 2026. Trong tất cả 42 so sánh harness cùng mô hình, kiểm định Fisher exact hai phía chỉ tìm thấy một kết quả ở mức p < 0.05, trong khi xác suất ngẫu nhiên đơn thuần sẽ tạo ra khoảng hai, và không có kết quả nào vượt qua hiệu chỉnh Holm-Bonferroni. Hai hạn chế: các kết quả triển khai được công bố được sắp xếp theo chi phí, điều này phá vỡ việc ghép cặp tác vụ và loại trừ kiểm định cặp, và với 90 lần triển khai mỗi ô, nghiên cứu chỉ phát hiện được các biến động khoảng mười lăm điểm. Khoảng cách chất lượng chưa được chứng minh ở quy mô mẫu này, chứ không phải được chứng minh là không tồn tại.
Việc thay đổi harness là trường hợp GPT-5.6 Sol chuyển từ Claude Code sang Pi trong cùng nghiên cứu: từ 1,540 USD xuống 0,441 USD cho mỗi tác vụ được giải quyết, với cùng một mô hình trong cả hai trường hợp. Mức giảm 71% đó là dữ liệu đo lường được và là cơ sở cho lập luận này. Phần còn lại mang tính minh họa: một đánh giá công ty chạy khoảng mười bảy tác vụ chuẩn tương đương, và cả hai công ty đều chịu 25.000 USD chi phí hàng bán không liên quan đến suy luận cho lưu trữ, hạ tầng đánh giá và kiểm tra của con người. Những giả định đó thiết lập biên lợi nhuận tuyệt đối, không phải khoảng cách giữa chúng. Ở mức mười tác vụ tương đương, sự so sánh là 59% so với 81%; ở mức ba mươi, một bên thua lỗ so với 64%. Inferefficient vẫn là một doanh nghiệp phần mềm trong phạm vi đó còn Inferno thì không, đó mới là điểm mấu chốt.
Nhận bài viết tiếp theo trong hộp thư đến của bạn
Bài đọc 1 phút giúp biến dữ liệu công nghệ thành lợi thế chiến lược. Được đọc bởi hơn 150.000 nhà sáng lập và nhà điều hành.
Đối tác chung (GP) tại Theory Ventures. Cựu Giám đốc sản phẩm (PM) tại Google. Chia sẻ những hiểu biết dựa trên dữ liệu về AI, web3 và đầu tư mạo hiểm.
Bloomberg • WSJ • Economist
Bài viết được AI dịch và tổng hợp tự động từ Tomer Tunguz Blog (phân tích VC). Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.