# NVIDIA ra mắt SWE-Serve: Vạch trần khoảng cách giữa kiểm thử cục bộ và thực tế triển khai AI

- Nguồn: NVIDIA Technical Blog: Agentic AI / Generative AI
- Thời gian phát hành: 2026-09-23 23:44 (giờ Việt Nam)
- Điểm AI: 53/100
- Link AIHOT.vn: https://aihot.vn/items/8c57f915442a9f25
- Nguồn dữ liệu AI HOT: https://aihot.news/items/cmuec2oix0v2rrogha98a4vxs
- Link gốc: https://developer.nvidia.com/blog/how-swe-serve-exposes-the-gap-between-local-tests-and-live-serving

## Tóm tắt AI

NVIDIA hợp tác cùng đội ngũ SGLang giới thiệu chuẩn đo lường SWE-Serve, sử dụng 53 tác vụ kỹ thuật thực tế từ 83 pull request của SGLang để đánh giá hiệu năng của các AI agent trong môi trường triển khai thực tế.

## Thân bài

![How SWE-Serve Exposes the Gap Between Local Tests and Live Serving](https://developer-blogs.nvidia.com/wp-content/uploads/2026/09/image1-16.webp)

Bản vá của một AI coding agent có thể vượt qua các bài kiểm tra nhưng lại thất bại khi máy chủ tải một mô hình thực tế và xử lý các yêu cầu. Do đó, việc đánh giá các thay đổi đối với phần mềm phục vụ suy luận (inference-serving software) đòi hỏi phải kiểm tra toàn bộ đường dẫn phục vụ, bao gồm cả việc liệu hệ thống có trả về kết quả chính xác thông qua giao diện công khai hay không.

Được phát triển với sự đóng góp từ đội ngũ SGLang, SWE-Serve đánh giá khoảng cách này với 53 tác vụ bắt nguồn từ các thay đổi đã hợp nhất vào SGLang, một hệ thống mã nguồn mở dùng để phục vụ các mô hình ngôn ngữ lớn. Trong 19 tác vụ có kiểm tra phục vụ trực tiếp (live-serving), các bản vá tương tự đạt tỷ lệ thành công 69,4% khi loại bỏ các kiểm tra đó, nhưng chỉ đạt 45,9% với bộ xác thực hoàn chỉnh. Khoảng một trong ba bản vá vượt qua các kiểm tra khác đã thất bại trong các bài kiểm tra phục vụ trực tiếp.

Liên kết nhanh: [Đọc bài báo](https://arxiv.org/abs/2609.26777) | [Khám phá bảng xếp hạng](https://research.nvidia.com/benchmarks/swe-serve) | [Chạy SWE-Serve trên GitHub](https://github.com/NVIDIA/swe-serve)

### Những gì SWE-Serve kiểm tra

Các benchmark cấp kho lưu trữ hiện có đánh giá các coding agent thông qua các tác vụ kỹ thuật phần mềm chung, trong khi các benchmark suy luận thường tập trung vào tạo kernel hoặc tối ưu hóa hiệu suất. Thay vào đó, SWE-Serve kiểm tra các thay đổi ở quy mô kho lưu trữ trên toàn bộ ngăn xếp phục vụ suy luận, bao gồm kích hoạt mô hình, giải mã, lưu bộ nhớ đệm, lập lịch, API phục vụ và hiệu suất thời gian chạy.

Để đánh giá công việc kỹ thuật rộng hơn này, SWE-Serve chuyển đổi 83 pull request đã hợp nhất của SGLang thành 53 tác vụ có thể thực thi trên sáu nhóm kỹ thuật suy luận.

| Nhóm kỹ thuật | Tác vụ |
| --- | --- |
| Giải mã suy đoán và nâng cao | 14 |
| Kích hoạt mô hình và backend | 12 |
| Kernel, lượng tử hóa và hiệu suất | 8 |
| API phục vụ và tính đúng đắn của thời gian chạy | 8 |
| Lưu bộ nhớ đệm và trạng thái thời gian chạy | 7 |
| Thực thi phân tán và lập lịch | 4 |

Bảng 1. Phân bổ 53 tác vụ của SWE-Serve trên sáu nhóm kỹ thuật suy luận

Mười hai tác vụ chạy trên CPU, trong khi 41 tác vụ sử dụng một NVIDIA H100 duy nhất. Bản phát hành đầu tiên này không đánh giá các công cụ suy luận khác, thực thi đa GPU hoặc phục vụ đa nút.

Ba mươi bảy tác vụ đến từ một pull request upstream duy nhất. 16 tác vụ còn lại kết hợp từ hai đến sáu thay đổi liên quan. Tổng cộng, benchmark này dựa trên 83 pull request đã hợp nhất của SGLang. Đội ngũ SGLang, đối tác ra mắt của SWE-Serve, đã đóng góp ý tưởng để xác định các tác vụ khó, đề xuất các pull request đặc biệt đòi hỏi khắt khe và giúp định hình phương pháp xác minh tính đúng đắn của chúng tôi.

Mỗi tác vụ cung cấp cho agent một hướng dẫn và một bản checkout SGLang được đóng gói (containerized) từ trước khi thay đổi mục tiêu. Bản vá của agent vượt qua nếu nó đáp ứng bộ xác thực ẩn của tác vụ trên phần cứng đã khai báo. Nó không bao giờ được so sánh với bản triển khai tham chiếu.

Đây là những thay đổi đáng kể. Giải pháp tham chiếu trung bình sửa đổi 553 dòng trên bảy tệp. Một bộ xác thực điển hình có bảy bài kiểm tra cho hành vi mới và 10 bài kiểm tra hồi quy. Mười chín tác vụ khởi chạy một máy chủ thực tế và ba tác vụ thực thi cổng hiệu suất được hiệu chuẩn trên một H100.

### Một tác vụ trông như thế nào

Một tác vụ yêu cầu agent thêm hỗ trợ phục vụ cho các mô hình Qwen3.5 dạng dày (dense) và hỗn hợp chuyên gia (MoE). Bắt đầu từ một phiên bản không có hỗ trợ Qwen3.5, agent phải làm cho cả mô hình dày 0.8B và mô hình MoE 35B-A3B tải và phục vụ thông qua các giao diện SGLang thông thường trên một H100.

Bộ xác thực của nó kiểm tra việc đăng ký mô hình, cấu hình và tải trọng số, đầu vào hình ảnh và video, các yêu cầu tương thích với OpenAI, tạo theo lô gốc, xác suất log và thực thi thông qua các chuyên gia được định tuyến của mô hình MoE.

### Những gì các bài kiểm tra phục vụ trực tiếp phát hiện

Một số lỗi chỉ xuất hiện khi một máy chủ thực tế khởi động. Đội ngũ SGLang đã đóng góp ý tưởng cho việc xác minh end-to-end, bao gồm các khuyến nghị cho các bài kiểm tra phục vụ mô hình cụ thể. SWE-Serve bao gồm 19 tác vụ tải mô hình cần thiết và kiểm tra bản vá của agent thông qua giao diện phục vụ trực tiếp.

Trên các tác vụ này, 627 bản vá tương tự đạt tỷ lệ thành công 45,9% dưới bộ xác thực hoàn chỉnh. Khi loại bỏ các bài kiểm tra phục vụ trực tiếp, tỷ lệ đó tăng lên 69,4%. Nói cách khác, 147 bản vá đã chuyển từ thất bại sang thành công khi các bài kiểm tra phục vụ trực tiếp bị loại bỏ.

19 tác vụ chứa 276 bài kiểm tra phục vụ trực tiếp. Trong số đó, 242 bài được lấy nguồn hoặc điều chỉnh từ SGLang. 34 bài còn lại bao gồm hành vi được giới thiệu bởi các thay đổi hợp nhất tương ứng khi không có bài kiểm tra upstream phù hợp.

Tác vụ Gemma 4 MoE làm cho kết quả trở nên cụ thể. Mười sáu trong số 33 bản vá đã vượt qua mọi kiểm tra khác nhưng thất bại ít nhất một bài kiểm tra phục vụ trực tiếp. Các bài kiểm tra đó bao gồm tải mô hình, định tuyến chuyên gia, phục vụ văn bản và hình ảnh, và tạo theo lô với thứ tự và xác suất log chính xác.

![Two bar charts compare pass rates: 45.9% with all tests versus 69.4% with model-serving E2E tests excluded; 47.7% on multi-runtime-domain tasks versus 69.0% on single-runtime-domain tasks.](https://developer-blogs.nvidia.com/wp-content/uploads/2026/09/image2-17.webp)

Một lần vượt qua SWE-Serve có ý nghĩa hẹp: bản vá đáp ứng bộ xác thực của benchmark. Các bài kiểm tra của SWE-Serve không phải là quy trình đánh giá upstream của SGLang. Chúng không xác lập rằng một bản vá của agent hoặc giải pháp tham chiếu benchmark là có thể triển khai, sẵn sàng hợp nhất hoặc được những người bảo trì SGLang chứng thực.

### Nơi các agent đạt điểm thấp hơn

Chúng tôi chia đường dẫn từ yêu cầu đến đầu ra thành bốn miền thời gian chạy: xử lý yêu cầu và I/O, lập lịch và vòng đời yêu cầu, thực thi mô hình, và quản lý KV-cache và tài nguyên thời gian chạy.

Trên thiết lập tốt nhất cho mỗi trong số 11 mô hình, 26 tác vụ giới hạn trong một miền thời gian chạy có tỷ lệ vượt qua là 69,0%. 27 tác vụ trải dài hơn một miền thời gian chạy có tỷ lệ vượt qua là 47,7%, chênh lệch 21,3 điểm phần trăm. Mọi thiết lập mô hình đều cho thấy cùng một hướng chênh lệch.

### Hiệu suất thay đổi rộng rãi giữa các mô hình

Hiệu suất mô hình thay đổi đáng kể. Trên cấu hình được kiểm tra tốt nhất của mỗi mô hình, pass@1 trung bình dao động từ 34,6% đến 75,5%. Không có mô hình nào đạt điểm cao nhất trong mọi danh mục tác vụ, và các cấu hình có điểm tổng thể tương tự có thể có chi phí và thời gian chạy rất khác nhau.

Chúng tôi đã đánh giá 11 mô hình và 31 cấu hình nỗ lực mô hình với mini-swe-agent, một agent kỹ thuật phần mềm tối giản chỉ sử dụng Bash, trong điều kiện đóng (closed-book). Chúng tôi đã kiểm tra hai mô hình Claude và ba mô hình GPT-5.6 ở năm mức độ nỗ lực; sáu mô hình còn lại chạy ở một thiết lập mỗi loại.

Mỗi cấu hình chạy benchmark 53 tác vụ hoàn chỉnh ba lần. Mỗi phiên làm việc của agent được giới hạn ở 210 phút và 350 bước. Một tác vụ chỉ được tính là đã giải quyết khi bản vá của agent vượt qua bộ xác thực hoàn chỉnh trên phần cứng đã khai báo của tác vụ. Bảng báo cáo thiết lập nỗ lực đạt điểm cao nhất cho mỗi mô hình.

| Mô hình | Thiết lập suy luận | pass@1 (trung bình ± SD, 3 lần chạy) | Chi phí trung bình/tác vụ | Thời gian thực tế trung bình |
| --- | --- | --- | --- | --- |
| Claude Opus 5 | tối đa | 75% ± 3% | $17.40 | 57,5 phút |
| GPT-5.6 Sol | tối đa | 75% ± 6% | $12.26 | 29,5 phút |
| Claude Sonnet 5 | xcao | 64% ± 3% | $6.61 | 40,6 phút |
| Kimi K3 | tối đa | 64% ± 5% | $7.24 | 99,9 phút |
| GPT-5.6 Luna | tối đa | 64% ± 4% | $0.95 | 28,9 phút |
| GPT-5.6 Terra | tối đa | 64% ± 4% | $5.06 | 25,5 phút |
| DeepSeek V4 Flash (0731) | tối đa | 55% ± 4% | $0.69 | 36,4 phút |
| GLM-5.2 | tối đa | 48% ± 2% | $2.10 | 34,0 phút |
| Gemini 3.6 Flash | cao | 48% ± 6% | $4.84 | 37,3 phút |
| Laguna S 2.1 | tối đa | 46% ± 5% | $0.33 | 56,9 phút |
| Inkling S | rất cao | 35% ± 3% | $0.44 | 17,6 phút |

Bảng 2. Thiết lập suy luận đạt điểm cao nhất cho mỗi mô hình qua ba lần chạy của tất cả 53 tác vụ SWE-Serve. Pass@1 hiển thị giá trị trung bình ± độ lệch chuẩn; chi phí và thời gian thực hiện là giá trị trung bình trên mỗi tác vụ. Chi phí mô hình API sử dụng mức sử dụng token đã ghi lại và giá cố định; chi phí mô hình có thể tải xuống sử dụng ước tính theo giá lưu trữ.

Các bộ công cụ gốc không cải thiện hai mô hình dẫn đầu: GPT-5.6 Sol đạt 73,6% trong Codex và Claude Opus 5 đạt 69,8% trong Claude Code, so với 75,5% của mỗi mô hình khi dùng mini-swe-agent.

Chi phí không tương ứng hoàn toàn với hiệu suất. Trong số bốn mô hình cùng đạt 64%, chi phí trung bình dao động từ 0,95 USD đến 7,24 USD mỗi tác vụ, trong khi thời gian thực hiện trung bình dao động từ 25,5 đến 99,9 phút.

Không có mô hình nào dẫn đầu cả sáu nhóm kỹ thuật, và các mô hình có cùng điểm tổng thể có thể có những thế mạnh khác nhau. Điểm số cao nhất cho thấy nhiều tác vụ SWE-Serve nằm trong khả năng của các tác nhân hiện tại; sự chênh lệch cho thấy hiệu suất còn lâu mới đồng nhất.

### Cách chúng tôi xác thực bộ tiêu chuẩn đánh giá

Chúng tôi đã sàng lọc 786 nguồn tác vụ tiềm năng, xây dựng 156 ứng viên có thể thực thi và chấp nhận 53 tác vụ.

Mọi tác vụ được chấp nhận đều được kiểm thử trên phần cứng đã khai báo. Kho lưu trữ chưa sửa đổi phải thất bại trong các bài kiểm tra đối với hành vi mới trong khi vẫn phải vượt qua các bài kiểm tra hồi quy. Một bản vá tham chiếu phải vượt qua trình xác minh hoàn chỉnh. Chúng tôi cũng thử thách các trình xác minh bằng các bản vá do tác nhân tạo ra, sửa chữa, thu hẹp hoặc loại trừ các tác vụ khi phát hiện vấn đề cụ thể.

Các đánh giá được báo cáo là dạng "closed-book" (không truy cập tài liệu bên ngoài). Chúng tôi chặn web công cộng và các kho lưu trữ nguồn thượng nguồn, đồng thời cho phép truy cập Hugging Face để lấy trọng số mô hình, vì một thử nghiệm mạng mở cho thấy các mô hình đã truy xuất mã nguồn thượng nguồn cụ thể của tác vụ. Chúng tôi đã kiểm toán tất cả 1.749 lượt thử nghiệm đằng sau bảng xếp hạng; 196 nỗ lực truy xuất bị cấm đã bị chặn và không có nỗ lực nào thành công. Bài báo mô tả đầy đủ quy trình kiểm định và tính toàn vẹn của đánh giá.

_Bài gốc còn tiếp._ Xem tiếp tại: <https://developer.nvidia.com/blog/how-swe-serve-exposes-the-gap-between-local-tests-and-live-serving>
