Tin ngành
Descript rút ngắn thời gian đánh giá mô hình AI từ một tuần xuống còn hai giờ nhờ OpenRouter
(giờ Việt Nam)
Tóm tắt AI
Nền tảng chỉnh sửa video và âm thanh Descript đã tích hợp OpenRouter để chuẩn hóa quy trình thử nghiệm, giúp đội ngũ đánh giá các mô hình AI mới nhanh chóng và thường xuyên hơn.
Bản dịch AI

Đối với Descript, việc thử nghiệm một mô hình mới từng tốn vài giờ làm việc và một tuần chờ đợi. Đội ngũ đã loại bỏ khoảng thời gian chờ đợi đó. Hiện nay, các đánh giá chỉ mất một hoặc hai giờ để hoàn tất và không ai phải yêu cầu kỹ sư dành thời gian hỗ trợ nữa. Kiến trúc đầy đủ đã được trình bày trong nghiên cứu điển hình (case study) của Descript.
Khi quyền truy cập mô hình được kết nối riêng lẻ với từng nhà cung cấp, việc thử nghiệm một mô hình mới bắt đầu bằng các công việc kỹ thuật. Khi người muốn thử nghiệm mô hình không phải là người có quyền thêm mô hình đó vào hệ thống, yêu cầu phải được giải thích, lên lịch và chờ đợi. Đó là một vấn đề về hàng đợi, và tại Descript, nó đã giới hạn số lượng mô hình mà đội ngũ có thể thử nghiệm.
Cái giá mà Descript phải trả cho hàng đợi
Descript, nền tảng chỉnh sửa video và âm thanh AI, đã gặp phải tình trạng này khi xây dựng Underlord, tác nhân (agent) chỉnh sửa video của họ. Trước khi có OpenRouter, đội ngũ phải duy trì ba tích hợp trực tiếp với OpenAI, Anthropic và Google, đồng thời tự viết logic dự phòng (fallback logic) giữa chúng. Việc thêm một mô hình mất vài giờ. Để đưa những giờ làm việc đó vào lịch trình của một kỹ sư lại mất vài ngày, vì vậy một mô hình tiềm năng có thể bị bỏ ngỏ cả tuần trước khi bất kỳ ai biết liệu nó có đáng để theo đuổi hay không.
Phần tốn kém nhất chính là sự chờ đợi. Đội ngũ chỉ thử nghiệm những mô hình đủ quan trọng để làm gián đoạn công việc của một kỹ sư và bỏ qua những mô hình còn lại.
Cách Descript đánh giá mô hình hiện nay
Aleks Mistratov, Trưởng bộ phận Sản phẩm AI tại Descript, mô tả quy trình hiện tại.
“Tôi đang đi dạo, tôi thường xuyên online đến mức có hại cho bản thân, và tôi thấy một dòng tweet thông báo về một mô hình mới. Tôi vào Slack và nói: hãy chạy đánh giá (evals) trên mô hình này qua OpenRouter, kèm theo đường link. Một hoặc hai giờ sau, chúng tôi đã chạy xong các đánh giá trong hệ thống của mình trên mô hình đó.”
Cơ chế này là Claude Tag, tích hợp Slack của Anthropic mà Descript đã cấu hình cho quy trình này. Nó chạy các đánh giá và mở các pull request, sau đó con người sẽ xem xét và phê duyệt.
Điều giúp quy trình làm việc đó có thể tự động hóa là việc thử nghiệm một mô hình không còn đòi hỏi phải xây dựng tích hợp với nhà cung cấp trước. Kiểm thử không có nghĩa là phải mở mối quan hệ với nhà cung cấp hay kết nối thêm một API endpoint. Vẫn có công việc cần thực hiện, nhưng không ai phải bị làm phiền vì điều đó nữa.
Những thay đổi từ việc đánh giá hàng tuần
Descript hiện đánh giá các mô hình nhiều lần mỗi tuần. Hầu hết những gì đội ngũ thử nghiệm đều không được đưa vào sản phẩm chính thức. Ba điều rút ra từ đó là:
Việc lựa chọn mô hình dựa trên thực nghiệm. Descript đo lường các bản phát hành mới dựa trên các trường hợp kiểm thử của riêng mình và thay đổi những gì họ cung cấp khi có mô hình đạt chuẩn. Giải pháp thay thế mà đội ngũ từng có trước đây là chuẩn hóa trên một mô hình từ sớm và chỉ xem xét lại quyết định khi có yếu tố bắt buộc.
Các bản phát hành mới không còn là những sự kiện lớn. Với một bản phát hành gần đây của Anthropic, Descript đã chuyển từ thông báo sang triển khai thực tế chỉ trong vài giờ. Các bước còn lại đều nằm trong nội bộ. Chạy đánh giá, quyết định xem mô hình mới có vượt trội hơn mô hình hiện tại không, thêm nó vào bộ chọn mô hình và triển khai. Hầu hết công việc đó đến từ cách cấu trúc mã nguồn của chính Descript thay vì từ kết nối với mô hình.
Lĩnh vực này đã được mở rộng. Descript chưa bao giờ xây dựng tích hợp trực tiếp với xAI. Grok 4.5 hiện đang chạy trong môi trường sản xuất, được thêm vào thông qua cùng một lộ trình như mọi mô hình khác.
Cách Descript vận hành các mô hình mà họ cam kết sử dụng
Điều này không có nghĩa là định tuyến mọi thứ qua một endpoint dùng chung và chấp nhận bất cứ kết quả nào trả về. Descript sử dụng khóa riêng của mình trên Baseten để triển khai chuyên biệt một mô hình mã nguồn mở (open-weight model), với OpenRouter định tuyến đến Baseten trước và các nhà cung cấp khác được cấu hình làm dự phòng phía sau. Các dự phòng đó thay thế nhà cung cấp suy luận (inference provider) nhưng giữ nguyên mô hình, vì vậy sự cố tại một máy chủ không làm thay đổi mô hình nào đưa ra câu trả lời.
Lời khuyên của Mistratov dành cho một kỹ sư khác đang cân nhắc thay đổi tương tự rất ngắn gọn.
“Nó dễ dàng hơn nhiều so với việc cố gắng tìm hiểu tất cả các kết nối khác nhau này. Bạn chỉ cần làm một lần và mọi thứ khác chỉ là tham số.”
Descript sử dụng cùng một tích hợp để thử nghiệm các mô hình mới và vận hành các mô hình mà họ giữ lại. Kiểm thử là cách đội ngũ tìm ra mô hình phù hợp. Cấu hình định tuyến là cách họ vận hành mô hình đó.
Đọc nghiên cứu điển hình
Nghiên cứu điển hình của Descript chứa phần còn lại của kiến trúc, bao gồm cách Descript thiết lập ưu tiên nhà cung cấp suy luận cho từng mô hình, điều gì xảy ra khi một nhà cung cấp bị suy giảm hiệu năng giữa lúc lưu lượng truy cập cao, và công việc trực kỹ thuật (on-call) của đội ngũ hiện trông như thế nào.
Bài viết được AI dịch và tổng hợp tự động từ OpenRouter: Announcements. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.