IT Home ITHome
92

Sản phẩm

OpenAI ra mắt API GPT-Live-1: Bước tiến mới cho trợ lý giọng nói thời gian thực

(giờ Việt Nam)

Tóm tắt AI

OpenAI chính thức đưa mô hình GPT-Live-1 vào API, cho phép nhà phát triển xây dựng các trợ lý giọng nói có khả năng phản hồi tức thì, xử lý ngắt lời và tích hợp công cụ thông minh với độ trễ cực thấp.

Bản dịch AI

Theo tin từ IT ngày 11 tháng 9, OpenAI hôm nay thông báo đưa GPT-Live-1 vào API, cho phép các nhà phát triển xây dựng các ứng dụng và quy trình nghiệp vụ hỗ trợ tương tác giọng nói theo thời gian thực. Mô hình này hỗ trợ hội thoại song công (full-duplex), có khả năng vừa lắng nghe vừa phản hồi giọng nói đồng thời, cũng như xử lý các tình huống ngắt lời, tạm dừng và tiếng ồn nền trong quá trình hội thoại.

GPT-Live-1 cũng hỗ trợ các kịch bản gọi điện thoại, có thể được sử dụng cho các tác nhân giọng nói thông minh song công như đặt bàn nhà hàng, dịch vụ khách hàng. OpenAI cho biết, các nhà phát triển có thể kết nối mô hình này với các công cụ như Codex, hoặc thông qua OpenAI Presence để phát triển các tác vụ giọng nói có khả năng truy vấn hệ thống doanh nghiệp, thực hiện các thao tác đã được phê duyệt và chuyển tiếp cho nhân viên con người khi cần thiết.

Theo giới thiệu, GPT-Live-1 tích hợp khả năng hiểu giọng nói và xuất giọng nói trong cùng một mô hình, giúp giảm bớt các bước kết nối trung gian của quy trình truyền thống "chuyển giọng nói thành văn bản — mô hình ngôn ngữ lớn — chuyển văn bản thành giọng nói", từ đó giảm độ trễ. Mô hình này cũng hỗ trợ việc chuyển giao các tác vụ suy luận phức tạp và gọi công cụ cho mô hình văn bản ở phía backend xử lý.

Các nhà phát triển có thể điều chỉnh tông giọng, tốc độ nói và phong cách hội thoại thông qua các câu lệnh hệ thống (system prompts), đồng thời cũng có thể cấu hình các mô hình backend, công cụ và khung tác nhân (agent framework).

OpenAI cho biết, GPT-Live-1 hỗ trợ nhận dạng giọng nói gốc (native speech recognition) để chuyển mã và phản hồi văn bản, đồng thời sở hữu khả năng hiểu chữ và số, ưu tiên từ khóa và phát hiện lượt hội thoại.

Trong các đánh giá ban đầu, nền tảng học ngôn ngữ Speak sau khi sử dụng GPT-Live-1 đã ghi nhận số lần ngắt lời nhầm lẫn trong lúc người học tạm dừng suy nghĩ giảm gần 80% so với hệ thống dựa trên lượt hội thoại trước đây. Tony Stoyanov, đồng sáng lập kiêm Giám đốc công nghệ của một nền tảng dịch vụ y tế, cho biết đội ngũ của ông đã giảm được 80% lượng mã nguồn, loại bỏ khoảng 23.000 dòng code.

Kết quả đánh giá do OpenAI công bố cho thấy, hiệu suất của GPT-Live-1 trong bài kiểm tra Full Duplex Bench cao hơn 30 điểm phần trăm so với GPT-Realtime-2.1, và khi kết hợp với GPT-6 Astra ở cường độ suy luận trung bình, mô hình này xếp hạng nhất trong các bài kiểm tra tác vụ tác nhân giọng nói đầu cuối (end-to-end) Tau3.

Hiện tại, GPT-Live-1 đã có sẵn trên API với mức giá cho lớp giọng nói frontend là 0,05 USD mỗi phút. Tính theo 60 phút mỗi giờ, chi phí riêng cho lớp giọng nói frontend là khoảng 3 USD (Ghi chú của IT: tỷ giá hối đoái hiện tại tương đương khoảng 20,2 nhân dân tệ), chi phí cho mô hình backend và các công cụ tác nhân sẽ được tính riêng.

OpenAI đồng thời mở rộng các tùy chọn giọng nói thời gian thực, bổ sung thêm các giọng như Quartz, Ripple, Vesper, Willow, Stone, Gleam, Meridian, Bossa, Tempo, Beacon, Delta và Cinder, đồng thời có kế hoạch tiếp tục bổ sung thêm giọng nói và hỗ trợ ngôn ngữ trong những tháng tới.

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ IT Home ITHome. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.