OpenAI mở API cho mô hình giọng nói GPT-Live-1
Tổng quan sự kiện
Toàn cảnh do AI tổng thuật
OpenAI thông báo đưa mô hình giọng nói song công GPT-Live-1 vào API, cho phép các nhà phát triển xây dựng những ứng dụng có khả năng vừa lắng nghe vừa phản hồi bằng giọng nói cùng lúc. Mô hình này trước đó đã được áp dụng trên ChatGPT, với các khả năng cốt lõi bao gồm: xử lý ngắt lời cải tiến, ủy quyền suy luận và gọi công cụ cho các mô hình backend (như GPT-6 Astra), cũng như kiểm soát ngữ điệu, nhịp độ và phong cách của tác nhân giọng nói thông qua lời nhắc hệ thống (system prompt).
Theo dữ liệu đánh giá từ OpenAI, GPT-Live-1 đạt hiệu suất cao hơn 30 điểm phần trăm so với thế hệ tiền nhiệm GPT-Realtime-2.1 trong bài kiểm tra Full Duplex Bench. Khi kết hợp với GPT-6 Astra ở cường độ suy luận trung bình, mô hình này đứng đầu trong các bài kiểm tra tác nhân giọng nói đầu cuối Tau3. Trong các đánh giá sớm, nền tảng học ngôn ngữ Speak cho biết sau khi sử dụng mô hình này, số lần ngắt lời nhầm lẫn trong lúc người học tạm dừng suy nghĩ đã giảm gần 80% so với hệ thống dựa trên lượt phản hồi trước đây.
Lớp giọng nói giao diện người dùng của GPT-Live-1 có giá 0,05 USD mỗi phút, chi phí cho mô hình backend và các công cụ tác nhân sẽ được tính riêng. Mô hình cũng mở rộng các tùy chọn giọng nói, cung cấp 12 giọng mới bao gồm nhiều ngữ điệu, phương ngữ và ngôn ngữ khác nhau, đồng thời hỗ trợ nhận dạng giọng nói, chuyển đổi văn bản và phản hồi bằng văn bản gốc. OpenAI cho biết sẽ tiếp tục mở rộng các tùy chọn giọng nói và khả năng hỗ trợ ngôn ngữ trong những tháng tới.
Tổng thuật do AI tổng hợp từ toàn bộ bài đưa tin, cập nhật theo diễn biến · làm mới T2 · 14/09 · 11:27.
Diễn biến mới nhất
OpenAI chính thức phát hành mô hình giọng nói song công (full-duplex) GPT-Live-1 thông qua API. Các nhà phát triển hiện có thể sử dụng công nghệ song công tương tự như trên ChatGPT để xây dựng ứng dụng, với mức giá cho lớp giọng nói giao diện người dùng là 0,05 USD mỗi phút.
Chính chủ · 2 bài
Nghe trực tiếp từ bên liên quan
- X: OpenAI Developers (@OpenAIDevs)OpenAI mở API cho mô hình giọng nói GPT-Live-1
- OpenAI: Tin chính thức (RSS - lọc nội dung doanh nghiệp/khách hàng)OpenAI ra mắt mô hình giọng nói song công GPT-Live-1 trên API
Dòng thời gian đưa tin
Đang hiện 12 bài · tất cả · mới trước
T2 · 14/09
Bản tin sáng BestBlogs: Việc áp dụng AI là hiệu ứng lựa chọn, đội ngũ Evernote tinh gọn còn 50-60 người giúp tăng tốc độ gấp ba lần, Claude Code bị kỹ sư dịch ngược phát hiện Antspace
X: Hongming (@hongming731)Một bài phân tích sử dụng 40 nghìn tài khoản để mô phỏng cho thấy mức tăng "tỷ lệ giữ chân +15,4 điểm phần trăm" của trợ lý AI gần như hoàn toàn là do hiệu ứng lựa chọn, trong khi phương pháp hồi quy điểm gián đoạn (RDD) ước tính hiệu ứng thực tế chỉ khoảng +4,9 điểm phần trăm. Đồng sáng lập Bending Spoons cho biết sau khi mua lại Evernote, đội ngũ đã giảm từ khoảng 350 người xuống còn 50-60 người, giúp tốc độ lặp lại sản phẩm nhanh hơn ít nhất ba lần. Ngoài ra, một kỹ sư đã dịch ngược phiên bản web của Claude Code và phát hiện ra Antspace, một nền tảng lưu trữ chưa được Anthropic công bố.
Bản tin sáng BestBlogs: Claude Code chạy runtime ngược và GPT-Live 1 chính thức ra mắt
X: Hongming (@hongming731)Bản tin sáng ngày 14-09 của BestBlogs tổng hợp 10 nội dung, trong đó tác giả đã thực hiện lệnh strace đối với PID 1 của phiên làm việc Claude Code trên web và phát hiện môi trường chạy là Firecracker MicroVM. Đồng thời, tác giả cũng tìm ra nền tảng lưu trữ ứng dụng chưa công bố của Anthropic là Antspace, đây cũng là mục tiêu triển khai mặc định của trình xây dựng Baku trên http://claude.ai.
T6 · 11/09
Agora tích hợp GPT-Live-1 vào Copilot họp trực tuyến mã nguồn mở
X: Testing Catalog (@testingcatalog)Agora đã triển khai GPT-Live-1 vào Copilot họp AI mã nguồn mở của mình. Copilot này có thể tham gia cuộc gọi video như một người tham dự và sẽ phản hồi khi nghe thấy từ khóa "Copilot". Nó có khả năng ghi chép thời gian thực toàn bộ cuộc gọi, trả lời câu hỏi trong cuộc họp, tóm tắt thảo luận và thêm nhiệm vụ vào bảng Kanban. Tính năng này được vận hành bởi Agora RTC, Conversational AI và API GPT-Live-1 của OpenAI.
Bản tin AI hàng ngày: OpenAI ra mắt tác nhân giọng nói song công toàn phần GPT-Live-1
X: Testing Catalog (@testingcatalog)OpenAI đã đưa tác nhân giọng nói song công toàn phần GPT-Live-1 lên API, cho phép vừa nghe vừa nói đồng thời chuyển giao tác vụ cho các mô hình khác; Agents API cũng đã bắt đầu giai đoạn thử nghiệm công khai. Phiên bản ChatGPT dành cho dịch vụ tài chính đã được ra mắt cho các tổ chức đủ điều kiện, bao gồm chế độ làm việc và GPT-6 Astra; do nhu cầu về Astra gây áp lực lên dung lượng hệ thống, gói Pro 200 USD hiện tạm dừng đăng ký mới.
OpenAI mở API cho mô hình giọng nói GPT-Live-1
X: Sherwin Wu (@sherwinwu)OpenAI thông báo GPT-Live-1 đã khả dụng trên API, cho phép các nhà phát triển xây dựng ứng dụng giọng nói riêng dựa trên công nghệ song công (duplex) tương tự như tính năng giọng nói trên phiên bản ChatGPT mới. Các tác nhân giọng nói (voice agent) này có khả năng vừa lắng nghe vừa phản hồi trong thời gian thực, đồng thời hỗ trợ nhà phát triển tùy chọn mô hình và harness theo nhu cầu.
OpenAI đưa GPT-Live-1 vào API, hỗ trợ đàm thoại song công, xử lý ngắt lời và gọi công cụ
IT HomeOpenAI thông báo GPT-Live-1 đã có mặt trên API, hỗ trợ đối thoại song công, xử lý ngắt lời và lọc tiếng ồn nền. Công nghệ này có thể ứng dụng cho các tổng đài viên thông minh, đồng thời tích hợp khả năng hiểu và phản hồi giọng nói trong cùng một mô hình để giảm thiểu độ trễ.
Mô hình giọng nói GPT-Live-1 đã có mặt trên OpenAI API
X: Greg Brockman (@gdb)GPT-Live-1 hiện đã có mặt trên OpenAI API. Các nhà phát triển có thể mang trải nghiệm hội thoại tự nhiên như ChatGPT vào ứng dụng của mình, xây dựng các đại lý giọng nói thông minh có khả năng vừa nghe vừa nói, đồng thời tùy chọn mô hình và khung hỗ trợ (harness) đi kèm.
OpenAI ra mắt GPT-Live-1 trên API và OpenAI Platform
X: Testing Catalog (@testingcatalog)OpenAI đã mở quyền truy cập GPT-Live-1 thông qua API và OpenAI Platform, mang trải nghiệm hội thoại giọng nói song công (full-duplex) tự nhiên như ChatGPT đến với các nhà phát triển. Các tác nhân giọng nói (voice agents) giờ đây có thể vừa nghe vừa nói, đồng thời có khả năng ủy thác nhiệm vụ cho các mô hình khác do người dùng lựa chọn.
OpenAI mở API cho mô hình giọng nói GPT-Live-1
X: Tibo (@thsottiaux)OpenAI mở API cho GPT-Live-1, mang hệ thống giọng nói đã phục vụ 1 tỷ người dùng của ChatGPT đến với các nhà phát triển, hỗ trợ tính năng vừa nói vừa nghe, có thể kết hợp với các mô hình và công cụ tùy chọn. Tác giả cho rằng sự kết hợp giữa tính năng song công và gọi công cụ mang lại nhiều khả năng ứng dụng, khiến việc quay lại trải nghiệm thuần văn bản trở nên khó khăn hơn.
OpenAI mở API cho mô hình giọng nói GPT-Live-1, hỗ trợ tính năng song công vừa nghe vừa nói
The Decoder: AI NewsOpenAI cung cấp mô hình giọng nói GPT-Live-1 dưới dạng API cho các nhà phát triển, hỗ trợ tính năng song công vừa nghe vừa nói với mức giá 0,05 USD mỗi phút. So với GPT-Realtime-2.1, điểm số kiểm tra tương tác song công đạt 80,1% so với 45,4%, độ trễ lượt phản hồi giảm từ 1,4 giây xuống 0,8 giây, độ chính xác khi gọi công cụ tăng từ 60% lên 87% và tỷ lệ vượt qua bài kiểm tra hỗ trợ giọng nói ngân hàng tăng từ 12,4% lên 32%.
OpenAI mở API cho mô hình giọng nói GPT-Live-1
X: OpenAI Developers (@OpenAIDevs)Chính chủOpenAI thông báo GPT-Live-1 hiện đã khả dụng trên API. Các nhà phát triển có thể tích hợp trải nghiệm hội thoại tự nhiên như ChatGPT vào ứng dụng của mình; các tác nhân giọng nói (voice agent) có thể vừa nghe vừa nói, đồng thời hỗ trợ kết hợp với các mô hình và công cụ tùy chọn của người dùng.
OpenAI ra mắt mô hình giọng nói song công GPT-Live-1 trên API
OpenAI: Tin chính thức (RSS - lọc nội dung doanh nghiệp/khách hàng)Chính chủOpenAI vừa phát hành mô hình giọng nói GPT-Live-1 thông qua API, cho phép vừa nghe vừa nói đồng thời. Mô hình này hỗ trợ ủy quyền các tác vụ suy luận và gọi công cụ cho các mô hình backend như GPT-6 Astra, với mức giá cho lớp giọng nói frontend là $0,05 mỗi phút.