OpenAI ra mắt mô hình giọng nói song công (full-duplex) GPT-Live-1 thông qua API, với mức giá 0,05 USD mỗi phút cho lớp giọng nói giao diện người dùng, đồng thời sẽ mở rộng thêm các tùy chọn về giọng nói và ngôn ngữ
Tổng quan sự kiện
Toàn cảnh do AI tổng thuật
OpenAI thông báo phát hành mô hình giọng nói song công (full-duplex) GPT-Live-1 thông qua API. Mô hình này có khả năng vừa nghe vừa phản hồi giọng nói cùng lúc, hỗ trợ các nhà phát triển xây dựng những ứng dụng tương tác bằng giọng nói tự nhiên hơn. OpenAI cho biết GPT-Live-1 hiện đã khả dụng trên API, với mức giá cho lớp giọng nói giao diện người dùng là 0,05 USD mỗi phút, chi phí cho mô hình backend và các công cụ tác nhân (agent) sẽ được tính riêng.
GPT-Live-1 sở hữu nhiều năng lực mới, bao gồm khả năng xử lý ngắt lời được cải thiện, ủy quyền suy luận và gọi công cụ cho các mô hình văn bản backend (như GPT-6 Astra hoặc các mô hình bên thứ ba), cũng như định hình tông giọng, nhịp điệu và phong cách cho tác nhân giọng nói thông qua các chỉ dẫn hệ thống (system prompt). OpenAI khẳng định trong các đánh giá của mình, GPT-Live-1 đạt hiệu suất cao hơn 30 điểm phần trăm so với GPT-Realtime-2.1 trong bài kiểm tra Full Duplex Bench. Khi kết hợp với GPT-6 Astra ở cường độ suy luận trung bình, mô hình này xếp hạng nhất trong các bài kiểm tra tác nhân giọng nói đầu cuối Tau3.
Mô hình này cũng mở rộng các tùy chọn giọng nói, cung cấp sự lựa chọn đa dạng hơn bao gồm nhiều ngữ điệu, phương ngữ và ngôn ngữ khác nhau. OpenAI cho biết sẽ tiếp tục mở rộng các tùy chọn giọng nói và ngôn ngữ trong những tháng tới. Trong các đánh giá sớm, nền tảng học ngôn ngữ Speak ghi nhận số lần ngắt lời nhầm lẫn trong lúc người học tạm dừng suy nghĩ đã giảm gần 80% so với các hệ thống dựa trên lượt phản hồi trước đây. Tony Stoyanov, đồng sáng lập kiêm Giám đốc công nghệ của một nền tảng dịch vụ y tế, cho biết đội ngũ của ông đã giảm được 80% khối lượng mã nguồn, loại bỏ khoảng 23 nghìn dòng code.
Tổng thuật do AI tổng hợp từ toàn bộ bài đưa tin, cập nhật theo diễn biến · làm mới T6 · 11/09 · 16:30.
Diễn biến mới nhất
Xem chi tiết toàn cảnh sự việc tại đây.
Chính chủ · 2 bài
Nghe trực tiếp từ bên liên quan
- X: OpenAI Developers (@OpenAIDevs)OpenAI mở API cho mô hình giọng nói GPT-Live-1
- OpenAI: Tin chính thức (RSS - lọc nội dung doanh nghiệp/khách hàng)OpenAI ra mắt mô hình giọng nói song công GPT-Live-1 trên API
Dòng thời gian đưa tin
Đang hiện 9 bài · tất cả · mới trước
T6 · 11/09
Bản tin AI hàng ngày: OpenAI ra mắt tác nhân giọng nói song công toàn phần GPT-Live-1
X: Testing Catalog (@testingcatalog)OpenAI đã đưa tác nhân giọng nói song công toàn phần GPT-Live-1 lên API, cho phép vừa nghe vừa nói đồng thời chuyển giao tác vụ cho các mô hình khác; Agents API cũng đã bắt đầu giai đoạn thử nghiệm công khai. Phiên bản ChatGPT dành cho dịch vụ tài chính đã được ra mắt cho các tổ chức đủ điều kiện, bao gồm chế độ làm việc và GPT-6 Astra; do nhu cầu về Astra gây áp lực lên dung lượng hệ thống, gói Pro 200 USD hiện tạm dừng đăng ký mới.
OpenAI mở API cho mô hình giọng nói GPT-Live-1
X: Sherwin Wu (@sherwinwu)OpenAI thông báo GPT-Live-1 đã khả dụng trên API, cho phép các nhà phát triển xây dựng ứng dụng giọng nói riêng dựa trên công nghệ song công (duplex) tương tự như tính năng giọng nói trên phiên bản ChatGPT mới. Các tác nhân giọng nói (voice agent) này có khả năng vừa lắng nghe vừa phản hồi trong thời gian thực, đồng thời hỗ trợ nhà phát triển tùy chọn mô hình và harness theo nhu cầu.
OpenAI đưa GPT-Live-1 vào API, hỗ trợ đàm thoại song công, xử lý ngắt lời và gọi công cụ
IT HomeOpenAI thông báo GPT-Live-1 đã có mặt trên API, hỗ trợ đối thoại song công, xử lý ngắt lời và lọc tiếng ồn nền. Công nghệ này có thể ứng dụng cho các tổng đài viên thông minh, đồng thời tích hợp khả năng hiểu và phản hồi giọng nói trong cùng một mô hình để giảm thiểu độ trễ.
Mô hình giọng nói GPT-Live-1 đã có mặt trên OpenAI API
X: Greg Brockman (@gdb)GPT-Live-1 hiện đã có mặt trên OpenAI API. Các nhà phát triển có thể mang trải nghiệm hội thoại tự nhiên như ChatGPT vào ứng dụng của mình, xây dựng các đại lý giọng nói thông minh có khả năng vừa nghe vừa nói, đồng thời tùy chọn mô hình và khung hỗ trợ (harness) đi kèm.
OpenAI ra mắt GPT-Live-1 trên API và OpenAI Platform
X: Testing Catalog (@testingcatalog)OpenAI đã mở quyền truy cập GPT-Live-1 thông qua API và OpenAI Platform, mang trải nghiệm hội thoại giọng nói song công (full-duplex) tự nhiên như ChatGPT đến với các nhà phát triển. Các tác nhân giọng nói (voice agents) giờ đây có thể vừa nghe vừa nói, đồng thời có khả năng ủy thác nhiệm vụ cho các mô hình khác do người dùng lựa chọn.
OpenAI mở API cho mô hình giọng nói GPT-Live-1
X: Tibo (@thsottiaux)OpenAI mở API cho GPT-Live-1, mang hệ thống giọng nói đã phục vụ 1 tỷ người dùng của ChatGPT đến với các nhà phát triển, hỗ trợ tính năng vừa nói vừa nghe, có thể kết hợp với các mô hình và công cụ tùy chọn. Tác giả cho rằng sự kết hợp giữa tính năng song công và gọi công cụ mang lại nhiều khả năng ứng dụng, khiến việc quay lại trải nghiệm thuần văn bản trở nên khó khăn hơn.
OpenAI mở API cho mô hình giọng nói GPT-Live-1, hỗ trợ tính năng song công vừa nghe vừa nói
The Decoder: AI NewsOpenAI cung cấp mô hình giọng nói GPT-Live-1 dưới dạng API cho các nhà phát triển, hỗ trợ tính năng song công vừa nghe vừa nói với mức giá 0,05 USD mỗi phút. So với GPT-Realtime-2.1, điểm số kiểm tra tương tác song công đạt 80,1% so với 45,4%, độ trễ lượt phản hồi giảm từ 1,4 giây xuống 0,8 giây, độ chính xác khi gọi công cụ tăng từ 60% lên 87% và tỷ lệ vượt qua bài kiểm tra hỗ trợ giọng nói ngân hàng tăng từ 12,4% lên 32%.
OpenAI mở API cho mô hình giọng nói GPT-Live-1
X: OpenAI Developers (@OpenAIDevs)Chính chủOpenAI thông báo GPT-Live-1 hiện đã khả dụng trên API. Các nhà phát triển có thể tích hợp trải nghiệm hội thoại tự nhiên như ChatGPT vào ứng dụng của mình; các tác nhân giọng nói (voice agent) có thể vừa nghe vừa nói, đồng thời hỗ trợ kết hợp với các mô hình và công cụ tùy chọn của người dùng.
OpenAI ra mắt mô hình giọng nói song công GPT-Live-1 trên API
OpenAI: Tin chính thức (RSS - lọc nội dung doanh nghiệp/khách hàng)Chính chủOpenAI vừa phát hành mô hình giọng nói GPT-Live-1 thông qua API, cho phép vừa nghe vừa nói đồng thời. Mô hình này hỗ trợ ủy quyền các tác vụ suy luận và gọi công cụ cho các mô hình backend như GPT-6 Astra, với mức giá cho lớp giọng nói frontend là $0,05 mỗi phút.