Hôm qua · 27/09

Chủ Nhật · 1 tin
The Decoder: AI News
Sản phẩmĐiểm AI 56/100

Nvidia ra mắt mô hình mã nguồn mở Nemotron 3 Diarization: Phân tách giọng nói thời gian thực cho 8 người

Nvidia vừa phát hành mô hình Nemotron 3 Diarization với 100 triệu tham số, cho phép nhận diện và phân tách giọng nói của tối đa 8 người cùng lúc trong thời gian thực, hỗ trợ cả ghi âm và luồng âm thanh trực tiếp.

23/09

Thứ Tư · 1 tin
PixVerse@PixVerse
Mô hìnhĐiểm AI 40/100

PixVerse R2: Mô hình thế giới thời gian thực cho phép tương tác và kiến tạo môi trường

Take the wheel and drive across open terrain. #PixVerseWorldModel Change the world without stopping….

DịchPixVerse R2 là mô hình thế giới thời gian thực mới, cho phép người dùng điều khiển, chỉnh sửa môi trường và tương tác với các nhân vật có khả năng ghi nhớ thông qua câu lệnh.

20/09

Chủ Nhật · 1 tin
MarkTechPost
Mô hìnhĐiểm AI 63/100

Cùng sự kiệnAlibaba ra mắt Qwen3.8-LiveTranslate: Phiên dịch thời gian thực với độ trễ chỉ 2,3 giây

Đội ngũ Qwen của Alibaba vừa giới thiệu mô hình Qwen3.8-LiveTranslate với kiến trúc Interleave mới, giúp giảm độ trễ phiên dịch xuống còn 2,3 giây và hỗ trợ lên đến 60 ngôn ngữ.

Cùng sự kiện, bài đại diện «Alibaba ra mắt Qwen3.8-LiveTranslate: Mô hình dịch thuật trực tiếp với độ trễ chỉ 2,3 giây»

19/09

Thứ Bảy · 1 tin
IT Home
Mô hìnhĐiểm AI 63/100

Cùng sự kiệnAlibaba ra mắt Qwen3.8-LiveTranslate: Mô hình thông dịch trực tiếp với độ trễ cực thấp

Alibaba giới thiệu Qwen3.8-LiveTranslate, mô hình thông dịch thời gian thực sử dụng kiến trúc Hybrid MoE Thinker-Talker, giúp giảm độ trễ trung bình xuống còn 2,3 giây.

Cùng sự kiện, bài đại diện «Qwen ra mắt mô hình dịch thuật trực tiếp Qwen3.8-LiveTranslate»

15/09

Thứ Ba · 1 tin
Hugging Face Daily Papers
Nghiên cứuĐiểm AI 88/100

Tinh chọnRealtime-Venus: Hệ thống tương tác song công thời gian thực với cơ chế ủy quyền bất đồng bộ

Realtime-Venus là hệ thống tương tác đa phương thức sử dụng mô hình 9B, cho phép duy trì hội thoại liên tục trong khi thực hiện các tác vụ phức tạp ở chế độ nền nhờ cơ chế ủy quyền bất đồng bộ.

Thêm 1 nguồn khác đưa tinAnt Group inclusionAI: GitHub kho mã mới

Vì sao đáng đọc: Bước tiến quan trọng trong việc tối ưu hóa trải nghiệm hội thoại thời gian thực, giải quyết được bài toán xử lý đa nhiệm mà không làm gián đoạn tương tác của người dùng.

14/09

Thứ Hai · 1 tin
StepFun@StepFun_ai
NgànhĐiểm AI 22/100

StepFun tổ chức sự kiện trải nghiệm StepAudio 3 tại San Francisco

We're bringing StepAudio 3 to San Francisco this Wednesday. Live demos, an open AMA with the StepAud…

DịchStepFun mang StepAudio 3 đến San Francisco vào ngày 16/9 với các buổi demo trực tiếp, tọa đàm cùng chuyên gia về tương lai của AI thời gian thực và các giải pháp thực tế trong sản xuất.

11/09

Thứ Sáu · 3 tin
OpenAI Developers@OpenAIDevs
Sản phẩmĐiểm AI 52/100

OpenAI ra mắt GPT-Live-1: Trợ lý giọng nói thời gian thực cho phép ngắt lời tự nhiên

Restaurant reservations don't always follow a script. GPT-Live-1 listens while it speaks, so caller…

DịchOpenAI giới thiệu GPT-Live-1 với khả năng lắng nghe và phản hồi tức thì, cho phép người dùng ngắt lời hoặc thay đổi yêu cầu linh hoạt. Yelp đã ứng dụng công nghệ này để tối ưu hóa trải nghiệm đặt bàn tại nhà hàng.

IT Home
Mô hìnhĐiểm AI 72/100

Cùng sự kiệnOpenAI ra mắt API GPT-Live-1: Hỗ trợ đàm thoại giọng nói thời gian thực, ngắt lời và gọi công cụ

OpenAI chính thức đưa GPT-Live-1 vào API, cho phép xây dựng các trợ lý giọng nói có độ trễ thấp, hỗ trợ đàm thoại hai chiều, xử lý ngắt lời và tích hợp gọi công cụ linh hoạt.

Cùng sự kiện, tinh chọn hiển thị «OpenAI ra mắt mô hình giọng nói song công GPT-Live-1 qua API»
OpenAI Developers@OpenAIDevs
Sản phẩmĐiểm AI 67/100

Cùng sự kiệnOpenAI chính thức mở API cho mô hình giọng nói GPT-Live-1

GPT-Live-1 is now available in the API. Bring ChatGPT's natural back-and-forth to your app, with vo…

DịchOpenAI vừa ra mắt API cho GPT-Live-1, cho phép các nhà phát triển tích hợp trải nghiệm hội thoại tự nhiên như ChatGPT vào ứng dụng, hỗ trợ tính năng vừa nghe vừa nói cùng khả năng tùy biến mô hình linh hoạt.

Cùng sự kiện, tinh chọn hiển thị «OpenAI ra mắt mô hình giọng nói song công GPT-Live-1 qua API»

10/09

Thứ Năm · 1 tin
Elvis Saravia@omarsar0
Mô hìnhĐiểm AI 61/100

Robbyant ra mắt mô hình thế giới LingBot-World 2.0 Small 1.3B: Chạy thời gian thực trên GPU phổ thông

It's crazy how far small models can be pushed. Robbyant just open-sourced LingBot-World 2.0 Small, …

DịchRobbyant vừa mã nguồn mở LingBot-World 2.0 Small, mô hình thế giới 1.3B có khả năng tạo môi trường tương tác thời gian thực ở độ phân giải 720p/60fps trên GPU tiêu dùng, mở ra hướng đi mới cho việc tối ưu hóa mô hình AI trên phần cứng cá nhân.

09/09

Thứ Tư · 2 tin

08/09

Thứ Ba · 1 tin
Rohan Paul@rohanpaul_ai
NgànhĐiểm AI 50/100

Cartesia thống trị bảng xếp hạng Voice AI với bộ đôi Sonic-3.6 và Ink-2

There is a subtle architecture shift happening in voice AI. The voice stack is becoming part of the…

DịchCartesia vừa ra mắt Sonic-3.6 (Text-to-Speech) và Ink-2 (Speech-to-Text) với độ trễ cực thấp lần lượt là 90ms và 100ms, trở thành đơn vị duy nhất dẫn đầu cả hai mảng xử lý âm thanh, tối ưu hóa mạnh mẽ cho các tác nhân AI đàm thoại.

03/09

Thứ Năm · 1 tin
Kim@kimmonismus
Mô hìnhĐiểm AI 50/100

Inworld ra mắt Realtime TTS-2: Đứng đầu bảng xếp hạng giọng nói AI của Artificial Analysis

Inworld's Realtime TTS-2 is now generally available and currently ranks #1 in Artificial Analysis' C…

DịchInworld chính thức phát hành Realtime TTS-2, mô hình được đánh giá nhanh nhất phân khúc trên Artificial Analysis. Người dùng có thể tùy chỉnh cảm xúc và ngữ điệu linh hoạt thông qua mô tả văn bản, dựa trên những phản hồi tích cực từ phiên bản thử nghiệm trước đó.

Thêm 1 nguồn khác đưa tinX: Artificial Analysis (@ArtificialAnlys)

02/09

Thứ Tư · 2 tin
Rohan Paul@rohanpaul_ai
Mô hìnhĐiểm AI 59/100

Cùng sự kiệnMeta ra mắt Muse Voice Transcribe: Mô hình chuyển đổi giọng nói thành văn bản thời gian thực

Love this, another huge release from Meta. Lunched Muse Voice Transcribe for real-time voice dicta…

DịchMeta vừa giới thiệu Muse Voice Transcribe, mô hình nhận diện âm thanh thời gian thực với độ chính xác cao (tỷ lệ lỗi từ chỉ 3,1%). Công nghệ này tích hợp khả năng phân tách người nói và phát hiện điểm dừng tự động, mang lại trải nghiệm xử lý luồng âm thanh mượt mà.

Cùng sự kiện, bài đại diện «Meta ra mắt Muse Voice Transcribe: Mô hình nhận diện âm thanh thời gian thực đột phá»
AI at Meta@AIatMeta
Mô hìnhĐiểm AI 61/100

Meta ra mắt Muse Voice Transcribe: Mô hình nhận diện âm thanh thời gian thực đột phá

Introducing Muse Voice Transcribe, the first real-time audio perception model from Meta Superintelli…

DịchMeta giới thiệu Muse Voice Transcribe, mô hình nhận diện giọng nói thời gian thực hỗ trợ đa ngôn ngữ, phân tách người nói và chuyển đổi ngôn ngữ linh hoạt. Công nghệ này hiện dẫn đầu các bảng xếp hạng về khả năng chuyển đổi giọng nói thành văn bản.

Thêm 7 nguồn khác đưa tinIT HomeX: Rohan Paul (@rohanpaul_ai)MarkTechPostX: Alexandr Wang (Scale AI nhà sáng lập/Meta Giám đốc AI) (@alexandr_wang)X: Artificial Analysis (@ArtificialAnlys)X: Testing Catalog (@testingcatalog)X: Mark Zuckerberg (@finkd)

01/09

Thứ Ba · 1 tin
OpenRouter@OpenRouter
Mô hìnhĐiểm AI 57/100

Mô hình suy luận Mercury 2.5 Preview ra mắt trên OpenRouter: Tốc độ ấn tượng 1.107 token/giây

1/ The fastest reasoning LLM is now live exclusively on OpenRouter. Mercury 2.5 Preview from @_ince…

DịchMercury 2.5 Preview vừa cập bến OpenRouter với khả năng tạo token song song, đạt tốc độ kỷ lục 1.107 token/giây, tối ưu hóa cho các tác vụ yêu cầu độ trễ cực thấp và xử lý JSON chính xác.

28/08

Thứ Sáu · 1 tin

24/08

Thứ Hai · 1 tin
cb_doge@cb_doge
Hướng dẫnĐiểm AI 37/100

Grok Build: Điều khiển hiệu ứng hình ảnh thời gian thực bằng cử chỉ tay

Grok Build is incredible 🔥 I just built this interactive visual that I can control with my hands. …

DịchGrok Build cho phép người dùng tương tác trực tiếp với các hiệu ứng hình ảnh thông qua camera máy tính, biến cử chỉ bàn tay thành công cụ điều khiển sáng tạo đầy ấn tượng.

22/08

Thứ Bảy · 1 tin

20/08

Thứ Năm · 1 tin

16/08

Chủ Nhật · 1 tin
JiQiZhiXin
Nghiên cứuĐiểm AI 92/100

Tinh chọnECCV 2026: RiO-DETR - Mô hình phát hiện vật thể xoay thời gian thực đầu tiên đạt 2.7ms

Nhóm nghiên cứu từ USTC và Huawei giới thiệu RiO-DETR, mô hình DETR đầu tiên tối ưu hóa cho phát hiện vật thể xoay với tốc độ thực, đạt 78.4 AP50 chỉ trong 2.7ms, giải quyết triệt để bài toán độ trễ và độ chính xác trong các tác vụ viễn thám.


Vì sao đáng đọc: Đây là bước đột phá quan trọng trong kiến trúc DETR cho bài toán phát hiện vật thể xoay, kết hợp hiệu suất thực tế cao và tính ứng dụng rộng rãi trong công nghiệp.

15/08

Thứ Bảy · 1 tin
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Nghiên cứuĐiểm AI 72/100

Tinh chọnMOSS-VL: Dòng mô hình ngôn ngữ thị giác mã nguồn mở đột phá với khả năng tương tác thời gian thực

MOSS-VL là dòng mô hình ngôn ngữ thị giác tiên phong tích hợp khả năng vừa quan sát vừa phản hồi theo thời gian thực. Nhờ cơ chế chú ý chéo, mô hình đạt hiệu suất vượt trội trên các bài kiểm tra luồng dữ liệu, dẫn đầu các giải pháp mã nguồn mở hiện nay.


Vì sao đáng đọc: Đây là bước tiến quan trọng trong việc xử lý video thời gian thực, giải quyết bài toán độ trễ vốn là điểm yếu của các mô hình đa phương thức hiện nay.
Tổng 23 tin, không còn tin nào nữa

40 tin mỗi trang, cuộn để tải tiếp · lọc và sắp xếp ngay trên máy chủ (38 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả

Toàn bộ tin AI · Thẻ “AI thời gian thực” | AIHOT.vn