Jiqizhixin
92

Mô hình

Dots.tts: Mô hình tổng hợp giọng nói mã nguồn mở đột phá từ Xiaohongshu

(giờ Việt Nam)

Tóm tắt AI

Dots.tts là mô hình TTS 2 tỷ tham số sử dụng cơ chế tự hồi quy trong không gian ẩn liên tục, loại bỏ hoàn toàn token rời rạc để đạt độ chính xác và tính tự nhiên vượt trội, đồng thời hỗ trợ mạnh mẽ cho các tác vụ chỉnh sửa giọng nói.

Bản dịch AI

Hỗ trợ toàn diện từ sao chép giọng nói, âm thanh dài, đối thoại, chỉ lệnh đến hiệu ứng âm thanh! MOSS-TTS Family chính thức ra mắt bởi MOSS AI!

Cũng có thể kết hợp thành quy trình làm việc hoàn chỉnh. Toàn bộ dòng mô hình bao gồm năm thành viên cốt lõi: MOSS-TTS: nền tảng tạo giọng nói độ trung thực cao, biểu cảm mạnh mẽ, đa ngôn ngữ, âm thanh dài, tinh chỉnh...

Machine (Jiqizhixin)

Xiaohongshu, tái tạo một cộng đồng có "sức sống" hơn

Về mô hình nền tảng, đội ngũ đã ra mắt mô hình song công (full-duplex) đầu tiên trong ngành hỗ trợ mã nguồn mở và triển khai riêng tư... Xiaohongshu đã xây dựng một hệ thống bao phủ từ tối ưu hóa kiến trúc tầng dưới, tổng hợp giọng nói chất lượng cao, đến biểu cảm cảm xúc...

Machine (Jiqizhixin)

Tự do cảm xúc thực sự! TTS mã nguồn mở đạt đến tầm cao mới: Fish Audio S2 gây bão, "đạo diễn" cảm xúc như viết kịch bản, phản hồi cực nhanh chỉ trong 100ms!

Nguồn tin: "Bom tấn" mã nguồn mở mới của Xiaohongshu - FireRed-OCR, mô hình nhỏ 2B đạt đỉnh SOTA, tạm biệt... Nhờ kiến trúc tự hồi quy kép và thiết kế cửa sổ trượt của cơ chế chú ý (attention), S2 đạt hiệu suất vượt trội trong tiếng Trung...

Một ly Cola trò chuyện về AI

Xiaohongshu lại tiếp tục tung chiêu! Hệ thống giọng nói "bốn trong một" cấp công nghiệp FireRedASR2S gây bão, xử lý chính xác hơn 100 ngôn ngữ, 20 phương ngữ và cả hát!

Nguồn tin: "Bom tấn" mã nguồn mở mới của Xiaohongshu - FireRed-OCR, mô hình nhỏ 2B đạt đỉnh SOTA, tạm biệt... Thêm dấu câu chính xác cho đầu ra văn bản thuần túy, cải thiện đáng kể khả năng dịch máy và trải nghiệm đọc của con người...

Một ly Cola trò chuyện về AI

Mô hình lớn bí ẩn được cả mạng đồn đoán là DeepSeek V4 đã được Xiaomi nhận diện! Còn có thể "nuôi tôm hùm" miễn phí.

MiMo-V2-TTS: Huấn luyện trên hàng trăm triệu giờ dữ liệu giọng nói giúp tác nhân (agent) nói chuyện giống người hơn. Mô hình tổng hợp giọng nói Xiaomi MiMo-V2-TTS, sinh ra dành riêng cho tương tác đa phương thức trong kỷ nguyên Agent...

36Kr

Lần đầu tiên lượng gọi mô hình lớn tại Trung Quốc vượt Mỹ! Ba yếu tố then chốt đằng sau cuộc lội ngược dòng lịch sử.

Hơn 40 ngôn ngữ lập trình: Mô hình OCR đa phương thức dots.mocr của Đại học Khoa học và Công nghệ Hoa Trung & Xiaohongshu, tài liệu/hình ảnh... Mô hình nền tảng robot hình người Ψ₀ của Đại học Nam California, tỷ lệ thành công trong tám nhiệm vụ vượt qua GR của NVIDIA...

Hán Phong Kim Sử Giám

ByteDance cấm nhân viên sử dụng tài nguyên công ty để xây dựng kênh kiếm lợi nhuận, "Liệu sau này còn thấy được thẻ nhân viên ByteDance làm mưa làm gió trên Xiaohongshu nữa không?"

Nhằm giúp máy móc tiệm cận hơn với logic đọc hiểu hình ảnh của con người. Về kiến trúc tổng thể,... Đồng thời là công ty triển khai các mảng kinh doanh như mô hình nền tảng, chip, hệ điều hành, trí tuệ hiện thân (embodied AI)...

Vista Hydrogen Business

Lần mở mã nguồn này của Xiaohongshu quá "gắt"! "Công cụ chỉnh ảnh AI" này khiến tôi hoàn toàn từ bỏ Photoshop.

Hiện tại, đội ngũ FireRed đã cam kết "sẽ tiếp tục cập nhật các phiên bản mã nguồn mở và mô hình nền tảng văn bản thành hình ảnh trong vài tháng tới". Điều này có nghĩa là "công cụ chỉnh ảnh" này sẽ ngày càng mạnh mẽ hơn. Công cụ...

Tản văn cuộc sống của Tiêu Tiêu

Xiaomi ra mắt ba mô hình AI MiMo, cung cấp sức mạnh cho các tác nhân (agent), robot và giọng nói.

Một mô hình ngôn ngữ lớn, một mô hình đa phương thức và một mô hình tổng hợp giọng nói. Phiên bản flagship... --- Xiaomi hy vọng tạo ra các tác nhân có khả năng tự chủ điều khiển phần mềm, vận hành trình duyệt và cuối cùng là vận hành máy móc...

LLM Nhật Tri Lục

Nhật ký AI | Xiaohongshu cấm AI "nuôi tôm hùm", ComfyUI ra mắt App Mode, NVIDIA mở mã nguồn Nemotron 3 Super!

Thế hệ mô hình tổng hợp giọng nói mã nguồn mở mới TADA, sử dụng kiến trúc căn chỉnh kép văn bản-âm thanh, triệt để... Tiến tới RPA (tự động hóa quy trình bằng robot)... Tencent đột phá với lợi thế "kết nối"...

AI Tốc Dịch Quan

1234567 Trang tiếp theo

Tìm thấy khoảng 62 kết quả

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Jiqizhixin. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.