Mô hình
Microsoft ra mắt bộ đôi AI tự phát triển MAI-Image-2.5-Pro và MAI-Voice-2-Flash
(giờ Việt Nam)
Tóm tắt AI
Microsoft vừa giới thiệu hai mô hình AI tự phát triển, không qua chưng cất từ bên thứ ba, tập trung vào tạo ảnh chất lượng cao và xử lý giọng nói tốc độ nhanh, hiện đã được tích hợp vào Bing và PowerPoint.
Bản dịch AI
Theo tin từ IT ngày 24 tháng 7, Microsoft đã thông báo vào ngày 23 tháng 7 (giờ địa phương) về việc ra mắt hai mô hình AI tự phát triển mới, lần lượt là MAI-Image-2.5-Pro và MAI-Voice-2-Flash, hiện đều đã bước vào giai đoạn xem trước công khai (public preview). Hai mô hình này thuộc dòng mô hình tự phát triển của đội ngũ Microsoft AI, hướng tới các kịch bản tạo ảnh chất lượng cao và tương tác giọng nói có lưu lượng truy cập cao.

Microsoft cho biết, trong năm qua, công ty đã bắt đầu phát triển các mô hình chuyên dụng dựa trên quy trình đào tạo nội bộ, với mục tiêu sử dụng dữ liệu đã được làm sạch, có thể truy xuất nguồn gốc và đạt chuẩn doanh nghiệp để huấn luyện, không phụ thuộc vào việc chưng cất (distillation) từ các mô hình bên thứ ba, đồng thời thiết kế từ nền tảng để phục vụ người dùng các sản phẩm của Microsoft.
MAI-Image-2.5-Pro là mô hình hình ảnh có độ chính xác cao nhất hiện nay của Microsoft, chủ yếu hướng tới các kịch bản ứng dụng đòi hỏi chất lượng hình ảnh cao, bao gồm các tính năng như tạo hình ảnh chính (main visual), chỉnh sửa chi tiết và kết xuất văn bản trong ảnh.

Microsoft cho biết mô hình này đã được tối ưu hóa về độ chính xác khi tạo văn bản trong hình ảnh và hỗ trợ các lệnh chỉnh sửa bằng ngôn ngữ tự nhiên, cho phép người dùng điều chỉnh nội dung được tạo thông qua mô tả bằng văn bản.

Giá xem trước công khai của mô hình này là: 5 USD cho mỗi 1 triệu Token đầu vào văn bản (tỷ giá hiện tại khoảng 33,9 Nhân dân tệ), 8 USD cho mỗi 1 triệu Token đầu vào hình ảnh (tỷ giá hiện tại khoảng 54,3 Nhân dân tệ) và 106 USD cho mỗi 1 triệu Token đầu ra hình ảnh (Ghi chú của IT: tỷ giá hiện tại khoảng 718,8 Nhân dân tệ).

Một mô hình khác là MAI-Voice-2-Flash đã được tối ưu hóa cho các ứng dụng giọng nói tần suất cao. Microsoft cho biết mô hình này có tốc độ nhanh hơn khoảng 2 lần so với MAI-Voice-2, đồng thời giảm 32% chi phí, giúp cung cấp hỗ trợ độ trễ thấp hơn cho các dịch vụ giọng nói quy mô lớn trong khi vẫn duy trì được ngữ điệu tự nhiên và chất lượng giọng nói cao.

Giá xem trước công khai của MAI-Voice-2-Flash là 15 USD cho mỗi 1 triệu ký tự (tỷ giá hiện tại khoảng 101,7 Nhân dân tệ). Microsoft cho biết mô hình này phù hợp với các kịch bản cần phản hồi nhanh như trung tâm chăm sóc khách hàng và trợ lý giọng nói.

Microsoft tiết lộ rằng hiện tại cả hai mô hình đã được áp dụng dần vào nhiều sản phẩm của hãng. Trong đó, Bing Image Creator đã áp dụng hoàn toàn mô hình hình ảnh tự phát triển của Microsoft, với MAI-Image-2.5 trở thành mô hình tạo ảnh mặc định, cung cấp cho người dùng khả năng tạo và chỉnh sửa hình ảnh.
Trong PowerPoint, MAI-Image-2.5 đã được sử dụng cho tính năng chỉnh sửa ảnh-sang-ảnh (image-to-image). Microsoft cho biết so với GPT-Image-2, mô hình này có thể giảm tới 84% chi phí GPU.
Trong OneDrive, MAI-Image-2.5 đã trở thành mô hình mặc định cho một số tính năng chỉnh sửa ảnh. Dữ liệu của Microsoft cho thấy sau khi triển khai, tỷ lệ lưu thành công trong các kịch bản liên quan đã tăng 26%, độ trễ P95 giảm khoảng 25% và hiệu suất trong môi trường sản xuất có tải trung bình tăng 2,5 lần.
Về giọng nói, MAI-Voice-2-Flash đã được tích hợp vào Dynamics 365 Contact Center để phục vụ các tác nhân (agent) chăm sóc khách hàng doanh nghiệp. Microsoft cho biết mô hình này có thể giảm tới 89% chi phí GPU và đã được áp dụng vào các kịch bản liên quan của các khách hàng như T-Mobile, EasyJet, v.v.
Ngoài ra, Microsoft cũng đã tích hợp MAI-Voice-2-Flash vào dịch vụ Azure Voice Live, cho phép các nhà phát triển sử dụng mô hình này để xây dựng các tác nhân hỗ trợ tương tác giọng nói-sang-giọng nói.
Microsoft cũng cho biết các mô hình tự phát triển của họ đang được kết hợp với các đối tác trong lĩnh vực chuyên môn. Ví dụ, MAI-Transcribe-1.5 đã được áp dụng vào giải pháp giọng nói y tế Dragon Copilot, dịch vụ hiện đang được 170.000 nhà cung cấp dịch vụ y tế sử dụng và đã xử lý 28 triệu hồ sơ thăm khám bệnh nhân trong quý trước.
Microsoft cho biết MAI-Transcribe-1.5 hỗ trợ 58 ngôn ngữ. Trong các thử nghiệm ghi âm đa ngôn ngữ nội bộ, tỷ lệ lỗi chuyển đổi giọng nói thành văn bản và tỷ lệ lỗi nhận dạng ngôn ngữ ở hầu hết các ngôn ngữ đều giảm tương đối 50%. Các nghiên cứu ban đầu cho thấy độ chính xác khi tạo hồ sơ y tế của mô hình này cũng đã được cải thiện.
Microsoft cho biết dòng mô hình MAI sẽ tiếp tục được mở rộng và cung cấp cho các nhà phát triển thông qua nền tảng Foundry. Công ty cũng tiết lộ rằng cụm máy tính GB200 thế hệ tiếp theo của đội ngũ Microsoft AI hiện đã đi vào hoạt động và sẽ tiếp tục thúc đẩy việc nghiên cứu phát triển các mô hình tiếp theo.
Tuyên bố quảng cáo: Các liên kết ngoài (bao gồm nhưng không giới hạn ở siêu liên kết, mã QR, mật khẩu, v.v.) có trong bài viết được sử dụng để truyền tải thêm thông tin, tiết kiệm thời gian chọn lọc, kết quả chỉ mang tính chất tham khảo, tất cả các bài viết của IT đều bao gồm tuyên bố này.
Bài viết được AI dịch và tổng hợp tự động từ IT Home ITHome. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.