elsewhere:
85

Tin ngành

SigmaZ huy động thành công hàng triệu USD cho mô hình video tương tác thời gian thực

(giờ Việt Nam)

Tóm tắt AI

Startup SigmaZ vừa gọi vốn thành công hàng triệu USD để phát triển mô hình video tương tác thời gian thực, kết hợp giữa Pixel (ngoại hình) và Code (cấu trúc) nhằm tối ưu hóa khả năng biểu đạt hình ảnh.

Bản dịch AI

Diffusion Language Model-Powered Real-Time Interactive Video Model SigmaZ Raises Millions of Dollars in Funding

Pixel (điểm ảnh) vượt trội trong việc thể hiện diện mạo; Code (mã) vượt trội trong việc thể hiện cấu trúc. Tương lai sẽ bước vào mô hình biểu đạt trực quan kết hợp giữa Pixel và Code.

👦🏻 Tác giả: Ms. Yi

🥷 Biên tập: Koji

🧑‍🎨 Dàn trang: NCon

Trong cuộc đua đông đúc của các mô hình tương tác AI trực quan, một con đường mới đang tách ra khỏi lớp pixel (Pixel-based) — đó là lộ trình dựa trên mã (Code-based).

Với các mô hình video AI chủ đạo hiện nay, việc thay đổi một mức giá sản phẩm trong quảng cáo có thể đòi hỏi phải tạo lại toàn bộ video từ đầu; một bản tóm tắt sản phẩm chỉ cần chỉnh sửa nhỏ cho các khách hàng khác nhau cũng có thể cần xuất lại hàng chục phiên bản từ đầu...

Trong các mô hình nền tảng video thuần dựa trên pixel, video tồn tại ở dạng không mã hóa — một khi đã tạo xong là hoàn tất. Bất kỳ thay đổi nhỏ nào cũng đòi hỏi phải tạo lại toàn bộ. Nhưng nếu nền tảng là code, bạn chỉ cần sửa đổi văn bản, thành phần, tham số hoặc nguồn dữ liệu tương ứng. Đây chính là không gian cơ hội mà lộ trình dựa trên code mở ra.

Gần đây, SigmaZ AI, một công ty mô hình video tương tác thời gian thực được xây dựng trên các Mô hình Ngôn ngữ Khuếch tán (Diffusion Language Models - DLM), thông báo đã huy động được vài triệu đô la vốn đầu tư. Các nhà đầu tư bao gồm BlueRun Ventures, Yunqi Capital (một công ty trong danh mục đầu tư đợt đầu của Y Transformers), Decent Capital, XiaoXiao Fund và một số nhà đầu tư cá nhân nổi tiếng khác.

Phòng thí nghiệm Trí tuệ Tương tác SigmaZ AI được đồng sáng lập bởi William Yang Bolin, một doanh nhân khởi nghiệp sinh năm 2003 tại Cambridge, và Derek Law, cựu trưởng nhóm đào tạo visual-code cho các mô hình chủ lực của Amazon AGI Lab (London).

SigmaZ AI tập trung vào hai việc: Đào tạo mô hình Diffusion-LM và khung tự cải thiện đệ quy có hướng dẫn bằng thị giác (Vision-guided RSI) cho các mô hình.

Công ty đào tạo các mô hình để tạo trực tiếp mã trực quan, sản xuất ra những "hình ảnh sống" có thể tương tác trong thời gian thực và sửa đổi ngay tại chỗ — khác biệt hoàn toàn so với video pixel cố định truyền thống. Sản phẩm chủ lực của họ, Tap8, dự kiến sẽ sớm ra mắt chính thức.

Vào ngày 22 tháng 7, một video demo tương tác trực quan do công ty đăng tải trên X đã đạt gần 80.000 lượt xem trong 6 giờ, đứng đầu mục Tin tức trong ngày, thu hút hàng nghìn lượt đăng ký danh sách chờ trong vòng 24 giờ và dẫn đến các thỏa thuận hợp tác B2B sơ bộ với hơn 20 công ty.

Đâu là nút thắt cổ chai để video tương tác AI đi vào cuộc sống hàng ngày?

Hãy tưởng tượng bạn đang trong một cuộc gọi video với AI.

Tất nhiên, bạn muốn nhìn thấy khuôn mặt. Biểu cảm, cử chỉ, ánh mắt, cảm xúc — những tín hiệu có độ hỗn loạn (entropy) cao và mơ hồ này được thể hiện tốt nhất thông qua các pixel.

Nhưng nếu AI đang giải thích báo cáo tài chính của công ty, bạn có lẽ không muốn nó cầm một tờ giấy và đọc các con số trước camera.

Bạn muốn chia sẻ màn hình. Biểu đồ phải là biểu đồ, con số phải là con số có thể đọc được, nút bấm phải có thể nhấp vào, sản phẩm 3D phải có thể xoay được, quy trình làm việc phải có thể mở rộng và khi có thay đổi, hệ thống phải biết chính xác đối tượng nào đã thay đổi.

Hai loại thông tin này thuộc về các phương thức (modalities) hoàn toàn khác nhau.

Pixel vượt trội trong việc thể hiện diện mạo; Code vượt trội trong việc thể hiện cấu trúc. Cái trước xử lý "thế giới trông như thế nào"; cái sau xử lý "thế giới có gì, mọi thứ liên quan với nhau ra sao và tôi có thể làm gì với nó." Nhìn lại hai năm qua, trí tưởng tượng của AI đã bị giới hạn bởi "khung chat". Dù là gõ phím hay giọng nói, tương tác vẫn giữ nguyên định dạng hỏi đáp truyền thống.

Trên thực tế, phần lớn sự tò mò của con người rất khó chuyển đổi thành văn bản chính xác.

Ví dụ: khi xem đánh giá tai nghe, chúng ta muốn nhìn trực tiếp cấu trúc bên trong thay vì đọc mô tả về nó; khi theo dõi video tập luyện, chúng ta muốn biết ngay lập tức và trực quan xem tư thế hiện tại của mình có đúng không... Nội dung lẽ ra phải mang tính trực quan tự nhiên lại đang bị mô hình ép vào văn bản. Và vì thông tin vốn dĩ tồn tại trong hình ảnh, việc ép nó vào các câu lệnh (dạng văn bản) trước khi xuất ra bản thân nó đã là một sự đường vòng.

Đằng sau điều này là một vấn đề cơ bản bị bỏ quên: khoảng cách ngày càng lớn giữa con người và AI không nằm ở trí thông minh, mà ở "băng thông thông tin". Một tập hợp các con số minh họa khoảng cách băng thông này trực tiếp hơn: người lớn đọc thầm với tốc độ khoảng 5 token mỗi giây, trong khi các mô hình tiên tiến ngày nay xuất ra 300 token mỗi giây.

Mỗi bước tăng trưởng trong thông lượng mô hình đều làm nới rộng đáng kể khoảng cách giữa con người và AI.

Một người đọc tập trung đã chậm hơn khoảng 60 lần so với một mô hình đơn lẻ; với mười tác nhân (agent) chạy song song, khoảng cách đó trở thành 600 lần.

Theo quan điểm của SigmaZ AI, để thu hẹp khoảng cách này, thứ thực sự cần thay thế không phải là mô hình, mà là lớp tương tác giữa mô hình và con người. Ngay từ tháng 5 này, thành viên sáng lập OpenAI Andrej Karpathy đã viết trên X: khoảng một phần ba khả năng tính toán của não bộ dành cho việc xử lý thị giác; thị giác là siêu xa lộ mười làn cho thông tin đi vào não; hình thức đầu ra của AI sẽ tiến hóa từ văn bản thuần túy, sang markdown, sang HTML và cuối cùng là video tương tác do mô hình tạo ra.

Trên lộ trình các mô hình tương tác trực quan AI này, thay vì cách tiếp cận thuần Pixel, SigmaZ AI đã chọn lộ trình "lai giữa pixel và code": hình ảnh vẫn được trình bày dưới dạng video, hoạt ảnh hoặc cảnh quay, nhưng bên dưới không còn chỉ là các pixel — mà là một hệ thống tổ chức nội dung có thể được hiểu, sửa đổi và cập nhật liên tục.

Hiện tại, không thiếu các nghiên cứu về video tương tác và mô hình thế giới, nhưng hầu hết tập trung vào "công cụ trò chơi" (game engines) và "đào tạo mô phỏng robot", phục vụ các nhà phát triển và các doanh nghiệp công nghiệp cụ thể — còn rất xa so với màn hình điện thoại của người bình thường.

Kịch bản dịch vụ mà SigmaZ AI lựa chọn: đưa video tương tác vào các trường hợp sử dụng hàng ngày — xây dựng một nền tảng đa năng. Điều này cũng có nghĩa là ngưỡng cửa của SigmaZ AI đã nâng từ "chúng ta có thể xây dựng một bản demo không" lên thách thức thực tế tàn khốc về các đột phá kỹ thuật — phản hồi phải đủ nhanh, chất lượng tạo ra phải đủ ổn định, chi phí suy luận phải đủ bền vững cho việc sử dụng tần suất cao.

"Bánh đà công nghệ" của SigmaZ AI

Làm thế nào để đạt được những đột phá kỹ thuật khắt khe như vậy?

Đội ngũ SigmaZ AI đã chọn bắt đầu từ cơ sở hạ tầng. Họ thực hiện ba đặt cược kỹ thuật cốt lõi. Ba đặt cược này đan xen vào nhau, tạo thành hào kỹ thuật và bánh đà công nghệ của công ty.

Đầu tiên, chuyển đổi phương tiện tạo từ "Pixel" sang "Kết hợp Code-Pixel" — với sự phân công lao động rõ ràng. Các tác vụ nên dành cho "code" sẽ được xử lý bằng code; các tác vụ nên dành cho "pixel" sẽ được xử lý bằng khuếch tán pixel.

Ở đây, Code xử lý cấu trúc, quan hệ nhân quả, tương tác và trạng thái — những phần có độ hỗn loạn thấp cần "sự chính xác"; Khuếch tán Pixel xử lý kết cấu, chi tiết và nội dung thế giới mở có độ hỗn loạn cao — những phần chịu trách nhiệm cho "sức hấp dẫn thẩm mỹ".

Các mô hình video thuần Pixel xuất ra luồng pixel; một khi đã tạo xong, hình ảnh sẽ cố định. Ngược lại, SigmaZ AI có thể khiến các mô hình xuất ra mã frontend có thể thực thi, sau đó hiển thị thành hình ảnh sau khi thực thi.

SigmaZAI VideoGọi vốnCông nghệ mớiĐồ họa AI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ elsewhere:. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.