Tin ngành
Tại ECCV, các chuyên gia hàng đầu đang tìm cách dạy AI làm kinh doanh
(giờ Việt Nam)
Tóm tắt AI
Các chuyên gia AI đa phương thức hàng đầu thế giới cùng 64 đội ngũ nghiên cứu đang tập trung giải quyết bài toán ứng dụng AI vào thực tiễn kinh doanh tại hội nghị ECCV.
Bản dịch AI
< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">
2026-09-10 18:17:46 Nguồn: QbitAI
Các chuyên gia hàng đầu về AI đa phương thức lần lượt lên sân khấu, 64 đội thi trên toàn cầu cùng hợp sức giải bài toán khó.
Bước đi tiếp theo của AI sẽ hướng về đâu? Các hội nghị đỉnh cao thường là nơi đầu tiên hé lộ những tín hiệu này.
Từ ngày 8 đến 12 tháng 9, ECCV 2026 đang diễn ra tại Malmö, Thụy Điển. Hội nghị do Hiệp hội Thị giác Máy tính Châu Âu (European Computer Vision Association) tổ chức, quy tụ các gã khổng lồ công nghệ toàn cầu như Google, Meta, Apple, Amazon với vai trò là các nhà tài trợ chính.
Là hội nghị đỉnh cao về thị giác máy tính, ECCV luôn là đấu trường của các nghiên cứu học thuật tiên phong, nhưng năm nay, một chủ đề kỹ thuật gần gũi hơn với thế giới thực đã được đặt lên bàn nghị sự:
Agentic Commerce (Thương mại dựa trên tác nhân thông minh).
Bạn không nghe nhầm đâu? Tại một hội nghị đỉnh cao thuần túy về thị giác máy tính (CS), một nhóm các học giả hàng đầu bắt đầu nghiêm túc nghiên cứu cách để AI làm kinh doanh.

Hướng ống kính về phía MARS2 Workshop, các hàng ghế khán giả đã chật kín người.
Trên sân khấu là những gương mặt sáng giá, các nhà nghiên cứu từ Oxford, MIT, Đại học Queen Mary London và nhiều tổ chức khác lần lượt xuất hiện, cùng thảo luận về những vấn đề tiên phong mà AI đa phương thức đang nỗ lực chinh phục.
Cuộc thi bên lề hội nghị cũng đã tìm ra các giải pháp xuất sắc. Với quỹ giải thưởng 100.000 USD, cuộc thi đã thu hút 64 đội thi toàn cầu tham gia, với tổng cộng hơn 1.060 bài dự thi được gửi về.
Độ phổ biến, đội hình khách mời, giải thưởng và sức nóng của chủ đề đều đã đạt mức tối đa.
Nhân tố kết nối tất cả những yếu tố này lại với nhau chính là một công ty công nghệ Trung Quốc: TecDo.

△ Khu vực trưng bày các bài báo xuất sắc tại MARS2 Workshop.
Workshop này có tên là MARS2, tên đầy đủ là "Multimodal Reasoning and Slow Thinking in the Large Model Era: Towards System 2 and Beyond" (Suy luận đa phương thức và tư duy chậm trong kỷ nguyên mô hình lớn: Hướng tới System 2 và xa hơn nữa).
Nó chỉ ra một thực tế đang diễn ra: Thương mại dựa trên tác nhân thông minh (Agentic Commerce) đang thay đổi toàn bộ chuỗi giao dịch từ khám phá, so sánh đến mua sắm của người tiêu dùng. Vậy, khi chuỗi giao dịch này ngày càng có sự tham gia hoặc thậm chí là đại diện bởi các tác nhân AI, liệu AI đa phương thức có thể nhìn thấu nội dung, hiểu được ý định và từ đó tối ưu hóa các hoạt động thương mại?
Theo thông tin công khai trên trang web của ECCV, MARS2 là Workshop duy nhất trong tất cả các Workshop tại ECCV năm nay do một công ty công nghệ Trung Quốc chủ trì tổ chức về hướng đi Agentic Commerce.
Vậy, các nhà nghiên cứu toàn cầu tại MARS2 Workshop đã đưa ra những giải pháp nào để "giúp AI làm kinh doanh"?
Trực tiếp tại hiện trường MARS2 Workshop.
Trước hết, cách nhanh nhất để đánh giá tầm vóc học thuật của một chủ đề chính là nhìn xem ai đang ngồi trên sân khấu.
Vậy, MARS2 có những ai? Tôi đã thấy 4 cái tên này:
Giáo sư Yarin Gal từ Đại học Oxford, một trong những học giả đại diện cho học máy Bayes hiện đại, lãnh đạo phòng thí nghiệm OATML tại Oxford, người đã nghiên cứu lâu năm về việc liệu câu trả lời do AI đưa ra có thực sự đáng tin cậy hay không.
Giáo sư trợ lý Paul Pu Liang từ MIT, đồng thời giảng dạy tại MIT Media Lab và EECS, dẫn dắt đội ngũ nghiên cứu về trí tuệ đa giác quan, chuyên giải quyết vấn đề làm thế nào để các thông tin khác nhau như văn bản, giọng nói, video được mô hình hiểu một cách đồng bộ.
Shanxin Yuan từ Đại học Queen Mary London chuyên sâu về con người kỹ thuật số và trí tuệ chuyển động; Fahad Shahbaz Khan từ Đại học Linköping đã nghiên cứu lâu năm về nhận dạng thị giác, mô hình ngôn ngữ thị giác và hiểu biết đa phương thức.
Việc có thể tập hợp một đội hình như vậy vào cùng một chương trình nghị sự đã đủ để khẳng định sức hút học thuật của MARS2 mà không cần giải thích thêm.

Phần chia sẻ của 4 vị khách mời cùng hướng tới bước tiếp theo của AI đa phương thức: Không chỉ dừng lại ở việc "nhìn thấy một đoạn video, nói ra vài dòng mô tả", mà là khả năng tìm ra bằng chứng trong các thông tin phức tạp, năng động và đa phương thức, hiểu được sự kiện diễn ra như thế nào, ý định hình thành ra sao và chuyển hóa các phán đoán đó thành hành động đáng tin cậy.
Chuỗi logic hoàn chỉnh từ "nhìn thấy" đến "thấu hiểu" này cũng chính là logic nền tảng trong thiết kế đề thi của cuộc thi AI đa phương thức MARS2 (MARS2 2026 Challenge).
Cụ thể hơn, cuộc thi AI đa phương thức MARS2 cần trả lời câu hỏi: AI có thể hiểu được video tiếp thị không?
Về mặt kỹ thuật, có thể chia thành ba tầng:
Đầu tiên là hiểu toàn bộ video, sau đó tìm ra những khoảnh khắc quan trọng và cuối cùng là đọc hiểu ý định tiếp thị đằng sau đó.
Ba tầng năng lực này cũng tương ứng với ba đường đua được thiết lập trong cuộc thi.

△ Hình ảnh do AI tạo ra.
Bộ đề thi chung cho cả ba đường đua có tên là M-CAR.
Đây là một bộ dữ liệu chất lượng cao được xây dựng dựa trên các kịch bản thương mại thực tế của TecDo, bao gồm 3.108 video quảng cáo, hỗ trợ hơn 30 ngôn ngữ. Tổng cộng 36,5 giờ video được phân tách tỉ mỉ thành 18.198 phân đoạn ngữ nghĩa, trung bình cứ khoảng 7 giây lại có một phân đoạn độc lập.
Các thí sinh cần để mô hình trả lời từng câu hỏi tại chỗ, sau đó tải kết quả lên EvalAI để nền tảng chấm điểm và xếp hạng thống nhất.
Sau một hồi tranh tài, kết quả thú vị nhất đã xuất hiện.
Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.