Mô hình
DeepSeek ra mắt mô hình thị giác V4-Flash-Vision-Exp, thách thức hiệu năng của Opus 4.8
(giờ Việt Nam)
Tóm tắt AI
DeepSeek vừa giới thiệu mô hình đa phương thức V4-Flash-Vision-Exp với khả năng suy luận văn bản mạnh mẽ và hiệu suất tiệm cận Opus 4.8 trong các bài kiểm tra tác tử AI. Mô hình hỗ trợ API linh hoạt, cho phép xử lý tới 600 ảnh mỗi yêu cầu với chi phí tối ưu.
Bản dịch AI
Công ty AI Trung Quốc Deepseek vừa ra mắt V4-Flash-Vision-Exp, một mô hình đa phương thức thử nghiệm bổ sung khả năng hiểu hình ảnh vào các tính năng văn bản hiện có. Theo các bài kiểm tra đánh giá của chính Deepseek, mô hình này đạt hiệu suất gần tương đương với Opus 4.8 trong các tác vụ đại lý (agent tasks).
Deepseek cho biết, Deepseek-V4-Flash-Vision-Exp mở rộng khả năng của Deepseek-V4-Flash bằng cách thêm tính năng xử lý hình ảnh, đồng thời vẫn duy trì hiệu suất văn bản của mô hình cơ sở trong việc lập luận và kiến thức thế giới. Trên các bài kiểm tra đánh giá đại lý đa phương thức nội bộ của công ty, biến thể thị giác này đạt điểm số tiệm cận với Opus 4.8.
Deepseek đang nhắm đến các quy trình làm việc của đại lý thị giác (visual agent workflows).
Deepseek đang định vị mô hình này cho các ứng dụng dựa trên đại lý. Nó được thiết kế để hoạt động với nhiều khung đại lý (agent frameworks) khác nhau và kết hợp khả năng hiểu hình ảnh với việc sử dụng công cụ. Trong thực tế, mô hình có thể mô tả hình ảnh, trích xuất văn bản từ ảnh chụp màn hình và phân tích biểu đồ. Theo tài liệu API, nó hỗ trợ các định dạng JPEG, PNG, GIF và WebP, đồng thời xác định định dạng dựa trên nội dung tệp thực tế thay vì tên tệp hoặc loại MIME được khai báo.

Mô hình này tương thích với các API Chat Completions và Responses của OpenAI cũng như endpoint Messages của Anthropic. Deepseek cũng đã phát hành phiên bản 0.1.1 của khung Harness, hỗ trợ mô hình mới này ngay khi cài đặt.
Giá cả và giới hạn hình ảnh
Có ba cách để gửi hình ảnh tới mô hình. Các nhà phát triển có thể nhúng trực tiếp hình ảnh bằng mã hóa Base64, trỏ đến các URL có thể truy cập công khai (tối đa 32 MiB), hoặc sử dụng Files API mới và miễn phí. Files API cho phép bạn tải tệp lên một lần và tham chiếu tệp đó bằng ID trong nhiều yêu cầu, với giới hạn kích thước là 64 MiB.
Trường "detail" tùy chọn sẽ giảm tỷ lệ hình ảnh xuống 512 x 512 pixel, giúp tiết kiệm token khi không cần các chi tiết hình ảnh quá sắc nét. Mô hình tự động chuẩn hóa hình ảnh về mức khoảng 800 x 800 pixel tùy thuộc vào tỷ lệ khung hình trước khi xử lý. Bất kể độ phân giải gốc là bao nhiêu, mỗi hình ảnh tiêu tốn tối đa 384 token. Giá cả tuân theo mức phí của V4-Flash.
Một yêu cầu duy nhất có thể bao gồm tối đa 600 hình ảnh. Độ dài cạnh tối đa là 8.192 pixel mỗi cạnh, nhưng con số này sẽ giảm xuống còn 4.096 pixel khi một yêu cầu chứa từ 15 hình ảnh trở lên. Hình ảnh chỉ có thể được đặt trong các tin nhắn của người dùng.
Tin tức AI không thổi phồng – Được biên soạn bởi con người
Đăng ký THE DECODER để đọc không quảng cáo, nhận bản tin AI hàng tuần, báo cáo độc quyền về các công nghệ tiên phong "AI Radar" sáu lần một năm, quyền truy cập toàn bộ kho lưu trữ và tham gia phần bình luận của chúng tôi.
Đăng ký ngay
Bài viết được AI dịch và tổng hợp tự động từ The Decoder: AI News. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.