Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
85

Mô hình

DeepSeek ra mắt mô hình DeepSeek-v4-flash-vision-exp: Hỗ trợ đa phương thức hình ảnh và văn bản

(giờ Việt Nam)

Tóm tắt AI

DeepSeek vừa giới thiệu phiên bản thử nghiệm DeepSeek-v4-flash-vision-exp, cho phép người dùng phân tích hình ảnh, trích xuất văn bản từ ảnh chụp màn hình và đọc hiểu biểu đồ một cách hiệu quả.

Bản dịch AI

Vision | DeepSeek API Docs

Mô hình deepseek-v4-flash-vision-exp chấp nhận hình ảnh đi kèm với văn bản, vì vậy bạn có thể yêu cầu mô hình mô tả hình ảnh, đọc văn bản từ ảnh chụp màn hình, phân tích biểu đồ và nhiều tác vụ khác.

Các định dạng hình ảnh được hỗ trợ: JPEG, PNG, GIF và WebP. Định dạng được phát hiện từ nội dung thực tế của tệp, không phải từ tên tệp hay loại MIME được khai báo.

Gửi hình ảnh

Có ba cách để cung cấp hình ảnh cho mô hình. Tất cả đều sử dụng định dạng Chat Completions tiêu chuẩn tương thích với OpenAI, trong đó nội dung là một mảng các khối thay vì một chuỗi văn bản thuần túy. Ba phương thức tương tự cũng khả dụng trong Responses API, nơi hình ảnh được truyền trong các phần nội dung input_image.

base_url cho các ví dụ dưới đây là https://api.deepseek.com.

1. Hình ảnh mã hóa Base64 (inline)

Mã hóa hình ảnh và nhúng trực tiếp vào yêu cầu dưới dạng URL data:. Đây là tùy chọn đơn giản nhất cho các tệp cục bộ. Dữ liệu được mã hóa sẽ được tính vào giới hạn 48 MiB của phần thân yêu cầu (xem phần Giới hạn).

2. URL hình ảnh bên ngoài

Truyền một liên kết http(s) có thể truy cập công khai và mô hình sẽ tải xuống hình ảnh đó cho bạn. URL phải có tối đa 8192 ký tự, tệp hình ảnh tối đa 32 MiB và quá trình tải xuống phải hoàn tất trong vòng 60 giây. Nếu liên kết của bạn dài hơn, hãy sử dụng URL dữ liệu base64 hoặc Files API thay thế.

3. Tham chiếu tệp đã tải lên qua Files API

Tải hình ảnh lên một lần bằng Files API, sau đó tham chiếu file_id của nó trong các yêu cầu của bạn. Đây là tùy chọn tốt nhất khi bạn sử dụng lại cùng một hình ảnh cho nhiều yêu cầu, hoặc khi hình ảnh khiến phần thân yêu cầu vượt quá giới hạn 48 MiB cho hình ảnh inline. Không giống như hình ảnh inline, hình ảnh được tham chiếu qua file_id của Files API có thể lên tới 64 MiB và không bị giới hạn kiểm tra 32 MiB mỗi hình ảnh.

Sử dụng một khối nội dung tệp với file_id đã trả về (có dạng file-api-...):

Ngoài ra, một khối tệp có thể chứa hình ảnh inline dưới dạng base64 thông qua file_data thay vì file_id (hai tùy chọn này loại trừ lẫn nhau):

Mức độ chi tiết (Detail Level)

Đối với các đầu vào image_url, bạn có thể tùy chọn thiết lập trường detail để kiểm soát cách hình ảnh được xử lý:

Khi nào nên sử dụng Files API

Hình ảnh inline (base64 hoặc file_data) được tính vào giới hạn kích thước phần thân yêu cầu là 48 MiB. Hãy cân nhắc sử dụng Files API khi:

Mức sử dụng Token

Hình ảnh được chuyển đổi thành các token dựa trên kích thước của chúng, và các token này được tính phí cùng với các token văn bản của bạn.

Trước khi suy luận (inference), mọi hình ảnh đều được tự động thay đổi kích thước:

Kết quả là, có một giới hạn tối đa là 384 token cho mỗi hình ảnh: ví dụ, một hình ảnh 2000×2000 và một hình ảnh 5000×5000 sẽ tiêu tốn cùng một số lượng token sau khi thay đổi kích thước. Khi một yêu cầu chứa nhiều hình ảnh, mỗi hình ảnh được tính độc lập theo cùng một quy tắc — không có tính toán riêng biệt cho các yêu cầu đa hình ảnh.

Để ước tính chi phí token của một hình ảnh với kích thước cụ thể, hãy sử dụng công cụ tính token hình ảnh trên trang Token & Token Usage.

Giới hạn

Đối với hạn mức lưu trữ và tải lên của các tệp được tải lên qua Files API, hãy xem Files API: Limits.

Hạn chế

Sử dụng hình ảnh với Anthropic API

Ngoài endpoint tương thích với OpenAI ở trên, bạn có thể gửi hình ảnh thông qua endpoint /messages tương thích với Anthropic (base_url = https://api.deepseek.com/anthropic). Để biết thiết lập chung, hãy xem Anthropic API.

Sự khác biệt nằm ở hình dạng của khối nội dung hình ảnh. Thay vì image_url, Anthropic sử dụng một khối hình ảnh với đối tượng source có type là một trong các giá trị: base64, url, hoặc file:

Ba biến thể nguồn này phản ánh các phương thức của OpenAI ở trên:

Sử dụng hình ảnh với Responses API

Mô hình deepseek-v4-flash-vision-exp cũng chấp nhận hình ảnh thông qua Responses API tương thích với OpenAI. Ba phương thức đầu vào tương tự (URL dữ liệu base64, URL http(s) bên ngoài, file_id của Files API) và các giới hạn tương tự được áp dụng; chỉ có hình dạng của phần nội dung là khác biệt — hình ảnh được truyền trong các phần input_image, dù là trong tin nhắn của người dùng / nhà phát triển hay trong đầu ra của các mục function_call_output / custom_tool_call_output:

Phần input_image hỗ trợ trường detail với ngữ nghĩa tương tự như trên (low / high / original / auto). detail sẽ bị bỏ qua khi hình ảnh được cung cấp qua file_id, và image_url cùng file_id loại trừ lẫn nhau.

Để biết về ngữ nghĩa trường, các hạn chế (hình ảnh trong tin nhắn hệ thống / trợ lý sẽ bị từ chối với lỗi 400) và hình ảnh đầu ra của công cụ, hãy xem hướng dẫn Responses API.

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.