The Decoder
85

Mô hình

Qwen-Image-3.0 của Alibaba: Tạo infographic phức tạp và văn bản siêu nhỏ chỉ trong một lần xuất

(giờ Việt Nam)

Tóm tắt AI

Mô hình Qwen-Image-3.0 mới của Alibaba hỗ trợ prompt dài 4.500 token, cho phép tạo infographic và văn bản sắc nét ở kích thước 10 pixel bằng 12 ngôn ngữ khác nhau.

Bản dịch AI

Alibaba's Qwen-Image-3.0 renders full infographic grids and readable ten-pixel text in a single pass

Qwen-Image-3.0 có khả năng kết xuất các đồ họa thông tin (infographics) đa khung hình trong một lần thực hiện, tạo ra văn bản dễ đọc với kích thước nhỏ chỉ mười pixel và viết bằng mười hai ngôn ngữ. Việc liệu các bài báo học thuật và trang báo do AI tạo ra có hữu ích dưới dạng hình ảnh tĩnh hay không vẫn là một câu hỏi còn bỏ ngỏ.

Đội ngũ Qwen của Alibaba đã phát hành Qwen-Image-3.0, phiên bản thứ ba của trình tạo hình ảnh này. Theo nhóm phát triển, phiên bản đầu tiên tập trung vào "độ chính xác", trong khi phiên bản thứ hai nhắm đến "độ chính xác, sự đa dạng, tính toàn diện, vẻ đẹp và tính chân thực". Lần này, Qwen tóm tắt mục tiêu của mình bằng một từ duy nhất: "Real" (Thực). Mô hình này được thiết kế để xử lý các công việc thực tế như dàn trang báo, bảng phân cảnh (storyboards) và đề thi, thay vì chỉ tạo ra những hình ảnh bắt mắt.

Các câu lệnh (prompts) dài hơn cho phép mô hình xây dựng các bố cục phức tạp trong một lần thực hiện.

Qwen-Image-3.0 chấp nhận các câu lệnh dài tới 4.500 token. Theo đội ngũ phát triển, điều đó cung cấp cho mô hình đủ không gian để tạo ra các bố cục dày đặc trong một lần thực hiện thay vì phải lắp ghép chúng từ nhiều hình ảnh khác nhau.

Một bản demo đã gói gọn chín đồ họa thông tin riêng biệt vào một lưới 3 x 3, mỗi khung hình đều có văn bản, công thức và hình minh họa riêng. Các khung hình bao quát các chủ đề như khoảng cách an toàn gần đường hầm, các đường vuông góc, một bài học Nho giáo về cảm xúc và lý trí, và tốc độ tách rời của một vật thể từ một hình trụ đang quay. Các khung hình khác giải thích về vòng đời của sán lá gan, đau ngực phải, các định lý Sylow cho các nhóm có bậc 72, kiểm soát nội bộ tại các ngân hàng, và DNA trong tế bào động vật và thực vật.

Nine-panel grid with infographics covering tunnel safety, geometry, Confucian ethics, physics, medicine, math, banking oversight, and cell DNA.

Đội ngũ phát triển cũng cho thấy cách mô hình xử lý các giao diện lồng nhau. Một ví dụ bắt đầu với cửa sổ VSCode chứa màn hình Qwen Chat. Bên trong màn hình đó là một cuộc hội thoại WeChat, bao gồm một tấm áp phích giải thích cách pha cà phê pour-over.

VSCode window with an open image file nested_mockup.png showing a Qwen chat interface, which in turn contains a WeChat conversation thread with a four-step pour-over coffee brewing poster.

Văn bản mười pixel và các công thức LaTeX thúc đẩy độ trung thực khi kết xuất.

Qwen cho biết mô hình có thể tạo ra văn bản dễ đọc với kích thước nhỏ chỉ mười pixel. Các ví dụ của họ bao gồm một đồ họa thông tin về cá mập voi chứa đầy văn bản và một trang đầy đủ từ một bài báo giả định về hình học đại số. Bài báo chứa các phương trình LaTeX nhiều dòng với chỉ số dưới, chỉ số trên, dấu ngoặc, phân số, tổng và tích. Các bản demo khác cho thấy một trang báo mô phỏng và các ghi chú viết tay màu đỏ trông giống như lời phê của giáo viên.

Two-column page of a simulated math paper with the header "Qwen-Image 3.0 Fake PDF," multi-line LaTeX formulas on Čech cohomology, and theorems and proofs on simplicial maps.

Qwen-Image-3.0 cũng hướng tới độ chi tiết như ảnh chụp trong các bức chân dung và vật thể, bao gồm lỗ chân lông có thể nhìn thấy, kết cấu da và từng sợi tóc riêng biệt. Trong một bản demo chỉnh sửa khác, mô hình đã phục hồi một bức tranh thủy mặc truyền thống bị hư hỏng vẽ cảnh đại bàng chiến đấu. Nó lấp đầy các khu vực bị thiếu trong khi vẫn khớp với nét cọ và độ đậm nhạt của mực gốc.

Close-up of a young woman in sunlight with flower shadows on her cheek, a pink carnation in her hair, and multiple earrings; individual strands of hair and skin pores are visible.

Hỗ trợ ngôn ngữ và các bản mẫu giao diện (UI mockups) mở rộng phạm vi ứng dụng của mô hình.

Qwen mô tả lĩnh vực trọng tâm thứ ba là "kiến thức sâu". Mô hình hỗ trợ mười hai ngôn ngữ một cách tự nhiên, bao gồm tiếng Nhật, tiếng Hàn và tiếng Tây Ban Nha. Các ví dụ được công bố cũng cho thấy khả năng tái tạo giao diện từ các trang web, trò chơi và các buổi phát trực tiếp (livestreams). Trong một bản demo chỉnh sửa, mô hình biến ảnh chụp một loài côn trùng thành một bảng định danh đầy đủ với phân loại học, nhãn cho các đặc điểm vật lý, các góc nhìn chi tiết phóng to và thước đo tỷ lệ.

Identification plate for the damselfly Ischnura senegalensis with a macro photo of a tandem pair on a leaf, taxonomic classification, labeled morphological features, four magnified detail circles, and

Theo Qwen, mô hình cũng có thể lấy dữ liệu internet trực tiếp và sử dụng nó để tạo ra các nội dung như dự báo thời tiết cho Hàng Châu. Một ví dụ khác đặt họa sĩ tranh thủy mặc Trung Quốc Tề Bạch Thạch và Vincent van Gogh cùng nhau trong một phòng thu livestream mô phỏng.

Alibaba đã phát hành phiên bản tiền nhiệm trực tiếp, Qwen-Image-2.0, vào tháng 5 vừa qua. Báo cáo kỹ thuật tập trung vào việc tăng hiệu quả huấn luyện và suy luận, bao gồm một biến thể nhanh hơn chỉ cần bốn bước thay vì 40 bước cho mỗi hình ảnh. Trong các bài kiểm tra trên nền tảng arena của riêng Alibaba, Qwen-Image-2.0 chỉ đứng sau GPT-Image-2 của OpenAI và Nano Banana Pro của Google.

Hiện tại, Qwen-Image-3.0 dường như chỉ khả dụng thông qua quyền truy cập API theo lời mời. Mô hình sẽ sớm xuất hiện trong các ứng dụng chính chủ như Qwen Chat. Khả năng cao là trọng số của mô hình sẽ không được phát hành theo giấy phép mở như cách họ đã làm với Qwen-Image bản gốc.

Công nghệ ấn tượng, nhưng các trường hợp sử dụng không phải lúc nào cũng hợp lý.

Giá trị thực tiễn của một số bản demo vẫn chưa rõ ràng. Các nhà nghiên cứu thường viết và dàn trang các bài báo bằng LaTeX thay vì kết xuất chúng dưới dạng hình ảnh, vì vậy các trang báo do AI tạo ra với các công thức có thể phù hợp hơn với các bản mẫu và bản nháp trực quan thay vì các bài báo cuối cùng.

Một câu hỏi tương tự cũng áp dụng cho các trang báo và đồ họa thông tin phức tạp. Các mô hình hình ảnh hiện đại có thể chỉnh sửa từng thành phần văn bản, nhưng các định dạng có thể tìm kiếm và chỉnh sửa được vẫn mang lại sự linh hoạt hơn cho công việc sản xuất. Dù vậy, các ví dụ cho thấy khả năng kết xuất văn bản đã tiến xa đến mức nào và có thể chỉ ra những ứng dụng hữu ích ngoài các bản demo được trình bày ở đây.

Tin tức AI không cường điệu – Được tuyển chọn bởi con người.

Đăng ký THE DECODER để đọc không quảng cáo, nhận bản tin AI hàng tuần, báo cáo chuyên sâu "AI Radar" độc quyền sáu lần một năm, quyền truy cập toàn bộ kho lưu trữ và quyền tham gia phần bình luận của chúng tôi.

Đăng ký ngay.

AlibabaQwenTạo ảnh AICông nghệ mớiInfographic
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ The Decoder. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.