Mô hình
Alibaba ra mắt Qwen-Image-3.0: Mô hình tạo ảnh đột phá với khả năng hiển thị văn bản sắc nét
(giờ Việt Nam)
Tóm tắt AI
Qwen-Image-3.0 tập trung vào tính ứng dụng thực tế với khả năng xử lý văn bản phức tạp, hỗ trợ 12 ngôn ngữ và độ phân giải chi tiết cao, biến AI tạo ảnh thành công cụ sản xuất chuyên nghiệp.
Bản dịch AI
Theo tin từ IT ngày 21 tháng 7, Alibaba đã ra mắt mô hình nền tảng tạo ảnh mới nhất mang tên Qwen-Image-3.0. Mô hình mới hỗ trợ đầu vào siêu dài lên tới 4.5k token, có khả năng tạo ra trong một lần duy nhất các sơ đồ tri thức tích hợp nhiều yếu tố như công thức toán học, hình học, các bước suy luận logic, cũng như các giao diện UI phức tạp. Đồng thời, mô hình hỗ trợ hiển thị nguyên bản 12 ngôn ngữ và hơn 20 loại phông chữ với độ sắc nét cao, giúp giảm đáng kể chi phí sản xuất các tài liệu thương mại "có thể đọc và sử dụng được" như poster sản phẩm đa ngôn ngữ, phân cảnh phim/truyện tranh.

IT đính kèm giới thiệu chi tiết từ phía chính thức như sau:
Những tiến bộ của các mô hình tạo ảnh AI là điều ai cũng có thể thấy rõ — hình ảnh ngày càng tinh xảo, phong cách ngày càng đa dạng. Tuy nhiên, khi nhu cầu chuyển từ "tạo ra một bức ảnh đẹp" sang "hoàn thành một công việc thực tế", những hạn chế bắt đầu lộ rõ: mô hình có thể tạo ra một bức chân dung chân thực đầy kinh ngạc, nhưng lại khó lòng hiển thị chính xác một đề thi toán học với bố cục chuẩn, một trang luận văn học thuật với các công thức phức tạp, hay phục chế một bức tranh cổ bị hư hỏng.
Một bức ảnh, liệu có thể thực sự đi từ "đẹp" đến "dùng được"? Hôm nay, chúng tôi đưa ra câu trả lời của mình.
Chúng tôi chính thức ra mắt Qwen-Image-3.0, thế hệ thứ ba của dòng mô hình nền tảng tạo ảnh Qwen-Image. Nếu từ khóa của Qwen-Image-1.0 là "Chuẩn", của Qwen-Image-2.0 là "Chuẩn-Đa-Đều-Đẹp-Thật", thì chủ đề cốt lõi của Qwen-Image-3.0 chỉ gói gọn trong một chữ — "Thực".
Chữ "Thực" này được thể hiện qua ba khía cạnh:
Nội dung phong phú: Hỗ trợ đầu vào tối đa 4.5k token, dễ dàng tạo ra các bố cục phức tạp như báo chí, phân cảnh, đề thi.
Chi tiết chân thực: Hỗ trợ hiển thị chính xác các dòng chữ nhỏ 10px, tái hiện sống động từng lỗ chân lông, sợi tóc, mang lại độ sắc nét ở cấp độ vi mô.
Tri thức vững chắc: Hỗ trợ hiển thị nguyên bản 12 ngôn ngữ, mô phỏng các giao diện web, game, livestream phổ biến, sở hữu kho tri thức thế giới phong phú.
Tóm lại, Qwen-Image-3.0 không chỉ theo đuổi sự "đẹp mắt" mà còn hướng tới sự "dùng được" — biến việc tạo ảnh thực sự trở thành một công cụ năng suất có tính ứng dụng cao.
Hiện tại, Alibaba Cloud Bailian và nền tảng Qwen AI đã mở API cho thử nghiệm theo lời mời, Qwen Studio và ứng dụng Qwen cũng sắp ra mắt để người dùng trải nghiệm miễn phí.
Nội dung phong phú: Có thể vẽ phức tạp đến mức nào?
Nội dung có thể mở rộng theo chiều ngang: Ma trận tri thức 9 ô
Đây là một slide toán học được Qwen-Image-3.0 hiển thị chính xác, bao gồm các nội dung trực quan phong phú như quan hệ không gian, ký hiệu toán học, mô tả định lý, v.v., với bố cục hợp lý và quan hệ vị trí tương đối.

Và đây chỉ là "1/9" khả năng thực tế của Qwen-Image-3.0, vì bức ảnh này thực chất chỉ là một ô trong ma trận 9 ô phức tạp do Qwen-Image-3.0 tạo ra. Hãy cùng xem bức ảnh gốc:

Toàn bộ bức ảnh phía trên được Qwen-Image-3.0 tạo ra trong một lần duy nhất, không phải là sự ghép nối của nhiều bức ảnh. Độ khó của bức ảnh này nằm ở chỗ mỗi ô đều là một sơ đồ thông tin phức tạp; nếu muốn mô tả chính xác toàn bộ ma trận 9 ô này, cần tới 3.7k token.
3.7k token này cần mô tả đầy đủ về truyện tranh an toàn đường hầm, giáo trình hình học không gian, phân tích văn bản "Xuất Sư Biểu", chuyển động vật lý của vật ném, kiến thức phổ cập về ký sinh trùng sinh học, sơ đồ y tế đau ngực phải, định lý Sylow trong lý thuyết nhóm, sơ đồ thông tin quản lý kiểm soát nội bộ ngân hàng, và so sánh cấu trúc DNA tế bào — mỗi ô đều chứa văn bản tiếng Trung và tiếng Anh chính xác, công thức, biểu đồ và nhân vật truyện tranh, v.v.
Điều này vẫn là dễ dàng đối với Qwen-Image-3.0, vì Qwen-Image-3.0 đã nâng giới hạn độ dài lệnh có thể chấp nhận lên 4.5k token, đồng nghĩa với việc mô hình có thể hiểu và hiển thị các bố cục trực quan cực kỳ phức tạp và dày đặc thông tin.
Đây chính là một đặc điểm quan trọng của sự "phong phú về nội dung" trên Qwen-Image-3.0: nội dung có thể mở rộng theo chiều ngang. Khả năng mở rộng ngang phản ánh sức mạnh của mô hình trong việc đặt cạnh nhau các ngữ nghĩa và kiểm soát không gian — cho phép nhiều khái niệm được bố trí có trật tự trong cùng một khung hình mà không gây nhiễu lẫn nhau.
Nội dung có chiều sâu: Lồng ghép giao diện
Khả năng mở rộng ngang thử thách việc "đặt bao nhiêu phần tử song song trên một khung hình", trong khi khả năng chiều sâu thử thách khả năng giải cấu trúc ngữ nghĩa và lồng ghép logic của mô hình — liệu có thể hiển thị nhiều giao diện lồng ghép theo từng lớp trong một bức ảnh hay không.
Ví dụ dưới đây sử dụng một câu lệnh duy nhất để hiển thị lần lượt từ ngoài vào trong trên một bức ảnh: Giao diện lập trình VSCode → Giao diện chat Qwen → Giao diện chat mạng xã hội → Poster cà phê thủ công. Mỗi lớp đều giữ được phong cách và chi tiết UI chân thực của riêng mình, tạo nên chiều sâu thị giác "tranh trong tranh trong tranh".

Chi tiết chân thực: Có thể vẽ chân thực đến mức nào?
Nếu "nội dung phong phú" giải quyết vấn đề "vẽ bao nhiêu", thì "chi tiết chân thực" giải quyết vấn đề "vẽ chi tiết đến mức nào". Độ chính xác hiển thị các chi tiết vi mô của Qwen-Image-3.0 đã đạt đến một tầm cao mới: chữ nhỏ 10px rõ ràng dễ đọc, lỗ chân lông và sợi tóc hiện lên rõ nét, kết cấu da đạt đến độ chân thực như ảnh chụp chuyên nghiệp.
Sơ đồ tri thức về cá mập voi
Đây là một sơ đồ tri thức về cá mập voi, chứa lượng lớn văn bản và hình minh họa, và Qwen-Image-3.0 có thể hiển thị chính xác từng khu vực.

PDF luận văn học thuật
Luận văn học thuật là bài kiểm tra giới hạn cho việc hiển thị chữ nhỏ, mô hình đã hiển thị hoàn chỉnh một trang luận văn học thuật trong lĩnh vực hình học đại số, bao gồm nhiều dòng suy luận công thức phức tạp. Các yếu tố định dạng LaTeX như chỉ số trên, chỉ số dưới, dấu ngoặc nhọn, đường phân số, căn lề nhiều dòng đều được trình bày chính xác, duy trì khả năng đọc cực cao ngay cả ở cỡ chữ nhỏ.

Ghi chú chú thích
Mô hình đã chồng các chú thích viết tay màu đỏ chân thực lên trang sách — gạch chân, đường lượn sóng, khoanh tròn, mũi tên và các nhận xét ngắn, nét chữ tự nhiên trôi chảy, mô phỏng hoàn hảo phong cách ghi chép bài giảng của học sinh trung học.
Chụp ảnh chân dung
Trong nhiếp ảnh chân dung, mô hình cũng có thể khắc họa các kết cấu rất tinh tế.
Kết cấu vật thể
Ngoài chân dung, mô hình cũng có thể khắc họa các chi tiết kết cấu của các vật thể khác.
Bài viết được AI dịch và tổng hợp tự động từ IT Home ITHome. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.