QbitAI
85

Mô hình

Mô hình tạo ảnh mới cực hot: Xuất thẳng 4K, hàng Việt Nam chất lượng cao, mã nguồn mở!

(giờ Việt Nam)

Tóm tắt AI

SenseTime vừa giới thiệu bản xem trước của SenseNova U1.5 Lite, một mô hình tạo ảnh mạnh mẽ với khả năng xuất trực tiếp độ phân giải 4K và được phát hành dưới dạng mã nguồn mở.

Bản dịch AI

< img id="wx_img" src="https://www.qbitai.com/wp-content/uploads/imgs/qbitai-logo-1.png" width="400" height="400">

03/08/2026 19:59:32 Nguồn: QbitAI

SenseTime giới thiệu trước SenseNova U1.5 Lite

Kim Lỗi, đưa tin từ Aofeisi

QbitAI | Kênh chính thức QbitAI

Vừa mới đây, một mô hình tạo ảnh mới ra mắt thực sự có những điểm rất đáng gờm:

Hàng nội địa, xuất ảnh 4K trực tiếp, mã nguồn mở, nhẹ, và còn có thể chỉnh sửa theo yêu cầu.

Ví dụ như bức ảnh có mật độ thông tin cực cao dưới đây, chính là tác phẩm của nó:

Từ kết quả, chúng ta có thể thấy rằng ngay cả khi phóng to ảnh lên để xem, dù là văn bản hay các yếu tố hình ảnh, mọi chi tiết đều được thể hiện vô cùng sắc nét.

Hay như loạt ảnh nghệ thuật đầy ấn tượng này, AI này cũng xử lý một cách dễ dàng:

Vậy đây là AI nào?

Đó chính là SenseNova U1.5-Lite-Preview vừa được SenseTime mở mã nguồn cho cộng đồng.

Đây là phiên bản xem trước sớm của mô hình đa phương thức thống nhất nguyên bản, trọng lượng nhẹ. Nó kế thừa kiến trúc NEO-Unify do SenseTime tự phát triển, tích hợp ngôn ngữ, ngữ nghĩa thị giác và tạo pixel vào cùng một mô hình, bao quát cả khả năng hiểu, suy luận, tạo và chỉnh sửa hình ảnh.

Tuy nhiên, phải nói rằng khả năng xuất ảnh 4K trực tiếp chỉ là một trong những điểm sáng của nó.

Với thân hình nhẹ nhàng chỉ có 8B-MoT tham số, U1.5-Lite-Preview đã đạt được:

Suy cho cùng, trong sáng tạo thực tế, "biết vẽ" chỉ là bước đầu tiên, điều thực sự quyết định liệu nó có thể đưa vào quy trình sáng tạo hay không còn phụ thuộc vào khả năng xử lý các tác vụ phức tạp và chỉnh sửa.

Vậy mô hình nhỏ 8B-MoT U1.5-Lite-Preview này tạo ảnh thuận tiện đến mức nào? Chúng ta hãy cùng xem tiếp nhé~

Khả năng xử lý các tác vụ sáng tạo và chỉnh sửa phức tạp mới là điểm mấu chốt

Trước tiên, hãy xem một bức ảnh có mật độ thông tin tương đương.

Chủ đề của bức ảnh này là nhiếp ảnh bạc gelatin (silver gelatin photography).

Ở chính giữa khung hình là một chiếc máy ảnh cổ điển đã được tháo rời. Các cấu trúc như ống kính, màn trập, khoang phim, trục cuốn phim, kính ngắm... được dàn trải từng lớp để giải thích rõ ràng; một luồng sáng màu cam chiếu từ phía trước ống kính, xuyên qua con đường tạo ảnh, nhờ đó mà tâm điểm thị giác của toàn bộ bức ảnh được làm nổi bật ngay lập tức.

Điểm khó nhất của loại ảnh này thực ra không nằm ở việc "vẽ một chiếc máy ảnh". Cái khó thực sự là mô hình phải đồng thời tổ chức được dòng thời gian, các mô-đun kiến thức, cấu trúc tháo rời, giải thích quy trình và phân cấp thị giác vào cùng một bức ảnh, đồng thời phải khiến người xem nhìn vào là biết đâu là phần chính, đâu là phần bổ sung, đâu là chú thích và đâu là kết luận.

Nhìn vào kết quả cuối cùng, U1.5-Lite-Preview đã có thể xử lý tốt cả nội dung lẫn bố cục trong các tác vụ đồ họa thông tin (infographic) có mật độ thông tin cao như thế này. Phong cách khắc đen trắng rất đồng nhất, hình ảnh chủ đạo nổi bật, chi tiết phong phú, toàn bộ bức ảnh không hề gây rối mắt mà ngược lại còn tạo cảm giác "càng nhìn càng thấy nhiều thứ hay ho".

Nếu bức ảnh trước thử thách khả năng "tạo một infographic phức tạp từ con số 0", thì loạt ảnh tiếp theo giống như đang kiểm tra khả năng sao chép logic của một bức ảnh rồi xuất ra phiên bản mới của mô hình.

Chủ đề của ảnh đầu vào là một infographic có tên "Modern Pop Culture Film & TV Milestone Journey" (Hành trình cột mốc phim và truyền hình văn hóa đại chúng hiện đại).

Nó kết nối các tác phẩm điện ảnh và truyền hình nổi tiếng trên một con đường uốn lượn, các nút, thẻ, hình minh họa và tiêu đề đều mang phong cách màu nước vẽ tay khá đồng nhất. Toàn bộ bức ảnh trông giống như một bản đồ lộ trình chủ đề văn hóa nhẹ nhàng, gần gũi.

Và ở ảnh đầu ra, chủ đề được đổi thành "The Journey of Postal Mail" (Hành trình của thư tín).

Nhưng nếu nhìn kỹ, bạn sẽ thấy nó không hề làm lại từ đầu.

Con đường uốn lượn đó vẫn còn, nhịp điệu kiểu nút thắt vẫn còn, và mối quan hệ bố cục trái-giữa-phải cũng được giữ nguyên. Chỉ là nội dung xoay quanh phim ảnh và chương trình truyền hình ban đầu đã được thay thế hoàn toàn bằng bốn giai đoạn: "gửi, phân loại, vận chuyển, phát hàng". Các mô-đun nhỏ như tiệm giặt là, thẻ phim, poster phim đã được thay bằng thùng thư, trung tâm phân loại, xe vận chuyển, nhân viên bưu điện – những yếu tố phù hợp hơn với chủ đề mới.

Nói cách khác, thứ nó lĩnh hội không chỉ là "phong cách vẽ" đơn thuần, mà là cả một khung thiết kế và phương thức tổ chức.

Trong sản xuất nội dung thực tế, việc tạo ảnh từ đầu chỉ chiếm một phần thời gian; phần lớn thời gian gây "đau khổ" thực chất lại nằm ở khâu sửa bản thảo.

Ví dụ như loạt trường hợp về sản phẩm văn hóa bảo tàng dưới đây:

Chủ đề của cả ảnh đầu vào và đầu ra thực chất đều là quy trình phát triển sản phẩm văn hóa bảo tàng.

Khung lớn của toàn bộ bức ảnh không thay đổi. Bên trái vẫn là tiêu đề dọc, ở giữa vẫn là chữ "MUSE" khổng lồ, bên phải vẫn là quy trình sáu bước từ "Nghiên cứu & Khai thác" đến "Phản hồi & Lặp lại", các mô-đun giá trị ở dưới cùng và tông màu be, nâu nhạt tổng thể vẫn được giữ nguyên.

Nhưng thứ nó thay đổi chính là hình ảnh chủ đạo cốt lõi trong khung hình. Trường hợp này khá giống với cách sửa đổi thường thấy trong quy trình làm việc thực tế.

SenseNovaMô hình tạo ảnhMã nguồn mởSenseTimeAI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ QbitAI. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.