The Decoder: AI News
92

Mô hình

OpenAI ra mắt bộ đôi mô hình ChatGPT Images 2.5: Tốc độ vượt trội và chỉnh sửa ảnh chuyên sâu

(giờ Việt Nam)

Tóm tắt AI

OpenAI giới thiệu hai mô hình mới là Flare và Sunburst, tập trung vào khả năng xử lý ánh sáng tự nhiên, giữ nguyên chi tiết ảnh gốc và cho phép chỉnh sửa cục bộ, với tốc độ nhanh hơn tới 50% so với thế hệ trước.

Bản dịch AI

ChatGPT Images 2.5: Faster, more precise, but not the same for everyone

Các mô hình này được thiết kế để bảo toàn chủ thể từ ảnh tham chiếu tốt hơn và tuân thủ các hướng dẫn chỉnh sửa đáng tin cậy hơn qua nhiều vòng xử lý. Theo OpenAI, biến thể nhanh hơn giúp giảm độ trễ tạo ảnh tới 50% so với Images 2.0.

Hai mô hình mới được xây dựng cho các công việc khác nhau

Đối với các nhà phát triển, OpenAI cung cấp cả hai mô hình thông qua API. GPT-Image-2.5 Flare là lựa chọn mặc định cho hầu hết các mục đích sử dụng, với chất lượng hình ảnh cao hơn GPT-Image-2 nhưng độ trễ thấp hơn 50%. Mô hình mạnh mẽ hơn, GPT-Image-2.5 Sunburst, nhắm đến các công việc hình ảnh đòi hỏi khắt khe hơn với khả năng kiểm soát chỉnh sửa chặt chẽ, và cần thời gian tạo lâu hơn để hoàn thành.

Cả hai mô hình đều sử dụng cùng mức giá token. Đó là 8 đô la cho mỗi một triệu token đầu vào hình ảnh và 30 đô la cho mỗi một triệu token đầu ra. Tuy nhiên, vì mức sử dụng token thay đổi tùy theo mô hình và cấp độ chất lượng, nên cùng một mức giá không có nghĩa là chi phí cho mỗi hình ảnh là như nhau. Điểm mới trong Images 2.5 là các cấp độ chất lượng "xhigh" và "max", vượt xa giới hạn "high" trước đây.

Một hình ảnh 1024x1024 ở cấp độ "low" có giá khoảng 0,006 đô la, tương đương với phiên bản tiền nhiệm, trong khi cấp độ "high" có giá khoảng 0,053 đô la, và cấp độ "max" mới rơi vào khoảng 0,21 đô la với khoảng 7.024 token đầu ra. Điều này đưa cấp độ "max" của Images 2.5 vào cùng mức giá với cấp độ "high" của GPT-Image-2. Không giống như phiên bản tiền nhiệm, Images 2.5 hiện chưa có mức giá theo lô (batch rate) rẻ hơn. Tuy nhiên, trong các thử nghiệm ban đầu, Sunburst thường có chi phí mỗi ảnh cao hơn Flare mặc dù giá token giống hệt nhau, có lẽ do quá trình suy luận kéo dài hơn. Và không giống như lần trước, OpenAI không đưa ra con số giá trung bình cho mỗi hình ảnh.

Cũng chưa rõ OpenAI điều hướng người dùng ChatGPT giữa hai mô hình này như thế nào. Cả thông báo lẫn tài liệu đều không đề cập khi nào ChatGPT sẽ sử dụng Flare nhanh hơn hay Sunburst chính xác hơn. Trong API, bạn có thể chọn mô hình một cách rõ ràng. Giao diện ChatGPT hiện chưa cung cấp quyền kiểm soát này.

Trong các thử nghiệm của chúng tôi, ranh giới hiện tại dường như chủ yếu nằm giữa Chat và Work. Trong Work, các câu lệnh của chúng tôi thực sự chỉ thay đổi những gì được yêu cầu, bất kể cài đặt suy luận. Những chỉnh sửa có mục tiêu này là trọng tâm của các cải tiến mô hình. Tuy nhiên, trong Chat, nhiều chi tiết vẫn tiếp tục thay đổi trong các hình ảnh tiếp theo, ngay cả khi cài đặt suy luận ở mức cao. Chỉ ở cài đặt "6 Pro", mô hình mạnh hơn mới đôi khi xuất hiện.

Chỉnh sửa chỉ thay đổi những gì bạn yêu cầu

Như đã lưu ý, trọng tâm của mô hình mới là chỉnh sửa. Nó được thiết kế để chỉ thay đổi các yếu tố được yêu cầu và giữ nguyên phần còn lại của hình ảnh, ngay cả với các chủ thể và hậu cảnh phức tạp hơn. Trong các cuộc hội thoại dài hơn, các thay đổi trước đó sẽ giữ được tính nhất quán mà không làm giảm chất lượng hình ảnh qua nhiều bước chỉnh sửa. OpenAI minh họa điều này bằng ví dụ thiết kế lại căn phòng. Trong khi mô hình cũ thay đổi các chi tiết khác sau mỗi lần chỉnh sửa, mô hình mới vẫn giữ được sự ổn định ngay cả qua nhiều lần lặp lại.

Một thử nghiệm nhanh thông qua ChatGPT Work với GPT-6 Astra (Max) cho thấy hiệu quả của nó. Chúng tôi đã sử dụng câu lệnh sau và sau đó điều chỉnh lặp đi lặp lại một chi tiết nhỏ (màu quả chuối) và một chi tiết lớn (con mèo lớn).

Một bức ảnh DSLR siêu thực. Một con khỉ cầm quả chuối màu hồng đang ngồi trên một con hổ ở tiền cảnh. Ở hậu cảnh, một CON NGỰA ĐANG CƯỠI MỘT PHI HÀNH GIA. Phi hành gia ở bên dưới, giống như một "yên ngựa phi hành gia" sống động, và CON NGỰA rõ ràng ở trên, nắm quyền kiểm soát với tư cách là người cưỡi. Hãy làm cho nó rõ ràng 100%: CON NGỰA là người cưỡi và PHI HÀNH GIA là người bị cưỡi, KHÔNG phải ngược lại. Độ phân giải cao, lấy nét sắc nét, ánh sáng chân thực.

Hình ảnh: GPT-Images-2.5 / Astra (Max)

Một lưu ý nhỏ, đây có lẽ là phiên bản tốt nhất về hình ảnh con ngựa cưỡi phi hành gia mà một mô hình hình ảnh của OpenAI từng tạo ra trong các thử nghiệm của chúng tôi. Đây là hình ảnh trông như thế nào với Image 2.0 (biến thể Thinking).

Ngược lại, các thử nghiệm trong chế độ Chat của ChatGPT luôn thay đổi phần còn lại của hình ảnh khi chúng tôi điều chỉnh màu quả chuối. Chỉ ở chế độ "6 Pro", hình ảnh mới giữ được tính nhất quán trong một lần chạy, nhưng không phải trong lần chạy khác. Điều này có thể thay đổi trong tuần khi quá trình triển khai tiếp tục.

Images 2.5 cũng được thiết kế để xử lý các hướng dẫn hình ảnh phức tạp tốt hơn, cung cấp nội dung chính xác hơn cho thông tin thực tế, và làm việc với nền trong suốt cùng các bố cục đòi hỏi khắt khe hơn. Ví dụ, trong bài viết trước, chúng tôi đã yêu cầu ChatGPT biến tác phẩm thành một trang tạp chí thập niên 80. Nó trông như thế này.

GPT-Images-2.5 thông qua Astra (Max) cũng tạo ra một tạp chí chi tiết với hình ảnh mẫu dựa trên câu lệnh khỉ-phi hành gia của chúng tôi, ở cả biến thể yếu hơn và mạnh hơn, mà không làm mất đi hướng dẫn ban đầu vì chất lượng kém hơn.

Mô hình đã sửa một lỗi mà chúng tôi cố tình đưa vào (GPT-Images-2.5 thay vì 2.0 ngay phía trên các hình ảnh ở trang đầu tiên) theo lệnh, cho thấy khả năng bảo toàn phần nội dung còn lại tốt như thế nào, và nó cũng thực hiện tương tự cho bản dịch theo yêu cầu đơn giản "Tạo phiên bản tiếng Anh Mỹ".

Hình ảnh: GPT-Images-2.5 / Astra (Max)

Để so sánh, kết quả thông qua ChatGPT Chat thông thường cũng đáng xem, nhưng chúng cho thấy mô hình yếu hơn cũng thay đổi các chi tiết khác trong quá trình dịch. Tuy nhiên, trong một trường hợp, nó đã mô tả CEO hiện tại của Microsoft chính xác hơn.

Hình ảnh: GPT-Images-2.5 / ChatGPT Chat (Medium và Instant)

Vẽ, mẫu và câu lệnh có thể chia sẻ

Trong ChatGPT, OpenAI đang bổ sung một số tính năng mới cùng với các mô hình mới. Tính năng quan trọng nhất được gọi là "Sketch". Nó cho phép người dùng vẽ trực tiếp trong ChatGPT và sử dụng bản phác thảo làm mẫu hình ảnh cho hình ảnh hoàn thiện. Bạn kích hoạt nó bằng lệnh "@Sketch", và OpenAI cho biết nó hoạt động tốt cho sơ đồ, bố cục phòng hoặc áp phích.

Các mẫu (Templates) là những câu lệnh có sẵn nhằm giúp người dùng dễ dàng bắt đầu với các định dạng như áp phích, logo, đồ họa thông tin, hình thu nhỏ, hình minh họa hoặc quảng cáo. Chúng cung cấp cho bạn một cấu trúc thay vì một khung vẽ trống và xác định các yêu cầu của bạn thông qua các câu hỏi tiếp theo có mục tiêu. Người dùng cũng có thể đặt bình luận trực tiếp lên hình ảnh và chia sẻ các câu lệnh họ đã sử dụng, để người khác có thể thử cùng một ý tưởng với ảnh và chi tiết của riêng họ. Ví dụ, OpenAI chỉ ra một câu lệnh hiện đang lan truyền tạo ra các bức chân dung theo phong cách thập niên 1980.

Cả hai mô hình đều đứng đầu bảng xếp hạng Arena

Trong bảng xếp hạng chuyển văn bản thành hình ảnh của Arena, các mô hình mới hiện đang giữ hai vị trí dẫn đầu. GPT-Image-2.5 Sunburst dẫn đầu với số điểm 1421, theo sau là GPT-Image-2.5 Flare với 1399 điểm. Cả hai điểm số đều mang nhãn "Sơ bộ" và dựa trên số lượng bình chọn còn thấp, khoảng 3.100 và 2.900. Ở vị trí thứ ba là phiên bản tiền nhiệm GPT-Image-2 với 1381 điểm từ khoảng 78.700 lượt bình chọn.

Theo sau là mai-image-2.6 của Microsoft (1331), grok-imagine-image-2.0 của SpaceXAI (1315), và một số mô hình từ Reve, Meta, Google và Bytedance. Vì xếp hạng cho hai mô hình mới của OpenAI là sơ bộ, vị trí của chúng vẫn có thể thay đổi khi có thêm nhiều lượt bình chọn.

Đóng dấu bản quyền (Watermarking) hợp tác với Google DeepMind

Đối với việc dán nhãn nguồn gốc, OpenAI vẫn dựa vào tiêu chuẩn ngành C2PA, vốn nhúng siêu dữ liệu để theo dõi. Để làm cho nguồn gốc trở nên chống chịu tốt hơn, OpenAI cũng thêm một hình mờ ẩn thông qua SynthID của Google DeepMind, trong ChatGPT, Codex và API. OpenAI cho biết không có giải pháp duy nhất cho việc dán nhãn nguồn gốc, đó là lý do tại sao họ áp dụng phương pháp phân lớp.

Images 2.5 hiện đã có sẵn trên toàn thế giới cho tất cả người dùng ChatGPT, ChatGPT Work và Codex trên máy tính để bàn, thiết bị di động và web, bao gồm cả phiên bản miễn phí. OpenAI cho biết thời gian chờ ngắn hơn và giới hạn sử dụng cao hơn sẽ được áp dụng. Các thử nghiệm của chúng tôi cho thấy chế độ Chat hiện đang sử dụng mô hình yếu hơn.

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ The Decoder: AI News. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.