UltraTex là khung làm việc hiệu quả giúp tạo vân bề mặt 3D chất lượng cao ở độ phân giải 2K, giải quyết bài toán tiêu tốn tài nguyên tính toán bằng cách loại bỏ dữ liệu dư thừa trong các chuỗi đa góc nhìn.
Mira-Scene là khung tái tạo cảnh 3D mới, sử dụng bản đồ tọa độ chính tắc (CCM) để ánh xạ điểm ảnh vào không gian vật thể, giúp sắp xếp các đối tượng 3D vào cảnh một cách chính xác và chi tiết hơn so với các phương pháp truyền thống.
KaiNinja nâng cấp mô hình TRELLIS.2 bằng cách sử dụng biểu diễn thể tích kép, cho phép tạo các mô hình 3D với các khớp nối chi tiết mà không cần đến công cụ phân tách phức tạp, đồng thời vẫn giữ nguyên tốc độ và chất lượng vượt trội.
ReMoMask-2 cải thiện việc tạo chuyển động từ văn bản bằng cách tích hợp cấu trúc không gian-thời gian của cơ thể người, giúp khắc phục sự thiếu hụt trong các mô hình RAG hiện tại.
The 2026 Tripothon S1 Global Online Kickoff is almost here! Get ready for inspiring presentations, …
DịchSự kiện Tripothon S1 của Tripo sẽ diễn ra vào ngày 13/9, mang đến các bài thuyết trình chuyên sâu, quy trình làm việc 3D độc quyền và trình diễn trực tiếp từ các chuyên gia hàng đầu.
RenderFormer-V2 là mô hình kết xuất thần kinh thống nhất, xử lý hiệu quả các hiệu ứng ánh sáng phức tạp như khúc xạ và tán xạ mà không cần huấn luyện riêng cho từng cảnh, nhờ cơ chế chú ý cải tiến giúp tăng khả năng mở rộng.
Nghiên cứu giới thiệu phương pháp chỉnh sửa 3D trực tiếp mà không cần dữ liệu cặp, bằng cách chưng cất tri thức thị giác và hình học từ các mô hình nền tảng thông qua quy trình render vi phân.
RelightFormer là mô hình Transformer đột phá giúp tái chiếu sáng vật thể từ một hoặc nhiều góc nhìn mà không cần ước tính các thuộc tính vật lý phức tạp. Bằng cách tận dụng dữ liệu từ bộ dataset LOD khổng lồ, mô hình đạt độ chính xác cao trong việc mô phỏng tương tác ánh sáng 3D.
Vì sao đáng đọc: Đây là bước tiến quan trọng trong lĩnh vực đồ họa máy tính và AI tạo sinh, giải quyết bài toán khó về chiếu sáng 3D bằng cách bỏ qua các quy trình render truyền thống.
HoloWorld là khung làm việc tiên phong giúp tạo dựng thế giới đô thị 3D liền mạch, kết nối chi tiết nội thất bên trong với kiến trúc ngoại thất thành một hệ thống thống nhất từ mô tả văn bản.
Vì sao đáng đọc: Công nghệ này giải quyết bài toán hóc búa về tính nhất quán giữa không gian nội và ngoại thất trong tạo dựng 3D, có tiềm năng ứng dụng lớn trong game và mô phỏng đô thị.
Công nghệ mới cho phép tạo ra các bối cảnh 3D hoàn chỉnh chỉ từ một hình ảnh duy nhất, biến nghiên cứu từ các hội nghị AI hàng đầu thành công cụ thực tế trong quy trình sản xuất.
Vì sao đáng đọc: Đây là bước tiến quan trọng trong lĩnh vực tạo nội dung 3D, giải quyết bài toán ứng dụng thực tế cho các nhà làm phim và phát triển game, có tính thời sự cao.
Chat-Edit-3D++ giới thiệu mạng Hash-Atlas giúp tách biệt quy trình chỉnh sửa 2D và tái tạo 3D, cho phép người dùng chỉnh sửa cảnh 3D và 4D linh hoạt thông qua hội thoại tự nhiên.
BLARM là phương pháp tiên phong cho phép tạo hoạt ảnh 3D từ video đơn lẻ và lưới vật thể tĩnh mà không cần khung xương hay gắn nhãn phức tạp. Công nghệ này sử dụng các thành phần chuyển động cứng tiềm ẩn để tạo ra chuyển động mượt mà, ổn định và chính xác về mặt hình học.
Luce là mô hình 3D đột phá kết hợp hình học và vật liệu PBR vào đám mây Gaussian, cho phép tạo tài sản 3D chất lượng cao từ một ảnh duy nhất với khả năng tái chiếu sáng linh hoạt.
Vì sao đáng đọc: Công nghệ này giải quyết bài toán quan trọng trong đồ họa 3D là tái chiếu sáng, có tính ứng dụng cao trong game và thực tế ảo, rất đáng chú ý cho cộng đồng AI.
Procedura là khung tác nhân AI mới giúp chuyển đổi văn bản thành các mô hình 3D dưới dạng mã nguồn có cấu trúc, cho phép chỉnh sửa tham số và đảm bảo tính chính xác về kỹ thuật thay vì chỉ tạo lưới bề mặt đơn thuần.
Vì sao đáng đọc: Giải quyết được điểm yếu lớn nhất của AI tạo 3D hiện nay là tính chỉnh sửa và độ chính xác hình học, mở ra hướng đi thực tiễn cho thiết kế công nghiệp.
HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
Magpie tách biệt logic game và tạo hình ảnh, cho phép engine xử lý trạng thái thế giới trong khi server AI render khung hình. Giải pháp này giúp giảm phụ thuộc vào tài sản đồ họa truyền thống mà vẫn giữ được tính tương tác và khả năng thiết kế gameplay.
OmniColor là giải pháp đột phá từ ĐH Bách khoa Hồng Kông, cho phép tô màu tranh vẽ nét dựa trên sự kết hợp linh hoạt giữa văn bản, gợi ý màu sắc, hình ảnh tham chiếu và khung hình lịch sử, giải quyết triệt để vấn đề xung đột điều kiện trong quy trình sản xuất hoạt hình chuyên nghiệp.
Vì sao đáng đọc: Nghiên cứu giải quyết bài toán thực tế trong sản xuất nội dung sáng tạo với cách tiếp cận đa phương thức thông minh, có tính ứng dụng cao và được công bố tại hội nghị AI hàng đầu.
Luce là phương pháp biểu diễn 3D mới kết hợp hình học và vật liệu PBR trong đám mây Gaussian, cho phép tái chiếu sáng linh hoạt và tích hợp mượt mà vào các quy trình dựng hình tiêu chuẩn.
VibeWorlding là khung tác nhân đa phương thức cho phép người dùng xây dựng và chỉnh sửa thế giới 3D tương tác thông qua đối thoại tự nhiên, thay thế quy trình thiết kế thủ công bằng cơ chế tự động hóa thông minh.
Vì sao đáng đọc: Đây là bước tiến đột phá trong việc ứng dụng AI Agent vào đồ họa 3D, kết hợp giữa mô hình ngôn ngữ và môi trường sandbox, có tính ứng dụng cao cho ngành game và metaverse.
Block3D tối ưu hóa việc tạo mô hình 3D bằng cách chia nhỏ chuỗi token thành các khối, kết hợp giữa giải mã tự hồi quy và khử nhiễu đồng thời để tăng tốc độ và độ chính xác, đồng thời giảm thiểu lỗi tích lũy.
Nghiên cứu giới thiệu aDSL, ngôn ngữ chuyên dụng giúp AI chuyển đổi ý tưởng thành mã lập trình 3D chính xác thông qua cơ chế phản hồi lặp lại, vượt trội hơn các mô hình LLM hiện tại trong việc tạo hình khối và cấu trúc phức tạp.
MegaParts là khung tạo mô hình 3D tự hồi quy mới, sử dụng bộ mã hóa hình học nén để xử lý các vật thể phức tạp lên tới 300 bộ phận mà vẫn đảm bảo hiệu suất và độ chi tiết cao.
Nghiên cứu giới thiệu phương pháp tái tạo cấu trúc và hình học của vật thể chuyển động chỉ từ một trạng thái tĩnh duy nhất, thay vì cần nhiều dữ liệu chuyển động như trước đây. Hệ thống sử dụng mô hình khuếch tán video để giả lập các khớp nối, giúp tạo ra bản sao số chính xác và nhất quán.