Tất cả chủ đề
CHỦ ĐỀ

Đánh giá & So sánh

Đo lường sức mạnh mô hình: Kết quả Benchmark tranh cãi, phương pháp đánh giá và biến động bảng xếp hạng.

Hôm nay · 04/09

The Verge AI
95

Tinh chọnOpenAI ra mắt GPT-6 Astra: Bước tiến đột phá hướng tới kỷ nguyên AGI

OpenAI chính thức giới thiệu GPT-6 Astra, mô hình được đánh giá là bước nhảy vọt về năng lực trong các lĩnh vực từ kỹ thuật phần mềm đến khoa học, đồng thời là mô hình đầu tiên đạt ngưỡng an ninh mạng quan trọng của hãng.

OpenAIGPT-6AGIAICông nghệ

Hôm qua · 03/09

IT Home· 2 nguồn
85

HUMAIN (Ả Rập Xê Út) ra mắt mô hình ngôn ngữ tiếng Ả Rập chuyên sâu humain-m3, hợp tác cùng MiniMax

HUMAIN, công ty AI thuộc PIF, vừa giới thiệu humain-m3, mô hình ngôn ngữ được tối ưu hóa cho tiếng Ả Rập dựa trên nền tảng MiniMax-M3. Với khả năng xử lý dữ liệu quy mô lớn, mô hình này hiện dẫn đầu các bảng xếp hạng đánh giá tiếng Ả Rập và sẽ sớm phát hành phiên bản mở.

AIMiniMaxHUMAINTiếng Ả RậpLLM
Alexandr Wang (Scale AI /Meta AI )@alexandr_wang
85

Alexandr Wang: Muse 1.3 gia nhập cuộc đua, định hình lại thế trận AI cùng Claude, ChatGPT và Grok

Nhà sáng lập Scale AI khẳng định Muse 1.3 đã vươn lên hàng ngũ các mô hình hàng đầu, phá vỡ thế độc tôn cũ. Với hiệu suất ấn tượng trên các bảng xếp hạng kỹ thuật, Muse chính thức trở thành đối trọng mới bên cạnh Claude, ChatGPT và Grok.

Muse 1.3LLMScale AITrí tuệ nhân tạoXu hướng AI
CafeF Kinh tế số
85

Tinh chọnOpenAI thắt chặt bảo mật trước thềm ra mắt mô hình AI Astra

OpenAI đang đẩy mạnh các tiêu chuẩn an toàn và kiểm soát truy cập nghiêm ngặt khi chuẩn bị trình làng Astra, mô hình AI được đánh giá là có tầm ảnh hưởng quan trọng đến an ninh mạng.

OpenAIAstraBảo mật AICông nghệAn ninh mạng
Artificial Analysis@ArtificialAnlys
88

Wan 3.0 thống trị bảng xếp hạng Artificial Analysis: Đỉnh cao mới trong tạo video có âm thanh

Mô hình Wan 3.0 của Alibaba vừa vươn lên dẫn đầu bảng xếp hạng chỉnh sửa video có âm thanh của Artificial Analysis, đồng thời xếp thứ hai ở hạng mục tạo video từ văn bản. Đây là mô hình đa năng hỗ trợ xuất video 1080p dài 30 giây với khả năng tùy chỉnh sâu qua văn bản, hình ảnh và âm thanh.

Wan 3.0AlibabaVideo AIArtificial AnalysisGenerative AI
Rohan Paul@rohanpaul_ai
85

Meta loại bỏ chỉ số sử dụng AI token khỏi đánh giá hiệu suất kỹ sư

Sau khi phát hiện nhân viên cố tình 'cày' chỉ số sử dụng AI, Meta đã quyết định loại bỏ tiêu chí này khỏi đánh giá hiệu suất. Dù vậy, công ty khẳng định 93% mã nguồn vẫn được hỗ trợ bởi AI và khuyến khích kỹ sư tiếp tục sử dụng công cụ này.

MetaAIQuản trị nhân sựKỹ thuật phần mềmTin tức công nghệ
Alexandr Wang (Scale AI /Meta AI )@alexandr_wang
85

Scale AI CEO chia sẻ: Muse Spark 1.3 tạo game platform chỉ trong một lần thử

Alexandr Wang giới thiệu Muse Spark 1.3 thông qua trải nghiệm thực tế của người dùng: tạo thành công một trò chơi đi cảnh chủ đề cướp biển mà không gặp lỗi ngay lần đầu. Đây được đánh giá là mô hình lập trình nhanh, chi phí thấp và cực kỳ hiệu quả.

Muse SparkLập trình AIScale AIPhát triển gameAI tạo sinh
Hugging Face Daily Papers
88

Tinh chọnASPIRE: Liệu AI có thể tự tiến hóa từ những mục tiêu mơ hồ?

ASPIRE là bộ tiêu chuẩn mới giúp đánh giá khả năng tự học của AI khi chỉ nhận mục tiêu định hướng thay vì các nhiệm vụ cụ thể, buộc mô hình phải tự xác định cách thức cải thiện và đánh giá hiệu quả của chính mình.

AI tự họcASPIRENghiên cứu AITự tiến hóaAGI
Hugging Face Daily Papers
85

Tinh chọnĐánh giá rủi ro danh mục đầu tư không cần hiệp phương sai: Ứng dụng biểu diễn từ mô hình ngôn ngữ

Nghiên cứu đề xuất phương pháp mới đánh giá rủi ro danh mục bằng cách sử dụng đặc trưng phân phối từ mô hình ngôn ngữ thay vì hiệp phương sai truyền thống, giúp tối ưu hóa danh mục mà không cần dữ liệu tương quan phức tạp.

tài chính AIquản trị rủi romô hình ngôn ngữđầu tư định lượng
Hugging Face Daily Papers
85

Tinh chọnAutoregressive Mosaics: Giải mã khả năng tư duy không gian 2D của các mô hình ngôn ngữ thuần văn bản

Nghiên cứu giới thiệu AM-Bench để đánh giá liệu LLM hiểu bố cục không gian hay chỉ đơn thuần là chuyển đổi mô tả thành mã nguồn. Kết quả cho thấy khả năng tư duy không gian thực sự khác biệt đáng kể giữa các mô hình, vượt xa khả năng viết code đơn thuần.

LLMTư duy không gianNghiên cứu AIAM-BenchMô hình ngôn ngữ