Apodex has released Apodex 1.1, a model family for long-horizon work that moves reasoning out of res…
DịchApodex 1.1 vừa trình làng, tối ưu hóa cho các quy trình làm việc phức tạp với khả năng xử lý tài liệu, tìm kiếm và lập trình. Mô hình này vượt trội hơn phiên bản cũ gấp đôi trong các bài kiểm tra về tác nhân tự hành và nghiên cứu khoa học.
New benchmark from @Apodex_AI worth digging into. TRACES scores AI systems on discoveries where the…
DịchApodex giới thiệu khung Discovery và chuẩn TRACES để đo lường năng lực giải quyết các vấn đề chưa có đáp án xác thực. Với dữ liệu từ 16 ngành công nghiệp, hệ thống này đã vượt qua các mô hình SOTA hiện tại 7% trong lĩnh vực thiết kế protein.
Most benchmarks assume the answer exists somewhere. Scientific discovery often starts precisely beca…
DịchApodex giới thiệu TRACES, bộ benchmark gồm 423 câu hỏi khoa học thực tế từ 561 lĩnh vực, được các chuyên gia STEM biên soạn nhằm kiểm tra khả năng tư duy và khám phá của AI đối với những vấn đề chưa có đáp án xác định.
Most AI agents are still judged by the answer they return. Apodex 1.1 from @Apodex_AI is training …
DịchApodex 1.1 tối ưu hóa khả năng thực thi tác vụ phức tạp thay vì chỉ phản hồi văn bản, cho phép AI tự vận hành từ dữ liệu thô, xử lý mã nguồn và tự phục hồi khi gặp lỗi để tạo ra kết quả chính xác.
Apodex released Apodex 1.1, its proprietary model that reached 44 on the Artificial Analysis Intelli…
DịchApodex 1.1 đạt 1.348 Elo trên bảng xếp hạng GDPval-AA v2, vượt qua nhiều mô hình có điểm số tổng quát cao hơn, chứng minh khả năng xử lý tác vụ thực tế ấn tượng dù chỉ đạt 44 điểm trên Artificial Analysis Intelligence Index.
Apodex has launched Apodex 1.1, a proprietary model scoring 44 on the Artificial Analysis Intelligen…
DịchApodex vừa trình làng mô hình Apodex 1.1 với điểm số 44 trên bảng xếp hạng Artificial Analysis, ngang hàng với các đối thủ mạnh như Kimi K2.6 và MiniMax-M3.
Apodex 1.1 chứng minh khả năng xử lý dữ liệu thực tế khi phân tích thành công 1,2 triệu dòng log Web Server, tự động nhận diện các cuộc tấn công leo thang đặc quyền và đề xuất quy tắc chặn tường lửa hiệu quả.
Bài viết chia sẻ phương pháp loại bỏ văn phong máy móc bằng cách định hình nhân vật, kiểm soát nhịp điệu câu chữ và sử dụng danh sách từ cấm. Đồng thời giới thiệu kiến trúc đa Agent Apodex 1.1 hỗ trợ triển khai cục bộ để tối ưu hóa nội dung.
Nghiên cứu Apodex 1.1 trên 221 dự án MATS cho thấy sự bùng nổ của các mô hình mở từ Trung Quốc, với tỷ lệ ứng dụng thực tế tăng từ 4,35% năm 2023 lên 65,52% tính đến tháng 8/2026.
Apodex 1.1 Scaling Agentic Intelligence for Complex Work paper: https://huggingface.co/papers/2608...
DịchApodex 1.1 vừa được công bố với những cải tiến vượt trội, giúp các AI Agent thực hiện các tác vụ phức tạp và đa nhiệm hiệu quả hơn. Đây là bản cập nhật quan trọng cho những ai quan tâm đến khả năng tự chủ của AI.
Apodex 1.1 giới thiệu FrontierAgent, khung đa tác nhân mã nguồn mở (Apache 2.0) tương thích với mọi endpoint OpenAI. Hệ thống hỗ trợ triển khai cục bộ với đầy đủ công cụ quản lý, kiểm duyệt và đánh giá, dù kết quả thực tế trong việc tìm kiếm thu nhập phụ vẫn còn hạn chế.
Apodex 1.1 giới thiệu tính năng Agent Team cho phép điều phối đa tác nhân xử lý song song các nhiệm vụ phức tạp. Đồng thời, dự án cũng mở mã nguồn bộ công cụ FrontierAgent và phát hành phiên bản Apodex 1.1 mini để chạy cục bộ.
Apodex 1.1 tối ưu hóa khả năng xử lý tài liệu, lập trình và nghiên cứu thông qua cơ chế phối hợp tác tử thông minh. Với phiên bản 35B có thể chạy cục bộ, mô hình đạt hiệu suất vượt trội so với các hệ thống lớn hơn trong nhiều lĩnh vực chuyên môn.
Congrats to @Apodex_AI for the great work! Apodex 1.1: Scaling Agentic Intelligence for Complex Wo…
DịchPhiên bản Apodex 1.1 vừa được phát hành với những cải tiến đáng kể, giúp các tác nhân AI (AI agents) thực hiện hiệu quả hơn những công việc đòi hỏi độ phức tạp cao.
This is a good example of why final-answer accuracy can hide bad agent behaviour. Most AI benchmark…
DịchApodex giới thiệu TRACES, chuẩn mực đánh giá AI chuyển dịch từ việc truy xuất câu trả lời có sẵn sang quy trình điều tra toàn diện cho các vấn đề chưa có lời giải, định nghĩa lại cách đo lường trí tuệ nhân tạo.