Testing Catalog@testingcatalogPerplexity sắp tích hợp mô hình GPT-5.6 Sol Fast?
Nền tảng Perplexity được cho là sẽ sớm hỗ trợ mô hình GPT-5.6 Sol Fast trên giao diện Perplexity Computer, hứa hẹn tốc độ xử lý vượt trội.

Testing Catalog@testingcatalogNền tảng Perplexity được cho là sẽ sớm hỗ trợ mô hình GPT-5.6 Sol Fast trên giao diện Perplexity Computer, hứa hẹn tốc độ xử lý vượt trội.

cb_doge@cb_dogeGrok Build cho phép người dùng tương tác trực tiếp với các hiệu ứng hình ảnh thông qua camera máy tính, biến cử chỉ bàn tay thành công cụ điều khiển sáng tạo đầy ấn tượng.
Rohan Paul@rohanpaul_aiTại giải đấu bóng đá 5v5 dành cho robot hình người, dù các cỗ máy đã cải thiện khả năng đứng dậy sau khi ngã, việc kiểm soát bóng linh hoạt trong va chạm vẫn là rào cản kỹ thuật lớn.
Rohan Paul@rohanpaul_aiArchAgent v2 từ Google, DeepMind và Berkeley đã đánh bại thiết kế thủ công DPC4 trong việc tối ưu hóa bộ nhớ đệm CPU, đạt hiệu suất IPC vượt trội. Dù vẫn còn hạn chế ở môi trường đa nhân, đây là bước tiến lớn trong việc dùng AI tự động hóa thiết kế phần cứng.

Peter Steinberger@steipeteDự án Camsnap vừa bổ sung giao thức điều khiển xoay qua USB, cho phép cánh tay robot tự động xoay để tương tác linh hoạt với webcam 360 độ.
Kim@kimmonismusĐội ngũ kỹ thuật của Anthropic xác nhận đang ưu tiên sửa lỗi trên mô hình Opus, đặc biệt là vấn đề phản hồi quá dài. Người dùng có thể tạm thời khắc phục bằng lệnh cấu hình 'outputStyle=concise' trong khi chờ bản cập nhật chính thức.
SemiAnalysis@SemiAnalysis_Thử nghiệm cho thấy gói 200 USD/tháng của Claude có thể tạo ra giá trị 8.000 USD, trong khi OpenAI đạt tới 14.000 USD nếu tận dụng tối đa hạn mức token hàng tuần.

Elvis Saravia@omarsar0Nghiên cứu mới đề xuất phương pháp 'Đánh giá đối kháng' với 3 tác nhân AI (lập trình, đánh giá, phản biện), vượt trội hơn mô hình 5 tác nhân truyền thống. Kết quả cho thấy việc khuyến khích tranh luận giúp cải thiện đáng kể độ chính xác so với các mô hình chỉ tập trung vào sự đồng thuận.

Dù doanh thu Anthropic tăng trưởng mạnh, mô hình flagship Fable 5 chỉ chiếm 3,5% thị phần sử dụng do chi phí đắt đỏ, trong khi người dùng ưu tiên các lựa chọn kinh tế hơn.
Testing Catalog@testingcatalogPerplexity đang phát triển bộ chọn mức độ nỗ lực cho Perplexity Computer, cho phép người dùng tối ưu hóa hiệu suất và tiết kiệm hạn mức sử dụng (credits) khi thực hiện các tác vụ đơn giản.

Rohan Paul@rohanpaul_aiMerchantBench thử thách các tác nhân AI quản lý cửa hàng trực tuyến trong một năm, từ chọn sản phẩm đến quản lý dòng tiền. Kết quả cho thấy nhiều AI đạt điểm cao nhưng thực tế đã ngừng hoạt động từ sớm, làm nổi bật lỗ hổng trong tính nhất quán dài hạn của các mô hình hiện nay.

Mô hình AI mới Ox Alpha xuất hiện trên OpenRouter với khả năng lập trình vượt trội, thu hút sự chú ý lớn từ CEO Stripe. Hiện cộng đồng đang đồn đoán đây có thể là sản phẩm từ Z.ai của Trung Quốc hoặc một phiên bản thử nghiệm từ Microsoft.
Drew Breunig cảnh báo về tính tự chủ của AI Agent và đề xuất dùng Teleport để bảo mật. Ông cũng khuyên doanh nghiệp nên ưu tiên các mô hình hiệu quả như Opus hay GLM thay vì các model đắt đỏ để tối ưu hóa chi phí lập trình.
Testing Catalog@testingcatalogGrok vừa bổ sung hai tùy chọn giọng nói mới là Aurora và Liora vào chế độ hội thoại. Hãy cùng trải nghiệm xem đâu là giọng nói phù hợp với bạn hơn.

NLP@dongxi_nlpBài báo giới thiệu phương pháp huấn luyện mạng RNN thông qua mô hình giáo viên Transformer, giúp tối ưu hóa khả năng biểu diễn trạng thái dự đoán và học giám sát hàm chuyển đổi bộ nhớ.
Kim@kimmonismusCác mô hình Claude mới mang tên Marshmallow và Melon vừa được phát hiện, làm dấy lên dự đoán về bản cập nhật lớn cho dòng Opus hoặc Haiku sắp ra mắt.
Rohan Paul@rohanpaul_aiChi phí cho các token đầu vào (context window) trong AI đang giảm mạnh, mở ra kỷ nguyên mới cho các ứng dụng xử lý dữ liệu lớn với chi phí cực thấp.
Elon Musk@elonmuskGrok đã có những cải tiến đáng kinh ngạc về khả năng xử lý và độ chính xác. Elon Musk vừa chia sẻ minh chứng về sự thông minh vượt trội của chatbot này khi giải thích các khái niệm vật lý phức tạp so với phiên bản trước đó.
cb_doge@cb_dogeX sắp sửa tích hợp tính năng tạo ảnh AI có tên là Grok Imagine, hứa hẹn mang đến khả năng sáng tạo hình ảnh trực tiếp ngay trên nền tảng.
Elvis Saravia@omarsar0Thị phần token của AI mã nguồn mở đã tăng từ 28% lên 62% trong hai tháng qua. Xu hướng sử dụng các hệ thống đa tác nhân (multi-agent) khiến nhu cầu token tăng mạnh, nơi các mô hình mã nguồn mở đang chiếm ưu thế vượt trội về chi phí và hiệu suất so với các mô hình đóng.
Tibo@thsottiauxKhi AI trở thành hạ tầng cốt lõi vào năm 2026, các doanh nghiệp sẽ chuyển trọng tâm sang việc nâng cao hiệu suất vận hành và đảm bảo độ tin cậy cho các mô hình AI.
Harvey vừa giới thiệu Tenet, mô hình hậu huấn luyện tối ưu hóa cho các tác vụ pháp lý phức tạp dựa trên nền tảng Kimi K3, giúp cải thiện đáng kể hiệu suất xử lý hợp đồng và tài liệu chuyên ngành.
Kim@kimmonismusKể từ ngày 23/8, DeepSeek chính thức áp dụng mức giá đồng nhất cho API vào cuối tuần, loại bỏ sự phân biệt giữa giờ cao điểm và thấp điểm.

Testing Catalog@testingcatalogGrok Imagine vừa bổ sung trang Khám phá mới, cho phép người dùng trực tiếp thử nghiệm các công cụ chỉnh sửa và thay đổi kích thước hình ảnh ngay trên nền tảng.

Lauren Tan@potetoGrok hiện đã hỗ trợ nhiều ngôn ngữ khác nhau. Đội ngũ phát triển đang tìm kiếm phản hồi từ người dùng để cải thiện chất lượng dịch thuật và mở rộng danh sách ngôn ngữ trong tương lai.
Yuchen Jin@Yuchenj_UWTừ mức 2 tok/s trên RTX 4090 năm 2024, tốc độ chạy mô hình AI cục bộ dự kiến đạt 24 tok/s trên RTX 5090 vào năm 2026, mở ra khả năng chạy các mô hình thông minh cấp độ cao ngay tại nhà.
Rohan Paul@rohanpaul_aiSam Altman khẳng định OpenAI không chỉ dừng lại ở ứng dụng AI mà muốn trở thành nền tảng cốt lõi cho các nhà phát triển. Công ty sẽ cung cấp giao diện AGI thống nhất qua API, đáp ứng mọi nhu cầu từ nghiên cứu chuyên sâu đến các tác vụ quy mô lớn với chi phí tối ưu.
Rohan Paul@rohanpaul_aiVới trọng lượng dưới 20kg và kích thước tương đương vali xách tay, robot Booster K1 không chỉ cực kỳ di động mà còn đảm bảo an toàn tối đa khi vận hành trong môi trường đông người.
Elvis Saravia@omarsar0Các phương pháp đánh giá mô hình truyền thống đang dần lỗi thời. Thay vào đó, ngành AI cần chuyển sang các khung tiêu chuẩn tối giản như Pi hoặc Hermes Agent, hướng tới tương lai nơi khung đánh giá có thể tự động tùy chỉnh theo từng tác vụ cụ thể.
Ethan Mollick@emollickChuyên gia Ethan Mollick cảnh báo rằng việc dùng mô hình cũ như GPT-4 để đánh giá năng lực AI có thể gây sai lệch. Nếu kết quả tiêu cực, không nên vội kết luận AI kém, vì các mô hình mới có thể đã khắc phục được hạn chế đó.