got tired of watching slopcodebench boxes progress so made something a little…sloppier
DịchChán ngấy các thanh tiến trình cứng nhắc của slopcodebench, Dex Horthy đã tạo ra một công cụ đánh giá năng lực lập trình mới với cách tiếp cận tự do và phóng khoáng hơn.
Trong thử nghiệm tìm đường trong mê cung, Jev bị kẹt vòng lặp tại một góc và mất hơn 2300 bước, trong khi bộ tạo số ngẫu nhiên thuần túy chỉ mất 892 bước và chưa đầy 300ms để hoàn thành.
jevchat sử dụng API chấm điểm xác suất của Jev để dự đoán từng ký tự tiếp theo, tạo ra một mô hình ngôn ngữ thô sơ bằng cách lấy mẫu từ các token tiềm năng cho đến khi gặp lệnh dừng.
OpenJev là nền tảng chạy mô hình AI cục bộ ngay trên trình duyệt, cho phép người dùng so sánh tốc độ và độ chính xác giữa việc đọc trực tiếp logits và tạo JSON theo từng token.
2 months ago, we launched a Gemini power user group to test early features in the app. 20+ features …
DịchGoogle Labs đang tìm kiếm thêm người dùng tham gia nhóm thử nghiệm sớm các tính năng mới như Daily Brief và Personal Intelligence trên Gemini, tiếp nối thành công của đợt thử nghiệm trước đó.
DịchJason Liu chia sẻ trên X rằng anh đang thử nghiệm cho mô hình AI Astra chơi tựa game mô phỏng RimWorld, dù chưa tiết lộ chi tiết kỹ thuật hay kết quả cụ thể.
ZHO bắt đầu kiểm tra khả năng của GPT-6 Astra qua các tác vụ kiến trúc phức tạp như mô hình hóa BIM, dựng phim 3D và thiết kế bản vẽ thi công, nhằm đánh giá hiệu suất của AI trong quy trình làm việc chuyên nghiệp.
Lan Tây đã thử thách 9 mô hình AI hàng đầu viết văn bản phản hồi thay cho Cảnh Điềm trước bài đăng dài của Tôn Vũ Thần. Kết quả cho thấy phong cách đa dạng từ châm biếm đến nghiêm túc, trong đó Qwen3.8 Max gây chú ý khi từ chối viết và khuyên dùng biện pháp pháp lý.
Google đã triển khai phiên bản thử nghiệm Gemini 3.8 Flash trên nền tảng lập trình nội bộ Jetski, cho phép nhân viên tiếp cận sớm công nghệ AI thế hệ tiếp theo của hãng.
Anthropic đang thực hiện thử nghiệm A/B trên Claude Code 2.1.236+ bằng cách điều chỉnh quy mô các mức độ xử lý (effort). Nếu bạn thấy mức "high" hiện tại có hiệu suất tương đương mức "low", có khả năng bạn đang nằm trong nhóm thử nghiệm này.
I asked GPT-5.6 Sol to create the most Claude-y possible parody image and what it came up with is pr…
DịchEthan Mollick đã yêu cầu GPT-5.6 Sol tạo ra một bức ảnh chế mang đậm phong cách của Claude. Kết quả nhận được vô cùng ấn tượng và châm biếm rất sâu cay.
Chuyên gia đang chạy thử nghiệm với 100 triệu token để xác định nguyên nhân lỗi trên phiên bản DeepSeek-V4-Pro-0813, hứa hẹn sẽ sớm có video phân tích chuyên sâu.
Người dùng đang kiểm chứng lại các phản hồi trái chiều về độ ổn định giữa hai phiên bản mô hình 'Max' và 'High'. Điểm đáng chú ý là mô hình này có xu hướng đưa ra kết quả ngay lập tức mà không cần suy luận, giống như đã biết trước đáp án.
Not entirely sure what is happening, but I like it.
DịchChuyên gia sáng tạo AI fofr chia sẻ cảm nhận đầy tò mò về một hiện tượng lạ trong quá trình vận hành mô hình, dù chưa rõ nguyên nhân nhưng kết quả mang lại đầy thú vị.