T2 · 10/08

Dex Horthy (HumanLayer)@dexhorthy
Thủ thuật85

SlopCodeBench: Thử thách khả năng tái cấu trúc mã nguồn của các mô hình AI

SlopCodeBench từ UW đánh giá khả năng tái cấu trúc mã nguồn theo thời gian thực của LLM thông qua các yêu cầu tăng dần, ngăn chặn tình trạng 'rác mã'. Ngay cả những mô hình mạnh nhất như Fable hay Kimi K3 cũng chỉ đạt tỷ lệ thành công 33%.

LLMLập trìnhĐánh giá AISlopCodeBenchTái cấu trúc mã
Boris Cherny@bcherny· 2 nguồn
Thủ thuật92

Tinh chọnAnthropic tuyên bố đã cơ bản hóa giải được tấn công tiêm nhiễm câu lệnh (Prompt Injection)

Anthropic cho biết việc kết hợp huấn luyện mô hình, dò tìm đầu vào và phân loại ý định đã giúp giảm tỷ lệ tấn công tiêm nhiễm câu lệnh xuống gần bằng 0. Ngoài ra, chế độ tự động của Claude Code sẽ được kích hoạt mặc định vào tuần tới.

AnthropicClaudeBảo mật AIPrompt InjectionAn toàn AI
Alexandr Wang (Scale AI /Meta AI)@alexandr_wang
Thủ thuật92

Bước tiến thần tốc của AI: Từ viết code thủ công đến kỷ nguyên đa tác nhân tự hành

Chỉ trong 9 tháng, AI đã tiến hóa từ việc cần con người viết code thủ công sang khả năng tự phối hợp để khai thác lỗ hổng bảo mật. Tốc độ phát triển này báo hiệu những thay đổi đột phá và khó lường hơn trong tương lai gần.

AIĐa tác nhânXu hướng công nghệBảo mậtTương lai AI
MarkTechPost
Thủ thuật92

So sánh các nền tảng đánh giá và giám sát LLM hàng đầu năm 2026: Langfuse, LangSmith, Braintrust và hơn thế nữa

Thị trường giám sát LLM dự kiến đạt 9,26 tỷ USD vào năm 2030. Dù 89% doanh nghiệp đã triển khai giám sát, hơn một nửa vẫn chỉ dừng lại ở đánh giá ngoại tuyến, cho thấy nhu cầu cấp thiết về các công cụ tối ưu hóa quy trình vận hành AI.

LLMGiám sát AIĐánh giá mô hìnhCông cụ AIVận hành AI
Ethan Mollick@emollick
Thủ thuật85

Ethan Mollick: Ngôn ngữ 'Fableish' là minh chứng cho sự thiếu hụt lý thuyết tâm trí ở AI

Ethan Mollick cho rằng phong cách ngôn ngữ khó hiểu của Fable không phải do AI kém thông minh, mà là do thiếu 'lý thuyết tâm trí' – khả năng thấu hiểu nhu cầu người dùng và điều chỉnh cách giao tiếp phù hợp với từng đối tượng.

AIEthan MollickLý thuyết tâm tríTrải nghiệm người dùngLLM
Elvis Saravia@omarsar0
Nghiên cứu88

Meta giới thiệu EvoHarness-RL: Bước tiến mới giúp AI tự học cách sử dụng công cụ

Meta ra mắt EvoHarness-RL, cho phép AI tự tối ưu hóa chiến lược sử dụng công cụ thay vì lập trình thủ công. Mô hình Qwen3-8B đạt độ chính xác 96,9% trên ALFWorld, chứng minh khả năng phối hợp tác vụ dài hạn vượt trội hơn việc chỉ mở rộng bộ công cụ hay bộ nhớ.

Meta AIEvoHarness-RLAI AgentHọc tăng cườngNghiên cứu AI
Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
Thủ thuật85

Sử gia Harvard: Thung lũng Silicon đang hiểu sai khoa học viễn tưởng và làm suy yếu nền dân chủ

Sử gia Jill Lepore cảnh báo các tập đoàn công nghệ đang dần thay thế vai trò chính phủ, khi các lãnh đạo như Elon Musk xây dựng tương lai dựa trên những hiểu lầm về khoa học viễn tưởng, đe dọa đến các giá trị dân chủ.

Công nghệDân chủThung lũng SiliconXã hộiGóc nhìn
Ethan Mollick@emollick
Thủ thuật85

ChatGPT và Claude nên học cách tư duy của Product Manager khi tương tác với người dùng

Các công cụ AI hiện nay đang sai lầm khi giấu đi quy trình xử lý. Thay vì tự động hóa hoàn toàn, chúng nên đóng vai trò như một Product Manager, giải thích rõ ràng các lựa chọn và chiến lược thực thi để người dùng không chuyên có thể hiểu và kiểm soát công việc tốt hơn.

AIChatGPTClaudeUXProduct Management

CN · 09/08

cb_doge@cb_doge
Mô hình85

Grok Image 2.0 ra mắt: Nâng cấp khả năng xử lý chi tiết và chỉnh sửa ảnh chuyên sâu

xAI vừa trình làng Grok Image 2.0 với khả năng hiểu lệnh tinh tế, hiển thị văn bản sắc nét và tính nhất quán cao. Phiên bản này bổ sung loạt công cụ mạnh mẽ như chỉnh sửa cục bộ, xóa nền, thay đổi tỷ lệ khung hình thông minh và hỗ trợ đa tham chiếu cho quy trình làm việc chuyên nghiệp.

GrokxAIAI tạo ảnhChỉnh sửa ảnhCông nghệ AI

30 tin mỗi trang · lọc và sắp xếp ngay trên máy chủ (63 ms) · bộ lọc nằm trong đường dẫn nên chia sẻ link là giữ nguyên kết quả