smol.ai AI News
85

Tin ngành

OpenAI siết chặt an toàn, Qwen3.8-27B gây sốt và GLM-5.3 ra mắt

(giờ Việt Nam)

Tóm tắt AI

OpenAI tạm dừng huấn luyện mô hình tiên tiến để nâng cấp bảo mật, trong khi Qwen3.8-27B trở thành tâm điểm của cộng đồng mã nguồn mở nhờ khả năng chạy cục bộ mạnh mẽ. Đồng thời, GLM-5.3 vừa ra mắt với những cải tiến đáng kể về hiệu suất thông qua kỹ thuật học tăng cường mới.

Bản dịch AI

not much happened today | AINews

một ngày yên ắng.

Tin tức AI từ 17/8/2026 đến 18/8/2026. Chúng tôi đã kiểm tra 12 subreddit, 544 tài khoản Twitter và không có thêm thông tin nào từ Discord. Trang web của AINews cho phép bạn tìm kiếm tất cả các số báo cũ. Xin nhắc lại, AINews hiện là một chuyên mục của Latent Space. Bạn có thể tùy chọn đăng ký/hủy đăng ký nhận email theo tần suất mong muốn!

Tóm tắt AI trên Twitter

OpenAI tạm dừng Frontier RL, mở rộng giám sát và sự chuyển dịch sang hướng “Điều tiết biên giới công nghệ” (Pacing the Frontier)

Các mô hình mở: Động lực của Qwen3.8-27B, những cải tiến sau đào tạo của GLM-5.3 và cuộc tranh luận về mô hình nhỏ

Suy luận và hạ tầng hệ thống: Mojo mã nguồn mở, TensorRT Connect, lưu trữ Git của Cursor và giải mã nhanh hơn

Khung tác nhân (Agent Harnesses), đánh giá (Evals) và vòng lặp phản hồi sản xuất

Ghi chú nghiên cứu: Phối hợp đa tác nhân, phương sai đào tạo và đo lường mức độ sử dụng AI công cộng

Các tweet hàng đầu (theo mức độ tương tác)

Tóm tắt AI trên Reddit

Tóm tắt từ /r/LocalLlama + /r/localLLM

1. Điểm chuẩn (Benchmarks) và tinh chỉnh Qwen 3.8 27B

Các điểm chuẩn Qwen3.8-27B của Artificial Analysis cho thấy nó ngang ngửa với DeepSeek V4 và GPT-5.6 Luna Max (Hoạt động: 1991): Bài viết trích dẫn các điểm chuẩn của Artificial Analysis cho rằng Qwen3.8-27B có khả năng cạnh tranh với các mô hình biên (frontier models) lớn hơn nhiều như DeepSeek V4 và GPT-5.6 Luna Max, dựa trên chỉ số Intelligence Index v4.1.1 của AA tổng hợp từ các tác vụ sử dụng công cụ tác nhân, suy luận, độ tin cậy về kiến thức/ảo tưởng, suy luận ngữ cảnh dài, lập trình/khoa học và phân tích tài liệu định lượng. Khung kỹ thuật chính là biểu đồ Pareto giữa Intelligence Index và tổng số tham số, cho thấy hiệu suất tham số mạnh mẽ bất thường đối với một mô hình trọng số mở quy mô 27B, mặc dù bản tóm tắt markdown được liên kết không tiết lộ chính xác điểm số từng bài kiểm tra hoặc số liệu giá cả. Người bình luận chủ yếu phản ứng với hàm ý rằng một mô hình 27B có thể được thảo luận trong cùng phân khúc hiệu suất với các hệ thống lớn hơn nhiều; một người lưu ý rằng các mô hình lớn hơn vẫn có thể thắng trong thực tế, nhưng bản thân sự so sánh này đã là “không thể tin được”. Ý kiến kỹ thuật thực chất duy nhất là biểu đồ Pareto/hiệu suất tham số là điểm rút ra cốt lõi.

Sau khi đẩy hơn 1 triệu token qua Qwen 3.8 27B, đây là cấu hình llama.cpp tối ưu của tôi cho 16GB VRAM (Ngữ cảnh 73k, Lập trình tác nhân) (Hoạt động: 1334): Một người dùng báo cáo việc chạy Qwen3.8-27B-UD-Q3_K_XL.gguf trên llama.cpp với RTX 5060 Ti 16GB + Intel N100 + 16GB RAM, đạt ngữ cảnh 73.728 token bằng cách tắt tính năng tự động khớp (auto fit), sử dụng bộ nhớ đệm q4_1 KV, FlashAttention, batch-size=1024, ubatch-size=512 và giải mã suy đoán MTP gốc thông qua spec-type=ngram-mod,draft-mtp / spec-draft-n-max=2. Trong một bài kiểm tra lập trình tác nhân thực tế, OpenCode được cho là đã xử lý hơn 1 triệu token tổng cộng qua 3 lời nhắc để tạo ra một NestJS REST API cộng với máy chủ MCP để quét/xác thực với một diễn đàn vBulletin cũ, bao gồm tài liệu kiến trúc, triển khai theo giai đoạn, kiểm thử, linting và một bản sửa lỗi trình phân tích cú pháp HTML. Người bình luận nhấn mạnh rằng kết quả phụ thuộc rất nhiều vào việc lượng tử hóa mô hình Q3_K_XL mạnh tay và bộ nhớ đệm q4_1 KV; một người dùng 16GB VRAM khen ngợi các con số, trong khi người khác nói họ không tin tưởng vào chất lượng q3 và thích các mô hình MoE được offload q6 hơn.

Tôi đã đo điểm chuẩn mọi bản lượng tử hóa Qwen 3.8 27B vừa với 16GB VRAM (Hoạt động: 840): Hình ảnh trực quan hóa điểm chuẩn llama-perplexity của bài viết trên llama.cpp cho WikiText-2 đối với các bản lượng tử hóa GGUF của Qwen3.8-27B, vẽ biểu đồ kích thước mô hình so với chất lượng tương đối với Q8_0 cùng với độ phức tạp (perplexity) được mã hóa màu. Điểm rút ra kỹ thuật chính là Q4_K_M gần như không thể phân biệt được với Q8_0 (6.9576 so với 6.9557 PPL, ~99.97%) trong khi tiết kiệm được ~10GB, và trong số các tùy chọn dưới 16GB, IQ4_XS hoạt động tốt nhất (14.6GB, 7.0130 PPL, ~99.2%); các biến thể NVFP4 hoạt động kém hơn so với các bản lượng tử hóa IQ/GGUF có kích thước tương đương. Các bình luận lưu ý rằng khả năng chạy thực tế phụ thuộc rất nhiều vào chi phí VRAM: một người dùng với 16GB 4070 Ti Super cho biết Windows/màn hình tiêu tốn ~3.1GB nhưng bản lượng tử hóa Qwen3.8-27B-Ridge-GGUF vẫn vừa với Q8 KV và ngữ cảnh 64k. Một người bình luận khác cảnh báo rằng perplexity/KLD không dự đoán đầy đủ hiệu suất tác vụ, trong khi những người khác coi kết quả này là bằng chứng cho thấy GPU tiêu dùng hiện có thể chạy các mô hình gần với chất lượng của các mô hình biên gần đây.

Đánh giá dài: Qwen 3.8 27B RẤT giỏi trong việc khai thác kiến thức thực tế của nó. Việc “suy nghĩ quá mức” (overthinking) của nó mang lại hiệu suất ngang tầm Sonnet với tiềm năng cho kết quả ngang tầm Opus (Hoạt động: 636): Tác giả đo điểm chuẩn Qwen 3.8 27B sử dụng bản lượng tử hóa Unsloth UD-Q8_K_XL trên giàn máy cục bộ với 3× RTX 3090, 1× Tesla P40 và 128 GB RAM, so sánh nó với Qwen 3.6 27B, DeepSeek V4 Flash, Claude Sonnet 5 và Claude Opus 5 trên các tác vụ tái tạo trò chơi arcade HTML/Tailwind/JS đơn tệp. Trong lời nhắc Galaga, Qwen 3.8 ở mức suy luận xHigh tạo ra hành vi trung thực hơn đáng kể so với Qwen 3.6—các sprite bitmap pixel với khung hình động, hiệu ứng CRT/bật nguồn/nhét xu, âm thanh, kẻ địch lao xuống/bắn và cơ chế bắt máy bay chiến đấu một phần—nhưng cần ~15 phút suy nghĩ so với 8 giây của Qwen 3.6; mức trung bình mất ~3 phút và mang lại ~90% kết quả của xHigh. Tác giả cũng nhận thấy Qwen có thể đạt được độ trung thực của sprite giống như Opus khi được nhắc rõ ràng sử dụng quy trình trích xuất hình ảnh Python, tương tự như trích xuất lưới pixel có hỗ trợ công cụ của Opus 5, dẫn đến lập luận rằng các khung/công cụ tốt hơn có thể thu hẹp phần lớn khoảng cách giữa mô hình cục bộ và mô hình biên. Các bình luận hàng đầu phản bác rằng các bài kiểm tra “nhân bản Flappy Bird / Space Invaders / Pac-Man” có thể đánh giá quá cao năng lực vì các hiện vật này được thể hiện dày đặc trong dữ liệu đào tạo và ưu tiên việc ghi nhớ hơn là sự mới lạ. Những người khác mô tả kết quả là “Opus tại nhà”, trong khi một người bình luận báo cáo Qwen 3.8 27B mang lại cảm giác như một bước tiến lớn, phù hợp với các đánh giá tác nhân không lập trình của họ cho GLM-5.2 đầy đủ ngay cả khi là bản lượng tử hóa Q4 với bộ nhớ đệm Q8 KV.

DFlash 2 đã có sẵn cho Qwen 3.8 27B và Muse Glimmer (Hoạt động: 387): DFlash 2 (bản phát hành thứ hai từ các tác giả DFlash gốc) đã xuất bản các bản lượng tử hóa GGUF cho Qwen 3.8/27B và Muse Glimmer, kèm theo PR #27342 của llama.cpp để thêm hỗ trợ thời gian chạy. Một hình ảnh điểm chuẩn được liên kết tuyên bố DFlash 2 vượt trội hơn MTP với biên độ lớn trên Qwen 3.8/27B, ngụ ý hiệu quả giải mã đa token/suy đoán tốt hơn đáng kể so với các đường cơ sở dự đoán đa token tiêu chuẩn. Các bình luận chủ yếu yêu cầu chi tiết về việc áp dụng thực tế—đặc biệt là cách sử dụng đường dẫn GGUF/llama.cpp trên Apple Silicon có RAM cao—và làm rõ liệu DFlash 2 là một mô hình, một phương pháp suy luận hay một thành phần giải mã phụ trợ.

2. Những tiến bộ trong ngăn xếp suy luận cục bộ

Chạy DeepSeek V4 Flash Q4_K_XL ở tốc độ ~100 token/giây xử lý lời nhắc trên 4× RTX 3060 12GB (Hoạt động: 904): Hình ảnh cho thấy một giàn máy tính để bàn đa GPU tự chế với hệ thống dây cáp lộ ra ngoài và một vài card GeForce, trực quan hóa tuyên bố của bài viết về việc chạy DeepSeek-V4-Flash-0731 UD-Q4_K_XL GGUF (~144 GiB) trên 4× RTX 3060 12GB thông qua llama.cpp. Cốt lõi kỹ thuật của bài viết là chiến lược đặt mô hình bị hạn chế bộ nhớ nghiêm ngặt: -ncmoe 34, gán lớp chuyên gia -ot rõ ràng cho GPU, -ts 100,1,1,1, bộ nhớ đệm Q8_0 KV và -ub 2048, mang lại khoảng 99.4 token/giây xử lý lời nhắc và 10.1 token/giây giải mã ở ngữ cảnh 368.640 token được cấu hình. Bản thân hình ảnh không phải là một hiện vật điểm chuẩn, nhưng nó có liên quan về mặt kỹ thuật như bằng chứng về thiết lập phần cứng tiêu dùng 4-GPU tự chế đằng sau các phép đo được báo cáo. Các bình luận chủ yếu phản ứng với cấu trúc vật lý thay vì kết quả mô hình, đùa rằng bộ nguồn 850W cộng với các GPU hở, rời rạc là một thiết lập “dựa trên” hoặc “AI cục bộ kiểu dân chơi”. Không có sự phản bác hoặc xác nhận kỹ thuật đáng kể nào xuất hiện trong các bình luận được cung cấp.

llama.cpp phiên bản v0.1.0 đã được phát hành (Hoạt động: 630): llama.cpp đã tạo thẻ phát hành có phiên bản ngữ nghĩa đầu tiên, v0.1.0, chuyển khỏi các định danh bản dựng tuần tự thuần túy như b10456. Người đăng bài lưu ý rằng việc áp dụng semver vẫn đang được tiến hành, tham chiếu đến thảo luận ggml #1579 liên quan của ggerganov. Người bình luận hoan nghênh động thái này nhưng nhấn mạnh việc thiếu ghi chú phát hành/nhật ký thay đổi và ngữ nghĩa cột mốc không rõ ràng; một người dùng đặc biệt lưu ý cần theo dõi việc ngừng sử dụng (deprecation) tốt hơn sau khi phát hiện --no-mmap chỉ bị ngừng sử dụng bằng cách đọc nhật ký cập nhật.

CPU RISC-V của Alibaba, XuanTie C950, chạy Qwen-3.8 27B ở tốc độ 30 tps (Hoạt động: 490): XuanTie C950 của Alibaba được Wccftech báo cáo là CPU RISC-V cấp máy chủ, 64 nhân, tiến trình 5nm của TSMC với hỗ trợ gốc ngay từ đầu cho Qwen-3.8 27B, đạt khoảng 30 token/giây giải mã và 1.9 giây thời gian đến token đầu tiên mà không cần GPU hoặc lớp dịch. Chip này được mô tả là sử dụng các cụm 8 nhân qua AMBA CHI, tăng tốc ma trận/vector tích hợp, bộ nhớ đệm/L3 có thể cấu hình, tìm nạp trước thông minh, giải mã 8-rộng và đường ống 16 giai đoạn, định vị nó cho suy luận LLM tại biên/riêng tư và tích hợp dọc kiểu Alibaba trên toàn bộ mô hình, silicon và ngăn xếp triển khai. Người bình luận lưu ý rằng giải mã 30 t/s chỉ là một phần của câu chuyện: các chi tiết còn thiếu bao gồm mở rộng độ dài ngữ cảnh, thông lượng tiền nạp (prefill) và định dạng lượng tử hóa. Cũng có sự quan tâm đến việc liệu các hệ thống như vậy có thể được bán như một giải pháp thay thế rẻ hơn cho các hộp loại NVIDIA DGX Spark hay không, nhưng sự hoài nghi tập trung vào việc thiếu tiết lộ lượng tử hóa trong tiêu đề.

3. Áp lực thị trường hạ tầng AI

Stripe được cho là sẽ mua lại startup cổng AI OpenRouter với giá hơn 7 tỷ USD (Hoạt động: 1069): Stripe được cho là sẽ mua lại OpenRouter, một startup về cổng AI/định tuyến LLM và tổng hợp API, với giá hơn 7 tỷ USD theo MSN. Báo cáo không cung cấp chi tiết kỹ thuật thực chất nào về cấu trúc thỏa thuận, tích hợp sản phẩm, hạ tầng định tuyến, mối quan hệ nhà cung cấp, thay đổi giá cả hoặc cách lớp API đa mô hình của OpenRouter sẽ được ánh xạ vào nền tảng của Stripe. Người bình luận nhìn chung là tiêu cực, coi việc mua lại này có khả năng là sự “enshittification” (sự suy giảm chất lượng) của OpenRouter và đặt câu hỏi về ý nghĩa của từ “mở” trong tên công ty. Một số người dùng ngụ ý rằng họ có thể thích các thiết lập LLM cục bộ/tự lưu trữ hơn nếu tính trung lập, giá cả hoặc tính khả dụng của OpenRouter thay đổi dưới quyền Stripe.

Giá bộ nhớ tăng 500% trong 12 tháng, lên tới 10 lần mức giá thấp nhất từng được theo dõi - 128GB DDR5 hiện có giá 3.399 USD (Hoạt động: 699): Tom’s Hardware báo cáo giá DRAM đã tăng mạnh, với một số bộ kit tăng ~500% so với cùng kỳ năm ngoái và lên tới 10 lần mức thấp nhất từng được theo dõi; một bộ kit DDR5 128GB được niêm yết ở mức 3.399 USD. Người bình luận lưu ý bộ nhớ ECC/máy chủ dung lượng cao cũng đã được định giá lại đáng kể: 1×64GB DDR5 ECC RDIMM được trích dẫn ở mức 300 USD cách đây 12 tháng, 1.550 USD vào tháng 5 và 1.800 USD từ giữa tháng 6 đến giữa tháng 8, cho thấy sự ổn định gần đây sau một đợt tăng giá lớn. Người bình luận phần lớn coi việc tăng giá là đủ để trì hoãn hoặc hủy bỏ các bản dựng PC/máy trạm mới, với một người lưu ý rằng một bộ kit Corsair 96GB được mua với giá 320 euro năm ngoái và gọi việc xây dựng PC hiện tại thực sự là “đã chết”.

CDW đã tăng giá MSRP của RTX Pro 6000 từ 16.000 USD lên 19.999 USD (Hoạt động: 620): Hình ảnh cho thấy danh sách CDW cho PNY NVIDIA RTX PRO 6000 với 96 GB GDDR7, nơi MSRP hiển thị là 19.999,00 USD trong khi giá bán hiện tại là 16.513,99 USD, với 33 đơn vị còn trong kho. Bài viết coi đây là một sai sót có thể xảy ra của nhà bán lẻ hoặc tín hiệu giá trong tương lai, nhưng về mặt kỹ thuật, nó chỉ xác nhận siêu dữ liệu trang sản phẩm của CDW tại thời điểm chụp, không phải là thay đổi MSRP chính thức của NVIDIA; danh sách trực tiếp và lưu trữ là các tài liệu tham khảo có liên quan. Các bình luận giải thích MSRP ~20k USD rõ ràng là áp lực giá thêm đối với người dùng AI cục bộ, đặc biệt là những người muốn có đủ VRAM để chạy các mô hình nguồn mở lớn như LLM loại 70B mà không bị OOM. Một số người bình luận lập luận rằng giá GPU NVIDIA/máy trạm thực sự đang đẩy những người có sở thích về phía chi phí cấp doanh nghiệp, với một người cũng lưu ý giá tăng trên các card cấp thấp hơn như 5060 Ti.

Tóm tắt Subreddit AI ít kỹ thuật hơn

/r/Singularity, /r/Oobabooga, /r/MachineLearning, /r/OpenAI, /r/ClaudeAI, /r/StableDiffusion, /r/ChatGPT, /r/ChatGPTCoding, /r/aivideo, /r/aivideo

1. Điểm chuẩn lập trình Qwen cục bộ và kỹ năng lập trình viên AI

Trò chơi kết thúc. Các mô hình cục bộ 22GB chạy trên Pi hiện vượt trội hơn Claude Code Opus 5 High trong các tác vụ lập trình thực tế được xuất bản sau thời điểm cắt dữ liệu đào tạo (Hoạt động: 1997): Hình ảnh là một đồ họa thông tin điểm chuẩn, không phải meme, tuyên bố rằng một mẫu trò chuyện Sharp cho các mô hình lập trình GGUF Qwen3.x cục bộ cải thiện độ trễ sửa lỗi thực tế trên các tác vụ kiểu SWE-bench-Live được xuất bản sau thời điểm cắt dữ liệu đào tạo mô hình. Nó báo cáo Qwen3.8-27B Q6 gốc sửa được 12/21 tác vụ trong trung vị 47.0 phút, Sharp Qwen3.8-27B sửa được 11/21 trong 20.0 phút, Nail / Sharp 35B-A3B sửa được 7/21 trong 3.4 phút, so với Claude Code Opus 5 High ở mức 10/21 và Sonnet 5 Medium ở mức 5/21; tác giả liên kết mẫu và các mô hình trên Hugging Face: Sharp Chat Templates, Dirk-Qwen3.8-27B-GGUF và Nail-Qwen3.6-35B-A3B-GGUF. Tuyên bố kỹ thuật là kỹ thuật lời nhắc/mẫu trò chuyện có thể giảm đáng kể việc sử dụng token và thời gian thực cho các tác nhân lập trình cục bộ, mặc dù ảnh chụp màn hình dán nhãn kết quả là tạm thời và kích thước mẫu nhỏ (21 tác vụ). Các bình luận tỏ ra hoài nghi hoặc mang tính giai thoại: một người bình luận cáo buộc Anthropic đã âm thầm làm suy giảm hoặc thay đổi hành vi của Opus, trong khi những người khác tập trung vào các hạn chế suy luận cục bộ thực tế, đặc biệt là thông lượng chậm và chi phí/tính khả dụng của GPU VRAM ~22GB.

Nếu Claude viết tất cả mã của tôi, thì kỹ năng của tôi chính xác là gì? Thực sự mất ngủ vì điều này (Hoạt động: 1077): Người đăng mô tả việc vận chuyển một hệ thống tác nhân giọng nói sản xuất xử lý hơn 1000 cuộc gọi trên Azure, cộng với SDK để phân tích cuộc gọi và bảng điều khiển Next.js + Supabase, trong khi dựa nhiều vào Claude Code với tệp quy tắc/ngữ cảnh CLAUDE.md để lập kế hoạch và thực hiện hầu hết các thay đổi. Mối quan tâm kỹ thuật cốt lõi của họ là họ có thể xác thực đầu ra ở mức độ cao nhưng thường không thể giải thích đầy đủ các chi tiết triển khai TypeScript, cơ sở dữ liệu hoặc AI giọng nói được tạo, đặt ra câu hỏi về khả năng bảo trì, sự sẵn sàng phỏng vấn, độ sâu của đánh giá mã và liệu có nên học chính thức các ngăn xếp như Postgres và TypeScript sau khi phân phối có hỗ trợ AI hay không. Các bình luận hàng đầu định hình vai trò hiện tại của người đăng ít giống như một nhà phát triển thực hành truyền thống và nhiều hơn là một quản lý dự án/sản phẩm hoặc trưởng nhóm kỹ thuật, nhấn mạnh rằng phát triển có hỗ trợ AI hiệu quả vẫn đòi hỏi kiến thức miền để chỉ định mục tiêu và đủ chuyên môn kỹ thuật để đánh giá, gỡ lỗi và sửa lỗi đầu ra. Cảnh báo ngụ ý là việc ủy quyền tạo mã là khả thi, nhưng chỉ khi người dùng xây dựng đủ hiểu biết để kiểm toán các khác biệt (diffs), suy luận về kiến trúc và chịu trách nhiệm về các lỗi trong sản xuất.

Tôi đã lập trình trình quản lý thiết bị đầu cuối cho bộ não ADHD. 100% mã nguồn mở (Hoạt động: 1100): NodeTerm là một không gian làm việc/canvas thiết bị đầu cuối mã nguồn mở để quản lý các phiên thiết bị đầu cuối cục bộ và SSH bền vững, được định vị là một giải pháp thay thế nhẹ cho việc tung hứng các quy trình làm việc macOS Terminal + VS Code Git. Các tính năng được tuyên bố bao gồm bố cục/phiên thiết bị đầu cuối có thể kết nối lại, quản lý thiết bị đầu cuối SSH từ xa với hỗ trợ kéo/thả và hình ảnh, tiếp tục phiên trên thiết bị di động, các thao tác Git tích hợp, chia sẻ ngữ cảnh giữa các thiết bị đầu cuối và quy trình làm việc kiểu Claude Code đa tác nhân/được điều phối; liên kết dự án: nodeterm.dev và kho lưu trữ GitHub. Các bình luận nhẹ nhàng về phê bình kỹ thuật: một người khen ngợi video, trong khi người khác chỉ trích khung “ADHD” là không có cơ sở nếu không có bằng chứng thực nghiệm hoặc giải thích cụ thể về vấn đề cụ thể của ADHD nào được giải quyết. Một người bình luận khác nói đùa rằng bản demo trông giống như một bản nhại của lập trình điện ảnh.

2. Chất lượng, giới hạn và chiến lược phát hành của Claude 5

Anthropic gia hạn mức tăng giới hạn 50% đến ngày 31 tháng 8 (Hoạt động: 1702): Hình ảnh là ảnh chụp màn hình của một bài đăng X từ ClaudeDevs đã được xác minh thông báo rằng Anthropic đang gia hạn mức tăng tạm thời 50% đối với giới hạn Claude Code hàng tuần đến ngày 31 tháng 8 cho người dùng Pro, Max, Team và Enterprise dựa trên chỗ ngồi, sau một lần gia hạn trước đó đến ngày 19 tháng 8. Anthropic cho biết họ hy vọng sẽ làm cho các giới hạn tăng lên trở thành vĩnh viễn, nhưng cảnh báo rằng “nhu cầu mạnh mẽ có thể giữ cho công suất bị thắt chặt” trong những tuần tới. Các bình luận về hình ảnh coi việc gia hạn là phản ứng đối với sự không hài lòng của khách hàng về công suất/chất lượng mô hình của Claude Code, với người dùng cáo buộc sự suy giảm, sự dài dòng quá mức và rủi ro rời bỏ. Một số suy đoán Anthropic có thể đang phản ứng cạnh tranh với áp lực giá từ “Sol5.6”, mặc dù điều này chưa được xác minh.

Claude đang làm tôi mất lòng sau khi là người dùng nặng từ khi phát hành (Hoạt động: 1637): Một người dùng nặng lâu năm của Claude / Claude Code báo cáo sự suy giảm định tính trong hành vi “Opus 5” / “Fable 5” mới hơn: giao tiếp nhà phát triển ít dễ đọc hơn, biệt ngữ không giải thích được như “chips” và cách diễn đạt tác vụ quá nén như “the server repoint” thay vì các bước triển khai rõ ràng. Khiếu nại kỹ thuật chính là sự suy giảm quy trình làm việc trong các phiên lập trình: Claude liên tục thêm các danh sách vấn đề “đã tìm thấy nhưng không chạm vào” không được yêu cầu, tạo ra sự mở rộng phạm vi xung quanh các mối quan tâm nhỏ về CSS/thành phần/DRY, đôi khi cho các hiện vật mà chính Claude đã giới thiệu, mặc dù có hướng dẫn dự án để xử lý việc dọn dẹp đó trực tiếp. Các bình luận hàng đầu đồng ý mạnh mẽ nhưng thêm rất ít chi tiết kỹ thuật, mô tả hành vi hiện tại của Claude là dài dòng, lười biếng và “không thể chịu nổi”. Người đăng cho biết họ đã hạ cấp từ Max 20x xuống 5x, đang sử dụng Codex nhiều hơn và có thể hạ cấp thêm nếu các sự suy giảm về giao tiếp và quản lý tác vụ vẫn tiếp diễn.

Anthropic đã hoàn thành đào tạo Mythos 2 nhưng hiện không có kế hoạch phát hành nó. Trọng tâm hiện là các cải tiến nội bộ (Hoạt động: 926): Một bài đăng trên Reddit trích dẫn báo cáo của Kimmonismus/X tuyên bố Anthropic đã hoàn thành đào tạo Mythos 2 nhưng hiện không có kế hoạch phát hành, trong khi vòng lặp đào tạo/cải tiến nội bộ hướng tới Mythos 3 vẫn tiếp tục. Bài đăng coi đây là một chiến lược không phát hành, suy đoán Anthropic có thể đang giữ lại các mô hình công cộng mạnh hơn để giảm rủi ro chưng cất (distillation) của đối thủ cạnh tranh và vì Claude Fable 5 được cho là vẫn đi trước các lựa chọn thay thế công cộng như GPT 5.6 Sol. Người bình luận suy đoán Anthropic sẽ chỉ phát hành Mythos/Mythos 2 để đáp trả việc ra mắt OpenAI Astra, trong khi một người khác lưu ý tình hình giống như các dự đoán từ bài báo “AI 2027”. Một sự bất đồng kỹ thuật hơn tuyên bố Anthropic có hai mô hình nội bộ, với mô hình tốt hơn chỉ hơn Mythos 1.5 AECI, gọi việc không phát hành là “không có gì” cho đến khi một mô hình đáng kể hơn sẵn sàng.

3. Dữ liệu đào tạo AI và hậu quả chính sách lao động

Các nhà báo nhét AirTag vào kho hàng của Amazon để chứng minh họ tiêu hủy sách hiếm để đào tạo AI (Hoạt động: 3301): 404 Media được cho là đã phối hợp với một người bán sách để giấu Apple AirTag trong một cuốn sách hiếm có trong một lô hàng lớn; dữ liệu theo dõi được cho là cho thấy cuốn sách kết thúc tại một cơ sở đào tạo AI của Amazon ở Las Vegas, hỗ trợ các tuyên bố rằng sách vật lý đang bị xử lý hủy hoại để lấy dữ liệu đào tạo AI. Một người bình luận bán sách đã đặt điều này vào bối cảnh như một phần của mô hình chuỗi cung ứng rộng lớn hơn: khối lượng lớn sách được quyên góp, còn lại, không bán được hoặc bị thư viện loại bỏ đã bị cắt nhỏ, với một ước tính rằng khoảng 50% đầu sách mới theo mùa trong các hiệu sách có thể không bao giờ bán được một bản trước khi bị trả lại, còn lại hoặc bị tiêu hủy (bình luận). Người bình luận tranh luận liệu thực tiễn của Amazon có đặc biệt đáng phản đối hay chỉ đơn giản là khai thác một dòng chất thải hiện có của sách có nhu cầu thấp. Một người bình luận yêu cầu một nguồn mạnh hơn, trong khi người khác tuyên bố—không có bằng chứng trong chuỗi được cung cấp—rằng việc tiêu hủy có thể được yêu cầu hợp pháp theo “Dự án Panama” thay vì hoàn toàn tự nguyện.

Big Tech đang huy động hàng tỷ USD để ngăn chặn UBI (Hoạt động: 2317): Bài đăng tuyên bố Gina Raimondo (cựu Bộ trưởng Thương mại Hoa Kỳ) hiện là CEO của RAISE US, một tổ chức mới ra mắt, được các tập đoàn hậu thuẫn, định vị chống lại UBI/thu nhập cơ bản như một phản ứng với sự gián đoạn của AI, với việc Raimondo được trích dẫn nói rằng UBI sẽ “giống như sự kết thúc của nước Mỹ”. Nó nói RAISE US ra mắt vào ngày 25 tháng 6, đã huy động được hơn 500 triệu USD hướng tới mục tiêu 1 tỷ USD và liệt kê Amazon, Anthropic, Microsoft và OpenAI Foundation là các đối tác neo cùng với các công ty bao gồm Blackstone, IBM, GM, Mastercard, Deloitte, Cisco và Workday. Các bình luận hàng đầu định hình một nền kinh tế do AI thúc đẩy mà không có UBI là một “chế độ loạn luân” (dystopia) ưu tiên chủ sở hữu vốn và chỉ trích các công ty công nghệ lớn vì tài trợ cho các nỗ lực chống UBI trong khi có khả năng tự động hóa công việc. Một chuỗi chính sách thực chất lập luận cho một loại thuế thu nhập âm—trích dẫn Milton Friedman và các đề xuất thất bại của Hoa Kỳ những năm 1970—như một giải pháp thay thế đơn giản hơn cho các chương trình phúc lợi phân mảnh, với các ưu đãi được thiết kế để công việc và các hộ gia đình hai cha mẹ luôn duy trì mức dương ròng.

Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ smol.ai AI News. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.