smol.ai AI News
85

Tin ngành

OpenAI mở rộng điều tra bảo mật, ra mắt công cụ mới và tối ưu hóa chi phí vận hành

(giờ Việt Nam)

Tóm tắt AI

OpenAI mở rộng điều tra sự cố bảo mật, phát hành công cụ quét mã nguồn Codex Security CLI và đạt hiệu suất tối ưu nhờ GPT-5.6 Sol. Đồng thời, hãng cam kết hỗ trợ nghiên cứu học thuật với mục tiêu tiếp cận 100.000 người dùng vào năm 2027.

Bản dịch AI

not much happened today | AINews

Một ngày yên ắng.

Tin tức AI từ 28/7/2026 đến 29/7/2026. Chúng tôi đã kiểm tra 12 subreddit, 544 tài khoản Twitter và không có thêm thông tin nào từ Discord. Trang web của AINews cho phép bạn tìm kiếm tất cả các số đã phát hành. Xin nhắc lại, AINews hiện là một chuyên mục của Latent Space. Bạn có thể tùy chọn nhận hoặc hủy nhận email theo tần suất mong muốn!

Tóm tắt AI trên Twitter

Hệ quả bảo mật tác nhân (Agent Security) của OpenAI, quản trị sự lệch lạc (Misalignment Governance) và cuộc tranh luận về "tốc độ phát triển" (Pacing)

Nỗ lực Codex của OpenAI: CLI bảo mật, quyền truy cập học thuật và hạ tầng tự cải tiến

Hệ sinh thái Kimi K3: Hiệu năng vLLM, chi tiết về chưng cất mô hình (Distillation) và khả năng sẵn sàng cục bộ/ngày đầu ra mắt

Tác nhân (Agents), bộ công cụ (Harnesses) và các bộ tiêu chuẩn đánh giá (Benchmarks): Việc đánh giá trong môi trường thực tế đang trở nên tinh vi hơn

Trọng số mở (Open Weights), công cụ cho tác nhân và hạ tầng dành cho nhà phát triển

Các tweet hàng đầu (theo mức độ tương tác)

Tóm tắt AI trên Reddit

Tóm tắt từ /r/LocalLlama + /r/localLLM

1. Các tiêu chuẩn đánh giá suy luận cục bộ cho mô hình MoE khổng lồ

Kimi K3 cho mục đích sử dụng cục bộ (1,56TB → 594GB) được nén và phát hành bởi Unsloth (Hoạt động: 386): Unsloth đã phát hành các bản lượng tử hóa (quantization) để sử dụng cục bộ cho Kimi K3 ở mức 8/4/2/1 bit, với dung lượng được báo cáo là Q8 1,56 TB (không mất dữ liệu), Q4 1,51 TB, Q2 861 GB và Q1 594 GB. Họ khẳng định biến thể Q1 nhỏ nhất vẫn giữ được 78,9% độ chính xác trong khi nhỏ hơn khoảng 3 lần so với bản gốc. Một người bình luận cũng chỉ ra công trình cắt tỉa (pruning) sớm: prometheusAIR/Kimi-K3-REAP55-GGUF, được mô tả là một biến thể GGUF nhỏ/đã cắt tỉa với dung lượng khoảng 342 GB. Những người bình luận tỏ ra hoài nghi về tính hữu dụng của Q1 trong sản xuất, đặc biệt là khi mô hình cơ sở đã được lượng tử hóa—gọi đây là "lượng tử hóa của lượng tử hóa" với mục đích thực tế không rõ ràng ngoài việc làm benchmark. Những người khác nói đùa rằng ngay cả mô hình 594–600 GB "nhỏ" này vẫn đòi hỏi bộ nhớ/lưu trữ cấp máy chủ thực thụ.

Kết quả Kimi K3 đầu tiên trên máy tính cá nhân ~ 4t/s (Hoạt động: 582): Hình ảnh là ảnh chụp màn hình kỹ thuật về quá trình suy luận Kimi K3 cục bộ, hiển thị phản hồi thuật toán sắp xếp nổi (bubble sort) và các thông số thời gian chạy: model shard Kimi-K3-Q2_K-00001-of-00094, tạo ra 947 token trong 4 phút 6 giây, tương đương khoảng 3,85 tok/s trên một máy tính cá nhân với 768 GB DDR5 + 2× RTX 5090 (hình ảnh). Bài đăng cho biết sử dụng một bản fork của llama.cpp để hỗ trợ văn bản cho Kimi K3 và bản lượng tử hóa Q2_K GGUF từ Hugging Face, với tốc độ prefill cho prompt dài khoảng 50–70 tok/s và thông lượng giải mã dường như tăng dần theo thời gian, có thể do quá trình khởi động (warmup) hoặc hành vi hoán đổi bộ nhớ. Người bình luận coi mức ~4 tok/s là mạnh một cách đáng ngạc nhiên đối với một mô hình quy mô tiên phong đã bị lượng tử hóa nặng trên "phần cứng gia đình phi lý", đặc biệt là khi so sánh với các báo cáo về các thiết lập nhiều card 5090 qua Ethernet chỉ đạt ~0,7 tok/s. Một số người nói đùa về yêu cầu điện năng/nhiệt độ và sự trớ trêu khi sử dụng một thiết lập như vậy chỉ để yêu cầu mã nguồn thuật toán sắp xếp nổi.

Cập nhật: Kimi K3 hiện đang chạy ở mức ~4 token/phút trên M1 MacBook của tôi (Hoạt động: 560): Deltafin báo cáo việc suy luận toàn bộ mô hình Moonshot AI Kimi K3 trên một chiếc MacBook Pro M1 Max 64 GB đã cải thiện từ ~1 token/phút lên mức trung bình 4,1 token/phút (14,6 giây/token, 0,069 tok/s) qua sáu lần chạy toàn bộ mô hình, khớp với kết quả tham chiếu của repo là ~0,0687 tok/s cho mô hình MoE 2,8 nghìn tỷ tham số (GitHub). Các tối ưu hóa chính bao gồm việc chỉ tải có chọn lọc 16 chuyên gia (experts) được định tuyến cho mỗi lớp thông qua đọc raw-span song song, lượng tử hóa int8 cho phần "xương sống" (spine) với kernel giải mã/sao chép Metal hợp nhất, và Apple packed MPS int8 matmul cho phép chiếu đầu ra, giúp giảm dung lượng lưu trú từ ~4,7 GB xuống 1,17 GB và cải thiện thông lượng giải mã trung bình khoảng 17%. Người bình luận chủ yếu nhấn mạnh sự cực đoan khi chạy một mô hình MoE hàng nghìn tỷ tham số trên Apple Silicon tiêu dùng và ca ngợi sự cải thiện nhanh chóng ~4 lần chỉ trong ~35 giờ kể từ khi có trọng số; phần còn lại là những lời nói đùa nhẹ nhàng về "token theo phút" và thử nghiệm trên phần cứng nhỏ hơn như Raspberry Pi 8 GB.

Chạy Kimi K3 2,8 nghìn tỷ tham số của Moonshot trên mini-PC không có GPU, một ngày sau khi ra mắt (Hoạt động: 350): Tác giả báo cáo việc chạy Moonshot Kimi K3, một checkpoint MoE 2,8 nghìn tỷ tham số (1,56TB, 96 safetensors shards, 93 lớp, 896 chuyên gia/lớp), trên một chiếc mini-PC Slimbook ONE không có GPU với chip Ryzen AI 9 HX 370, 128GB RAM và hai ổ NVMe tiêu dùng sử dụng rabbit. Việc triển khai giữ các thành phần dày đặc/chia sẻ đã được lượng tử hóa trong RAM trong khi truyền trực tiếp trọng số chuyên gia MXFP4 từ các tệp safetensors của Moonshot với bộ nhớ đệm LRU/pinning; không cần chuyển đổi checkpoint, và quá trình xác thực bao gồm so sánh bit-exact với mã tham chiếu của Moonshot cùng các kiểm tra cấu trúc. Hiệu suất hiện tại cực kỳ chậm: tải mô hình 610 giây, prefill 412,8 giây cho 7 token và tạo 40 token trong 2698,1 giây (~0,015 tok/s), với việc tác giả lưu ý rằng kernel MXFP4 vẫn ở dạng vô hướng và chưa được tinh chỉnh. Người bình luận coi kết quả này là bằng chứng thực thi hơn là suy luận thực tế: "0,01 token mỗi giây, nhưng nó chạy được." Một người khác lưu ý rằng thời gian tải 10 phút không phải là quá tệ so với một số trải nghiệm vLLM.

DeepSeek V4 Flash, lên tới 32 tok/s trên AMD Ryzen AI MAX+ 395 (Hoạt động: 484): Hình ảnh là một đồ họa quảng cáo/phi kỹ thuật cho tuyên bố của bài đăng: chạy DeepSeek V4 Flash trên AMD Ryzen AI MAX+ 395 / Strix Halo với 128 GB bộ nhớ thống nhất. Nội dung kỹ thuật nằm trong phần tự mô tả: Lucebox báo cáo việc nạp một mục tiêu DeepSeek V4 Flash GGUF 284B tham số cộng với một bản nháp suy đoán DSpark 11,3 GB sử dụng các định dạng bit thấp hỗn hợp ROCmFPX, đạt 25,31 tok/s tự hồi quy, lên tới 32,0 tok/s giải mã suy đoán và khoảng 245–255 tok/s prefill thưa thớt ở ngữ cảnh ~8K dưới ROCm/HIP gfx1151. Người bình luận đặt câu hỏi về các giới hạn thực tế, đặc biệt là liệu ngữ cảnh 8k có hữu ích không và hiệu suất sẽ ra sao khi bộ nhớ 128 GB được tải đầy; những người khác hỏi về chất lượng lập trình so với Qwen và liệu thiết lập ROCm/HIP chỉ dành cho Linux hay có hoạt động trên Windows.

2. Điểm nóng về chính sách Trọng số mở (Open-Weights)

Anthropic đang kêu gọi cấm các mô hình trọng số mở bằng cách đề xuất các yêu cầu bắt buộc mà họ có lẽ sẽ không bao giờ đáp ứng được (Hoạt động: 1893): Hình ảnh là một đoạn trích được làm nổi bật từ lập luận chính sách của Anthropic, tuyên bố rằng họ "chưa bao giờ ủng hộ việc cấm các mô hình trọng số mở" trong khi cũng lập luận rằng các bản phát hành trọng số mở khó giám sát hoặc kiểm soát hơn sau khi phát hành và rằng các mô hình mở và đóng đủ khả năng nên đối mặt với các bài kiểm tra an toàn bắt buộc. Trong bối cảnh tuyên bố của tiêu đề rằng Anthropic thực sự đang kêu gọi lệnh cấm, người bình luận tập trung vào việc liệu các yêu cầu như vậy có thực sự bất khả thi đối với các mô hình trọng số mở hay không và liệu các mô hình đóng của chính Anthropic có thể vượt qua các bài kiểm tra tương tự hay không. Những người bình luận về hình ảnh tỏ ra hoài nghi, lập luận rằng cách đặt vấn đề của Anthropic có thể tương đương với một lệnh cấm trọng số mở trên thực tế mặc dù họ phủ nhận lệnh cấm rõ ràng. Một điểm phản bác đáng chú ý là nếu việc chưng cất mô hình khó ngăn chặn như việc lạm dụng trọng số mở, thì logic tương tự có thể ngụ ý các hạn chế đối với chính các mô hình của Anthropic.

Xin lỗi, nhưng có phải Dario vừa nói rằng các mô hình trọng số đóng, bí mật còn tệ hơn các mô hình trọng số mở không? (Hoạt động: 1042): Hình ảnh là ảnh chụp màn hình của một bài báo về chính sách AI (được liên kết tại đây) làm nổi bật một tuyên bố được gán cho Dario trong tiêu đề: rằng "mô hình nguy hiểm nhất có thể là mô hình được huấn luyện trong bí mật" và được trao cho các tác nhân quân sự/an ninh, thay vì một mô hình được phát hành trọng số công khai. Ý nghĩa kỹ thuật/ngữ cảnh là sự căng thẳng trong các lập luận quản trị AI: trong khi trọng số mở thường bị coi là rủi ro phổ biến, đoạn trích được làm nổi bật cho thấy các mô hình tiên phong bí mật, đóng có thể nguy hiểm hơn khi được tối ưu hóa và triển khai bởi các tác nhân nhà nước cho máy bay không người lái, giám sát, đàn áp hoặc ưu thế quân sự. Các bình luận chủ yếu coi đây là sự đạo đức giả hoặc một sự mâu thuẫn vô tình trong các lập luận chống trọng số mở, với một người bình luận nói đùa rằng nó trông giống như văn bản do Claude tạo ra mà không được kiểm duyệt. Một luồng thảo luận khác đặt mối lo ngại vào bối cảnh địa chính trị, lập luận rằng sự lạm dụng được mô tả phản ánh hành vi quân sự/giám sát hiện có của Hoa Kỳ thay vì là duy nhất đối với Trung Quốc.

Ý kiến của Zuck: Tương lai AI là dành cho tất cả mọi người (Hoạt động: 494): Hình ảnh là ảnh chụp màn hình/hình minh họa cho bài xã luận của Mark Zuckerberg trên WSJ, "Tương lai AI là dành cho tất cả mọi người", định hình sự cởi mở của AI như một vấn đề về phân quyền, quyền tự quyết của con người và sự kháng cự đối với quyền kiểm soát tập trung. Về mặt kỹ thuật, bài đăng đặt quan điểm của Zuckerberg vào cuộc tranh luận về chính sách AI hiện tại: hệ sinh thái mở/khuếch tán so với các hạn chế dựa trên ngưỡng, tốc độ phát triển tiên phong hoặc quản trị tập trung các hệ thống AI tiên tiến. Bản thân hình ảnh mang tính biểu tượng hơn là kỹ thuật: một cái đầu người hình lồng đang thả những con chim giống như mạch điện, trực quan lập luận rằng quyền truy cập AI mở "giải phóng" tiềm năng con người. Người bình luận chủ yếu tập trung vào các tác động chính sách của quyền lực AI tập trung, với một người đồng ý rằng việc coi AI là quá nguy hiểm đến mức chỉ có kiểm soát tập trung mới an toàn thì bản thân điều đó có thể đã nguy hiểm. Một bình luận thực tế khác đã cắt ngang khung tuyên ngôn bằng cách yêu cầu một bản phát hành Llama mới.

3. Hành vi của mô hình vượt ra ngoài các tiêu chuẩn đánh giá

Các LLM "không kiểm duyệt" (Uncensored) lạc quan hơn đáng kể so với các mô hình cơ sở của chúng (Hoạt động: 382): Bài đăng báo cáo một đánh giá cục bộ đã đăng ký trước về các biến thể Gemma và Qwen không kiểm duyệt đã được "xóa bỏ" (abliterated) bởi huihui so với các mô hình cơ sở của chúng trên 21.600 quyết định về hướng cổ phiếu, sử dụng các payload tin tức/trích dẫn công ty giống hệt nhau và yêu cầu dự báo tăng/giảm trong 1 tuần; dữ liệu/mã nguồn được liên kết trong bài viết của tác giả: arXiv:2607.17427. Phát hiện chính là việc loại bỏ các từ chối thông qua xóa bỏ đã thay đổi khuynh hướng của mô hình: các mô hình không kiểm duyệt đưa ra nhiều dự báo "tăng" hơn, ít dấu hiệu không chắc chắn hơn và các lập luận dài hơn/tự tin hơn, nhưng không cải thiện độ chính xác dự đoán, vẫn gần như tung đồng xu. Một kết quả cụ thể theo dòng mô hình đáng chú ý là sự trôi dạt sự tự tin trái ngược: sự tự tin của Gemma giảm, trong khi sự tự tin của Qwen tăng lên dưới cùng một kiểu chỉnh sửa. Người bình luận gợi ý rằng hiệu ứng này có thể là một hệ quả tầm thường của việc loại bỏ khả năng nói "không" của mô hình, làm chệch hướng đầu ra một cách hiệu quả về phía các phản hồi khẳng định, trong khi một người khác đặt câu hỏi liệu "sự tự tin" có phải là chiều tiềm ẩn đúng để đo lường cho sự trôi dạt này hay không.

Một mô hình có 5B tham số hoạt động không biết nhiều, và tôi đã ngừng coi đó là một khiếm khuyết (Hoạt động: 318): Hình ảnh là một sơ đồ kiến trúc kỹ thuật, không phải meme: nó cho thấy Ling–3.0–flash là một mô hình MoE lớn với tổng cộng 124B / khoảng 5B tham số hoạt động, từ vựng 157k, ngữ cảnh 1M, kích thước nhúng 2560, Kimi Delta Attention, gated latent attention, RoPE/RMSNorm và định tuyến chuyên gia E512A8 + 1 chuyên gia chia sẻ (hình ảnh). Trong bối cảnh của bài đăng, sơ đồ hỗ trợ lập luận của tác giả rằng các mô hình MoE có ít tham số hoạt động nên được đánh giá ít hơn dựa trên các tiêu chuẩn đánh giá kiến thức ghi nhớ như MMLU và nhiều hơn vào việc liệu chúng có gọi công cụ / truy xuất ngữ cảnh một cách đáng tin cậy thay vì ảo tưởng khi thiếu kiến thức hay không. Người bình luận phần lớn đồng ý rằng đối với các quy trình RAG/tác nhân công cụ cục bộ, kiến thức nội tại của mô hình quan trọng ít hơn việc truy xuất và sử dụng công cụ đáng tin cậy. Một cuộc tranh luận tập trung vào việc liệu "tham số hoạt động" có phải là một điểm yếu có ý nghĩa hay không: một người bình luận lập luận rằng các mô hình dày đặc cũng thực sự thưa thớt trong quá trình suy luận, vì vậy số lượng tham số hoạt động của MoE không nên được coi là một đại diện đơn giản cho khả năng.

Cảm ơn bất cứ ai đã nói đừng lượng tử hóa KV (Hoạt động: 619): Bài đăng báo cáo sự suy giảm chất lượng từ việc lượng tử hóa KV-cache trên Qwen3.6-27B, tuyên bố rằng việc vô hiệu hóa lượng tử hóa KV Q8 tạo ra sự cải thiện "một trời một vực" so với việc chỉ lượng tử hóa trọng số, đặc biệt là đối với lập trình Elixir ở ngữ cảnh 100k+. Thiết lập sử dụng chế độ chia tensor đa GPU của llama.cpp trên hai GPU Nvidia 5060 Ti 16GB (tổng cộng 32GB), chạy các bản lượng tử hóa trọng số bartowski IQ4_NL của Qwen3.6-27B; OP cho biết việc chia tensor đã giải phóng đủ VRAM để tránh lượng tử hóa KV và/hoặc tăng kích thước ngữ cảnh. OP cũng liên kết bình luận lời khuyên gốc tại đây và một bình luận mô tả sự cải thiện tại đây. Người bình luận nhìn chung đồng ý rằng việc tránh lượng tử hóa KV-cache có thể quan trọng, nhưng một người lưu ý rằng họ thường giữ KV ở Q8 vì nó "đủ gần với không mất dữ liệu" và họ chưa quan sát thấy sự khác biệt về hiệu suất. OP phản bác rằng các bài kiểm tra tổng hợp có thể bỏ lỡ các lỗi trong lập trình ngôn ngữ ngách ở ngữ cảnh rất dài, nơi các tổn thất chất lượng nhỏ trở nên dễ nhận thấy hơn.

Tóm tắt các Subreddit AI ít kỹ thuật hơn

/r/Singularity, /r/Oobabooga, /r/MachineLearning, /r/OpenAI, /r/ClaudeAI, /r/StableDiffusion, /r/ChatGPT, /r/ChatGPTCoding, /r/aivideo, /r/aivideo

1. Các bản demo trò chơi và video do AI tạo ra

Mọi người thích sa mạc của tôi, nên đây là bản demo điều khiển nước! (Hoạt động: 4989): Bài đăng công bố SNOWFLOW, một bản demo đồ họa WebGPU/Babylon.js chỉ chạy trên trình duyệt với địa hình tuyết theo thủ tục, tuyết biến dạng bền bỉ, mô phỏng vải/áo choàng, hiệu ứng hình ảnh phép thuật nước/tuyết và hệ thống di chuyển lướt trên tuyết; bản demo trực tiếp được lưu trữ trên Vercel và mã nguồn nằm trên GitHub. Tác giả cho biết Claude Code với Opus 5 đã tạo ra dự án từ đầu đến cuối từ một bản tóm tắt triển khai chi tiết—kiến trúc, hệ thống Babylon.js/WGSL, lập hồ sơ, lặp lại ảnh chụp màn hình và tài liệu—trong khoảng 9 giờ và ~4 triệu token không được lưu vào bộ nhớ đệm. Bản tóm tắt chỉ định mục tiêu cao cấp là Chrome/WebGPU trên Windows 11 + RTX 5070 Ti ở độ phân giải 2560×1440, duy trì 90 FPS / tối thiểu 60 FPS, biến dạng tuyết bền bỉ thông qua mục tiêu kết xuất theo người chơi, bản đồ địa hình, đổ bóng tuyết tùy chỉnh với SSS/glints/trạng thái băng, hậu kỳ, làm ấm đường ống và tránh phân bổ vòng lặp kết xuất nghiêm ngặt. Các bình luận hàng đầu chủ yếu là phản ứng nhẹ nhàng thay vì đánh giá kỹ thuật: người dùng ca ngợi bản demo, đề xuất mở rộng nó thành trò chơi nhiều người chơi hoặc trò chơi điều khiển kiểu Avatar thế giới mở, và nói đùa về dòng prompt "Đừng xây dựng bộ kiểm thử; thời gian dành cho kiểm thử là thời gian không dành cho shader tuyết."

Ai đó đã tạo ra một trò chơi khám phá kiểu NMS trong một ngày với Opus 5 (Hoạt động: 1657): Một nhà phát triển tuyên bố Opus 5 đã xây dựng một trò chơi khám phá kiểu No Man’s Sky/Starfield trong khoảng một ngày, bao gồm mã trò chơi cộng với tất cả tài nguyên—mô hình 3D và kết cấu—được tạo thông qua Blender MCP sử dụng các tác nhân phụ; quy trình làm việc được mô tả trong chuỗi X được liên kết: x.com/anshuc/status/2081801966158811506. Người bình luận lưu ý rằng kết quả dường như được đóng gói dưới dạng "tệp HTML tự chứa", ngụ ý một bản dựng có thể phân phối trên trình duyệt với các tài nguyên được nhúng/tạo thay vì một dự án công cụ trò chơi thông thường. Các bình luận hàng đầu bị ấn tượng bởi chất lượng tài nguyên, với một người nói rằng các mô hình "tốt đến điên rồ" và một người khác lập luận rằng nó trông gần giống Starfield hơn là No Man’s Sky. Một cuộc tranh luận rộng hơn đã nảy sinh xung quanh sự thù địch với AI trong phát triển trò chơi, với một người bình luận lập luận rằng tâm lý chống AI đang kìm hãm các trò chơi thú vị tiềm năng và trích dẫn phản ứng dữ dội đối với các tài nguyên tạm thời do AI tạo ra.

Tôi đã chạy SCAIL 2 qua một loạt các tình huống mà nó không nên xử lý. Nó đã xử lý hầu hết chúng. (Hoạt động: 1223): Tác giả đã kiểm tra căng thẳng SCAIL 2 cho các chỉnh sửa dựa trên video/hình ảnh vượt ra ngoài các bản demo nhân vật đơn lẻ điển hình, báo cáo kết quả mạnh nhất cho việc hoán đổi nhân vật khi khung hình đầu tiên được chỉnh sửa trước thành danh tính/tư thế mục tiêu bằng Flux Klein 9B hoặc Krea 2 Identity Edit LoRA. Các khả năng được báo cáo bao gồm sự tồn tại của đối tượng hợp lý sau khi các đối tượng rời/vào lại khung hình, các động lực học ảo tưởng hợp lý như cung lửa, chuyển động tóc/quần áo, khúc xạ ly rượu trong suốt và chất lỏng sóng sánh, trong khi kết xuất văn bản bị suy giảm thành hỗn hợp không thể đọc được. Quy trình làm việc sử dụng giao diện người dùng cục bộ mã nguồn mở Mix Studio ComfyUI (GitHub); các thế hệ được báo cáo mất ~2–3 phút trên Dell Pro Precision T2 + NVIDIA RTX 6000 Pro, với hướng dẫn trên YouTube. Các bình luận rất thưa thớt nhưng coi SCAIL 2/Bernini là "bị đánh giá thấp một cách điên rồ" và nêu lên mối lo ngại về tính xác thực được mong đợi: "Chúng ta không bao giờ có thể tin tưởng vào video nữa." Một người dùng đặc biệt tự hỏi liệu quy trình làm việc có phù hợp với RTX 4070 12GB hay không, nhưng không có xác nhận về VRAM/thời gian chạy nào được cung cấp.

2. MCP 2026-07-28 và các công cụ quy trình làm việc của Claude

MCP vừa có bản cập nhật lớn nhất kể từ khi ra mắt 👀 (Hoạt động: 1034): Hình ảnh là ảnh chụp màn hình của một bài đăng X thông báo "MCP 2026-07-28", được mô tả trong tiêu đề Reddit là bản cập nhật lớn nhất của MCP kể từ khi ra mắt: hình ảnh. Thay đổi kỹ thuật chính được thảo luận trong các bình luận là MCP hiện không trạng thái/yêu cầu-phản hồi, vì vậy các máy chủ MCP từ xa không còn cần các phiên kéo dài theo từng khách hàng và có thể chạy sau các bộ cân bằng tải HTTP thông thường hoặc hạ tầng không máy chủ. Người bình luận cũng lưu ý sự liên kết OAuth 2.0/OIDC được cải thiện cho xác thực doanh nghiệp và các Tác vụ được tiêu chuẩn hóa cho các hoạt động chạy dài, trong khi các máy chủ MCP stdio cục bộ hầu như không bị ảnh hưởng. Người bình luận nhìn chung coi việc thiết kế lại không trạng thái là một chiến thắng lớn cho các triển khai MCP được lưu trữ/từ xa, mặc dù một người chỉ trích thiết kế có trạng thái ban đầu là một lựa chọn kiến trúc tồi.

có ai đang sử dụng tính năng này không? (Hoạt động: 1402): Hình ảnh (JPEG) hiển thị một video di động có tiêu đề "Sử dụng Điều khiển từ xa Claude Code" từ @claude, và tiêu đề Reddit hỏi liệu có ai đang sử dụng tính năng này không. Người bình luận mô tả việc sử dụng Điều khiển từ xa Claude Code như một quy trình làm việc từ điện thoại đến tác nhân: để Claude chạy trên máy tính xách tay hoặc một phiên bản EC2 nhỏ, sau đó yêu cầu nó kiểm tra cơ sở mã, chẩn đoán sự cố, chỉnh sửa mã và mở PR từ xa trong khi rời khỏi máy trạm. Chuỗi thảo luận nhìn chung tích cực giữa các người bình luận kỹ thuật, gọi đó là "tiện lợi ĐIÊN RỒ" và "một trong những tính năng tốt nhất của họ". Bình luận hình ảnh hiển thị nắm bắt mối lo ngại chính: các tác nhân lập trình từ xa có thể làm mờ ranh giới giữa công việc và thời gian cá nhân — "Tôi cần sự cân bằng giữa công việc và cuộc sống, không phải sự tích hợp giữa công việc và cuộc sống."

Bất cứ ai đã tạo ra kỹ năng ADHD, chúa phù hộ bạn (Hoạt động: 3607): Một người dùng Reddit đã chia sẻ toàn bộ văn bản của một "kỹ năng" Anthropic Claude có tên i-have-adhd, nhằm định hình lại toàn cầu các đầu ra của Claude cho khả năng sử dụng định hướng ADHD: dẫn đầu bằng các hành động tiếp theo có thể thực thi, các bước được đánh số giới hạn, nêu lại trạng thái qua các lượt, giới hạn danh sách ở mức 5, cung cấp ước tính thời gian cụ thể, loại bỏ các đoạn lạc đề/lời mở đầu/lời kết và xử lý các vòng xoáy gỡ lỗi bằng cách đặt lại chẩn đoán. Một bình luận hàng đầu gán nguồn gốc cho repo GitHub ayghri/i-have-adhd. Người bình luận phần lớn xác nhận tiền đề một cách mỉa mai, lưu ý rằng họ đã bỏ qua văn bản kỹ năng dài do ADHD; một người nhấn mạnh việc ghi công thích hợp cho người tạo ban đầu.

3. Các hạn chế truy cập AI và xếp hạng mô hình

Công ty tôi làm việc đã nhận được chỉ thị của Chính phủ Hoa Kỳ yêu cầu chúng tôi ngừng sử dụng các sản phẩm, dịch vụ và mô hình của Anthropic. (Hoạt động: 1186): Một người dùng Reddit tuyên bố chủ lao động của họ đã nhận được chỉ thị của Chính phủ Hoa Kỳ yêu cầu loại bỏ dần toàn công ty đối với các sản phẩm/dịch vụ/mô hình của Anthropic—bao gồm ứng dụng Claude, Claude Code/CLI, Anthropic Console/APIs, Opus/Sonnet/Haiku và các tích hợp do Anthropic hỗ trợ trong IDEs/đám mây/dịch vụ được quản lý—với thời hạn cắt nội bộ là ngày 31 tháng 8 năm 2026 và lệnh cấm ngay lập tức đối với các tài khoản/khóa API/triển khai mới. Thông báo hướng dẫn người dùng kỹ thuật giữ các công cụ như Cursor chỉ với các mô hình Anthropic đã bị xóa, di chuyển quy trình làm việc Claude Code sang Codex thông qua các mô hình WebAI/GPT và yêu cầu CNTT/Bảo mật thực thi các kiểm soát truy cập và theo dõi phụ thuộc thông qua vé. Các bình luận hàng đầu chủ yếu mang tính chính trị hơn là kỹ thuật, định hình chỉ thị là sự vượt quyền của chính phủ và suy đoán rằng các nhà cung cấp có thể bị đẩy về phía các lựa chọn thay thế được ưu tiên về mặt chính trị như Grok.

Trump đang cấm các robot/mô hình AI của Trung Quốc (Hoạt động: 1263): Hình ảnh là ảnh chụp màn hình của một bài đăng X trích dẫn tiêu đề Reuters rằng chính quyền Trump có kế hoạch cấm các robot và bộ biến tần điện mới của Trung Quốc, được định hình là sự bảo vệ cho việc xây dựng hạ tầng AI của Hoa Kỳ. Bài đăng/tiêu đề bổ sung tuyên bố về một lệnh cấm mô hình AI của Trung Quốc có thể xảy ra, nhưng bản thân ảnh chụp màn hình lưu ý rằng đây chỉ là một tuyên bố trên X và "không được đề cập trong bài báo Reuters được hiển thị." Người bình luận tập trung ít hơn vào các mô hình AI và nhiều hơn vào tác động của chuỗi cung ứng, gọi lệnh cấm bộ biến tần điện là "điên rồ" và cảnh báo nó có thể làm tổn thương các công ty khởi nghiệp công nghệ Hoa Kỳ; một người hỏi tại sao bộ biến tần lại bị nhắm mục tiêu.

GPT-5, mô hình tốt nhất thế giới chỉ 1 năm trước, ngày nay kém hơn Qwen3.6 27B và hầu hết các mô hình cấp thấp ngày nay (Hoạt động: 2788): Hình ảnh là biểu đồ thanh tiêu chuẩn từ Chỉ số Trí tuệ Phân tích Nhân tạo (hình ảnh) cho thấy các mô hình tiên phong mới hơn ở gần đầu—ví dụ: Claude Opus 4.1 ở mức 61—trong khi GPT-5 "cao" được hiển thị thấp hơn nhiều ở mức 35. Tuyên bố kỹ thuật của bài đăng là Qwen3.6 27B, một mô hình tương đối nhỏ/mở, đạt 37, cao hơn một chút so với GPT-5 trên chỉ số "Trí tuệ" tổng hợp này, ngụ ý sự nén tiêu chuẩn nhanh chóng giữa các mô hình tiên phong và các mô hình nhỏ hơn. Người bình luận tranh luận liệu tiêu chuẩn đánh giá có phản ánh khả năng thực tế hay không: một số nhấn mạnh rằng Qwen3.6 27B miễn phí/mở và có khả năng chạy trên máy tính xách tay, trong khi những người khác lập luận rằng việc sử dụng thực tế vẫn đặt GPT-5 "vượt xa" và biểu đồ có khả năng phóng đại sự ngang bằng của mô hình nhỏ.

OpenAIBảo mật AIGPT-5.6Hạ tầng AINghiên cứu AI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ smol.ai AI News. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.