Tin ngành
Andrew Ng chính thức gia nhập làn sóng Kỹ thuật AI
(giờ Việt Nam)
Tóm tắt AI
Huyền thoại trong ngành AI đã bắt đầu tập trung vào lĩnh vực kỹ thuật AI, đánh dấu một bước chuyển mình quan trọng mà cộng đồng không thể bỏ qua.
Bản dịch AI
![[AINews] Andrew Ng gets into AI Engineering](https://substackcdn.com/image/fetch/$s_!2Hw4!,w_1200,h_675,c_fill,f_jpg,q_auto:good,fl_progressive:steep,g_auto/https%3A%2F%2Fsubstack-post-media.s3.amazonaws.com%2Fpublic%2Fimages%2F3107842a-995c-42c3-a41a-592339e041f8_1002x1182.png)
Chúng tôi đã không còn đếm xuể có bao nhiêu cột mốc áp dụng công nghệ đã trôi qua kể từ bài viết gốc "Rise of the AI Engineer", nhưng chắc chắn việc Andrew Ng, đồng sáng lập Google Brain và Coursera cùng nhiều dự án khác, tái khởi động DeepLearning.ai với trọng tâm là Kỹ thuật AI (AI Engineering) là một cột mốc quan trọng:

Điều này được thực hiện thông qua “phân tích hơn 10.000 tin tuyển dụng; thực hiện hàng chục cuộc phỏng vấn chuyên sâu với các chuyên gia AI, quản lý tuyển dụng và nhà tuyển dụng; thu thập dữ liệu qua khảo sát; và tổng hợp các dữ liệu trực tuyến khác”.
Dưới đây là bốn kỹ năng kỹ thuật AI quan trọng nhất theo Andrew:

Bạn có thể đọc toàn bộ bài viết của ông để biết thêm chi tiết từ chính nguồn tin, nhưng chúng tôi đồng ý rằng “Kỹ năng Kỹ thuật AI” có khả năng áp dụng rộng rãi cho nhiều người hơn là chỉ những ai có chức danh “Kỹ sư AI” và đó là một trọng tâm đầy sâu sắc.
Bình luận về 4 kỹ năng này:
Xây dựng và triển khai các ứng dụng AI: “Những người có kỹ năng xây dựng và triển khai ứng dụng AI hiểu rõ các khối xây dựng của AI (như LLM, context engineering, RAG, agentic workflows, machine learning và deep learning) và quan trọng hơn là cách sử dụng các kỹ thuật thống kê để đo lường, điều hướng và quản trị các hệ thống AI sao cho chúng hoạt động một cách dễ dự đoán hơn. Một kỹ năng cốt lõi để thực hiện việc này là biết cách thúc đẩy các vòng lặp đánh giá (evals) và phân tích lỗi một cách kỷ luật.”
Đúng vậy. Phần này gần nhất với quy trình MLE/MLOps truyền thống, từ “zero gradient” hay còn gọi là các kỹ thuật prompt engineering, đến harness engineering, cho đến tinh chỉnh (finetuning) và xa hơn nữa, tiến tới việc xây dựng phòng thí nghiệm tác nhân (agent lab) của riêng bạn như cách những người tại Harvey đang làm hiện nay.
Các nguyên lý cơ bản về kỹ thuật phần mềm (Software engineering fundamentals). “Hiểu các nguyên lý phần mềm cơ bản cho phép bạn nhận ra những sự đánh đổi (tradeoffs) nào đang tồn tại. Điều này dẫn đến những quyết định tốt hơn trong việc chọn stack phần mềm, thiết kế kiến trúc hệ thống, thiết kế kho dữ liệu, kiểm thử, v.v. Nó cũng mang lại kết quả tốt hơn nhiều so với một lập trình viên thiếu kinh nghiệm, người chỉ 'vibe code' (viết code theo cảm tính) một giải pháp mà không biết các sự đánh đổi mà coding agent của họ đang thực hiện — điều này thường dẫn đến kết quả kém, vì họ không biết phải cung cấp ngữ cảnh (context) nào cho coding agent của mình.”
Đúng vậy. Phần này gần nhất với quy trình SWE truyền thống. Các LLM ưu ái chuyên môn — chúng nâng cao trần năng lực (đối với các lập trình viên tay nghề cao) nhiều hơn là nâng cao sàn năng lực (đối với những người 'vibe coder' tay nghề thấp), mặc dù cả hai đều được cải thiện.
Sử dụng các coding agent. “Sử dụng coding agent hiệu quả hiện là kỹ năng then chốt cho mọi lập trình viên. Khi có kỹ năng này, bạn sẽ có một mô hình tư duy tốt về cách các tác nhân hoạt động. Bạn hiểu các hạn chế của chúng và cách khắc phục, đồng thời có thể nhanh chóng điều hướng chúng — biết khi nào cần can thiệp và khi nào nên để chúng tự làm — để xây dựng phần mềm mạnh mẽ mà không lãng phí quá nhiều thời gian hoặc token. Bạn cũng cần biết cách làm việc với một đặc tả (spec) rõ ràng (và khi nào không cần bận tâm làm điều đó), điều phối nhiều tác nhân làm việc cùng nhau, và tránh các cạm bẫy như nguy cơ một tác nhân làm hỏng cơ sở dữ liệu sản xuất của bạn. Vì coding agent đang phát triển nhanh chóng, việc sử dụng chúng một cách thành thạo không chỉ có nghĩa là biết các thực tiễn tiên tiến nhất, mà còn phải có thói quen liên tục thử nghiệm các công cụ mới và phát triển quy trình làm việc của mình khi các thực tiễn tốt nhất thay đổi.”
Khi chúng tôi lần đầu nói về "1000x AI Engineer" vào năm 2023, khi Copilot là lựa chọn duy nhất trên thị trường, đây là phần ít rõ ràng nhất nhưng đã bắt đầu xuất hiện ở phía chân trời. Lập trình đã bùng nổ trong giai đoạn 2024-2026, đỉnh điểm là sự tăng trưởng thần tốc từ 0 lên 60 tỷ USD của Cursor và sự trỗi dậy của Claude Code, Codex, Cognition, Cline cùng các thế lực lập trình khác không bắt đầu bằng chữ C. Sự linh hoạt ở đây là một điểm cộng, cũng giống như việc cần cảnh giác với những kẻ "tokenmaxxer" mắc chứng "LLM psychosis".
Định hình quá trình xây dựng (Shaping the build). “Kỹ thuật AI hiệu quả đòi hỏi tư duy sản phẩm và hiểu biết về bối cảnh kinh doanh cũng như mục tiêu của khách hàng, để bạn có thể tham gia định hình và thúc đẩy quá trình xây dựng… Tận dụng cơ hội này đòi hỏi phải biết cách thúc đẩy các dự án tiến lên. Ví dụ, biết khi nào cần nhanh chóng xây dựng một MVP để đưa cho người dùng kiểm thử, và khi nào cần chậm lại để xây dựng một cách cẩn thận hơn.”
Đây có lẽ là phần duy nhất của Kỹ thuật AI không được dự đoán trước trong bài luận gốc; chúng tôi đã thêm lộ trình AI PM vào World’s Fair 2024 và sắp tới là Design Engineering cùng các lĩnh vực liên quan đến AIE khác vì ranh giới bắt đầu mờ đi rất nhanh theo cả hai hướng.
Nhìn chung, đây là một bản cập nhật tuyệt vời cho trọng tâm của DeepLearning.AI. Chào mừng Andrew và đội ngũ!
Tin tức AI từ 22/8/2026 đến 24/8/2026. Chúng tôi đã kiểm tra 12 subreddit, 544 tài khoản Twitter và không có thêm Discord nào mới. Trang web của AINews cho phép bạn tìm kiếm tất cả các số đã phát hành. Xin nhắc lại, AINews hiện là một chuyên mục của Latent Space. Bạn có thể chọn nhận/hủy nhận email theo tần suất!
Agent Harnesses, Persistent Agents và Enterprise MCP
Thiết kế Harness đang trở thành bề mặt tối ưu hóa chính: Nhiều bài viết hội tụ tại ý tưởng rằng chất lượng của tác nhân ngày càng được định hình bởi harness (khung điều phối) thay vì chỉ bởi mô hình cơ sở. Nghiên cứu đánh giá mới của NVIDIA lập luận rằng các kiểm tra cấu trúc về “kỹ năng” của tác nhân hầu như không dự đoán được tính hữu dụng — điểm số quét chỉ tương quan với chất lượng được đánh giá ở mức Spearman ρ = 0.14 — và đề xuất thay thế bằng cách đo lường “Skill Lift”: chạy cùng một tác vụ với và không có kỹ năng đó trong các điều kiện giống hệt nhau và tính điểm chênh lệch trong công việc hoàn thành (tóm tắt bài báo qua @omarsar0). Song song đó, một bài báo quan điểm về các harness kiểu Anthropic lập luận rằng các doanh nghiệp nên chuẩn hóa trên một harness coding-agent duy nhất có thể tái sử dụng thay vì các biểu đồ điều phối tùy chỉnh, khẳng định rằng việc chọn harness có thể quan trọng hơn chọn mô hình trong công việc doanh nghiệp (tóm tắt qua @dair_ai).
Các tác nhân bền bỉ (persistent) và tự sửa đổi đang chuyển từ khái niệm sang các triển khai mã nguồn mở: @andykonwinski đã giới thiệu Headlong, một “microharness” mã nguồn mở cho các tác nhân bền bỉ suy nghĩ liên tục thay vì chỉ khi có yêu cầu. Hệ thống lưu trữ các quỹ đạo dưới dạng DAG của các tệp jsonl, duy trì một vòng lặp nội bộ tự hướng dẫn và được báo cáo là đã đạt được khả năng tự gỡ lỗi và sửa chữa mà không cần giám sát trong 48 phút; các đánh đổi bao gồm chi phí suy nghĩ nền từ 1–2 USD/giờ và đôi khi xảy ra lỗi tự gây ra. Bổ sung cho điều đó, @omarsar0 đã mô tả exo, một kiến trúc harness cho khả năng tự cải thiện đệ quy với nhật ký sự kiện chỉ thêm (append-only), trình thực thi có thể thay thế và sandbox có khả năng snapshot/rollback — được thiết kế rõ ràng để các tác nhân có thể viết lại prompt/công cụ/bộ nhớ mà không thể làm hỏng trạng thái bền vững. Cùng với nhau, các bài viết này cho thấy làn sóng hạ tầng tác nhân tiếp theo là về độ bền, phân nhánh, khôi phục và vận hành liên tục, không chỉ là prompt tốt hơn.
MCP đang trưởng thành thành hạ tầng doanh nghiệp: Anthropic đã triển khai xác thực do doanh nghiệp quản lý cho các trình kết nối MCP, tập trung hóa việc ủy quyền thông qua nhà cung cấp danh tính của tổ chức để người dùng cuối không còn phải thực hiện OAuth cho từng công cụ như Asana, Atlassian, Canva, Datadog, Figma, Notion, Slack và Supabase (thông báo từ @ClaudeDevs). Riêng biệt, lộ trình MCP nhấn mạnh sự hỗ trợ sắp tới cho các khối lượng công việc chạy dài với streaming/server push, HTTP cho các máy chủ cục bộ, khám phá lũy tiến cho các danh mục lớn và danh tính tiêu chuẩn/quyền được ủy quyền (tóm tắt lộ trình qua @_philschmid). Điều này thu hẹp khoảng cách đáng kể giữa các bản demo thử nghiệm và việc triển khai doanh nghiệp có thể kiểm toán.
Phát hành mô hình, rò rỉ và định vị cạnh tranh
Qwen3.8-27B tiếp tục vượt xa phân khúc kích thước của nó: Trong Code Arena: WebDev, Qwen3.8-27B đứng thứ 9 chung cuộc với 1595 điểm, là mô hình duy nhất trong phân khúc kích thước của nó lọt vào top 10 và chỉ kém Qwen3.8-Max sáu bậc (cập nhật bảng xếp hạng từ @arena). Nó cũng xếp hạng cao trong các danh mục sản phẩm tiêu dùng, thương hiệu/tiếp thị và trò chơi. Một dẫn xuất mã nguồn mở liên quan, Carnice-V3-27B, đã được @kaiostephens phát hành: một mô hình SFT dựa trên Qwen 27B, Hermes-agent được thiết kế để chạy trên GPU tiêu dùng (3090+), với các biến thể BF16 và GGUF đã hợp nhất.
Chu kỳ tin đồn xung quanh các mô hình tiên phong chưa phát hành ngày càng tăng: Nhiều tweet đề cập đến quyền truy cập sớm hoặc dấu vết của các hệ thống chưa phát hành: Các mô hình EAP có nhãn “claude-melon-eap” và “claude-marshmallow-eap” được cho là nhấn mạnh vào các tác vụ kiểu 3D/RL và sử dụng nhiều token suy nghĩ (demo bởi @Lentils80); @kimmonismus đã thu thập các dấu hiệu về các mô hình Claude mới, Ox Alpha, Qwen 4 và một GPT Astra đã được xác nhận; và @eliebakouch tuyên bố có quyền truy cập vào một mô hình vẫn đang trong quá trình đào tạo với một lần chạy W&B công khai. Hãy coi hầu hết những điều này là tín hiệu hệ sinh thái thay vì thông số kỹ thuật đã được xác minh, nhưng đáng chú ý là phần lớn các cuộc thảo luận hiện nay là về sự bất đối xứng trong quyền truy cập trước khi phát hành thay vì các đợt ra mắt công khai — lặp lại lời cảnh báo của @michael_nielsen rằng việc kiểm soát quyền truy cập vào các mô hình chưa phát hành đang trở thành nguồn gốc của sự tập trung quyền lực.
Định vị của OpenAI và Anthropic vẫn đang biến động: Các nhà phát triển OpenAI đã thông báo về sự sẵn có của GPT-5.6 trong Kiro và tuyên bố giảm khoảng 82% chi phí cho mỗi tác vụ Terminal-Bench 2.1 thành công trong môi trường dựa trên đặc tả của Kiro cho biến thể Terra (thông báo). OpenAI cũng đã cắt giảm giá API GPT-5.6 Sol xuống còn 4 USD/M token đầu vào và 20 USD/M token đầu ra (ghi chú giá qua @kimmonismus), với các cập nhật từ Arena cho thấy Sol và Luna đang dịch chuyển đường biên Pareto về chi phí/hiệu suất (@arena). Về phía Anthropic, @tenobrus lưu ý rằng chưa có bản nâng cấp rõ ràng nào cho dòng Opus trong hơn sáu tháng, ngay cả khi các kiểm thử viên bên ngoài báo cáo kết quả suy luận trung bình mạnh mẽ hơn từ các biến thể Claude mới (@kimmonismus).
Suy luận, Đánh giá và Hiệu quả chi phí
Sự chồng lấp độ trễ công cụ đang nổi lên như một cách tăng tốc ở cấp độ harness: @a1zhang đã giới thiệu Speculative Programmatic Tool Calling (sPTC), dự đoán các lệnh gọi công cụ an toàn trong quá trình tạo mã và khởi chạy chúng sớm trong một bản sao của môi trường để việc thực thi chồng lấp với quá trình tạo token. Sự cải thiện được báo cáo cho đến nay còn khiêm tốn — khoảng 1.0–1.2× — nhưng cơ chế này rất quan trọng: nó chuyển dịch tối ưu hóa từ các thủ thuật giải mã cấp token sang quy trình làm việc của tác nhân. @lateinteraction so sánh nó với thực thi suy đoán (speculative execution) trên CPU, nhấn mạnh rằng công việc bị loại bỏ là chấp nhận được nếu hầu hết các dự đoán đều đúng.
Kế toán token và vệ sinh benchmark vẫn còn lộn xộn: Một số bài viết đã chỉ trích các thực tiễn báo cáo gây hiểu lầm. @bnjmn_marie đã chia sẻ một lần chạy DeepSWE với 918.9M token đầu vào, làm rõ rằng nhiều token là các lượt truy cập bộ nhớ đệm (cache hits), trong khi @cHHillee thẳng thắn lập luận rằng việc tính các token đầu vào đã lưu vào bộ nhớ đệm trong “mức sử dụng token” là “cực kỳ ngớ ngẩn”. Về phía đánh giá, @jmbollenbacher cảnh báo rằng khi một mô hình lượng tử hóa (quantized) vượt qua mô hình tham chiếu trên một benchmark, nó có thể cho thấy sự quá khớp (overfitting) với dữ liệu lượng tử hóa, chứ không phải là sự cải thiện thực sự; @xeophon tóm tắt bài học rộng hơn: sửa lỗi đánh giá có thể quan trọng hơn việc leo thang điểm số trên đó.
Các benchmark tác nhân được chuẩn hóa theo chi phí tiếp tục định hình lại các lựa chọn mô hình: Together AI báo cáo rằng với ngân sách 100 USD, GLM-5.3 đã hoàn thành công việc gấp 5 lần so với Fable 5 trên DeepSWE, khoảng 17 so với 3 tác vụ được giải quyết, mặc dù hiệu suất lần thử đầu tiên tương tự (tweet). @reach_vb tương tự báo cáo GPT-5.6 Sol Max đạt 72.7% trên DeepSWE v1.1 với giá 6.47 USD/tác vụ so với Fable 5 Max đạt 69.7% và 21.63 USD/tác vụ. Cline cũng so sánh Ox Alpha với Fable trên một bản sửa lỗi thực tế và thấy cả hai đều giải quyết được, nhưng Ox sử dụng ít token đầu ra hơn khoảng 3 lần, cho thấy một triết lý hậu đào tạo khác biệt đáng kể về việc xác minh lại so với việc hành động dựa trên kết luận đầu tiên (so sánh từ @cline).
AI trên thiết bị và Hệ thống suy luận
Liquid AI + Artificial Analysis đã ra mắt một bộ benchmark nghiêm túc cho thiết bị: @liquidai đã phát hành Pipette, một bộ đánh giá mã nguồn mở cho suy luận trên thiết bị, đo lường chất lượng, tốc độ, độ trễ và bộ nhớ trên các kết hợp mô hình + lượng tử hóa + runtime + thiết bị, với hơn 10.000 kết quả đã xác minh trải dài trên 35 lớp mô hình, 7 mức lượng tử hóa, runtime llama.cpp và bốn thiết bị. Artificial Analysis đã kết hợp điều này với các đánh giá trí thông minh quy mô điện thoại độc lập trên iPhone 17 Pro và Galaxy S26 Ultra (chuỗi bài đầy đủ).
Kết quả quy mô điện thoại làm nổi bật một đường biên Pareto khác với các đánh giá trên đám mây: Với khung 8 GB bộ nhớ / 16K ngữ cảnh, Nanbeige4.2-3B và LFM2.5-2.6B đứng đầu điểm số trung bình ở mức 63, với LFM2.5-2.6B hiệu quả hơn nhiều trên iPhone (8.0s, 2.3 GB) so với Nanbeige (21.4s, 4.0 GB). Các thiết kế MoE như LFM2.5-8B-A1B và Ling 3.0 Tiny đáng chú ý vì chúng kích hoạt ~1B tham số/token, cho phép phản hồi dưới 6 giây trên phần cứng điện thoại. Đánh giá cũng làm rõ rằng nhiều mô hình suy luận “thông minh” không phù hợp với các hạn chế về bộ nhớ và độ trễ của thiết bị di động.
Các nhà cung cấp suy luận đang cạnh tranh về thông lượng dành riêng cho tác nhân, không chỉ TPS thô: Groq 3 LPX của NVIDIA được mô tả là bổ sung một bộ tăng tốc tạo token chuyên dụng cho Vera Rubin, với tuyên bố 3.400 token đầu ra/giây trên Gemma 4 31B ở ngữ cảnh 100K trong benchmark của Artificial Analysis (tóm tắt qua @kimmonismus); Groq cho biết họ sẽ là một trong những đơn vị đầu tiên triển khai nó trong sản xuất (thông báo). Riêng biệt, vLLM đã công bố kết quả AgentX 1.0 mở rộng trên các dấu vết lập trình đa lượt thực tế, nhấn mạnh việc offload KV, tái sử dụng tiền tố và phân tách prefill/decode là chìa khóa cho thông lượng tác nhân cao thay vì các số liệu phục vụ đơn lượt cổ điển (@vllm_project).
Nghiên cứu, Bài báo và Giáo dục kỹ thuật
RL cho LLM và đào tạo harness-native vẫn đang rất nóng: @cwolferesearch đã xuất bản một hướng dẫn học tăng cường toàn diện bao gồm các công thức cấp token so với cấp hoàn thành, các biến thể PPO/GRPO, phương pháp actor-critic, RL dựa trên rubric và RL tác nhân/mô hình hóa thế giới. Điều này trùng hợp với sự chú ý ngày càng tăng đối với RL “harness-native” và các môi trường tác nhân, được phản ánh trong các bài tổng hợp bài báo như @TheTuringPost và thảo luận về các bài báo như Agent Lightning, LEGO-RL, EnvHarness và SkillGate.
Các luồng nghiên cứu đáng chú ý khác: Periodic Row-wise Muon của Meta/USC mở rộng tối ưu hóa Muon cho các diffusion transformer lớn hơn bằng cách khấu hao các cập nhật Newton–Schulz đắt đỏ trong khi vẫn giữ được lợi ích so với AdamW (tóm tắt qua @iScienceLuvr); Latent Dynamics Reasoning của Adobe học các mô hình thế giới video ngoại suy từ các pixel bằng cách mô hình hóa sự tiến hóa trạng thái tiềm ẩn thay vì dự đoán tương lai trực tiếp (bài báo qua @_akhaliq, ghi chú của tác giả); và Cartwheel đã báo cáo các định luật mở rộng tối ưu tính toán cho việc tạo chuyển động của con người, lập luận rằng chuyển động có thể trở thành phương thức thứ năm với hành vi mở rộng giống như Chinchilla (ra mắt).
Nội dung giáo dục đáng lưu giữ: @fchollet đề xuất các chương 15–16 của Deep Learning with Python như một trong những giải thích dễ tiếp cận nhất về lý do tại sao dot-product attention hoạt động; @ProfTomYeh đã đăng một hướng dẫn chi tiết từng bước về self-attention; và @mervenoyann đã công bố một ngôi nhà mới cho tài liệu llama.cpp, với tài liệu sắp tới về suy luận suy đoán (speculative decoding), lượng tử hóa và coding agent.
Các tweet hàng đầu (theo mức độ tương tác)
Hiệu suất sản phẩm/UI thực tế: Anthropic cho biết các câu trả lời dài trong Claude web/desktop hiện stream mượt mà hơn khoảng 4 lần, với số lần khựng ít hơn 9 lần và thời gian đóng băng tồi tệ nhất ngắn hơn 4.5 lần trên các máy tính xách tay chậm hơn (thông báo).
Bài viết được AI dịch và tổng hợp tự động từ Latent Space. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.