Tin ngành
AI tiên phong chạy trên phần cứng cá nhân: Tuần lễ Mã nguồn mở từ một phòng thí nghiệm học thuật
(giờ Việt Nam)
Tóm tắt AI
Một phòng thí nghiệm học thuật chứng minh nghiên cứu AI hiện đại không chỉ nằm ở bài báo mà là hệ sinh thái, cho phép chạy các mô hình khổng lồ như Qwen 3.8 Flash Next hay DeepSeek V4.1 trên phần cứng tiêu dùng thông thường.
Bản dịch AI
Trong một lớp học của mình, tôi đã đặt ra câu hỏi mà tôi từng rất sợ phải hỏi, nhưng tôi buộc phải tìm câu trả lời: “Ai sợ rằng mình sẽ không tìm được việc làm sau khi tốt nghiệp?” Khoảng 80% trong số 150 người trong phòng đã giơ tay. Điều đó có nghĩa là khoảng 120 sinh viên cùng đồng loạt trả lời rằng họ không tin mình có một chỗ đứng trong tương lai.
Câu chuyện thứ hai đến qua email. Đó là những nghiên cứu sinh tiến sĩ không thể chờ đợi đến ngày tốt nghiệp, vì họ muốn gia nhập một phòng thí nghiệm tiên phong và họ đã đi đến kết luận rằng nghiên cứu trong môi trường học thuật là vô nghĩa. Họ đang đếm từng năm cho đến khi có thể rời đi.
Tôi tin rằng cả hai câu chuyện trên đều sai, và sai vì cùng một lý do. Họ cho rằng tương lai của nghiên cứu thuộc về bất kỳ ai sở hữu nhiều GPU nhất. Tôi nghĩ điều ngược lại mới đúng. Môi trường học thuật có lẽ sắp trải qua một thời kỳ phục hưng, và những công trình thú vị nhất của thập kỷ tới sẽ diễn ra tại các phòng thí nghiệm đại học — không phải bất chấp nguồn lực hạn chế của họ, mà chính là nhờ vào những hạn chế đó.
Tuần này là lập luận của chúng tôi cho khẳng định đó, và chúng tôi thực hiện nó bằng mã nguồn thay vì văn xuôi.
Bài viết này gồm sáu phần: tại sao một phòng thí nghiệm như chúng tôi hiện nay lại xuất bản các hệ sinh thái thay vì các bài báo khoa học; nội dung thực sự của tuần lễ mã nguồn mở này là gì; tại sao sự bi quan mà tôi liên tục bắt gặp lại là sai lầm; điều gì cần buông bỏ và điều gì cần giữ lại; nghiên cứu sẽ trông như thế nào khi bạn đã buông bỏ được nó; và tại sao sự phục hưng lại diễn ra trong môi trường học thuật.
Đơn vị nghiên cứu không còn là bài báo khoa học nữa.
Có điều gì đó đã thay đổi trong năm qua, và hầu hết chúng ta vẫn chưa cập nhật thói quen của mình để thích ứng với nó.
Với các tác nhân (agent), việc nghiên cứu theo dự án đã trở nên dễ dàng và nhanh chóng. Công việc từng tốn cả năm trời để kỹ thuật và thử nghiệm giờ đây chỉ mất vài tuần, đôi khi là vài ngày. Đây là phần mà tôi mất nhiều thời gian hơn để nhận ra: khi mọi dự án cá nhân trở nên dễ dàng, công việc manh mún không còn là nghiên cứu tốt nữa. Một bài báo ở đây, một bài báo ở kia, mỗi bài đều độc lập, mỗi bài đều yêu cầu người đọc phải tự chắp vá các mảnh ghép lại với nhau — đó là định dạng của một thế giới nơi mọi mảnh ghép đều đắt đỏ.
Sự khó khăn không biến mất. Nó chỉ dịch chuyển. Việc xuất bản một bài báo không còn khó nữa. Cái khó là xuất bản một hệ sinh thái mạch lạc.
Đơn vị nghiên cứu chính là hệ sinh thái.
Đó là mục đích của Open Source Week. Khi tôi và các sinh viên của mình bắt đầu, chúng tôi đặt mục tiêu xây dựng các thành phần có thể bổ trợ cho nhau thay vì chỉ tồn tại song song, để mỗi mảnh ghép làm cho mảnh ghép tiếp theo trở nên hữu ích hơn. Phòng thí nghiệm của tôi và tôi tin vào việc sử dụng quyền tự do học thuật để mang những công cụ AI tốt nhất đến cho mọi người miễn phí. Một điều mà bạn chỉ có thể làm được tại các trường đại học. Cụ thể, điều đó có nghĩa là xây dựng các hệ thống mở, làm cho các mô hình chạy cục bộ rẻ hơn, làm cho các mô hình cục bộ mạnh mẽ hơn, xây dựng các hệ thống cục bộ tái tạo hiệu suất tiên phong trong nghiên cứu sâu và tự hành, đồng thời tạo ra các phương pháp mới để xây dựng môi trường học tăng cường (reinforcement learning) chuyên biệt theo lĩnh vực.
Tất cả đều nằm ở giao điểm của ba yếu tố: các khung làm việc phục vụ suy luận (inference-serving frameworks), các bộ công cụ tác nhân (agent harnesses) và công việc, cùng sự kết hợp của cả hai thành các hệ thống nghiên cứu tự hành. Và tất cả phải dễ sử dụng, bởi vì mã nguồn mở mà chỉ những nhà nghiên cứu giàu kinh nghiệm mới chạy được thì không phải là mã nguồn mở. Khả năng tiếp cận có hai nửa — nguồn lực bạn cần và chuyên môn bạn cần — và chỉ một trong số đó được giải quyết bằng phần cứng. Một vài GPU, hoặc một chiếc MacBook, là có thể đủ. Yêu cầu về chuyên môn là một vấn đề thiết kế, và bạn giải quyết nó bằng cách trừu tượng hóa mọi chi tiết kỹ thuật mà người dùng không cần phải bận tâm. Đó là nơi chúng tôi dồn hầu hết nỗ lực, và nó thể hiện rõ nhất ở bộ công cụ tác nhân (agent harness).
Tôi sẽ không tiết lộ tất cả trước khi tuần lễ mã nguồn mở bắt đầu, vì vậy đây là những gì tôi có thể nói với bạn bây giờ.
Nếu bạn hỏi tôi một phòng thí nghiệm nhỏ có thể làm được gì hôm nay, chúng tôi sẽ cho bạn thấy ba điều: nghiên cứu tự hành tiên phong, kỹ thuật mở rộng quy mô trong thời gian thử nghiệm (test-time scaling) hiệu quả nhất mà tôi biết, và tính năng tự động nén (auto-compaction) hiệu quả hơn nhiều so với những gì Claude Code hay Codex triển khai.
Hãy bắt đầu với bộ công cụ (harness), vì nó là thứ làm cho mọi thứ khác trở nên hữu dụng.
Bạn có lẽ đã nghe về các phiên làm việc của tác nhân kéo dài hàng giờ, hàng ngày, hoặc thậm chí hàng tuần. Đối với hầu hết mọi người, và đặc biệt là bất kỳ ai chưa từng làm việc với tác nhân, làm thế nào để đạt được điều đó vẫn là một bí ẩn. Bạn hướng bộ công cụ của chúng tôi vào một kho lưu trữ — ví dụ như một khung suy luận với các nhân CUDA — và bạn bảo nó tối ưu hóa các nhân đó. Sau đó bạn rời đi. Nó sẽ tiếp tục cải thiện chúng qua những phần mà tiến độ chậm chạp và công việc gây nản lòng, và nó cứ tiếp tục cho đến khi bạn quay lại. Không có phản hồi nào được cung cấp trong suốt quá trình, vì vậy tác nhân phải tự tìm ra mọi thứ bất cứ khi nào nó không rõ ràng hoặc không chắc chắn.
Đó là những gì chúng tôi đã làm với các triển khai Mac và Metal cho khung suy luận của mình. Một lệnh duy nhất đã giải phóng tác nhân trên các nhân (kernels). Kết quả trả về là suy luận lượng tử hóa của mô hình Qwen 3.6 35B-A3B ở tốc độ 450 token mỗi giây, với đầu ra chất lượng cao ở mức 1,5 bit trên mỗi trọng số. Một mô hình bán chính xác cần 16 bit cho mỗi trọng số; ở mức 1,5 bit, cùng một mô hình đó chạy với khoảng một phần mười bộ nhớ, và nó chạy nhanh đến mức cảm giác như một tiến trình cục bộ thay vì một dịch vụ từ xa.
Tiếp theo là chủ đề trong tiêu đề của bài viết này. Điều gì sẽ xảy ra khi các mô hình từng nằm ngoài tầm với giờ đây lại vừa vặn với phần cứng mà bạn đang sở hữu?
Qwen 3.8 với 27 tỷ tham số đã là mô hình cục bộ phổ biến. Khung làm việc của chúng tôi cho phép bạn chạy phiên bản lớn hơn của nó, Qwen 3.8 Flash Next với 125 tỷ tham số, trên một GPU 24 GB duy nhất — chiếc card có trong một máy tính để bàn thông thường. Với AMD Strix, NVIDIA DGX Spark, hoặc MacBook có 128 GB bộ nhớ, bạn có thể chạy DeepSeek V4.1 — một mô hình 550B. Bạn cũng sẽ không phải quản lý độ dài ngữ cảnh: việc nén và xử lý ngữ cảnh là tự động, và suy luận vẫn nhanh ngay cả ở các ngữ cảnh dài.
Sau đó là phần mà tôi hào hứng nhất.
Chúng tôi đã kết hợp các mảnh ghép này và tiến xa hơn vào nghiên cứu tự hành, và trên đường đi, chúng tôi đã xây dựng một kỹ thuật truy xuất thông tin mới với độ chính xác mà tôi chưa từng thấy trước đây. Hệ thống này đánh bại các hệ thống nghiên cứu sâu từ các phòng thí nghiệm tiên phong, và nó tạo ra kết quả nghiên cứu tự hành tốt hơn hệ thống của Sakana AI hay ScientistOne của Google. Nó chạy hoàn toàn cục bộ, không cần truy cập internet.
Sử dụng nó rất đơn giản. Hãy để tôi đưa ra thí nghiệm mà tôi đã thực hiện.
Tôi yêu cầu tác nhân tìm một vấn đề đáng nghiên cứu trong lĩnh vực tin sinh học — vì tôi không biết nhiều về nó — và các tiêu chí rất cụ thể. Tiến độ phải nhanh. Việc đánh giá phải đủ rẻ để chạy trên phần cứng chúng tôi đang có. Và đó phải là một vấn đề mới mẻ, với các nghiên cứu tích cực được công bố trong bốn tuần qua, để chúng tôi có thể làm việc trên thứ mà lĩnh vực này chưa giải quyết xong. Tác nhân trả về ba vấn đề. Chúng tôi chọn vấn đề đầu tiên, và trong khoảng hai giờ, nó đã thiết lập một cận dưới mới cho các phương pháp heuristic, phát triển và thử nghiệm phương pháp heuristic tốt nhất trong tài liệu, tiến gần hơn đến các phương pháp đắt đỏ được huấn luyện bằng mô hình AI, và tìm ra các vấn đề trong nguồn dữ liệu mà mọi người vẫn dùng để đánh giá vấn đề này. Chúng tôi chưa đạt đến trạng thái tiên tiến nhất (state of the art) về tổng thể vấn đề. Tuy nhiên: hai giờ làm việc trên một cỗ máy trong phòng thí nghiệm của tôi đã tạo ra bốn kết quả, và một trong số đó đặt dấu hỏi về dữ liệu đánh giá mà toàn bộ lĩnh vực này đang phụ thuộc vào.
Hệ thống này không phải là bản demo mà chúng tôi mang ra để viết bài blog. Sinh viên của tôi sử dụng nó mỗi ngày. Trước khi nó nằm trong bộ công cụ, nó nằm trong một con bot Slack, và nó chập chờn đến mức đôi khi bot bị sập. Tôi không có hệ thống email nào cảnh báo khi bot Slack ngoại tuyến, nhưng tôi có cách thay thế tốt nhất: sinh viên thường viết cho tôi “Tim, có vấn đề với bot slack và nó không hoạt động nữa. Thầy giúp em được không?” Trong một môi trường cộng tác, tôi đã sử dụng nó sau khi ghi âm một cuộc họp: nó tạo ra các câu hỏi nghiên cứu từ bản ghi âm, đánh giá các ý tưởng được thảo luận dựa trên tài liệu, và phân loại các hướng đi hứa hẹn khỏi những hướng không hứa hẹn. Sau đó, nó tạo một tài liệu google doc và gửi cho sinh viên. Tôi đã làm điều đó cho hai cuộc họp. Sinh viên rất thích, nhưng nó khá cồng kềnh vì tôi phải làm thủ công việc sao chép và dán hai phần trong quy trình, nên tôi đã dừng lại. Hai cuộc họp tiếp theo tôi không dùng nó nữa — và rồi các sinh viên háo hức hỏi tôi liệu chúng ta có thể sử dụng lại hệ thống đó không vì họ thấy nó quá hữu ích để hiểu rõ nghiên cứu của mình.
Đó là đánh giá duy nhất về một công cụ nghiên cứu mà tôi tin tưởng: mọi người yêu cầu sử dụng nó sau khi bạn ngừng cung cấp cho họ.
Mảnh ghép cuối cùng là thứ chúng tôi sử dụng nhiều nhất và nói đến ít nhất. Làm thế nào để giữ cho một tác nhân tiếp tục làm việc sau khi cuộc hội thoại lẽ ra đã kết thúc?
Câu trả lời của chúng tôi là một kỹ thuật tự động nén có tên là CliffCompaction. Chúng tôi đã sử dụng nó trong phòng thí nghiệm hàng tháng trời, và cá nhân tôi không bao giờ muốn chạy một tác nhân mà thiếu nó. Nó mạnh hơn đáng kể so với tính năng tự động nén trong Claude Code hay Codex. Các phiên làm việc với nó chạy hàng triệu token, và một số phiên của tôi đã vượt quá một trăm triệu. Nó cũng cắt giảm tổng chi phí khoảng 50%. Một trong những đối tác của chúng tôi đã triển khai nó trong công ty của họ và đo lường mức giảm 45% trong tổng ngân sách AI — gần một nửa số tiền họ chi cho AI đã biến mất mà không phải từ bỏ bất cứ điều gì. Trên KernelBench, nó đạt trạng thái tiên tiến nhất, vượt xa các phương pháp phức tạp hơn nhiều so với chúng tôi, bao gồm các phương pháp kiểu AlphaEvolve và các hệ thống bộ nhớ phân cấp. Chúng tôi sẽ xuất bản một phiên bản mạnh mẽ. Chúng tôi đã có các phần của kỹ thuật tự động nén tiếp theo, và nó còn tốt hơn nữa.
Nó thay đổi cả hai mặt của sự đánh đổi giữa chi phí và khả năng cùng một lúc: các phiên làm việc kéo dài hơn, và hóa đơn thì thấp hơn. Nói cách khác, tác nhân ngừng quên những gì nó đang làm, và bạn ngừng phải trả tiền cho sự quên lãng đó.
Phiên làm việc dài, hóa đơn thấp.
Điều đó đưa tôi đến phần mở rộng quy mô trong thời gian thử nghiệm (test-time scaling) của danh sách, bởi vì nó xuất phát từ cùng một thủ thuật. Tự động nén cắt giảm chi phí khoảng 50%, và bạn có thể tái đầu tư khoản tiết kiệm đó: thay vì một lần chạy (rollout), hãy mua nhiều lần với cùng một ngân sách. Chúng tôi đã tìm ra phương pháp thực tế đầu tiên biến nhiều lần chạy thành sự cải thiện đáng kể với cùng chi phí, và mặc dù nó chưa thực tế cho công việc kỹ thuật hàng ngày, nhưng bước nhảy vọt đến cấp độ đó sẽ không khó khăn. Kết hợp với các triển khai cục bộ, vốn thường bị sử dụng chưa hết công suất, chúng tôi tin rằng điều này dẫn đến một tương lai nơi bất kỳ ai cũng có thể chạy nhiều tác nhân song song trên bất kỳ vấn đề đơn lẻ nào.
Tại sao sự bi quan lại sai lầm
Vậy tại sao 120 trong số 150 sinh viên đó lại sợ hãi?
Ba điều đang xảy ra cùng một lúc, và chỉ một trong số đó liên quan đến AI. Thứ nhất là niềm tin rằng AI sẽ cướp mất công việc của mọi người. Thứ hai là sự hiểu biết kém về việc AI tác động thế nào đến công việc. Thứ ba là sự lây lan: những ý tưởng tự đánh bại bản thân lan truyền từ người này sang người khác, và một căn phòng đầy những người đã nghe cùng một câu bi quan mười lần sẽ tạo ra cánh tay thứ mười một.
Hãy bắt đầu với việc AI tác động thế nào đến công việc, vì đó là phần chúng ta thực sự có thể suy luận được.
Bắt đầu với nghề nghiệp mà mọi người dự đoán sẽ bị thay thế đầu tiên. Dự đoán là các kỹ sư phần mềm sẽ mất việc trước, nhưng xu hướng gần đây lại đi theo hướng ngược lại: nhu cầu về kỹ sư phần mềm cao hơn bao giờ hết. Một kỹ sư phần mềm với các tác nhân tốt sẽ tạo ra sản phẩm mới, duy trì các hệ thống hiện có và mở rộng chúng hiệu quả hơn nhiều, vì vậy công ty nhận được nhiều giá trị hơn cho mỗi đô la chi cho kỹ sư đó. Những gì công việc yêu cầu đã thay đổi. Nó cần các kỹ năng tác nhân mạnh mẽ và, thường là, sự chuyên môn hóa sâu hơn trước đây — công việc “kỹ sư phần mềm” không còn tồn tại nữa — và cả hai giờ đây đều nằm trong tầm tay: kỹ năng tác nhân đến theo thời gian, và sự chuyên môn hóa sâu, vốn từng mất nhiều năm, giờ đây có thể đạt được nhanh chóng với các tác nhân.
Chúng ta đang sống trong một nền kinh tế của những cải tiến gia tăng. Chiếc điện thoại tiếp theo không tốt hơn nhiều so với chiếc trước; những cải tiến là có thật nhưng nhỏ, và chúng ngày càng khó nhận thấy hơn mỗi năm. Nhiều dịch vụ cũng đã hội tụ theo cách tương tự. Một chuyến xe từ Lyft hay Uber không phải là một trải nghiệm khác biệt về cơ bản so với trước đây, và có lẽ sẽ không bao giờ như vậy, vì không còn nhiều thứ để thay đổi. Bạn chỉ có thể làm cho cùng một thứ tốt hơn một chút bao nhiêu lần trước khi ai đó ngừng trả tiền cho phiên bản tiếp theo.
Tiến trình đến dưới hai hình thức, và chúng hành xử hoàn toàn khác nhau. Hãy gọi cặp đôi này là cải tiến/khả năng: cải tiến làm cho những gì bạn đã có tốt hơn một chút, khả năng mang lại cho bạn thứ mà bạn hoàn toàn chưa có. Một nền kinh tế chỉ tạo ra loại thứ nhất sẽ có giới hạn, bất kể mọi người trong đó làm việc chăm chỉ đến đâu. Vì vậy, hãy nhìn vào những gì xảy ra khi công nghệ mang lại loại thứ hai.
Xe tự lái là ví dụ rõ ràng nhất, và phần thú vị là chúng sẽ đến một cách không đồng đều như thế nào. Việc lái xe ở những nơi phức tạp như châu Âu hay châu Á còn cách xa hàng thập kỷ. Nhưng trong các cấu trúc giống như lưới với giao thông trật tự — phần lớn Hoa Kỳ — nó sẽ hoạt động sớm hơn nhiều, và nó sẽ thay đổi rất nhiều trong hai thập kỷ tới. Robot học có lẽ cũng đang trên một con đường tương tự: robot trong gia đình sẽ giải phóng công việc giống như máy giặt đã làm, và mục đích của việc giải phóng công việc không phải là công việc. Đó là cuộc sống mà bạn có thể dẫn dắt thay vào đó.
Logic tương tự áp dụng cho thiết bị trong túi của bạn. Chiếc điện thoại tiếp theo có thể không nhanh hơn nhiều, vì chip không còn nhanh hơn nhiều nữa. Nó có thể là một thiết bị rất khác biệt.
Hãy lấy trường hợp mà mọi người đưa ra khi họ nói với tôi rằng AI làm cho sản phẩm tệ hơn, vì nó xứng đáng được lắng nghe một cách công bằng. Đến nay, việc AI được gắn thêm vào làm phá hủy trải nghiệm của sản phẩm mà nó được gắn vào đã trở thành một câu sáo rỗng, và các tính năng AI trong các sản phẩm của Microsoft gần như bị ghét bỏ nghiêm trọng trên diện rộng. Tôi nghĩ phản ứng đó là đúng, và tôi cũng nghĩ đó là phán quyết về sự tích hợp, không phải về công nghệ. Một trải nghiệm AI được thiết kế tốt sẽ thay đổi cách bạn tương tác, cách bạn làm việc và cách bạn cấu trúc ngày của mình. Phiên bản đó tồn tại, và bạn có thể cảm nhận được sự khác biệt ở những nơi mà nó đã được thực hiện tốt. ChatGPT là ví dụ điển hình nhất.
Bài viết được AI dịch và tổng hợp tự động từ Hacker News: AI bài nổi bật. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.