Tin ngành
AMD thâu tóm startup Taalas để tối ưu hóa AI bằng cách 'khắc' mô hình trực tiếp lên chip
(giờ Việt Nam)
Tóm tắt AI
AMD vừa mua lại Taalas, startup chuyên về công nghệ tích hợp trực tiếp các mô hình AI vào phần cứng silicon nhằm tăng tốc độ suy luận. Thương vụ này giúp AMD củng cố vị thế cạnh tranh trong thị trường phần cứng AI chuyên dụng.
Bản dịch AI

Trong nỗ lực mới nhất nhằm phá vỡ thế thống trị của Nvidia trong lĩnh vực phần cứng AI, "House of Zen" (AMD) đã mua lại công ty chip AI Taalas. Công ty này áp dụng phương pháp khắc trực tiếp trọng số mô hình (model weights) vào silicon, một quy trình hứa hẹn sẽ tăng hiệu suất suy luận lên gấp mười lần hoặc hơn.
Thỏa thuận này, được công bố vào thời điểm đóng cửa thị trường hôm thứ Năm, dường như có bối cảnh tương tự như thương vụ cấp phép trị giá 20 tỷ USD của Nvidia với Groq vào tháng 12 năm ngoái: giúp các dịch vụ suy luận "cao cấp" hiệu năng cao, vốn được ưa chuộng cho các tác nhân AI (AI agents) như trợ lý lập trình, chạy nhanh hơn và rẻ hơn. AMD không tiết lộ các điều khoản của thỏa thuận, nhưng theo những gì chúng tôi hiểu, đây là một thương vụ mua lại thực sự chứ không phải là "acquihire" (mua lại để lấy nhân sự).
Được thành lập vào năm 2023 và có trụ sở tại Toronto, cách tiếp cận suy luận của Taalas khác biệt hoàn toàn so với các GPU truyền thống hoặc các kiến trúc luồng dữ liệu (dataflow architectures) vốn là nền tảng cho LPU của Groq hay các bộ tăng tốc waferscale của Cerebras.
REG AD
Một mạch tích hợp chuyên dụng cho mô hình
REG AD
Chip của startup này không dựa vào HBM để lưu trữ trọng số mô hình mà khắc trực tiếp chúng vào silicon. Theo một nghĩa nào đó, chip của Taalas thực sự là các mạch tích hợp chuyên dụng cho mô hình (MSIC).
Có lẽ quan trọng hơn, công nghệ của Taalas không chỉ nằm trên lý thuyết. Vào tháng 2, startup này đã tiết lộ con chip thử nghiệm đầu tiên được chế tạo trên quy trình 6nm của TSMC, gọi là HC1. Các bài kiểm tra hiệu năng ban đầu cho thấy con chip này xử lý mô hình Llama 3.1 8B của Meta với tốc độ chóng mặt là 16.960 token mỗi giây — khi được công bố vào tháng 2 năm ngoái, con số này nhanh gấp 48 lần so với GPU của Nvidia và nhanh gấp 8,5 lần so với các bộ tăng tốc của Cerebras.
Mặc dù Llama 3.1 đã trở nên "cổ xưa" theo tiêu chuẩn ngày nay kể từ khi ra mắt vào giữa năm 2024, nhưng con chip có kích thước reticle này thực sự nhằm mục đích chứng minh tính khả thi của công nghệ.
Taalas cực kỳ kín tiếng về cách thức hoạt động thực sự của các con chip, nhưng chúng tôi biết rằng bộ xử lý của họ bao gồm hai vùng chính: cấu trúc truy xuất mask-ROM nơi các trọng số mô hình được khắc vào, và cấu trúc truy xuất SRAM nơi lưu trữ KV cache và các bộ điều hợp tinh chỉnh (fine-tuning adapters).
Đối với chip HC2 thế hệ thứ hai dự kiến ra mắt vào mùa hè này, Taalas đặt mục tiêu tăng số lượng tham số lên 20 tỷ. Con số đó nghe có vẻ không nhiều, nhưng giống như cách dùng GPU cho các mô hình lớn hơn, các trọng số sẽ được phân bổ trên nhiều bộ tăng tốc bằng cách sử dụng kỹ thuật song song đường ống (pipeline parallelism).
Với 20 tỷ tham số mỗi chip, bạn chỉ cần 50 bộ tăng tốc để hỗ trợ một mô hình có hàng nghìn tỷ tham số, và AMD tình cờ lại sở hữu một nền tảng tính toán quy mô rack cùng đội ngũ thiết kế hệ thống nội bộ có thể đáp ứng thoải mái yêu cầu đó.
Điều đó tiết kiệm không gian và điện năng hơn đáng kể so với các hệ thống LPX mới được công bố gần đây của Nvidia, vốn sẽ cần vài chục GPU và ít nhất 2.000 LPU của Groq để phục vụ cùng một mô hình.
Theo hiểu biết của chúng tôi, AMD dự định kết hợp các rack Helios dựa trên Instinct của mình với các con chip sử dụng công nghệ của Taalas. Điều này ngụ ý một kiến trúc phân tách, trong đó việc xử lý prompt nặng về tính toán được thực hiện trên GPU, trong khi việc tạo token được chuyển sang các bộ tăng tốc dựa trên công nghệ Taalas.
REG AD
Cũng có khả năng AMD sẽ áp dụng một kiểu nhịp độ "tick-tock", trong đó khách hàng ban đầu triển khai và xác thực các mô hình trên bộ tăng tốc Instinct, và khi đã hài lòng, họ sẽ chuyển sang các bộ tăng tốc Taalas. Chúng ta chỉ có thể suy đoán vào lúc này, nhưng đây là những gì Vamsi Boppana, Phó chủ tịch cấp cao phụ trách AI của AMD, đã chia sẻ trong một tuyên bố soạn sẵn:
“AMD đang xây dựng một nền tảng AI toàn diện, mang đến cho khách hàng sự linh hoạt để triển khai các giải pháp tính toán phù hợp cho mọi khối lượng công việc AI.”
Bạn tốt nhất nên thực sự yêu thích mô hình đó
Mặc dù công nghệ này cực kỳ nhanh, nhưng nếu bạn chưa nhận ra, nó đi kèm với một nhược điểm khá lớn. Một khi các con chip đã được triển khai, bạn sẽ bị "gắn chặt" với mô hình đó. Bất kỳ thay đổi nào lớn hơn một bộ điều hợp như LoRA đều sẽ yêu cầu phải tái sản xuất (re-spin) các con chip, điều này không chỉ đắt đỏ mà còn tốn thời gian.
Sau gần bốn năm bùng nổ AI, các mô hình mới liên tục ra mắt gần như hàng tháng. Để hưởng lợi từ công nghệ của Taalas, khách hàng của AMD sẽ phải thực sự chắc chắn về lựa chọn mô hình của mình, điều mà đối với một số người sẽ dễ dàng hơn những người khác.
Tuy nhiên, nếu tin vào những gì startup này tuyên bố, tình hình không tệ như vẻ ngoài. Mặc dù các mô hình mới sẽ yêu cầu tái sản xuất, nhưng không cần phải bắt đầu lại từ đầu. Thay vào đó, chỉ cần thay đổi hai lớp kim loại, điều này rẻ hơn và ít tốn thời gian hơn nhiều.
Với điều đó, chúng tôi nghi ngờ mạnh mẽ rằng công nghệ này sẽ chủ yếu được triển khai bởi các nhà phát triển mô hình AI, các nhà cung cấp cơ sở hạ tầng của họ và một số ít các nhà cung cấp dịch vụ suy luận. Trong một cuộc phỏng vấn với trang tin chị em của chúng tôi là The Next Platform vào tháng 2, công ty cho biết việc khắc trọng số của một mô hình vào silicon rẻ hơn 100 lần so với việc huấn luyện một mô hình tiên phong (frontier model).
AMD chắc chắn đang ở vị thế có thể đàm phán các thỏa thuận đó. OpenAI, Anthropic và Meta đều là những khách hàng lớn của Instinct. Với mối quan hệ làm việc chặt chẽ giữa các "nhà máy" mô hình và nhà thiết kế chip, sẽ không ngạc nhiên khi thấy một GPT hoặc Claude được triển khai trên sự kết hợp giữa bộ tăng tốc Taalas và Instinct.
REG AD
Công nghệ này cũng có những tác động đối với việc phát triển mô hình. Một trong những cách các nhà phát triển giảm thiểu hiện tượng "ảo giác" (hallucinations) là đánh đổi thời gian lấy độ chính xác. Kỹ thuật này, được gọi là mở rộng quy mô thời gian kiểm thử (test-time scaling), thực tế khá đơn giản và bao gồm việc cho phép mô hình "suy nghĩ" lâu hơn trước khi phản hồi.
Một nhược điểm của test-time scaling là nó tiêu tốn nhiều token hơn đáng kể, khiến chi phí trở nên đắt đỏ và người dùng phải chờ đợi lâu hơn để chatbot, trợ lý lập trình hoặc tác nhân AI phản hồi. Nếu thương vụ mua lại Taalas của AMD có thể giảm chi phí trên mỗi token và tăng tốc độ đầu ra lên 10 hoặc 20 lần, các nhà phát triển mô hình có thể chọn kéo dài thời gian suy luận hơn nữa.
Dù sao đi nữa, chúng ta có lẽ không phải chờ đợi lâu để thấy Taalas phù hợp như thế nào với tầm nhìn rộng lớn hơn của AMD. Sau khi được cơ quan quản lý phê duyệt, thỏa thuận dự kiến sẽ hoàn tất vào quý IV.

Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.