Tin ngành
Startup Kog tối ưu hóa phần mềm để tăng tốc suy luận LLM gấp 30 lần trên GPU hiện có
(giờ Việt Nam)
Tóm tắt AI
Startup Pháp Kog phát triển giải pháp phần mềm giúp khai thác tối đa hiệu năng GPU trung tâm dữ liệu, đạt tốc độ 3.000 token/giây và hứa hẹn tăng tốc suy luận LLM gấp 30 lần.
Bản dịch AI

Cuộc đua hướng tới suy luận AI (AI inference) nhanh hơn đang diễn ra sôi nổi, và thị trường đã chào đón Cerebras cùng các con chip chuyên dụng của hãng này rất nồng nhiệt trong đợt IPO vào tháng 5. Tuy nhiên, startup Kog của Pháp lại đang đặt cược rằng vẫn còn rất nhiều sức mạnh có thể khai thác từ các GPU truyền thống.
Startup này đã xuất hiện trên trang nhất của Hacker News vào tháng 5 với một bản xem trước công nghệ nhằm chứng minh rằng “việc giải mã đơn yêu cầu cực nhanh là hoàn toàn khả thi trên các GPU trung tâm dữ liệu tiêu chuẩn mà các doanh nghiệp đang sở hữu” — chẳng hạn như các GPU AMD MI300X và NVIDIA H200 mà họ đã sử dụng cho bản demo của mình.
Một số người cảm thấy thất vọng khi biết điều này không áp dụng cho GPU trên máy tính xách tay, nhưng những người khác lại nhìn thấy tiềm năng. Với việc tốc độ và chi phí suy luận hiện đang là nút thắt cổ chai quan trọng, lời hứa của Kog về việc mở khóa các khả năng mới trên phần cứng hiện có thông qua tối ưu hóa phần mềm đã thu hút không chỉ những người quan sát. “Chúng tôi đã có 200 đầu mối kinh doanh thực tế,” CEO Gaël Delalleau chia sẻ với TechCrunch.
Dựa trên những phản hồi ban đầu, nhà sáng lập duy nhất của công ty kỳ vọng kỹ thuật phần mềm sẽ là trường hợp sử dụng đầu tiên. Những người dùng lâu năm của Claude Code đều biết rõ rằng đôi khi họ phải chờ đợi hàng giờ để nhận được kết quả. Bản thân Anthropic cũng hiểu rằng tốc độ là tiền bạc, và họ tính phí cao hơn cho Fast Mode của Claude.
Kog hy vọng sẽ nhắm đến những khách hàng đang nản lòng vì sự chậm trễ đó, thường là do họ dựa vào các quy trình làm việc AI cho các tác vụ chuyên môn. Nhưng startup này cũng có các đối tác thiết kế cho phép người dùng tạo trò chơi và ứng dụng chỉ bằng một câu lệnh, và đối với họ, kết quả nhanh hơn nhờ Kog Inference Engine (KIE) sẽ đồng nghĩa với doanh thu cao hơn, Delalleau cho biết.
Công ty nhận ra rằng thị trường này vẫn chưa thực sự chín muồi. Trong khi quan sát nhu cầu, Kog nhận thấy các khách hàng tiềm năng của họ chưa sẵn sàng để tinh chỉnh (fine-tune) các mô hình nhỏ. “Và đó là lý do tại sao kể từ khi ra mắt, chúng tôi đã tập trung hoàn toàn vào việc đẩy nhanh quá trình phát triển các mô hình lớn hơn để đáp ứng nhu cầu mà chúng tôi đã thấy.”
Điều này đặt ra cho Kog một bước tiến khổng lồ cần thực hiện để hiện thực hóa lời hứa “suy luận LLM nhanh gấp 30 lần.” Bản demo của họ cho thấy tốc độ ấn tượng 3.000 token mỗi giây (TPS) cho mỗi yêu cầu — nhưng đó là với một mô hình nhỏ chuyên dụng chỉ có khoảng 2 tỷ tham số, Laneformer 2B, hiện đã được mở mã nguồn.
Phản bác lại những người hoài nghi, Delalleau tự tin rằng phương pháp tương tự cũng có thể hoạt động hiệu quả với các LLM, vốn có kích thước có thể là một thách thức đối với các con chip suy luận. “GPU có một tương lai tươi sáng,” ông nói. Đối với CEO của Kog, quan điểm cho rằng chúng không phù hợp để giải mã đã trở thành một quan niệm sai lầm; các GPU mới hơn ngày càng có băng thông bộ nhớ lớn hơn, chỉ chờ được khai thác.
Kog không đơn độc trong suy nghĩ rằng tối ưu hóa phần mềm có thể giúp GPU làm được nhiều việc hơn những gì được ghi trên thông số kỹ thuật. ZML, cũng đến từ Pháp, đã phát hành phần mềm không phụ thuộc vào phần cứng, giúp bỏ qua CUDA của Nvidia để hỗ trợ suy luận nhanh trên các con chip cạnh tranh. Nhưng Delalleau cho biết Kog giống với phòng thí nghiệm Hazy Research của Đại học Stanford hơn, với sự tập trung sâu hơn vào khả năng tăng tốc GPU.
Bản thân Delalleau không phải là một nhà nghiên cứu, và startup đầu tiên của ông, Stribe (cựu thành viên TechCrunch50 2009), không liên quan gì đến công ty mới này — ngoại trừ việc người đồng sáng lập cũ của ông đã chuyển sang làm VC là Kamel Zeroual, người có công ty Varsity VC đã đồng dẫn dắt vòng gọi vốn hạt giống của Kog. Nhưng sự tập trung chuyên sâu của startup này bắt nguồn từ nền tảng độc đáo của ông.
Sau khi học vật lý chất rắn tại École Polytechnique của Pháp, ông tiếp tục làm việc trong lĩnh vực an ninh mạng tấn công — còn được gọi là white hat hacking (tin tặc mũ trắng). Theo Delalleau, điều này đã định hình tư duy mà ông hiện đang khuyến khích đội ngũ của mình áp dụng. Về mặt khoa học, “có một tư duy hiểu rõ các định luật vật lý và các định luật của GPU để tận dụng tối đa chúng.”
Về phần hacking, bốn lần lọt vào vòng chung kết tại giải đấu CTF của DEF CON cho biết nó đã dạy ông “cách kỹ thuật đảo ngược (reverse-engineer) mọi thứ ở cấp độ rất thấp — xuống đến ngôn ngữ assembly và mã nhị phân — để hiểu cách nó hoạt động, và cố gắng sử dụng nó để đạt được mục tiêu mà ban đầu nó không nhất thiết được thiết kế để làm.”
Nhược điểm của phương pháp này là nó đòi hỏi sự thực hành trực tiếp và rất tốn thời gian. “Với mỗi GPU mới, chúng tôi sẽ dành vài tuần hoặc thậm chí vài tháng để thực sự đào sâu vào các chi tiết và tiến hành nghiên cứu kỹ thuật GPU trên phần cứng đó.” Với đội ngũ 11 người, điều này giới hạn số lượng chip mà Kog có thể làm việc, ít nhất là trong tương lai gần.
Về lâu dài, Kog hy vọng sẽ đưa phương pháp luận của mình vào các quy trình dựa trên tác nhân (agent-based pipelines) để cho phép hỗ trợ nhiều chip và mô hình hơn. Khi châu Âu tìm cách xây dựng năng lực riêng trên hai mặt trận này, điều này có thể tạo thêm động lực chủ quyền cho startup, vốn đã được hỗ trợ bởi Scaleway và được hậu thuẫn bởi Bpifrance và chương trình French Tech 2030 của Pháp.
Tuy nhiên, hiện tại, Kog cần chứng minh với thế giới rằng phương pháp của họ hoạt động hiệu quả trên các LLM. Đây cũng sẽ là chìa khóa để đảm bảo có thêm nguồn vốn. “Khi chúng tôi đã triển khai mô hình lớn đầu tiên của mình với tốc độ nhanh gấp 10 lần, điều mà tôi nghĩ sẽ diễn ra vào tháng 9, chúng tôi sẽ có thể bắt đầu chứng minh sức hút với khách hàng và từ đó, huy động vốn Series A,” Delalleau cho biết.
Khi bạn mua hàng thông qua các liên kết trong bài viết của chúng tôi, chúng tôi có thể nhận được một khoản hoa hồng nhỏ. Điều này không ảnh hưởng đến tính độc lập trong biên tập của chúng tôi.
Anna Heim là một cây bút và tư vấn biên tập.
Bạn có thể liên hệ hoặc xác minh thông tin từ Anna bằng cách gửi email đến annatechcrunch [at] gmail.com.
Là một phóng viên tự do tại TechCrunch từ năm 2021, cô đã đưa tin về nhiều chủ đề liên quan đến startup bao gồm AI, fintech & insurtech, SaaS & định giá, và các xu hướng đầu tư mạo hiểm toàn cầu.
Tính đến tháng 5 năm 2025, các bài viết của cô cho TechCrunch tập trung vào những câu chuyện startup thú vị nhất tại châu Âu.
Anna đã điều phối các phiên thảo luận và thực hiện các cuộc phỏng vấn trên sân khấu tại các sự kiện ngành ở mọi quy mô, bao gồm các hội nghị công nghệ lớn như TechCrunch Disrupt, 4YFN, South Summit, TNW Conference, VivaTech, và nhiều sự kiện khác.
Từng là Biên tập viên khu vực LATAM & Truyền thông tại The Next Web, nhà sáng lập startup và cựu sinh viên Sciences Po Paris, cô thông thạo nhiều ngôn ngữ, bao gồm tiếng Pháp, tiếng Anh, tiếng Tây Ban Nha và tiếng Bồ Đào Nha Brazil.
Xem tiểu sử

Bài viết được AI dịch và tổng hợp tự động từ TechCrunch: AI. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.