Tin ngành
Tổng quan về mô hình mở: Kimi K3, Qwen 3.8, bài phát biểu của Chủ tịch Tập tại WAIC và tương lai ngành AI
(giờ Việt Nam)
Tóm tắt AI
Podcast cùng Florian Brand phân tích sâu về các mô hình mã nguồn mở mới, kỹ thuật chưng cất dữ liệu và khoảng cách công nghệ giữa mô hình đóng và mở.
Bản dịch AI

Nathan và Florian ngồi lại để thảo luận về mọi diễn biến xoay quanh các mô hình mở (open models). Sau khi Kimi K3 ra mắt vào tuần trước, dường như mọi thứ đang tăng tốc — từ địa chính trị giữa Mỹ và Trung Quốc, kinh tế học của mô hình mở so với mô hình đóng, cho đến an ninh tại các ranh giới của AI, v.v. Các chương: 00:00 Chào mừng & bối cảnh, 04:38 Trải nghiệm/sử dụng Kimi K3, 08:53 Vai trò tiếp diễn của GLM 5.2, 12:47 Tại sao các mô hình Trung Quốc lại tốt đến vậy?, 17:41 Dữ liệu, môi trường và chuyến tham quan các phòng thí nghiệm Trung Quốc, 19:47 Tổng hợp các nhà cung cấp Trung Quốc: Qwen, DeepSeek, MiniMax…, 24:08 Hệ sinh thái mô hình mở của Mỹ, 30:25 Ranh giới so với cận ranh giới, và lập luận an ninh mạng chống lại các lệnh cấm, 34:58 Chưng cất (distillation) và cuộc tranh luận của Ben Thompson, 44:12 Dự đoán và bảng xếp hạng các mô hình ranh giới, 48:36 Kết luận.
Các chương: 00:00 Chào mừng & bối cảnh, 04:38 Trải nghiệm/sử dụng Kimi K3, 08:53 Vai trò tiếp diễn của GLM 5.2, 12:47 Tại sao các mô hình Trung Quốc lại tốt đến vậy?, 17:41 Dữ liệu, môi trường và chuyến tham quan các phòng thí nghiệm Trung Quốc.
Hãy lắng nghe trên Apple Podcasts, Spotify và bất cứ nơi nào bạn thường nghe podcast. Để xem các cuộc phỏng vấn khác của Interconnects, hãy truy cập tại đây.
Chia sẻ.
Để biết thêm các video giáo dục về hậu huấn luyện (post-training), hãy xem khóa học mà tôi đang biên soạn.
00:00:06 Nathan Lambert: Được rồi, chào mừng quay trở lại với Interconnects. Chúng ta đang thực hiện bản tổng hợp mô hình mở hàng quý, chủ yếu là để chúng ta giải thích — không phải chế giễu — tại sao rất nhiều quan điểm về chưng cất mô hình lại sai lệch, đồng thời nắm bắt tình hình hiện tại. Tôi nghĩ thứ Năm tuần trước là lúc Kimi K3 được phát hành. Tôi tin rằng chúng ta sẽ còn thấy nhiều điều hơn nữa trong tương lai gần. Điều đó dường như là không thể tránh khỏi. Như cuối tuần qua, ông Tập đã có bài phát biểu trực tiếp cam kết về sự cởi mở và mã nguồn mở như một chiến lược. Đó không phải là một bản kế hoạch chi tiết về tình hình hiện tại.
Qwen đã thông báo rằng mô hình lớn tiếp theo của họ sẽ là mô hình mở trọng số (open weight), đây là một thay đổi lớn. Tôi nghĩ có quá nhiều thứ để đi sâu vào. Flo, hình như bạn đã bắt đầu bàn luận về khoảng cách hiệu năng và các quan điểm về chưng cất rồi. Vậy nên chúng ta có thể bắt đầu từ đó, và khi tôi tiếp tục, tôi có một danh sách nhỏ để chúng ta có thể đi qua các chủ đề và bài blog mà tôi đã viết, tất cả đều rất tinh tế. Tôi nghĩ chúng ta có vô vàn điều để nói. Vậy nên, hãy tiếp tục phần tranh luận của bạn đi.
00:01:17 Florian Brand: Vâng, tôi nghĩ điều lớn nhất ở mỗi lần phát hành mô hình, ít nhất là mỗi lần phát hành mô hình mở, là việc nó chậm hơn bao nhiêu tháng so với các mô hình ranh giới đóng (closed frontier). Mọi người rất thích đưa ra một con số cụ thể cho việc này, điều này thực sự gây nhiễu vì chúng ta có quá nhiều nhà cung cấp benchmark khác nhau hiện nay và cũng có quá nhiều benchmark khác nhau, đến mức mỗi bên — và tôi cũng không ngoại lệ — đều lôi ra các benchmark ưa thích của mình để chứng minh rằng mô hình hiện tại hoặc mô hình mới ra mắt đang ở mức ranh giới, sau đó phía bên kia lại phản bác bằng cách đưa ra một benchmark khác và cho thấy "Ồ, thực ra nó chậm hơn một năm". Rất nhiều thứ dường như xoay quanh câu hỏi các mô hình mở đang chậm hơn bao nhiêu tháng.
00:02:26 Nathan Lambert: Đúng vậy. Vì vậy, quan điểm của tôi là một số benchmark thực sự tương quan hợp lý với những gì mọi người đang làm, đó là các tác vụ lập trình có tính đại lý (agentic coding) và sử dụng máy tính có tính đại lý (agentic computer use), và một số benchmark khác lại tương quan với "đuôi dài" (long tail) — nơi mà tôi nghĩ Claude và GPT rất có giá trị. Nhưng nếu xét đến thị trường cho Claude Code và Codex hiện nay, nếu đó là kỹ thuật phần mềm, thì việc các mô hình chậm hơn vài tháng về mặt đó có thể là một vấn đề rất, rất lớn. Và tôi nghi ngờ rằng mô hình này sẽ ổn — miễn trừ trách nhiệm: trọng số mô hình vẫn chưa được công bố, dự kiến là ngày 27 tháng 7, và rất nhiều cuộc thảo luận sẽ dựa trên giả định rằng chúng sẽ được công bố.
Nhưng mọi người có thể hậu huấn luyện (post-train) mô hình này để rất có khả năng sánh ngang với Opus và GPT trong nhiều lĩnh vực ngách mà mọi người mong muốn. Tôi nghĩ việc theo dõi... ý tôi là cả hai chúng ta đều có cái nhìn khác nhau về ngành công nghiệp mô hình mở hậu huấn luyện, nhưng có rất nhiều sự phấn khích và tiến bộ trong việc tinh chỉnh (fine-tune) các mô hình này cho các tác vụ giá trị cao cụ thể. Điều này trước đây thường được thực hiện trên sự kết hợp giữa Qwen và GLM, và GLM 5.2 thực sự đã đẩy nhanh điều này. Tôi tò mò về người đầu tiên đăng bài blog kiểu "Chúng tôi đã tinh chỉnh Kimi K3 cho tác vụ của mình" vì tôi cá là bạn có thể đạt được những bước tiến lớn. Tôi nghĩ ngay cả khi bạn sử dụng Kimi K3 nhiều hơn tôi, linh cảm của tôi là nó sẽ là một quá trình hậu huấn luyện hơi "thô" do quy mô của nó lớn đến mức nào, và điều đó thường có nghĩa là vẫn còn rất nhiều hiệu năng có thể được khai thác từ nó. Phải không?
00:04:03 Florian Brand: Đúng vậy. Chạy, chạy và chạy, đặc biệt là hậu huấn luyện cái đó sẽ cực kỳ khó vì bạn cần khoảng một node B300 chỉ để tải trọng số, điều này thật điên rồ về mặt quy mô. Vì vậy, có lẽ sẽ mất một thời gian và rất nhiều kỹ thuật như tôi đã nghe để thực sự đưa nó vào trạng thái có thể tinh chỉnh được. Nhưng mọi người muốn nói về việc sử dụng mô hình, giống như bạn đã thực sự đăng ký chương trình lập trình và sử dụng nó. Vì vậy, việc đưa thông tin này ra ngoài là bối cảnh tốt.
00:04:38 Nathan Lambert: Vâng. Tôi đã đăng ký vào ngày sau khi phát hành hoặc đại loại vậy cho gói 200 đô la, gói lớn nhất của họ tương tự như tất cả các gói khác, nhưng họ cũng có các gói 40 đô la và 100 đô la. Gói lớn nhất có 1 triệu context và tôi nghĩ, hoặc ít nhất cảm thấy là nó cũng có một số ưu tiên về yêu cầu API vì rất nhiều người trực tuyến đang nói rằng họ liên tục gặp lỗi API, và cho đến nay tôi vẫn khá ổn nếu tôi có thể nói như vậy. Và về khả năng của mô hình, ngoài giao diện người dùng thực sự tốt, thì ở một số khía cạnh, nó thực sự tỏa sáng và vượt trội.
Ngay cả kỳ vọng của tôi, ngay cả với những thứ như một số tác vụ nghiên cứu mà tôi có, hoặc tại Interconnects, chúng tôi hiện có hơn một năm dữ liệu về các mô hình mở, và tôi yêu cầu các mô hình ranh giới đưa ra một số phân tích thú vị mà chúng tôi chưa từng thực hiện trước đây vì chúng tôi tự làm phân tích của mình và đã xuất bản nó. Tôi yêu cầu chúng: "Được rồi, hãy làm điều gì đó mới và gây ngạc nhiên cho tôi". Và rất nhiều mô hình hoặc các mô hình ranh giới, về cơ bản là tất cả các mô hình, đều bám vào những gì chúng tôi đã làm, làm lại phần phân tích dữ liệu đó và sau đó thực hiện một số phần kỳ lạ, khó hiểu.
Kimi K3 đã làm một số điều thú vị hơn. Tôi đã yêu cầu nó một cách rõ ràng là hãy quét (scrape) Reddit, và sau đó nó tìm thấy một số subreddit mà tôi thậm chí chưa từng cân nhắc, rồi phát hiện ra ví dụ như các cuộc thảo luận trên Reddit gần đây hơn một hoặc hai tháng, hoặc chúng tìm thấy các mô hình thú vị trước khi số lượng tải xuống thường tăng vọt — giống như việc chúng đều tập trung vào Qwen và sau đó mọi người tải xuống nhiều mô hình Qwen hơn. Những kiểu phân tích đó mang tính đột phá, nhưng đó là điều mà Kimi đã làm tôi ngạc nhiên so với tất cả các mô hình ranh giới khác.
Một câu hỏi đơn giản như: bạn có thể sử dụng cái này cho hầu hết các công việc cốt lõi mà bạn làm không? Xét về việc bạn có một phân phối các công việc bạn thường làm, hầu hết chúng là với Codex — tôi nghĩ bạn là người dùng Codex hơn là người dùng Claude — bạn nghĩ biểu đồ Venn chồng chéo bao nhiêu phần trăm mà mô hình này sẽ ổn?
00:07:24 Florian Brand: Nó thực sự phụ thuộc vào việc tôi cho nó bao nhiêu sự linh hoạt. Điều lớn nhất tôi thấy với Kimi K3 hiện tại — tôi đang làm việc trên framework mà chúng tôi đang thực hiện tại Prime Intellect, nơi tôi làm việc — và điều chính tôi thấy với Kimi là mã của nó đơn giản hơn nhiều, điều này làm cho nó dễ đọc hơn nhiều, nhưng nó bỏ lỡ một số thứ mà Codex hoặc như chúng ta đang nói đến 56, 55 và đặc biệt là 54 sẽ đạt được ở những cấp độ đó. Vì vậy, tôi sẽ nói rằng Kimi K3 ở mức 54-55 cho những loại tác vụ này.
Nhưng nếu tôi đọc mã và tôi nói "Được rồi, đó là mã thực sự tốt", sau đó tôi cho nó chạy qua với Codex, nó tìm thấy tất cả những trường hợp ngách mà nó không vượt trội, nhưng để giám sát các lần chạy hoặc để chạy một số thử nghiệm, nó thực sự rất hữu ích. Và đối với một số thứ ngách khác, bạn chỉ cần để nó chạy. Một nhược điểm là — nhưng đó cũng là vì API hoàn toàn bị quá tải về người dùng và máy chủ của họ ở Trung Quốc — thời gian thực (wall clock time) cao hơn đáng kể so với GPT. Nhưng tôi sẽ nói rằng nếu tôi phải thúc đẩy nó và sử dụng nó trong quy trình làm việc hàng ngày, tôi sẽ chậm hơn, nhưng tôi sẽ không bị chậm đến mức tôi phải nói: "Được rồi, cái này không thể sử dụng được".
00:08:53 Nathan Lambert: Và điều này so với GLM 5.2 như thế nào? Bởi vì GLM 5.2 theo ý kiến của tôi vẫn là một câu chuyện đang diễn ra, nơi tôi sẽ đi quanh SF và mọi người kiểu như "Vâng, tôi thực sự sử dụng cái này cho phần này trong công việc lập trình có tính đại lý và/hoặc quy trình làm việc của tôi". Bạn có thuộc nhóm sử dụng GLM chút nào không?
00:09:20 Florian Brand: Vâng, tôi cũng đã sử dụng và đang sử dụng GLM chủ yếu vì chúng tôi có một endpoint nội bộ thực sự nhanh và chúng tôi có, hoặc trước đó tôi cũng đã sử dụng một API có khoảng 200 hoặc 300 token mỗi giây. Và nếu bạn có thể thực hiện rất nhiều tác vụ ở mức độ đủ tốt một cách thực sự nhanh chóng, bạn chỉ cần sử dụng mô hình đó thay vì chuyển sang Codex, sau đó chọn mô hình kém hơn, sau đó chọn nỗ lực suy luận (reasoning effort) phù hợp, sau đó chọn nhanh... Tôi chỉ cần sử dụng GLM, nhận được kết quả tương tự và nó khá ổn. Nó chắc chắn ở mức độ tương đương Sonnet về khả năng và đối với rất nhiều tác vụ dọn dẹp, cho một tác vụ chỉ là công việc chân tay, nó thực sự hiệu quả. Tôi muốn nói rằng bạn có thể đi rất xa với rất nhiều công việc với Kimi K3 là tác nhân chính và GLM cho công việc tác nhân phụ.
00:10:24 Nathan Lambert: Một điều khá khác biệt với thông báo của Kimi và quy mô của các mô hình này là tôi nghĩ sẽ mất nhiều thời gian hơn một chút để các mô hình mở này thực sự được tối ưu hóa và có sẵn trên các nhà cung cấp suy luận. Giống như GLM 5.2 khá nhanh, nhưng một là chúng ta chưa có trọng số, và hai là tôi không nghĩ nó sẽ có tốc độ triển khai nhanh như các mô hình MoE 500B, 700B. Tôi nghĩ sẽ có nhiều vấn đề hơn ở đó, một chế độ rất khác so với trước đây khi các mô hình Trung Quốc hoàn thành quá trình RL (học tăng cường) của họ và phát hành mô hình với trọng số mở trong vòng vài giờ đến vài ngày, có thể là một tuần, và sau đó hệ sinh thái ngay lập tức biết cách thực hiện điều này.
Tôi nghĩ có một sự nâng cấp về cơ sở hạ tầng lớn hơn nhiều đối với quy mô mô hình mở trọng số tiếp theo này, điều mà tôi nghĩ chúng ta phải tính đến. Các phòng thí nghiệm đóng thực hiện điều này sau hậu trường trước khi công bố mô hình. Vì vậy, nó giống như việc thao túng khoảng cách thời gian theo cách mà có thể mất thêm một tháng trước khi mọi người thực sự có thể hậu huấn luyện và sử dụng Kimi ở quy mô lớn cho quy trình làm việc của họ. Và chúng ta thích nói với tư cách là một người hâm mộ trọng số mở rằng "Ồ, chỉ khi mô hình đóng có sẵn thì bạn mới có thể tận dụng khoảng cách thời gian", nhưng bây giờ có những động lực tương tự trong các mô hình mở, kiểu như API Kimi hoàn toàn bị hỏng. Có quá nhiều cung, quá nhiều cầu, không đủ cung. Vì vậy, không phải là mô hình này ngay lập tức lan tỏa... Tôi chỉ đang nghĩ về điều này khi nó liên quan đến khoảng cách thời gian hiệu năng.
00:11:54 Florian Brand: Bởi vì điều đó đúng, nhưng mặt khác, hệ sinh thái mở đã chuyên nghiệp hóa khá nhiều trong vài tháng qua. Trong lần triển khai ban đầu của bạn, tất cả chúng đều đi kèm với một số đối tác có sẵn trọng số trước. Họ có các bản vá vLLM ra mắt trước vài ngày hoặc thậm chí vài tuần, hoàn toàn khác so với một năm trước khi về cơ bản trọng số được tung ra và các nhà sản xuất mô hình kiểu "Được rồi, bạn phải tự tìm cách giải quyết". Vì vậy, tôi hy vọng rằng tính khả dụng chung vào ngày đầu tiên sẽ khá ổn và sau đó cuộc đua bắt đầu giữa tất cả các nhà cung cấp để bắt đầu tối ưu hóa nhằm đạt được tốc độ cao hơn và cao hơn nữa vì nó mang lại rất nhiều uy tín.
00:12:47 Nathan Lambert: Vâng. Được rồi, có hai hướng để đi. Tại sao chúng ta nghĩ các mô hình Trung Quốc có thể tốt đến vậy? Tôi nghĩ tôi đã viết về việc có một cuộc tranh luận trong Discord của chúng tôi với JSD tại Epoch và tôi nghĩ nó rất tốt. Tôi có phần này trong bài viết của mình rằng tôi đang dần nghĩ rằng các phòng thí nghiệm Trung Quốc sử dụng vốn hiệu quả hơn và bạn có thể biến vốn thành tính toán, dữ liệu và tài năng theo cách làm cho các mô hình tốt hơn. Và tôi nghĩ điều này cực kỳ quan trọng nếu nó thực sự là một lợi thế cấu trúc nào đó. Dù nguyên nhân là gì, tôi nghĩ nguyên nhân có thể là tài năng được đào tạo tốt hơn cho bất cứ hệ thống giáo dục nào của họ để làm việc trên các vấn đề làm cho LLM tốt hơn.
Có thể chỉ là tất cả tính toán, tài năng và mọi thứ đều có chi phí thấp hơn nhiều ở Trung Quốc bằng cách nào đó. Cho dù đó là trợ cấp, hay chỉ là mức lương trung bình thấp hơn. Nhưng đây là một vấn đề rất lớn khi chúng ta xoay vòng các lần lặp mô hình. Và nếu một mô hình thế hệ tiếp theo có giá 10 tỷ đô la cho Anthropic nhưng chỉ 4 tỷ đô la cho Kimi, thì điều này có thể rất lớn, nhưng không rõ tại sao lại như vậy. Ví dụ, tôi nghĩ Big Eagle, kỹ sư của Kimi, đã trả lời tweet của tôi về điều này và nói rằng nó giúp ích vì chúng tôi không cố gắng thúc đẩy ranh giới, chúng tôi chỉ cố gắng bắt kịp, điều này thực sự có thể là một tư duy về cách các mục tiêu của các phòng thí nghiệm được xác định phạm vi ở Trung Quốc để họ tốn ít tiền hơn nhiều để xây dựng các mô hình này.
Nhưng trong năm qua, chúng ta đã đặt rất nhiều câu hỏi như liệu các mô hình Trung Quốc có bị tụt hậu không. Tôi đã nghĩ rằng khoảng cách giữa các mô hình đóng và mở sẽ tăng lên do loại cường độ vốn này của việc đào tạo, và có vẻ như nó đang đi theo hướng ngược lại, điều này thật khó để giải mã. Nhưng bạn có đồng ý rằng các phòng thí nghiệm đang bắt kịp nhiều hơn chúng ta mong đợi không, ý tôi là các phòng thí nghiệm Trung Quốc, và tại sao?
00:14:43 Florian Brand: Chà, tôi thực sự đã xem xét các dự đoán của chúng tôi cho năm nay dựa trên bản tóm tắt năm ngoái của chúng tôi và chúng tôi về cơ bản đã nói rằng khoảng cách sẽ duy trì trong vòng vài tháng. Vì vậy, dự đoán đó dường như phần lớn vẫn đúng. May mắn cho chúng tôi, chúng tôi không đưa ra một con số cụ thể liệu đó là 3 tháng, 6 tháng hay 9 tháng. Vì vậy, chúng tôi an toàn về mặt đó. Nhưng tôi nghĩ điều chung mà cả hai chúng tôi đều cảm thấy khi ở Trung Quốc và nói chuyện với những người này là họ giống như các nhà nghiên cứu, họ là những nhóm gồm 2 hoặc 300 người, tất cả đều ở độ tuổi 20 và tất cả chỉ muốn một mô hình thực sự tốt, họ dường như không làm bất kỳ nhiệm vụ phụ nào.
Họ dường như không làm bất cứ điều gì đi chệch khỏi những thứ này. Và họ có thể... hoặc về mặt tính toán, đây là một câu hỏi thực sự khó để chúng tôi trả lời, đặc biệt là khi các chip Trung Quốc này hiện đang trực tuyến. Tôi cũng nghĩ chip... tôi nghĩ việc buôn lậu chip đã tăng đáng kể trong khoảng 6 đến 9 tháng qua hoặc các chip đã được buôn lậu bắt đầu trực tuyến.
00:15:58 Nathan Lambert: Buôn lậu là một thuật ngữ chung để lách các hạn chế xuất khẩu. Nếu các chip ở Malaysia và họ đang sử dụng chúng, tôi coi đó là tương tự và tôi nghĩ rằng điều đó đã tăng lên đáng kể trong sáu đến chín tháng qua, đây là một phần kết quả của điều đó và bạn đang nói... nhưng tôi chỉ muốn đưa ra điều đó rằng tôi thực sự nghĩ rằng họ có nhiều tính toán hơn nhiều so với khi họ đang đào tạo thế hệ mô hình trước đó.
00:16:24 Florian Brand: Vâng. Giống như... hoặc chỉ để làm bối cảnh, hai tuần trước tôi nghĩ LongCat đã phát hành mô hình của họ mà họ tuyên bố — và chúng tôi biết rằng điều đó rất có khả năng là đúng — được đào tạo hoàn toàn trên các chip Trung Quốc. Họ không chỉ định công khai loại nào nhưng mọi người suy đoán rằng đó là một số Ascend từ Huawei. Và khi sản xuất trong nước tăng lên và họ có thể... chúng có lẽ được sử dụng nhiều nhất hoặc chúng được sử dụng để đào tạo nhưng chúng đặc biệt hữu ích cho suy luận, vốn là một phần rất lớn của đào tạo.
Vì vậy, họ có thể sử dụng một số kết hợp giữa Nvidia và các chip khác cho phần đào tạo và sau đó là một phần ngày càng lớn hơn cho phần suy luận, trong giai đoạn này là thực sự quan trọng. Vì vậy, tôi nghĩ tổng thể tính toán của họ đang tăng lên và họ cũng không thực sự có nhiều người dùng. Vì vậy, họ không cần phải cung cấp năng lượng cho 1 tỷ người dùng như ChatGPT phải làm, hàng trăm hoặc hàng nghìn doanh nghiệp như Anthropic phải làm vì họ không có quy mô khách hàng trả tiền đó.
00:17:41 Nathan Lambert: Vâng. Và tôi nghĩ ngay cả những khách hàng trả tiền đó, ít nhất là về phía doanh nghiệp, chỉ là có thời gian và sự bàn tán của công ty khi bạn hỗ trợ những thứ này. Ngay cả khi bạn không phải là nghiên cứu, ngay cả khi nó không nằm trong công việc của bạn, nó thực sự làm thay đổi sự chú ý của công ty. Và nếu SSI ra mắt một mô hình tốt, đó sẽ là sự xác nhận cuối cùng rằng sự xao nhãng là một vấn đề, nhưng đó là một vấn đề bên lề mà chúng ta có thể chờ đợi. Tôi nghĩ cũng có những lời bàn tán về ngành công nghiệp dữ liệu và môi trường bắt đầu xuất hiện ở đó.
Bạn có nhớ bất kỳ cái tên cụ thể nào không? Bởi vì khi chúng tôi ở Trung Quốc, thật sốc khi họ dường như sử dụng rất ít dữ liệu bên ngoài. Vì vậy, chỉ vài tháng sau khi nghe một loạt... một tháng sau chuyến đi của chúng tôi, chúng tôi đã đến vào tháng 4 và sau đó chỉ vài tháng sau vào tháng 7, chúng tôi đang nghe một vài điều như các công ty mới ở Trung Quốc và họ muốn mua dữ liệu và những thứ tương tự. Và đó là một dòng thời gian buồn cười về cách điều đó thay đổi.
00:18:40 Florian Brand: Và tôi sẽ đặt các thanh sai số (error bars) vào những gì họ thực sự nói với chúng tôi.
00:18:44 Nathan Lambert: Và điều đó bởi vì nó quá gần về thời gian nên tôi không biết.
00:18:49 Florian Brand: Vâng. Điều đó có thể đúng. Nhưng những thứ đó rất khó để xác định chính xác. Tôi muốn nói rằng có vẻ như việc mua dữ liệu bên ngoài đang trở thành một yếu tố quan trọng hơn. Điều này sẽ giúp các mô hình mở bắt kịp các mô hình đóng nếu họ chỉ mua cùng một dữ liệu, có thể là với giá chiết khấu vì họ mua các môi trường dữ liệu sau đó. Nhưng đó là một yếu tố. Yếu tố lớn đến mức nào thì chúng tôi không biết. Chúng tôi không có bất kỳ thông tin chi tiết công khai nào và tôi nghi ngờ rằng chúng tôi sẽ nhận được những thông tin chi tiết đó từ bất kỳ ai... thực sự... vì vậy đó chắc chắn là một trong những phần tại sao chúng tôi có thể bắt kịp hoặc cải thiện điểm số mô hình của họ.
00:19:47 Nathan Lambert: Được rồi, tổng hợp các nhà cung cấp mô hình Trung Quốc khác. Chúng ta đã nói về Kimi, chúng ta đã nói về Zhipu / GLM. Tôi nghĩ sẽ sớm có thêm các mô hình GLM rất tốt. Họ có thể gọi nó là GLM 5.5. Qwen, chúng ta đã nói về mô hình lớn nhất của họ sắp ra mắt. Các mô hình lớn nhất của Qwen, tôi sẽ nói, có xu hướng so với sự xuất sắc của các mô hình nhỏ của họ, không có cùng thứ hạng tuyệt đối về hiệu năng, đó có lẽ là cái giá của sự tập trung. Tôi nghĩ nó đi cùng với các công ty đám mây. Nó gần như là nếu bạn nheo mắt, nó gần như là Google.
Giống như Qwen có Alibaba có quá nhiều cơ hội ở đây và cơ hội để các nhà phát triển liên kết với Alibaba Qwen với những mô hình nhỏ này là một cơ hội quá lớn cho đám mây của họ đến mức tôi nghĩ họ đang thành công rực rỡ. Nhưng các mô hình lớn của họ luôn không xuất sắc bằng các mô hình nhỏ của họ. Vì vậy, tôi không mong đợi mô hình của họ sẽ mang tính đột phá như Kimi K3 hoặc GLM 5.2. Tôi mong đợi nó sẽ được đưa tin trên báo chí như một mô hình mở lớn khi tên mô hình mở ở Trung Quốc tung ra mô hình khổng lồ, nhưng tôi không nghĩ nó sẽ bền vững như một câu chuyện tin tức. DeepSeek, bạn có thể tham gia bất cứ điều gì.
00:21:01 Florian Brand: Điều thú vị là không biết bạn theo dõi điều này bao nhiêu, nhưng họ có một endpoint mà bạn có thể sử dụng cho phiên bản xem trước và họ đã cập nhật endpoint này hàng ngày, vì vậy họ có một chu kỳ lặp lại thực sự nhanh vì chúng tôi tiến bộ trong tất cả các benchmark trên Twitter này. Vì vậy, rất nhiều thứ SVG và three.js này, tất cả các tác vụ tạo hình ảnh này, mô hình đã cải thiện rất nhiều trong vài ngày qua. Vì vậy, họ đã tìm ra một loại cơ chế phản hồi nhanh mà các công ty khác cũng có. Chúng tôi biết điều này hoặc Cursor có rất nhiều blog về điều này, cách họ lặp lại thực sự nhanh. Nhưng họ dường như liên tục tải lên các checkpoint mới và làm cho chúng có sẵn.
00:21:47 Nathan Lambert: Nhưng tôi đồng ý. Tôi đoán nó giống như một thời gian bị giới hạn trong lần chạy RL cuối cùng của họ. Nó vẫn cải thiện một chút ở cuối lần chạy RL của họ và họ chỉ đang đánh dấu vào ô.
Bài viết được AI dịch và tổng hợp tự động từ Interconnects (Nathan Lambert). Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.