Thủ thuật
Kimi AI 'hồi sinh' người đã khuất: Tranh cãi về đạo đức và công nghệ
(giờ Việt Nam)
Tóm tắt AI
Bài viết phân tích hiện tượng người dùng sử dụng chatbot Kimi để mô phỏng lại người thân đã khuất, đặt ra những câu hỏi nhức nhối về ranh giới đạo đức và tác động tâm lý của AI trong việc 'gọi hồn' kỹ thuật số.
Bản dịch AI

"Vận may đang ở phía trước"
Với việc OpenAI không thể sớm ra mắt GPT-6, bảng xếp hạng LLM đã bị các đội ngũ Trung Quốc làm cho đảo lộn hoàn toàn.
Ngoài hai vị trí dẫn đầu vốn thuộc về Fable 5 và 5.6 Sol, các thứ hạng từ ba đến mười đang thay đổi nhanh hơn cả tốc độ ra mắt đồ uống mới của HEYTEA.
Xu hướng trong hai tháng qua: ban đầu Opus 4.8 bị "cày" như một con boss, sau đó khi GLM và DeepSeek tung ra các bản cập nhật trong vài ngày qua, Opus 5 cũng bị "cày" không kém.
Nhưng việc nhìn vào điểm số benchmark cụ thể đã trở nên vô nghĩa. Với quá nhiều benchmark, quá nhiều lượt chạy và mỗi bên đều tự kiểm tra trên bộ Harness riêng của mình, các con số thực tế hoàn toàn phụ thuộc vào việc một đội ngũ có muốn "phóng vệ tinh" để tạo hiệu ứng truyền thông hay không.
Ý tôi là, các phòng thí nghiệm mô hình có thể tạo ra bất kỳ điểm số nào họ muốn. Vì vậy, các benchmark công khai không quan trọng—chỉ có hiệu suất thực tế trong quy trình làm việc của bạn mới là thứ đáng giá. Đó là lý do chúng tôi đang xây dựng Dongmodi, tập hợp các bộ đánh giá được cá nhân hóa ❤️
Quay lại cuộc đua LLM khốc liệt.
Tình hình đã rõ ràng: mùa giải mới đã bắt đầu.
Nửa đầu năm 2026: tập trung tổng lực vào kịch bản lập trình. Với dưới 1T tham số, đẩy mạnh khả năng lập trình thông qua post-training. Vị vua không thể tranh cãi của mùa giải rõ ràng là Zhipu AI, với GLM 5.2 đã hoàn toàn chiếm lĩnh tâm trí người dùng, là người đầu tiên hạ gục Opus 4.8—tiên phong mở đường, tiên phong thống trị.
Nửa cuối năm: cuộc đua nhảy vọt về tham số. Ai tung ra mô hình 2T tham số ổn định, khả dụng đầu tiên, người đó thắng. Post-training là vô tận, nhưng các "vệ tinh" pre-training còn bay cao hơn nữa.
Mùa giải vừa bắt đầu, Kimi K3 là bên đầu tiên "phóng vệ tinh"—một đứa con của bản vá. Điểm số của nó tiệm cận Fable 5, chuyển dịch câu chuyện về mô hình nội địa từ "lựa chọn giá rẻ" sang "thách thức vị trí số 1", và với khả năng tối ưu hóa cực cao cho việc tạo trang web đẹp chỉ trong một lần nhắc, nó đã phá vỡ kịch bản frontend, khởi đầu cho một mùa giải mới của những cú "đổ bộ mặt trăng" từ các mô hình nội địa.
Khả năng tạo frontend "một lần là xong" của K3 thực sự ấn tượng. Khi tôi xây dựng trang Mianshen Quotes (libtv.md), Kimi là lựa chọn đầu tiên của tôi. Thời hạn gấp rút, khối lượng công việc lớn—trang web hoàn thành vội vã đã nhận được sự tán thưởng đồng lòng từ các môn đồ Mian.
Dù sao thì.
Những cái tên khác đã tham gia mùa giải mới bao gồm Qwen 3.8 Max với 2.4T tham số. Đáng buồn thay, nó ra mắt chỉ hai ngày sau K3—giống như Uông Phong của thế giới LLM, mãi mãi bị lu mờ.
Sắp gia nhập: GLM, DeepSeek, MiniMax, tất cả đều đang chạy đua để huấn luyện các mô hình đa nghìn tỷ tham số.
Tiến bộ rõ ràng nhất là sự ra mắt chính thức của DeepSeek V4 Pro. Dù hiệu suất không ổn định—lúc thì xuất sắc, lúc thì như ma làm—nhưng nó sở hữu 1.6T tham số. Với việc Flash của Little Whale cho thấy nó có thể sánh ngang với "vua post-training" GLM 5.2 chỉ với một phần ba số tham số, chỉ cần một bản cập nhật nhỏ nữa, Little Whale có thể trở lại làm vua post-training, khiến tất cả phải kinh ngạc.
Một khi đã nắm bắt được những điều cơ bản của mùa giải này, việc đưa ra kết luận rất dễ dàng.
Kimi đã khởi động mùa giải mới với K3, dẫn đầu trong một tháng, theo sau là sự gia nhập của Qwen 3.8.
Trong khi đó, "vua bản vá" cũ Zhipu AI, dựa vào ma thuật post-training để cố gắng kéo dài tuổi thọ, đã tung ra thêm GLM 5.3. Mô hình cơ sở 753B đó đã mất tới sáu tháng để tối ưu hóa từ mức "vừa đủ dùng" thành "lựa chọn thay thế Fable"—phải thừa nhận là khá kỳ diệu và đầy nỗ lực.
Chưa kể đến việc phiên bản post-training GLM 5.3 Macaron có lẽ đang trên đường ra mắt. Rất mong chờ post-training của post-training của post-training.
Tôi đã chạy thêm benchmark ZangAI. GLM 5.3 có cải thiện, nhưng không nhiều—xếp sau Grok 4.6 và K3. Tiếp tục duy trì đà tốt, nhưng thiếu đi tác động đột phá như phiên bản trước.
Và có lẽ vì vừa tăng giá và dỡ bỏ giới hạn mua gói Token, GLM 5.3 chạy tác vụ khá chậm, trung bình 12,7 phút mỗi tác vụ—cao hơn nhiều so với DeepSeek V4 Pro (7,9 phút) và Grok 4.6 (5,4 phút).
Nhân tiện, bản phát hành chính thức DeepSeek V4 Pro: các lượt chạy của tôi cho thấy có cải thiện so với Flash, nhưng không đáng kể. Người thắng cuộc thực sự là Grok 4.6—nhanh, điểm số cao và toàn bộ lượt kiểm tra chỉ tốn 15,7 RMB, chưa bằng một nửa chi phí API của GLM 5.3 (38,2 RMB, tính theo giá 5.2).
Thánh Ma đã nắm bắt được cách sản xuất. LLM cũng thuần túy là sản xuất mà thôi.
Phải nói rằng, không có ý gì với GLM 5.3, nhưng mô hình này cứ úp mở ra mắt mãi không thấy đâu, thổi phồng ARR (chúng ta sẽ thấy báo cáo nửa năm trong vài ngày tới), cộng thêm vụ rò rỉ API GLM 5.3 tuần trước—tôi thực sự tò mò liệu họ có thể post-train để lên được GLM 5.4 không?
Mùa giải mới nghĩa là: bản vá đã thay đổi. Việc đứng số 1 trong bản vá cũ chỉ là kéo dài sự sống. Điều quyết định thứ hạng mùa giải mới là tung ra mô hình 2T tham số càng sớm càng tốt.
Tin đồn về thời điểm ra mắt rất nhiều. Ít nhất chúng ta có thể xác nhận MiniMax và GLM có khả năng không thể phát hành mô hình thế hệ mới vào cuối tháng này. Hãy kiên nhẫn, anh em—để Thánh Yang tận hưởng khoảnh khắc của mình thêm một chút nữa.
Kimi, tạm thời dẫn đầu, có hai đối thủ cạnh tranh chính trong nước.
Một: Qwen sẽ sớm cập nhật một bản vá nhỏ. Điểm yếu của Qwen 3.8 Max là khả năng đa phương thức, cộng với sự nhầm lẫn trong tâm trí người dùng do các đợt phát hành bản xem trước và chính thức liên tiếp, khiến nó khó chiếm lĩnh được tâm trí người dùng.
Bằng chứng: phiên bản mã nguồn mở của Qwen 3.8 Max loại bỏ khả năng đa phương thức, cho thấy nó có thể đã được "chắp vá" từ một mô hình VL nhỏ riêng biệt.
Đối thủ còn lại: DeepSeek khó lường. Hiệu suất thực tế của DeepSeek V4 Pro chênh lệch rất lớn so với kết quả benchmark chính thức. Bởi vì điểm số chính thức được chạy ở chế độ tối thiểu của DeepSeek Harness.
Và DeepSeek Harness rõ ràng là bản xem trước dành cho nhà phát triển thử nghiệm, phiên bản 0.1, với triết lý thiết kế và tương tác quá mới lạ. Vì vậy, rõ ràng ít người dùng thực sự sử dụng nó. Do đó, bản phát hành chính thức DeepSeek V4 Pro, giống như Harness của nó, được coi là chưa hoàn thiện.
Tốc độ chạy theo danh tiếng thực sự rất nhanh.
Điểm sáng là: các bản vá nhỏ tiếp theo của Qwen 3.8 Max và DeepSeek V4 Pro đều có khả năng tái tạo phép màu post-training.
Tất nhiên, huấn luyện LLM là một bài toán kỹ thuật. Không có phép màu, không có bí mật nào cả.
Ý tôi là, danh hiệu vua post-training giống như số phiên bản mô hình—chỉ có giá trị trong một tháng. Kimi và Qwen đều có thể trở thành vua post-training.
Khi các LLM nội địa trở thành ngành sản xuất thuần túy, ở nước ngoài cũng có đối thủ mạnh nhất: vị thánh cuối cùng của ngành sản xuất Mỹ, Elon Musk.
Fable 5 và 5.6 Sol được đồn đại là có gần 10T tham số—như mặt trời và mặt trăng treo trên tất cả các mô hình khác.
Nhưng bay quá gần mặt trời đồng nghĩa với việc các đội ngũ LLM Mỹ thiếu đi sự cạnh tranh trăm hoa đua nở. Hai ngôi sao song hành thống trị, và ngay cả những mô hình nhỏ hơn của họ cũng bị Qwen 3.8-27B hạ gục—một mô hình chạy trên Mac Mini mà vẫn đạt điểm số ngang ngửa Opus 4.6. Bạn có tin điều đó không?
Bài viết được AI dịch và tổng hợp tự động từ elsewhere:. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.