WeChat vừa công bố mã nguồn mở WeKnora, khung kiến thức hỗ trợ doanh nghiệp xử lý tài liệu, truy xuất ngữ nghĩa và suy luận tự động. Hệ thống này nổi bật với kiến trúc 4 lớp, tích hợp môi trường sandbox Docker và khả năng tự động cập nhật tri thức, hiện đã hỗ trợ plugin cho DeepSeek Harness.
Bài viết giải thích hai giai đoạn suy luận của LLM: Prefill xử lý song song đầu vào quyết định tốc độ phản hồi ban đầu (TTFT), trong khi Decode tạo văn bản từng token một và thường bị nghẽn băng thông bộ nhớ.
Nathan Lambert vừa công bố danh sách các bài viết tiêu biểu về AI mã nguồn mở, bao gồm chiến lược kinh doanh, rủi ro và cục diện cạnh tranh Mỹ - Trung. Đây là tài liệu tham khảo giá trị cho những ai muốn hiểu sâu về xu hướng phát triển mô hình mở hiện nay.
"Symbolic learning" is simply "machine learning" (automatically learn function x -> y given examples…
DịchHọc máy biểu tượng (Symbolic Learning) là quá trình AI tự động học hàm x -> y dưới dạng mã nguồn rời rạc và tường minh, thay vì các mô hình tham số hóa hay khớp đường cong truyền thống.
Tác giả giải thích cách tokenizer hoạt động dựa trên tần suất xuất hiện trong dữ liệu, minh họa bằng việc cụm 3 chữ '' (Mưa sao băng) được mã hóa thành duy nhất 1 token, làm nổi bật sự khác biệt giữa tư duy ngôn ngữ của con người và AI.
Tác giả chia sẻ lộ trình học NLP chuyên sâu, bắt đầu từ việc giải thích đơn giản và trực quan về Tokenizer, kèm theo video hướng dẫn giúp người xem dễ dàng nắm bắt các khái niệm kỹ thuật phức tạp.
Khám phá quy trình xử lý phức tạp của LLM từ lúc nhận lệnh đến khi phản hồi, bao gồm cách tái tạo lịch sử hội thoại và tầm quan trọng của kỹ thuật ngữ cảnh trong việc tối ưu chi phí và chất lượng câu trả lời.
OpenWiki giúp giảm thiểu ảo giác AI bằng cách liên kết các tuyên bố với bằng chứng xác thực, cho phép hệ thống tự động phát hiện và cập nhật thông tin lỗi thời trong các cơ sở tri thức.
What's the best work you've consumed on open models, us v china AI, distillation, or related topics? …
DịchChuyên gia Nathan Lambert đang tìm kiếm các nguồn tài liệu chất lượng như blog, bài báo hay podcast về mô hình nguồn mở, kỹ thuật chưng cất tri thức và sự cạnh tranh AI giữa Mỹ và Trung Quốc.