Thủ thuật
Điều gì thực sự xảy ra bên trong chatbot AI khi bạn nhấn nút gửi?
(giờ Việt Nam)
Tóm tắt AI
Khám phá quy trình xử lý phức tạp của LLM từ lúc nhận lệnh đến khi phản hồi, bao gồm cách tái tạo lịch sử hội thoại và tầm quan trọng của kỹ thuật ngữ cảnh trong việc tối ưu chi phí và chất lượng câu trả lời.
Bản dịch AI


Các AI agent có thể tạo mã nguồn. Tuy nhiên, việc làm cho mã nguồn đó phù hợp với hệ thống, quy ước của nhóm và các quyết định trước đây mới là phần khó. Cuối cùng, bạn lại lãng phí thời gian và token vào các vòng lặp sửa lỗi.
Càng nhiều MCP, quy tắc và cửa sổ ngữ cảnh (context window) lớn hơn sẽ giúp các agent tiếp cận được nhiều thông tin hơn, nhưng không có nghĩa là chúng thực sự hiểu được vấn đề. Những đội ngũ đang dẫn đầu là những người sở hữu một lớp ngữ cảnh (context layer) để cung cấp chính xác những gì agent cần cho tác vụ hiện tại.
Hãy tham gia buổi hội thảo trực tuyến MIỄN PHÍ của chúng tôi vào ngày 2 tháng 9 để tìm hiểu:
Những điểm mà các đội ngũ thường gặp khó khăn trên lộ trình trưởng thành về AI và lý do tại sao các giải pháp thông thường không mang lại hiệu quả.
Cách một lớp ngữ cảnh giải quyết các vấn đề về chất lượng, hiệu suất và chi phí.
Demo trực tiếp: cùng một tác vụ lập trình với và không có lớp ngữ cảnh.
Nếu bạn muốn tối đa hóa giá trị nhận được từ các AI agent, buổi hội thảo này rất đáng để bạn dành thời gian.
Đăng ký ngay.
Khi bạn nhập một câu hỏi tiếp nối vào khung chat AI và nhấn Enter, sẽ có một khoảng lặng trong một hoặc hai giây. Sau đó, câu trả lời xuất hiện với các từ ngữ nối tiếp nhau nhanh chóng. Nó xuất hiện nhanh hơn nhiều so với những gì khoảng dừng ban đầu gợi ý.
Khoảng dừng này không phải là thời gian chết. Trong một LLM điển hình, một tin nhắn đơn lẻ phải trải qua khoảng một chục giai đoạn riêng biệt trước khi câu trả lời bắt đầu xuất hiện. Hai loại công việc tính toán rất khác nhau diễn ra ở phía sau để làm được điều này. Một số điểm chính về hành trình này như sau:
Mô hình không bao giờ nhận được tin nhắn đúng như cách bạn đã nhập.
Nó không có bộ nhớ về cuộc trò chuyện. Lịch sử trên màn hình được xây dựng lại từ đầu sau mỗi lượt phản hồi.
Nó chia sẻ máy chủ với những người dùng khác, và nhóm mà nó được xếp vào có thể ảnh hưởng đến câu trả lời.
Một khi một từ đã được gửi đi, mô hình không thể thu hồi lại được.
Trong bài viết này, chúng ta sẽ xem xét toàn bộ hành trình này một cách chi tiết. Dưới đây là những gì chúng ta sẽ đề cập:
Đầu vào của mô hình được tập hợp như thế nào?
Tại sao mỗi tin nhắn đầu vào gửi đến mô hình đều độc lập?
Thực hiện kiểm tra an toàn trên đầu vào.
Mô hình hiểu các từ ngữ như thế nào?
Mô hình được chia sẻ giữa nhiều cuộc trò chuyện như thế nào?
Các bước Prefill và decode.
Lưu trữ (caching) các tính toán hiện có.
Streaming và các cơ chế bảo vệ (guardrails).
Mô hình vận hành các công cụ khác nhau như thế nào?

Tuyên bố miễn trừ trách nhiệm: Bài viết này dựa trên các chi tiết được chia sẻ công khai từ nhiều nguồn khác nhau. Tài liệu tham khảo ở cuối bài. Vui lòng để lại bình luận nếu bạn phát hiện bất kỳ điểm nào không chính xác.
Điểm mấu chốt đầu tiên cần hiểu là câu văn được nhập vào khung chat không phải là thứ chính xác đến được với mô hình. Thứ đến được với mô hình là một tài liệu được tập hợp xung quanh câu văn đó trước khi yêu cầu được gửi đi.
Tài liệu này chứa một vài thành phần như sau:
Một system prompt (lời nhắc hệ thống), là một khối hướng dẫn do nhà cung cấp LLM viết. Những hướng dẫn này cho mô hình biết cách ứng xử trong suốt cuộc trò chuyện.
Định nghĩa về bất kỳ công cụ khả dụng nào, mô tả chức năng của từng công cụ và các đầu vào mà nó chấp nhận.
Bất kỳ dữ liệu nào được lưu trữ dưới dạng bộ nhớ từ các phiên làm việc trước đó.
Các tài liệu được lấy từ cơ sở tri thức trong trường hợp truy xuất là yếu tố then chốt.
Toàn bộ cuộc trò chuyện cho đến thời điểm hiện tại.
Cuối cùng là tin nhắn mới.
Quá trình quyết định những gì sẽ đưa vào tài liệu này, theo thứ tự nào và những gì cần loại bỏ, là một lĩnh vực chuyên môn riêng biệt được gọi là context engineering (kỹ thuật ngữ cảnh). Đây không đơn thuần là việc lấp đầy một thùng chứa. Các mô hình có ngân sách chú ý (attention budget) hữu hạn, và mỗi token được thêm vào đều làm tiêu hao ngân sách đó.
Độ chính xác giảm dần khi đầu vào càng dài, ngay cả với những tác vụ khá đơn giản. Sự suy giảm này diễn ra từ từ. Một prompt dài hơn không làm hỏng bất cứ thứ gì ngay lập tức, nhưng độ chính xác cơ bản sẽ giảm đi.
Cách tiếp cận đối với lĩnh vực context engineering này dẫn đến các kịch bản mà hai sản phẩm được xây dựng trên cùng một mô hình nền tảng, khi nhận được cùng một câu hỏi từng chữ một, lại đưa ra các câu trả lời khác nhau. Mô hình có thể giống hệt nhau, nhưng tài liệu bao quanh câu hỏi thì không.
Các nhà cung cấp khác nhau cũng khác nhau ở thời điểm họ thu thập tài liệu cho tài liệu đó. Một số truy xuất mọi thứ ngay từ đầu. Những bên khác cung cấp cho mô hình các tham chiếu nhẹ, đường dẫn tệp hoặc các truy vấn đã lưu, và để nó tự lấy những gì cần thiết trong khi làm việc. Cách thứ nhất nhanh hơn, còn cách thứ hai lãng phí ít token hơn cho những tài liệu có thể không liên quan.
Bài viết được AI dịch và tổng hợp tự động từ ByteByteGo. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.