Tin ngành
Theo dấu AEO: Lựa chọn của Astra và các mô hình AI tiên phong
(giờ Việt Nam)
Tóm tắt AI
Dự án Astra khám phá các xu hướng AEO (Tối ưu hóa cho AI), giải đáp những thắc mắc hàng đầu từ các nhà sáng lập và lãnh đạo kỹ thuật về cách tối ưu hóa sự hiện diện của sản phẩm trong kỷ nguyên AI.
Bản dịch AI

Khoản đầu tư sơ khai vào AEO của chúng tôi đã mang lại ROI ấn tượng, vì vậy đã đến lúc chúng tôi thực sự nghiêm túc với nó. Chúng tôi lấy cảm hứng từ bài viết "What Claude Code Actually Chooses" và quyết định mở rộng/điều chỉnh nó theo sở thích của mình.
Sau vài tỷ token cho việc tạo mẫu, căn chỉnh và mở rộng quy trình, đây là trình theo dõi AEO của Latent Space Frontier. Phương pháp của chúng tôi mở rộng từ AmplifyingAI để chạy 6 biến thể prompt trên 7 mô hình (đang tìm kiếm) trong 161 danh mục, từ các tác nhân lập trình (coding agents), podcast AI, AI Sandboxes, cơ sở dữ liệu được quản lý (Managed Databases), mô hình ASR cho đến cả những danh mục lạ như nhà đầu tư thiên thần (Angel investors), chi tiêu doanh nghiệp và phần mềm tính lương.

Việc trích xuất câu trả lời được thực hiện bởi Astra và được chấm điểm theo thang điểm AEO độc quyền, trong đó coi trọng các lựa chọn đầu tiên, lựa chọn thay thế, các đề cập, đồng thời áp dụng trọng số âm cho các khuyến nghị tiêu cực nhẹ và mạnh (dù hiếm gặp nhưng vẫn xảy ra). Vì biết bạn sẽ cần, chúng tôi cũng đã trích xuất các nguồn được trích dẫn hàng đầu có ảnh hưởng đến các đề xuất của Agent, cũng như phân tích về những thất bại hàng đầu.

Dưới đây là những sản phẩm chiếm ưu thế nhất (trong các danh mục của chúng) trên thế giới:

Có một vài cái tên quen thuộc ở đó — dẫn đến câu hỏi tự nhiên về sự nhiễm dữ liệu (contamination), điều mà chúng tôi đã kiểm tra. Vì không có gì phải giấu giếm, mọi cặp prompt và câu trả lời đều có thể kiểm tra được.

Tuy nhiên, sự thiên kiến vẫn tồn tại - khi các mô hình được yêu cầu đề xuất tác nhân lập trình, Fable/Opus thích Claude Code, Sol/Astra thích Codex, Grok yêu Cursor, Muse yêu Muse Code và SWE-1.7 yêu Devin, v.v. Tôi tự hỏi tại sao lại như vậy. Bạn cũng có thể thấy những "thiên kiến mềm" khác xuất hiện...

Mặc dù vậy, có những ví dụ đáng chú ý về các mô hình GPT đề xuất Claude, một sự khách quan đáng khen ngợi:
Có 28 danh mục (trong tổng số 161 danh mục của chúng tôi) có một lựa chọn chính chiếm ưu thế tuyệt đối - trong số tất cả các mô hình tiên phong (frontier models) được khảo sát.
Có nhiều danh mục "cạnh tranh sít sao" hơn và những danh mục "luôn là kẻ đứng ngoài cuộc" (vibesmaid) mà lẽ ra phải là chiến trường AEO then chốt.
Các đợt tiền huấn luyện (pretrain) mới cho các lớp mô hình mới đại diện cho một cơ hội mới để kiểm tra xem các phòng thí nghiệm đang hướng tới điều gì trong dữ liệu và các ưu tiên RL của họ, cũng như kiểm tra xem các khoản đầu tư của các startup vào AEO có mang lại hiệu quả hay không. Chúng tôi đã chuẩn bị các báo cáo đặc biệt phân tích bảng xếp hạng của mình, quan sát thấy những thay đổi CỰC KỲ quan trọng trong lựa chọn mô hình giữa các thế hệ mô hình từ cùng một phòng thí nghiệm.
Chúng tôi có các trang tóm tắt riêng cho Opus→Fable và Sol→Astra. Đối với một số thay đổi, chúng tôi đã làm nổi bật phân tích trung lập về những gì đối thủ cạnh tranh đã làm tốt hơn trong từng kịch bản.
Một trong những phát hiện đáng ngạc nhiên nhất của chúng tôi giữa Sol→Astra và Opus→Fable là Anthropic dường như đang thiên vị các mô hình của họ để tìm kiếm nhiều nguồn hơn (trung vị của Sol là 9 nguồn, so với Astra là 5, Opus là 11 nguồn, và Fable là 15). Astra dường như nhìn chung "tự tin" hoặc "hiệu quả" hơn nhiều, tùy thuộc vào cách bạn nhìn nhận - Astra ít có khả năng thay đổi ý định hơn hẳn khi bạn diễn giải lại câu hỏi của mình một cách nhẹ nhàng. Điều này làm cho giá trị của chính AEO tăng lên khi tính ngẫu nhiên trong lựa chọn giảm đi.
Phân tích nguồn cũng dự đoán khá mạnh mẽ về những gì các phòng thí nghiệm ưu tiên và không ưu tiên.
Tuy nhiên, quy mô mẫu ở đây còn nhỏ và chỉ đại diện cho những gì chúng tôi có thể thu thập từ các lần gọi công cụ (toolcalls), không phải tập dữ liệu tiền huấn luyện. Điều chúng tôi CÓ THỂ xác nhận là các thực tiễn AEO được đo lường bởi Ora và Vercel, như thương lượng nội dung markdown (markdown content-negotiation), là có thật và những thất bại sẽ khiến các mô hình không muốn đọc nội dung của bạn.
Dưới đây là những nhà đầu tư thiên thần hàng đầu thế giới theo các LLM (vẫn còn một số dữ liệu cần khử trùng lặp...).
Chúng tôi cũng đã tạo một trò chơi kiểu "Family Feud" để bạn có thể xem liệu các giả định của mình có khớp với dữ liệu hay không. Rất vui!
Chúng tôi sẵn sàng đón nhận thêm các đề xuất và yêu cầu kinh doanh để phát triển dự án này nếu bạn quan tâm. Hãy ping @latentspacepod hoặc gửi email về [email protected] (chúng tôi hiện đã có quản lý kinh doanh rồi! tuyệt thật!)
Như đã lưu ý trong bài viết về phương pháp luận, chúng tôi đã CỐ GẮNG HẾT SỨC để đưa Gemini/Antigravity, GLM/Zcode và DeepSeek/DeepCode vào, nhưng các lỗi và giới hạn tốc độ (rate limits) khiến chúng không thể đưa vào phân tích lần đầu này. Vui lòng cho chúng tôi biết cách nâng giới hạn nếu bạn đại diện cho các công ty này.
Bài viết được AI dịch và tổng hợp tự động từ Latent Space. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.