Nghiên cứu
Nghiên cứu từ Wharton: AI mua sắm vẫn chưa đủ tin cậy để thay bạn chốt đơn
(giờ Việt Nam)
Tóm tắt AI
Nghiên cứu của Wharton cho thấy các mô hình AI hiện nay rất dễ bị thao túng bởi nguồn tin bên ngoài, khiến kết quả gợi ý mua sắm thiếu ổn định và chưa sẵn sàng để tự động thực hiện giao dịch.
Bản dịch AI

Các nhà nghiên cứu tại Wharton School thuộc Đại học Pennsylvania đã kiểm tra mức độ nhất quán của các tác nhân mua sắm AI (AI shopping agents) khi đưa ra đề xuất sản phẩm trong bối cảnh quy trình tìm kiếm thay đổi. Ngay cả những thay đổi nhỏ trong ngữ cảnh cũng làm thay đổi đáng kể các quyết định mua hàng.
Nhóm nghiên cứu đã thử nghiệm sáu mô hình hiện nay, bao gồm cả các biến thể mini và các mô hình tiên tiến (frontier-level), giao nhiệm vụ cho mỗi mô hình đóng vai trò là trợ lý mua sắm cá nhân để chọn một chiếc đồng hồ thể thao từ một danh sách sản phẩm cố định. Họ sử dụng trình mô phỏng ACES (Agentic e-Commerce Simulator), cho phép tác nhân AI xem ảnh chụp màn hình của trang sản phẩm. Tác nhân sẽ phân tích hình ảnh, tùy chọn thu thập thêm các nguồn đề xuất, sau đó chọn một sản phẩm.

Chỉ một nguồn tin cũng đủ để thay đổi đề xuất
Ngay cả khi không có các nguồn bên ngoài, các mô hình vẫn cho thấy những ưu tiên cơ bản khác nhau. Tuy nhiên, khi tác nhân chỉ cần xem một nguồn bên ngoài trước khi xem trang sản phẩm, các đề xuất đã thay đổi đáng kể trong một số trường hợp.
Các nhà nghiên cứu đã thử nghiệm ba nguồn: một chủ đề trên Reddit đề xuất Garmin Forerunner 55, một bài đánh giá của Wirecutter cho Fitbit Inspire 3 và một bài viết trên Strategist về WHOOP 5.0. Wirecutter có sức ảnh hưởng mạnh nhất. Xác suất chọn Fitbit Inspire 3 đã tăng 90 điểm phần trăm đối với Claude Opus 4.8 so với điều kiện kiểm soát, và tăng 99 điểm phần trăm đối với Gemini 3.5 Flash.

Trong thí nghiệm thứ hai, các tác nhân được xem các kết hợp gồm hai hoặc ba nguồn. Tuy nhiên, nhiều nguồn không giúp cân bằng các đề xuất. Wirecutter có xu hướng chiếm ưu thế đối với hầu hết các mô hình bất cứ khi nào nó xuất hiện trong nhóm, mặc dù mức độ ảnh hưởng có sự khác biệt. Theo nghiên cứu, việc có nhiều nguồn thực tế lại dẫn đến sự biến động nhiều hơn.

Ngay cả thứ tự của cùng các nguồn cũng làm thay đổi kết quả
Trong nghiên cứu thứ ba, các tác nhân nhận được cả ba nguồn theo các thứ tự khác nhau. Một quy trình ra quyết định ổn định lẽ ra phải tạo ra cùng một kết quả khi nội dung đầu vào giống hệt nhau. Nhưng thực tế thì không.
Gemini 3.1 Flash Lite là mô hình nhạy cảm nhất, với xác suất chọn Fitbit Inspire 3 dao động từ 2 đến 56 điểm phần trăm so với điều kiện kiểm soát tùy thuộc vào thứ tự nguồn. Claude Haiku 4.5 duy trì sự ổn định ở mức 41 đến 42 điểm phần trăm. Các nhà nghiên cứu kết luận rằng bản thân thứ tự trình bày cũng là một yếu tố thúc đẩy việc lựa chọn sản phẩm.

Việc các nguồn được truyền đến mô hình theo từng cái một hay được gộp lại với nhau cũng rất quan trọng. GPT-5.5 đã chọn Fitbit Inspire 3 nhiều hơn 53 điểm phần trăm với cách truyền dữ liệu gộp, nhưng chỉ nhiều hơn 6 điểm phần trăm với cách truyền tuần tự.
Các đoạn ghi nhớ (memory snippets) lấn át sự vượt trội khách quan của sản phẩm
Trong thí nghiệm thứ tư, các nhà nghiên cứu đã sửa đổi danh sách sản phẩm sao cho một sản phẩm vượt trội về mọi khía cạnh có thể đo lường được: một chiếc đồng hồ thông minh có tích hợp Alexa với giá 29,99 USD, được đánh giá 5.0 trên 5.0 với 430 lượt đánh giá. Mọi sản phẩm khác đều có giá ít nhất 359 USD và có ít lượt đánh giá hơn.
Sau đó, họ thêm các câu ghi nhớ ngắn của người dùng như "Tôi thích đi bộ đường dài!". Đối với một số mô hình, những câu này đã chuyển hướng lựa chọn sang các sản phẩm đắt tiền hơn bất chấp sự hiện diện của một lựa chọn vượt trội về mặt khách quan. Tỷ lệ lựa chọn Garmin Vivoactive 5 đã tăng 75 điểm phần trăm đối với Claude Opus 4.8, 37 điểm phần trăm đối với GPT-5.5 và 36 điểm phần trăm đối với Gemini 3.1 Flash Lite.

Gemini 3.5 Flash là mô hình có khả năng chống chịu tốt nhất, chọn sản phẩm tốt nhất một cách khách quan trong 86 đến 92 phần trăm các lần chạy bất kể các câu ghi nhớ. GPT-5 Mini cho thấy một mô hình kỳ lạ: câu khẳng định tích cực về việc đi bộ đường dài không tạo ra sự thay đổi đáng kể đối với Garmin Vivoactive 5, nhưng câu phủ định ("Tôi không thích đi bộ đường dài!") lại thúc đẩy đáng kể lượt chọn Fitbit Versa 4.
Không nhất quán, không kiểm soát
Đối với người mua sắm, nghiên cứu cho thấy việc để một tác nhân AI thay mặt bạn mua hàng không đảm bảo các quyết định mua hàng nhất quán hoặc tối ưu. Hai người dùng với cùng một truy vấn, hoặc cùng một người dùng vào những ngày khác nhau, có thể nhận được các đề xuất sản phẩm khác nhau mà không có lý do rõ ràng. Quyết định mua hàng của con người cũng không nhất quán, nhưng đó khó có thể là điều mọi người mong đợi từ một người mua sắm AI. Bất kỳ ai đã thiết lập bộ nhớ (memory) trong ChatGPT hoặc các công cụ tương tự cũng nên biết rằng nó có thể ảnh hưởng đến các đề xuất mua hàng theo những cách không thể đoán trước.
Đối với người bán, theo các nhà nghiên cứu, kết quả này cho thấy việc tối ưu hóa cho mua sắm bằng AI sẽ khó khăn hơn so với SEO truyền thống. Người bán không biết mô hình nào đang thực hiện việc mua sắm, nó đã đọc những gì trước đó, hoặc thiết lập kỹ thuật của nó xử lý thông tin như thế nào.
Bài viết được AI dịch và tổng hợp tự động từ The Decoder: AI News. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.