Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung)
85

Nghiên cứu

Kiểm toán từ Haus Research: 1/3 nguồn trích dẫn của Perplexity không chứa thông tin được dẫn chứng

(giờ Việt Nam)

Tóm tắt AI

Haus Research đã thực hiện kiểm tra 310 câu hỏi về 210 công ty công nghệ trên Perplexity và phát hiện 1/3 các đường dẫn trích dẫn không hề chứa thông tin mà AI này khẳng định.

Bản dịch AI

A third of Perplexity's citations don't contain the number they're cited for

Trong số 1.826 trích dẫn mà các mô hình tìm kiếm của Perplexity đính kèm vào một câu chứa số liệu, 34,7% trỏ đến một trang web không thể mở được hoặc không chứa bất kỳ số liệu nào từ câu đó; nếu tính theo từng khẳng định thay vì từng trích dẫn, 14,4% trong số 872 khẳng định bị sai.

Chúng tôi đã đặt 310 câu hỏi thực tế về 210 công ty công nghệ cho hai mô hình tìm kiếm của Perplexity, thu thập mọi nguồn mà chúng trích dẫn, truy cập tất cả các nguồn đó và kiểm tra xem trang web có chứa thông tin như đã được trích dẫn hay không. Trong số 1.826 trích dẫn đính kèm vào một câu chứa số liệu — những trích dẫn có thể kiểm chứng mà không cần ý kiến thứ hai — 34,7% trỏ đến một trang web mà người đọc thông thường không thể mở được, hoặc mở được nhưng không chứa bất kỳ con số nào trong câu mà chúng được đính kèm. Tổng cộng, các mô hình đã đặt 2.511 dấu trích dẫn.

Đơn vị ở đây là trích dẫn, không phải khẳng định. Hai phần ba trong số 872 khẳng định có chứa số liệu có nhiều hơn một dấu trích dẫn, và chúng tôi chấm điểm từng dấu riêng biệt. Nếu chấm điểm theo từng khẳng định, tính là đạt khi bất kỳ trang nào được trỏ đến chứa một trong các số liệu của khẳng định đó, thì 14,4% bị sai. Chúng tôi ưu tiên trích dẫn vì mỗi dấu trích dẫn là một khẳng định riêng lẻ về nguồn gốc: câu này đến từ URL đó.

Lỗi chủ yếu không phải là các liên kết chết. Chỉ 1,3% URL được trích dẫn là bị chết. Hai nhóm lỗi lớn là các trang mà người đọc không thể truy cập và các trang mà người đọc có thể truy cập nhưng không chứa thông tin đó.

Chúng tôi đã làm gì

Mười mẫu câu hỏi, mỗi mẫu là một thông tin thực tế mà ai đó thực sự sẽ tìm kiếm: ngày thành lập, vòng gọi vốn mới nhất, số lượng nhân sự, giá khởi điểm, trụ sở chính, doanh thu, các vụ vi phạm dữ liệu đã công bố, CEO hiện tại, các thương vụ mua lại, SLA thời gian hoạt động của gói trả phí. Mỗi công ty nhận được một câu hỏi; 100 công ty nhận thêm câu hỏi thứ hai với mẫu khác. 310 câu hỏi được đặt ở nhiệt độ (temperature) 0 cho perplexity/sonar, perplexity/sonar-pro và, để đối chứng, là GPT-4.1 với plugin web.

Cả hai mô hình Perplexity đều đánh dấu các khẳng định của chúng trong văn bản dưới dạng [n], và n là chỉ số trong mảng trích dẫn mà chúng trả về. Đó là phần giúp việc kiểm định trở nên khả thi: nó không phải là danh mục tài liệu tham khảo ở cuối câu trả lời, mà là một khẳng định cụ thể rằng câu này đến từ URL đó. Chúng tôi chia mỗi câu trả lời thành các câu đơn và tạo ra một cặp khẳng định–trích dẫn cho mỗi dấu trích dẫn. Không mô hình nào đưa ra dấu trích dẫn trỏ vượt quá danh sách trích dẫn của chính nó.

Sau đó, chúng tôi truy cập mọi URL duy nhất được trích dẫn — 2.915 URL chỉ riêng cho sonar — và phân loại từng URL là chết, bị chặn (gated), trống, không thể truy cập hoặc hoạt động bình thường. Bất kỳ URL nào thất bại đều có thêm hai cơ hội: thời gian chờ lâu hơn, sau đó thử lại thông qua proxy xoay vòng để đảm bảo không trang nào bị ghi nhận là chặn chỉ vì một địa chỉ trung tâm dữ liệu không được chấp nhận. Lượt thử thứ ba này đã cứu được 192 URL. Việc phân loại chỉ có thể thay đổi theo hướng có lợi cho trang web.

Việc kiểm tra tiêu đề không cần đến mô hình nào cả. Từ mỗi khẳng định, chúng tôi trích xuất các chi tiết cụ thể — số tiền, tỷ lệ phần trăm, độ lớn, năm, bất kỳ chuỗi nào từ ba chữ số trở lên — và hỏi xem văn bản hiển thị của trang được trích dẫn có chứa ít nhất một trong số đó hay không, chuẩn hóa để $185 triệu, $185M và 185000000 đều khớp nhau. Một con số là đủ để đạt. Một năm đơn thuần là đủ để đạt. Do đó, con số 34,7% là mức tối thiểu: mỗi cặp thất bại là cặp mà trang web không chứa một con số nào từ câu trích dẫn nó.

Các trích dẫn không thể mở được

Trên 2.915 URL duy nhất được trích dẫn bởi perplexity/sonar:

Cứ sáu trích dẫn thì có một trích dẫn bị chặn (gated). Đó không phải là lỗi của nguồn — PitchBook, ZoomInfo, Crunchbase và Reuters có quyền thu phí — nhưng đó là lỗi của trích dẫn. Một chú thích mà người đọc không thể mở được là một khẳng định về nguồn gốc mà không có cách nào để kiểm chứng, điều mà trích dẫn sinh ra để ngăn chặn.

Tổng hợp theo câu trả lời, 84,2% trong số 310 câu trả lời của sonar đã trích dẫn ít nhất một URL mà người đọc thông thường không thể mở được, và 10,6% trích dẫn ít nhất một URL hoàn toàn bị chết.

Những URL chết rất đáng để nêu tên, vì khoảng một nửa trong số đó là cùng một loại trang — 20 trong số 38 của sonar — và URL của chúng đã tố cáo điều đó. komo.ai/directory/<company>-offices, temperstack.com/plans/<company>, devhelm.io/sla/<company>, apollo.io/where-is/<company>, portersfiveforce.com/blogs/brief-history/<company>, và đường dẫn tương tự trên matrixbcg.com và canvasbusinessmodel.com. Đây là các trang được tạo ra cho từng công ty, từng loại câu hỏi, được xuất bản hàng loạt để đón đầu chính xác truy vấn chúng tôi đã đặt ra, và bị gỡ xuống nhanh chóng như khi chúng được tạo ra.

Ba trang chúng tôi đã truy cập lại vào ngày viết bài. Khi hỏi trụ sở chính của Elastic ở đâu, sonar trích dẫn komo.ai/directory/elastic-offices: lỗi 404. Khi hỏi về trụ sở chính của Reddit, cả hai mô hình đều trích dẫn apollo.io/where-is/reddit: lỗi 410 Gone. Khi hỏi về gói trả phí rẻ nhất của Discord, sonar-pro trích dẫn temperstack.com/plans/discord: lỗi 404.

Các trích dẫn mở được nhưng không chứa thông tin

Trong số các cặp có trang web mở được và đọc được, 16,1% không chứa bất kỳ số liệu nào của khẳng định đó.

Ví dụ rõ ràng nhất là về giá cả. Khi hỏi về giá khởi điểm của gói trả phí rẻ nhất của Vercel, sonar trả lời rằng “gói Hobby miễn phí là $0/tháng, vì vậy gói trả phí đầu tiên bắt đầu ở mức $20/tháng”, và trích dẫn vercel.com/docs/plans. Chúng tôi đã truy cập trang đó vào thời điểm viết bài. Nó trả về mã HTTP 200, nó liệt kê các gói, nhưng các chuỗi $20, $20/tháng và 20/tháng không xuất hiện ở bất kỳ đâu trên đó. Con số có lẽ là đúng. Nhưng trích dẫn không phải là bằng chứng cho con số đó.

Mô hình thứ hai đáng chú ý hơn vì nó lặp lại ở nhiều công ty. Khi hỏi về trụ sở chính, cả hai mô hình đều đưa ra một địa chỉ đường phố và gán nó cho bài viết trên Wikipedia của công ty đó:

Cả bốn bài viết đều được truy cập vào thời điểm viết bài và không bài nào chứa số nhà, tên đường hoặc mã bưu chính được gán cho nó. Một vài câu trả lời tự thừa nhận điều này bằng cách diễn đạt như “nhiều nguồn liệt kê” hoặc “nhiều danh bạ doanh nghiệp liệt kê”, rồi sau đó vẫn đính kèm dấu trích dẫn vào Wikipedia. Khẳng định và trích dẫn được tạo ra bởi cùng một quy trình, và quy trình đó không phải là truy xuất dữ liệu.

Một phiên bản nhẹ nhàng hơn của cùng vấn đề: sonar nói CEO của GitLab là Bill Staples và ông đảm nhận vai trò này vào ngày 5 tháng 12 năm 2024, trích dẫn trang đội ngũ điều hành của chính GitLab. Trang đó có tên Bill Staples. Nó không chứa ngày tháng. Một nửa câu được trích dẫn có nguồn.

Nơi nó thất bại nặng nề nhất

Tổng hợp cả hai mô hình Perplexity, theo loại câu hỏi, tỷ lệ các cặp có trang được trích dẫn chứa một trong các số liệu của khẳng định:

Thứ tự này không phải ngẫu nhiên. Nó phản ánh mức độ một sự thật được ghi chép tốt như thế nào tại một nơi chính thống. Số lượng nhân sự và năm thành lập nằm trong các trường dữ liệu có cấu trúc trên các trang được xây dựng để chứa chúng. Ngày bắt đầu của một CEO và số nhà của một văn phòng là loại thông tin mà ai cũng nhắc lại nhưng không ai xuất bản, vì vậy mô hình tái tạo lại sự đồng thuận rồi trỏ đến một trang chưa bao giờ chứa thông tin đó.

Mô hình cao cấp không tốt hơn, cũng không tệ hơn

Thử nghiệm của chúng tôi cho thấy sonar-pro căn cứ các khẳng định của nó kém hơn sonar. Ở quy mô đầy đủ, khoảng cách đó biến mất. sonar đạt 65,9% trên các cặp số liệu (khoảng tin cậy 95% là 62,8–68,9), sonar-pro đạt 64,7% (61,5–67,7). Các khoảng tin cậy chồng lấp lên nhau một cách thoải mái, và hai mô hình trích dẫn với tỷ lệ gần như giống hệt nhau: 9,8 và 9,7 nguồn mỗi câu trả lời. Theo thước đo này, chúng là cùng một sản phẩm. Kết quả thử nghiệm ban đầu là một mẫu nhỏ cho chúng tôi thấy những gì chúng tôi muốn nghe, và nó không lặp lại.

GPT-4.1 với plugin web hoạt động khác biệt ở một điểm đáng lưu ý: nó trích dẫn 2,0 nguồn mỗi câu trả lời thay vì 9,8, và 36,4% trong số đó là tên miền của chính công ty so với 23,4% của Perplexity. Nó không đưa ra các dấu trích dẫn trong văn bản, vì vậy không thể kiểm tra ở cấp độ khẳng định, đó chính là phát hiện — một câu trả lời mà các trích dẫn chỉ là một danh sách ở cuối thì không thể kiểm định từng câu một.

Ai được trích dẫn

Trong số 3.031 trích dẫn của sonar, trải rộng trên 989 máy chủ khác nhau, 23,4% trỏ đến tên miền của chính công ty và 23,1% trỏ đến danh bạ B2B, công cụ ước tính doanh thu hoặc danh sách khách hàng tiềm năng — Tracxn, PitchBook, Clay, GetLatka, ZoomInfo, CB Insights, Growjo, Crunchbase và nhiều bản sao của chúng. Máy chủ đơn lẻ lớn nhất là linkedin.com với 5,6%, tiếp theo là en.wikipedia.org với 4,3%, và tracxn.com với 3,0%.

Các trang danh bạ đó cũng là tài liệu ít bền vững nhất trong tập dữ liệu: 66,0% trong số đó mở được, so với 78,7% trích dẫn nói chung. Chúng được tạo ra từ cơ sở dữ liệu, xuất bản hàng loạt để xếp hạng, bị chặn hoặc bị gỡ bỏ mà không báo trước, và đó là nơi chứa một phần tư nguồn dữ liệu cho các câu hỏi về các công ty thực tế hiện nay.

Con số do mô hình đánh giá, để so sánh

Chúng tôi cũng thực hiện một đánh giá về độ tin cậy (groundedness) thông thường như một thước đo phụ: một mô hình riêng biệt được xem mỗi khẳng định và trang được trích dẫn của nó, được hỏi liệu trang đó có hỗ trợ khẳng định hay không. Trên 400 cặp có thể đọc được được lấy mẫu ngẫu nhiên cho mỗi mô hình, nó gọi 50,8% khẳng định của sonar là được hỗ trợ, 24,5% là hỗ trợ một phần và 24,8% là không được hỗ trợ. Kết hợp với tỷ lệ các cặp có trang web mở được, đó là tỷ lệ toàn diện là 40,0%.

Hai thước đo không đo lường cùng một thứ, và khoảng cách giữa chúng chính là vấn đề. Trên một trang có thể đọc được, kiểm tra xác định (deterministic check) làm sạch 84,6% các cặp của sonar, vì một con số khớp là đủ để đạt; người đánh giá, được hỏi liệu trang đó có hỗ trợ toàn bộ khẳng định hay không, làm sạch 50,8%. Tính toàn diện là 65,9% so với 40,0%, một khoảng cách 26 điểm.

Dù sao thì chúng tôi vẫn ưu tiên con số xác định. Một mô hình chấm điểm công việc của một mô hình khác là điểm yếu nhất trong thiết kế này, và khoảng cách đó là quy mô trung thực của sự không chắc chắn mà nó tạo ra. Con số hào phóng là con số mà người đọc có thể tái tạo bằng grep, và nó đã đủ tệ để trở thành phát hiện chính.

Không ai lưu giữ bản sao

Chúng tôi đã tra cứu ngẫu nhiên 1.500 URL được sonar trích dẫn trong chỉ mục CDX của Wayback Machine. Trong số 1.432 URL phản hồi, 25,1% (khoảng tin cậy 95% là 23,0–27,5) chưa bao giờ được lưu lại — dù chỉ một lần, tại bất kỳ thời điểm nào trong vòng đời của trang web.

Đối với các trang danh bạ và danh sách khách hàng tiềm năng, con số này là 39,3%. Hai trong số năm trang đó chỉ tồn tại chừng nào công ty lưu trữ chúng còn duy trì, và chúng tôi đã biết kết cục: các URL chết trong nghiên cứu này gần như hoàn toàn thuộc về nhóm đó.

Vì vậy, lớp trích dẫn bên dưới các câu trả lời AI đang được xây dựng phần lớn từ các trang được tạo ra để tìm kiếm thay vì để lưu giữ, và một phần tư trong số đó không có bản sao ở bất kỳ đâu. Khi một trong những URL này biến mất, khẳng định dựa vào nó không biến mất theo. Câu văn vẫn còn đó, dấu trích dẫn vẫn còn đó, và thứ duy nhất biến mất là khả năng kiểm chứng.

Những gì điều này không cho thấy

PerplexityAI tìm kiếmKiểm chứng thông tinĐộ tin cậy AITin tức công nghệ
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Hacker News Nổi bật (buzzing.cc bản dịch tiếng Trung). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.