Google AI: DEV
85

Thủ thuật

Hướng dẫn Google AI: Xây dựng bảng điều khiển đánh giá AI tương tác với Data Studio

(giờ Việt Nam)

Tóm tắt AI

Katie McLaughlin hướng dẫn cách kết nối dữ liệu đánh giá từ Inspect AI vào Data Studio. Chỉ với 30 giây, bạn có thể tạo bảng điều khiển tương tác không cần lập trình thông qua Google Sheets.

Bản dịch AI

Interactive AI Eval Dashboards with Data Studio

Chào mừng bạn đến với bài viết cuối cùng trong loạt bài về thiết kế, phân tích và trực quan hóa các đánh giá AI (AI evals)! Cũng như các phần trước, bạn có thể chỉ cần đọc qua phần khám phá của tôi, hoặc nếu muốn thử thách bản thân, hãy thoải mái thực hành theo. Nếu không quan tâm đến phần này, vui lòng chuyển đến mục "Tổng quan về các thành phần Dashboard được cấu hình sẵn mới".

Lưu ý: Loạt bài blog này chứa các sơ đồ do AI tạo ra cùng với ảnh chụp màn hình thực tế và các chỉnh sửa vẽ tay trên cả hai. AI cũng hỗ trợ biên tập nội dung ở mức độ nhỏ. Ngoài ra, các công thức toán học là của tôi, nhưng định dạng công thức là do AI thực hiện.

Các điều kiện tiên quyết để triển khai

Nếu bạn dự định (tái) triển khai các quy trình trong hướng dẫn này, tất cả những gì bạn cần là tệp xuất CSV (data_mega_export.csv) được tạo trong Phần 3 (từ các đánh giá được thực hiện ở Phần 1) và một tài khoản Google Workspace để truy cập Data Studio. Phần 2 sẽ giúp bạn hiểu sâu hơn về các đánh giá, chẩn đoán vết (trace diagnostics) và phân tích nhanh, nhưng phần này là tùy chọn nếu bạn chỉ muốn xây dựng dashboard.

Quay lại nội dung chính

Trong phần cuối của loạt bài này, chúng ta sẽ kết nối tập dữ liệu đánh giá với Data Studio để xây dựng các dashboard tương tác mà không cần viết mã.

Trong khi chế độ xem inspect cung cấp các chẩn đoán vết TUI tập trung vào nhà phát triển và Google Sheets cung cấp các biểu đồ sparkline dạng bảng, thì các bên liên quan không chuyên về kỹ thuật (quản lý sản phẩm, lãnh đạo doanh nghiệp, nhà tài trợ điều hành) lại cần các dashboard tương tác. Tại đây, họ có thể cắt lát hiệu suất dựa trên Ma trận Đánh giá 3D nền tảng của chúng ta ngay lập tức mà không cần viết mã. Ngoài các chiều vĩ mô như dòng mô hình và nhóm kỹ năng, dashboard của chúng ta cho phép người dùng phân vùng dữ liệu linh hoạt dựa trên các biến boolean vận hành chính:

A 3D grid matrix visualizing evaluation conditions: Models on the vertical axis, Skill Conditions on the depth axis, and Samples on the horizontal axis. A callout box shows a grader model evaluating f

Thiết lập mẫu Data Studio chỉ với 1 cú nhấp chuột

Chúng tôi cung cấp một Mẫu Dashboard Tổng thể (Master Dashboard Template) đã được cấu hình sẵn, chứa tất cả các thành phần đã được định dạng được sử dụng ở đây.

Sao chép (Clone) mẫu tổng thể

A screenshot of the Data Studio top-right dropdown menu showing the 'Make a copy' option highlighted.

Thiết lập và tùy chỉnh trong 30 giây

Sau khi sao chép:

A screenshot of the Data Studio toolbar showing the 'Add data' button highlighted next to 'Add page' and 'Blend'.A screenshot of Data Studio's 'Add data to report' interface, with the Google Sheets connector highlighted among other Google connectors.A screenshot of the 'AI Evals' spreadsheet and the 'data\_mega\_export' worksheet selection dialog, with 'Use first row as headers' checked.

Thế là xong! Dashboard tương tác của bạn hiện đã hoạt động và được liên kết hoàn toàn với dữ liệu đánh giá của bạn.

Trước khi đi sâu vào các biểu đồ mới, hãy xem góc dưới bên trái của báo cáo. Bạn sẽ thấy một Pivot Table Heatmap (Bản đồ nhiệt bảng tổng hợp). Giống như bản đồ nhiệt tôi đã tạo trong phần thứ hai của loạt bài này, đây là một ma trận trực quan 2D, nơi cường độ màu sắc thể hiện độ lớn của số liệu—ở đây là điểm chính xác theo đường cong bậc hai. Vì tôi đã thảo luận về cách sử dụng chúng để phân tích trong bài blog trước, tôi sẽ không giải thích lại ở đây. Ngược lại, nếu bạn quan tâm đến việc triển khai, hãy thoải mái kiểm tra và điều chỉnh các cài đặt trên Pivot Table Heatmap trong báo cáo đã sao chép của bạn.

Lưu ý: Ảnh chụp màn hình này được thực hiện trên một tập dữ liệu sau này so với phần còn lại của báo cáo, vì vậy các số liệu cụ thể không nên được tính đến khi so sánh với các ảnh chụp màn hình khác ở đây.

Tổng quan về các thành phần dashboard được cấu hình sẵn mới

Data Studio chuyển đổi dữ liệu CSV đánh giá đa chiều thành các chiều trực quan trực quan (tọa độ không gian X/Y, tỷ lệ diện tích bong bóng, mã màu và cửa sổ bật lên khi di chuột). Dưới đây là cách mỗi phần tử dashboard được xây dựng sẵn đo lường hiệu suất đánh giá:

Biểu đồ A: Hiệu suất và chi phí (biểu đồ phân tán/bong bóng)

Biểu đồ này ánh xạ ba chiều đánh giá cốt lõi lên một khung hình trực quan 2D duy nhất:

Biểu đồ B: Độ chính xác và thanh sai số (±1 SEM whiskers)

Biểu đồ được cấu hình sẵn thứ hai trực quan hóa điểm chính xác cùng với các thanh sai số (whiskers) của sai số chuẩn trung bình (SEM).

Lưu ý về tính chặt chẽ thống kê: Sai số chuẩn theo dõi sự biến thiên của điểm đạt/không đạt qua các lần chạy. Bản demo của chúng tôi ( N=4) bao phủ phạm vi tin cậy khoảng ~68% ( ±1 SEM), trong khi các tiêu chuẩn sản xuất yêu cầu N≥30 cho các khoảng tin cậy 95% tiêu chuẩn.

4 bộ lọc nhóm động (các điều khiển thả xuống)

Nằm trên thanh điều khiển phía trên, bốn danh sách thả xuống này đóng vai trò là các bộ lọc động tương tác, hiển thị lại ngay lập tức cả hai biểu đồ trong thời gian thực:

Xem và tương tác

Phân tích dựa trên bộ lọc (Slicer-based)

Mặc dù bộ lọc mô hình (model slicer) sẽ hữu ích trong tình huống có nhiều mô hình hơn, nhưng vì chúng ta chỉ có hai mô hình và bạn có thể trực quan hóa chúng bằng cách sử dụng màu sắc hiện có, nên skill_group (nhóm kỹ năng) lại thú vị hơn.

Khi chọn gemini-api (Skill) và gemini-api (Baseline), có một vài xu hướng rõ ràng về mặt trực quan. Như đã thảo luận trong các phần trước, lần chạy gemini-api (Skill) đã cải thiện điểm đánh giá với cái giá phải trả là độ trễ và chi phí tăng lên.

Phân tích mức độ tiếp nhận có điều kiện: Tách biệt việc khám phá kỹ năng khỏi khả năng thực thi

Bằng cách lọc các lần chạy mà is_baseline_or_has_activated_skill là FALSE, chúng ta thực hiện phân tích mức độ tiếp nhận có điều kiện: kiểm tra các lần chạy không hoạt động nơi kỹ năng được cung cấp trong ngữ cảnh (Prior), nhưng tác nhân chọn không gọi activate_skill (không tiếp nhận).

Một điều cần lưu ý ngay là tổng số bong bóng LỚN HƠN 8 (số lượng kết hợp Mô hình x Kỹ năng). Điều này là do mỗi bong bóng này là các tập con của không gian Mô hình x Kỹ năng x Mẫu x Epoch, vì sự khác biệt này được thực hiện ở cấp độ mẫu/epoch.

Trong đo lường từ xa của Inspect AI, "activated" đặc biệt đo lường mức độ tiếp nhận—liệu mô hình có thực thi lệnh gọi công cụ activate_skill để tải kỹ năng vào ngữ cảnh hay không. Thú vị là, các mẫu của 3.5-flash-lite khi các kỹ năng được kích hoạt có trần trực quan cao hơn nhiều so với trường hợp chung (Baseline hoặc Has Activated Skill = Any), tương ứng với việc loại bỏ Baseline hoặc Has Activated Skill = False.

Lưu ý rằng chỉ có 3.5-flash-lite có các mẫu không kích hoạt kỹ năng được cung cấp, có lẽ cần điều tra xem đây có phải là một xu hướng chung hay không.

Thiên kiến sống sót và thời gian hoạt động vận hành chung (phân tích đã hoàn thành)

Google AIData StudioĐánh giá AITrực quan hóa dữ liệuNo-code
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Google AI: DEV. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.