The Decoder
85

Nghiên cứu

AI hỗ trợ thẩm phán Pakistan giải quyết tồn đọng án phí: Hiệu quả đầu tư gấp 38 lần

(giờ Việt Nam)

Tóm tắt AI

Thử nghiệm với 1.559 thẩm phán tại Pakistan cho thấy AI JudgeGPT giúp tăng 6,3% tốc độ xử lý vụ án, nhưng chỉ hiệu quả khi được đào tạo bài bản. Nghiên cứu ước tính lợi nhuận thu về lên tới 38,5 USD cho mỗi 1 USD đầu tư.

Bản dịch AI

An AI system helped Pakistani judges clear massive backlogs at $38.50 return per dollar invested

Các nhà nghiên cứu từ ETH Zurich, New Economic School và Imperial College London đã thực hiện một thử nghiệm thực địa quy mô lớn với hệ thống tư pháp của Pakistan. Thử nghiệm ngẫu nhiên này bao gồm 1.559 thẩm phán tại 118 tòa án, chiếm khoảng một nửa tổng số thẩm phán tòa sơ thẩm tại Pakistan.

Công cụ được sử dụng là JudgeGPT, một trợ lý AI được xây dựng dựa trên GPT-4 của OpenAI và được thiết kế dành riêng cho các tòa án sơ thẩm tại Pakistan. Công cụ này sử dụng kỹ thuật truy xuất tăng cường thế hệ (retrieval augmented generation) để tìm kiếm trong cơ sở dữ liệu gồm 129.235 tài liệu, bao gồm 128.292 phán quyết của tòa án và 943 bộ luật của Pakistan. Khi một thẩm phán nhập câu hỏi, JudgeGPT sẽ chọn ra mười đoạn văn bản liên quan nhất và tạo ra câu trả lời có trích dẫn.

Các thẩm phán được đào tạo giải quyết thêm 1.848 vụ việc mỗi năm cho mỗi quận.

Các nhà nghiên cứu đã chia các thẩm phán thành ba nhóm. Một nhóm được cấp quyền truy cập JudgeGPT kèm theo chương trình đào tạo chuyên sâu: sáu buổi giảng kéo dài 90 phút trong vòng ba tuần, do Giáo sư Elliott Ash của ETH giảng dạy sau giờ làm việc tại tòa. Các thẩm phán được học về những nhiệm vụ nào phù hợp với công cụ này, những hạn chế của nó và cách kiểm tra kết quả đầu ra.

Nhóm thứ hai được cấp quyền truy cập AI tương tự nhưng chỉ tham gia một buổi hội thảo chung về công nghệ và luật pháp. Nhóm đối chứng tham gia buổi hội thảo đó nhưng không được truy cập JudgeGPT.

Việc chỉ cấp quyền truy cập AI không mang lại nhiều hiệu quả. Các thẩm phán được đào tạo chuyên sâu sử dụng JudgeGPT nhiều gấp bốn lần so với nhóm tham gia hội thảo chung. Sau 40 tuần, các thẩm phán được đào tạo có trung bình gần 60 lượt đăng nhập và hơn 200 câu lệnh (prompt). Nhóm đối chứng chỉ có trung bình khoảng 20 lượt đăng nhập và dưới 50 câu lệnh.

Các quận có nhiều thẩm phán được đào tạo hơn đã giải quyết được nhiều vụ việc hơn. Ở mức độ tiếp cận vừa phải, con số này tương đương với khoảng 1.848 vụ việc tăng thêm mỗi năm cho mỗi quận, tăng 6,3%. Ngay cả các quận nằm trong nhóm thấp nhất cũng giải quyết thêm được khoảng 616 vụ việc.

Chất lượng phán quyết tăng lên mà không làm gia tăng định kiến.

Chất lượng phán quyết vẫn ổn định hoặc được cải thiện. Tỷ lệ kháng cáo trên mỗi 1.000 vụ việc được giải quyết giảm nhẹ, và các thẩm phán vẫn làm việc trong cùng số giờ mà không làm ảnh hưởng đến sự cân bằng giữa công việc và cuộc sống. Các nhà nghiên cứu ước tính mức tiết kiệm đạt khoảng 38,50 USD cho mỗi 1 USD đầu tư, dựa trên chi phí cần thiết để thuê thêm số lượng thẩm phán tương đương nhằm đạt được cùng một khối lượng công việc. Ngay cả những ước tính thận trọng nhất cũng cho thấy lợi nhuận đạt "ít nhất" 10 USD cho mỗi 1 USD.

Một đánh giá trên khoảng 4.000 phán quyết của tòa án cho thấy văn bản do AI hỗ trợ xuất hiện nhiều hơn như dự đoán. Tuy nhiên, khả năng đọc hiểu, độ dài và số lượng các lập luận pháp lý vẫn ổn định. Một bài kiểm tra chất lượng dựa trên LLM, được xác nhận bởi hai luật sư người Pakistan, cho thấy sự cải thiện nhẹ. Các phán quyết từ những thẩm phán được đào tạo được đánh giá tốt hơn trong 59% các so sánh cặp, tăng từ 42% ở nhóm đối chứng. Nghiên cứu không tìm thấy bằng chứng nào cho thấy việc sử dụng AI làm gia tăng định kiến về giới tính hoặc tôn giáo trong ngôn ngữ tư pháp.

Đào tạo thực hành định hình cách thẩm phán sử dụng AI.

Các nhà nghiên cứu đã xem xét nhật ký trò chuyện ẩn danh của khoảng 1.500 thẩm phán. Nghiên cứu pháp lý, chỉnh sửa văn bản và tạo văn bản là những nhiệm vụ phổ biến nhất. Khoảng 60% các câu hỏi tìm kiếm thông tin về luật pháp, thủ tục hoặc các khái niệm pháp lý.

Các thẩm phán được đào tạo sử dụng JudgeGPT nhiều hơn cho việc chỉnh sửa và tóm tắt văn bản, những nhiệm vụ mà các mô hình ngôn ngữ có độ tin cậy cao hơn. Họ đặt ít câu hỏi pháp lý chung chung hơn, nơi rủi ro "ảo giác" (hallucination) cao hơn. Các nhà nghiên cứu cho biết chương trình đào tạo đã hướng các thẩm phán đến các nhiệm vụ hỗ trợ hạn chế, trong khi vẫn giữ quyền quyết định cuối cùng trong tay họ.

Chỉ khoảng một phần năm các yêu cầu liên quan đến cái mà các nhà nghiên cứu gọi là "ủy quyền AI thực chất", nơi các thẩm phán yêu cầu JudgeGPT đánh giá các quyết định hoặc tự soạn thảo lập luận. Việc đào tạo giúp các thẩm phán có xu hướng tự mình quyết định các vụ việc và chỉ sử dụng AI để viết lại các lập luận của họ.

Các nhà nghiên cứu nhấn mạnh rằng những phát hiện của họ không ủng hộ việc thay thế thẩm phán bằng AI. Họ cho biết, thí nghiệm này cho thấy AI có thể thúc đẩy năng suất khu vực công, nhưng chỉ khi kết hợp với việc đào tạo hướng người dùng đến đúng nhiệm vụ. Nếu không có điều đó, hầu hết các lợi ích sẽ biến mất.

Những lợi ích về năng suất trong nghiên cứu này có khả năng là mức tối thiểu, không phải mức tối đa. JudgeGPT chạy trên GPT-4, một mô hình tiền suy luận (pre-reasoning) phù hợp nhất với dự án vào thời điểm đó. Các mô hình suy luận ngày nay viết tốt hơn, ít "ảo giác" hơn và xử lý các nhiệm vụ phức tạp một cách đáng tin cậy hơn.

AI trong tư phápNghiên cứu AIJudgeGPTHiệu suất công việcỨng dụng AI
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ The Decoder. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.