Mô hình
Viện Hàn lâm Khoa học Áo hợp tác cùng Mistral ra mắt Apollo: AI chuyên giải mã văn bản Hy Lạp cổ đại
(giờ Việt Nam)
Tóm tắt AI
Viện Hàn lâm Khoa học Áo phối hợp cùng Mistral và Sail Reply phát triển mô hình ngôn ngữ Apollo, được huấn luyện trên 600 triệu từ cổ ngữ để hỗ trợ phục dựng các bản thảo, giấy cói và bia đá Hy Lạp cổ.
Bản dịch AI
Theo tin từ IT ngày 22 tháng 9, tờ WIRED đưa tin các thư viện đại học trên khắp thế giới đang lưu giữ hàng trăm nghìn mảnh giấy cói Hy Lạp cổ đại. Nhiều mảnh trong số đó đã bị hư hại nghiêm trọng và nội dung có lẽ không còn khả năng giải mã; đối với những văn bản còn hy vọng phục hồi, các học giả chỉ có thể dựa vào việc thủ công bổ sung từng từ ngữ bị thiếu để hoàn thiện. Để đẩy nhanh công việc nặng nhọc này, các nhà nghiên cứu đã bắt đầu nhờ đến sự hỗ trợ của trí tuệ nhân tạo.

Viện Hàn lâm Khoa học Áo sẽ chính thức ra mắt mô hình ngôn ngữ lớn cao cấp đầu tiên trên thế giới dành cho tiếng Hy Lạp cổ đại vào thứ Tư theo giờ địa phương. Dự án này do Viện Hàn lâm Khoa học Áo phối hợp với phòng thí nghiệm AI Mistral của Pháp và nhà cung cấp dịch vụ công nghệ Sail Reply cùng phát triển, có tên gọi là Apollo. Dữ liệu huấn luyện của mô hình này được lấy từ các bản thảo, giấy cói và văn bia khắc trên đá, với tổng cộng khoảng 600 triệu từ vựng lịch sử tiếng Hy Lạp cổ đại.
Theo tìm hiểu của IT, các nhà nghiên cứu có thể sử dụng mô hình này miễn phí thông qua giao diện chatbot. Đội ngũ phát triển hy vọng Apollo sẽ giúp các học giả sàng lọc nhanh hơn các mảnh giấy cói liên quan đến hướng nghiên cứu chuyên sâu của họ, từ đó khai phá những điểm tiếp cận nghiên cứu mới. Đối với các tài liệu bị hư hỏng, Apollo sẽ dựa trên xác suất thống kê để đưa ra những từ ngữ có khả năng cao nhất nhằm lấp đầy các khoảng trống, hứa hẹn sẽ khai quật được những sự kiện lịch sử và chi tiết về phong tục xã hội cổ đại vốn đã bị che lấp trước đây.
Dimitris Vlitas, đối tác tại công ty Sail Reply, chia sẻ trong một cuộc phỏng vấn với WIRED rằng việc giải mã tri thức cổ đại theo cách này "là điều không thể tưởng tượng nổi chỉ một năm trước đây."
Trước đó, việc phục hồi các mảnh giấy cói bị hư hỏng hoàn toàn phụ thuộc vào các học giả kỳ cựu: đầu tiên phải phân định ranh giới từ ngữ — vì văn bản Hy Lạp cổ đại vốn không có khoảng trắng ngăn cách; sau đó phải xác định niên đại tài liệu, kết hợp với bối cảnh chính trị xã hội thời bấy giờ, tra cứu các loại tài liệu tham khảo để cân nhắc lựa chọn từ ngữ phù hợp nhằm bổ sung phần bị thiếu. Stephen Colvin, giáo sư ngành Cổ điển học và Ngôn ngữ học lịch sử tại Đại học College London (UCL), cho biết: "Trên thế giới chỉ có rất ít chuyên gia tinh thông lịch sử Hy Lạp cổ đại và đủ năng lực thực hiện công việc phục hồi kiểu này."
Và Apollo đã tích hợp loại kiến thức chuyên môn này vào bên trong mô hình. Anna Dolganov, nhà sử học và chuyên gia nghiên cứu tài liệu giấy cói tại Viện Hàn lâm Khoa học Áo, cho biết: "Khi nhận diện được văn bản của Homer, nó sẽ sử dụng tiếng Hy Lạp cổ đại thời Homer để bổ sung; khi gặp văn bia khắc bằng phương ngữ Dorian, nó sẽ tự động chuyển sang phương ngữ Dorian."
Giới học thuật vốn từ lâu đã chìm đắm trong công việc phục hồi văn bản gian khổ đang kỳ vọng Apollo có thể nâng cao hiệu quả nghiên cứu, giúp các học giả tập trung sức lực vào việc phân tích ý nghĩa lịch sử đằng sau các tài liệu cổ, thay vì tiêu tốn quá nhiều công sức vào việc nhận diện chính các văn bản bị khuyết thiếu.
Đại học Oxford đang lưu giữ bộ sưu tập giấy cói cổ đại lớn nhất thế giới. Armand D'Angour, giáo sư ngành Ngôn ngữ và Văn học Cổ điển tại trường này, nhận xét: "Điều này vô cùng phấn khích. Nếu máy tính có thể gợi ý cho tôi rằng 'khoảng trống này có ba từ thay thế', nó sẽ giúp đẩy nhanh tiến độ nghiên cứu một cách đáng kể."
Tuy nhiên, Apollo sẽ không làm đảo lộn nhận thức tổng thể của giới học thuật về thế giới cổ đại. Việc một lượng lớn giấy cói chậm được phục hồi vốn dĩ là do nội dung ghi chép chủ yếu là chuyện thường ngày: thư từ cá nhân, hợp đồng hôn nhân, văn bản hành chính. Colvin cho biết: "Độc giả phổ thông có thể nghĩ rằng chúng ta sẽ ngay lập tức khai quật được vài vở kịch bị thất truyền của Sophocles, nhưng điều đó sẽ không xảy ra." Mặc dù vậy, mô hình này vẫn giúp khôi phục thêm nhiều chi tiết về cuộc sống thường nhật thời cổ đại và cung cấp bằng chứng cho các suy luận học thuật hiện có. Đúng như lời D'Angour nói: "Mỗi lần hoàn thành việc phục hồi một văn bản, chúng ta lại bổ sung thêm một mảnh ghép nhỏ vào kho tàng tri thức về thế giới cổ đại."
Vlitas cho rằng nếu dự án Apollo thành công, công nghệ này có thể dễ dàng chuyển đổi sang các ngôn ngữ cổ đại khác như tiếng Latin, tiếng Ai Cập cổ đại; đồng thời có thể mở rộng sang các lĩnh vực học thuật khác cần sắp xếp và lập chỉ mục các kho dữ liệu tài liệu quy mô lớn. Trí tuệ nhân tạo đã mang lại những kết quả ấn tượng trong nhiều lĩnh vực nghiên cứu khoa học: OpenAI trước đó đã công bố mô hình AI của họ đã giải được một bài toán hóc búa tồn tại suốt 200 năm; Google DeepMind đã sử dụng AI để sắp xếp các tập dữ liệu lớn nhằm phân tích cách đột biến gen tác động đến sinh học phân tử.
Cũng có ý kiến bày tỏ lo ngại: việc dựa vào các mô hình ngôn ngữ lớn dựa trên tính toán xác suất để bổ sung các phần thiếu hụt trong tài liệu cổ có thể tạo ra sai sót, từ đó làm "ô nhiễm" các hồ sơ lịch sử gốc. Để tránh rủi ro này, tư duy thiết kế của Apollo là cung cấp nhiều phương án từ ngữ thay thế, và quyết định cuối cùng vẫn thuộc về các học giả. Dolganov chỉ ra rằng: "Điểm mấu chốt nằm ở chỗ, sự phán đoán chuyên môn của con người phải được giữ lại. Một khi chúng ta hoàn toàn phụ thuộc vào AI để hoàn thành việc phiên âm và giải mã tài liệu lịch sử, rắc rối sẽ theo đó mà đến."
Bài viết được AI dịch và tổng hợp tự động từ IT Home. Liên kết bài gốc ở phía trên. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.