# Nghiên cứu giải mã lý do LLM mặc định ưu tiên tiếng Anh Mỹ: Phân tích từ 1.813 biến thể ngôn ngữ

- Nguồn: HuggingFace Daily Papers (bài nghiên cứu nổi bật của cộng đồng)
- Thời gian phát hành: 2026-09-28 07:00 (giờ Việt Nam)
- Điểm AI: 44/100
- Link AIHOT.vn: https://aihot.vn/items/0d287cb85967b70e
- Nguồn dữ liệu AI HOT: https://aihot.news/items/i9rh56ltwz34p8by2y52fv5ym
- Link gốc: https://arxiv.org/abs/2604.04204

## Tóm tắt AI

Nghiên cứu sử dụng phương pháp DiAlign để chứng minh các LLM đều thiên vị tiếng Anh Mỹ trong cả dữ liệu huấn luyện lẫn suy luận, ngay cả khi được yêu cầu sử dụng tiếng Anh Anh.

## Thân bài

[Xem PDF](https://arxiv.org/pdf/2604.04204) [HTML (thử nghiệm)](https://arxiv.org/html/2604.04204v2)

> Tóm tắt: Các mô hình ngôn ngữ lớn (LLM) ngày càng được tích hợp sâu vào cơ sở hạ tầng giáo dục, chuyên môn và công cộng, tuy nhiên các nền tảng phổ biến vẫn mặc định "English (US)" là thiết lập tiếng Anh chính bất chấp sự đa dạng toàn cầu của ngôn ngữ này. Chúng tôi đặt câu hỏi: Làm thế nào "English (US)" trở thành mặc định? Chúng tôi nghiên cứu vấn đề này dưới góc độ thiên kiến cấu trúc, xem xét cách lịch sử địa chính trị trong việc quản lý dữ liệu, sự thống trị kỹ thuật số và tiêu chuẩn hóa ngôn ngữ giao thoa với quy trình phát triển LLM. Sử dụng tiếng Anh Anh làm tham chiếu đối chứng, chúng tôi xây dựng một tài nguyên gồm 1.813 biến thể tiếng Anh Mỹ (AmE) - tiếng Anh Anh (BrE) tương ứng và giới thiệu DiAlign, một phương pháp động, không cần huấn luyện để ước tính sự liên kết khu vực từ bằng chứng phân phối. Chúng tôi thực hiện đối chiếu ưu tiên AmE qua các giai đoạn: tiếp xúc dữ liệu --> biểu diễn --> tạo văn bản, kiểm tra đồng thời dữ liệu tiền huấn luyện và hậu huấn luyện, hành vi và nguồn gốc của tokenizer, chi phí dự đoán của mô hình, và ngôn ngữ được tạo ra trên các quốc gia phát triển, điều kiện nhắc lệnh (prompt), lĩnh vực và nguồn dữ liệu, danh mục ngôn ngữ và văn phong. AmE luôn được ưu tiên trong tất cả sáu kho dữ liệu tiền huấn luyện và 21 tập dữ liệu hậu huấn luyện được kiểm định, thường được các tokenizer biểu diễn gọn hơn và có chi phí dự đoán thấp hơn. Nó cũng vẫn là mặc định tạo văn bản chủ đạo khi sử dụng câu lệnh tiếng Anh trung tính; việc sử dụng câu lệnh tiếng Anh Anh có chuyển dịch ưu tiên này sang BrE nhưng không loại bỏ hoàn toàn mặc định AmE. Theo hiểu biết của chúng tôi, đây là nghiên cứu nghiêm ngặt đầu tiên trên toàn bộ quy trình về thiên kiến cấu trúc xuyên suốt các giai đoạn phát triển chính của LLM. Kết quả của chúng tôi cho thấy các LLM đương đại ưu tiên AmE như một chuẩn mực thực tế, làm dấy lên lo ngại về sự đồng nhất hóa ngôn ngữ, bất công nhận thức và sự bất bình đẳng trong triển khai AI toàn cầu, đồng thời cung cấp cơ sở vững chắc cho các can thiệp có mục tiêu ở cấp độ thành phần.

| Bình luận: | Bản in trước (Preprint) |
| --- | --- |
| Chủ đề: | Tính toán và Ngôn ngữ (cs.CL); Trí tuệ nhân tạo (cs.AI); Máy tính và Xã hội (cs.CY); Công nghệ mới nổi (cs.ET); Học máy (cs.LG) |
| Trích dẫn là: | arXiv:2604.04204 [cs.CL] |
|  | (hoặc arXiv:2604.04204v2 [cs.CL] cho phiên bản này) |
|  | https://doi.org/10.48550/arXiv.2604.04204 DOI do arXiv cấp thông qua DataCite |

### Lịch sử gửi bài

Từ: Mir Tafseer Nayeem [xem email](https://arxiv.org/show-email/a9a57d57/2604.04204)] [v1](https://arxiv.org/abs/2604.04204v1) Chủ nhật, 5 tháng 4 năm 2026 17:59:34 UTC (2.505 KB) [v2] Thứ hai, 28 tháng 9 năm 2026 00:34:52 UTC (3.097 KB)
