Nghiên cứu
Cách dữ liệu di chuyển giúp mô hình ngôn ngữ hiểu sâu hơn về địa điểm
(giờ Việt Nam)
Tóm tắt AI
Google Research giới thiệu khung ME-POIs, kết hợp mô hình di chuyển ẩn danh với mô tả văn bản để tạo ra các vector đặc trưng cho địa điểm, giúp cải thiện đáng kể khả năng dự đoán ý định và phân loại dịch vụ.
Bản dịch AI

Chúng tôi giới thiệu một khung làm việc năng động, dựa trên dữ liệu di chuyển, cho phép các mô hình AI hiểu được nhịp điệu hoạt động theo thời gian của các địa điểm, từ đó cải thiện đáng kể khả năng dự đoán các thuộc tính trong thế giới thực như giờ mở cửa, mức giá và độ đông đúc.
Trí tuệ nhân tạo đã đạt được những tiến bộ đáng kinh ngạc trong việc hiểu thế giới thông qua văn bản. Tuy nhiên, để xây dựng các mô hình AI thực sự hiểu được thế giới vật lý, chúng cần nắm bắt được nhiều thứ hơn là chỉ ngôn từ: chúng cần hiểu được chức năng động, thực tế của môi trường xây dựng. Mỗi địa điểm đều có hai đặc điểm riêng biệt: danh tính trên giấy tờ và nhịp điệu vận hành thực tế của nó.
Các mô hình ngôn ngữ truyền thống thường xây dựng biểu diễn của các địa điểm (thường được gọi là “điểm quan tâm” hay POI), dù đó là một doanh nghiệp hay một địa điểm như công viên hoặc địa danh, bằng cách dựa nhiều vào dữ liệu tĩnh này. Chúng phân tích thành công địa chỉ, danh mục doanh nghiệp và mô tả văn bản. Mặc dù các mô hình ngôn ngữ đẳng cấp thế giới như Gemini rất thành thạo trong việc xử lý dữ liệu văn bản, nhưng các biểu diễn không gian địa lý của chúng có thể được làm phong phú hơn đáng kể bằng cách kết hợp các động lực vận hành thực tế của môi trường đô thị. Việc bổ sung dữ liệu di chuyển vào các nhãn ngữ nghĩa có thể giúp các mô hình này nắm bắt hiệu quả nhịp điệu hoạt động theo thời gian độc đáo của các POI trong thành phố.
Để chứng minh khả năng bổ trợ này, chúng tôi giới thiệu Mobility-Embedded POIs (ME-POIs), một khung làm việc mới giúp cải thiện các biểu diễn địa điểm dựa trên văn bản được tạo ra bởi các mô hình ngôn ngữ. Sử dụng các bộ dữ liệu chuẩn công khai, ME-POIs kết hợp các mô hình di chuyển tổng hợp và ẩn danh, chẳng hạn như thời gian đến, thời gian lưu trú và các mô hình di chuyển xung quanh. Thay vì coi một địa điểm là một tập hợp các từ cố định, ME-POIs sử dụng phương pháp tự giám sát để kết hợp các mô tả văn bản với các mô hình di chuyển ẩn danh quy mô lớn từ các bộ dữ liệu công khai (nắm bắt dấu vết hoạt động không gian tổng hợp của môi trường trong suốt cả ngày). Nhờ đó, mô hình xây dựng một biểu diễn vectơ số (một "chữ ký" toán học, về mặt kỹ thuật gọi là embedding) mã hóa cả danh tính của địa điểm và chức năng động của nó. Việc tích hợp ME-POIs với các mô hình văn bản tiên tiến đã mang lại lợi thế về ngữ cảnh, giúp tăng tới 81,9% độ chính xác tương đối trong việc dự đoán ý định ghé thăm, cải thiện 75,1% trong phân loại mức giá và tăng 24,7% độ chính xác trong ước tính độ đông đúc tại các địa điểm chưa từng được biết đến.
Cách thức hoạt động của khung làm việc ME-POIs
Bằng cách cung cấp một biểu diễn đã được làm phong phú trước về một địa điểm, khung làm việc ME-POIs giúp các mô hình AI dễ dàng đưa ra các suy luận chính xác về nhiều thuộc tính khác nhau — như giờ hoạt động, mức giá mục tiêu và trạng thái kinh doanh hiện tại — mà không cần phải tính toán lại các thuộc tính đó từ đầu mỗi lần.
Để xây dựng một mô hình có hiểu biết sâu sắc hơn về các địa điểm, chúng ta phải phân biệt giữa danh tính của một địa điểm (tên và danh mục của nó) và chức năng của nó (dấu vết ghé thăm tổng hợp). Trong các nghiên cứu AI không gian địa lý trước đây, các mô hình di chuyển hầu như chỉ được áp dụng để dự đoán POI tiếp theo mà người dùng sẽ ghé thăm. Ngược lại, khung làm việc ME-POIs chuyển dịch dữ liệu di chuyển từ một tác vụ dự đoán đầu ra thành một đặc trưng đầu vào định nghĩa chính địa điểm đó.
Nhưng làm thế nào để chuyển đổi các điểm địa lý thô thành một chữ ký toán học (hoặc embedding) sạch và hữu ích về mặt số liệu? Chúng tôi thực hiện điều này thông qua quy trình ba bước: căn chỉnh lượt ghé thăm, lan truyền lượt ghé thăm đa quy mô không gian và sự kết hợp giữa văn bản và dữ liệu di chuyển.
Căn chỉnh lượt ghé thăm
Mô hình coi các lượt ghé thăm tổng hợp đến một POI cụ thể là các điểm dữ liệu cơ bản. Nó phân tích các khung thời gian đến, xu hướng rời đi và thời gian lưu trú điển hình. Thay vì tính toán các giá trị trung bình đơn giản, một bộ mã hóa thời gian sẽ ánh xạ các chuỗi thời gian này vào một không gian vectơ dày đặc. Quá trình này thiết lập một "trọng tâm chức năng" — một chữ ký đa chiều, độc đáo, ánh xạ các mô hình di chuyển ẩn danh tổng hợp liên quan đến địa điểm cụ thể đó trong chu kỳ một năm và qua các ngày khác nhau trong tuần.
Giải quyết vấn đề "đuôi dài" của sự thưa thớt dữ liệu
Một thách thức dai dẳng trong khoa học dữ liệu không gian địa lý là vấn đề "đuôi dài". Trong khi các địa danh nổi tiếng, trung tâm mua sắm lớn và các chuỗi cửa hàng phổ biến ở trung tâm thành phố tạo ra lượng dữ liệu ghé thăm dồi dào, thì phần lớn các doanh nghiệp địa phương — các cửa hàng nhỏ trong khu phố, tiệm sửa chữa chuyên dụng hoặc quán cà phê mới mở — lại chịu cảnh thiếu hụt dữ liệu nghiêm trọng. Trước đây, khi một mô hình gặp một địa điểm có ít hoặc không có lượt ghé thăm nào được ghi lại, nó sẽ giả định sai rằng địa điểm đó không có hoạt động, dẫn đến các dự đoán sai lệch.
ME-POIs giải quyết vấn đề này thông qua cơ chế lan truyền lượt ghé thăm đa quy mô không gian mới. Kiến trúc này nhận ra rằng các lượt ghé thăm thường bị giới hạn theo khu vực; một cửa hàng nhỏ trên con phố mua sắm cao cấp sẽ chia sẻ các đặc điểm hành vi hệ thống với những người hàng xóm của nó. Khung làm việc xem xét các địa điểm liền kề trên nhiều quy mô không gian: con phố ngay sát, khu nhà và khu vực lân cận rộng hơn. Sau đó, nó chuyển đổi thống kê các mô hình ghé thăm tổng hợp của những địa điểm bận rộn, giàu dữ liệu sang các địa điểm thưa thớt gần đó. Bằng cách học "nhịp điệu" khu vực từ các khu vực hoạt động tích cực, mô hình áp dụng cơ sở tri thức địa lý thông minh cho các cửa hàng nhỏ hơn, cho phép nó học được thông tin về chúng ngay cả khi chúng xuất hiện rất ít hoặc không xuất hiện trong dữ liệu.
Sự kết hợp giữa văn bản và dữ liệu di chuyển
Thay vì loại bỏ các mô tả văn bản, khung làm việc ME-POIs làm phong phú thêm chúng. Nó thực hiện điều này bằng cách căn chỉnh các embedding ngôn ngữ cấp cao (các biểu diễn vectơ tiêu chuẩn được trích xuất từ các mô hình tiên tiến như Gemini) với các vectơ di chuyển mới được tạo ra bằng cách tối đa hóa độ tương đồng cosine của chúng. Chúng tôi xếp chồng tín hiệu di chuyển trực tiếp lên trên biểu diễn ngôn ngữ, tạo ra cái nhìn toàn diện hơn về địa điểm hoặc doanh nghiệp đó.
Cách tiếp cận lai này đảm bảo rằng mô hình bảo toàn được ngữ nghĩa cấu trúc (ví dụ: biết rằng một địa điểm bán đồ ăn từ mô tả văn bản của nó) trong khi vẫn hấp thụ được bối cảnh vận hành (ví dụ: biết liệu nó hoạt động như một quán ăn trưa hay một quán ăn đêm từ chữ ký di chuyển của nó).
Thử nghiệm
Để đánh giá liệu ME-POIs có thực sự đạt được sự hiểu biết tổng quát, không phụ thuộc vào thuộc tính về các địa điểm vật lý hay không, chúng tôi đã tiến hành thử nghiệm trên diện rộng tại hai khu vực đô thị lớn, khác biệt về văn hóa: Los Angeles và Houston.
Chúng tôi đã đánh giá khung làm việc trên năm tác vụ riêng biệt. Quan trọng nhất, để chứng minh mô hình phát triển trí tuệ tổng quát thay vì chỉ ghi nhớ các mô hình cục bộ, chúng tôi đã huấn luyện khung làm việc trên một tập hợp các địa điểm quan sát được và sau đó yêu cầu nó dự đoán các thuộc tính trên các địa điểm hoàn toàn chưa từng thấy.
Năm tác vụ hạ nguồn bao gồm:
Để thiết lập cơ sở so sánh, chúng tôi đã so sánh khung làm việc ME-POIs với các mô hình embedding chỉ dựa trên văn bản tiêu chuẩn (như Gemini embeddings), các mô hình không gian địa lý dựa trên quỹ đạo hiện có (như TrajGPT) và các biến thể lai để xác định chính xác giá trị mà các mô hình di chuyển đã đóng góp vào phương trình.
Kết quả
Kết quả thử nghiệm rất ấn tượng, xác nhận rằng việc thêm dữ liệu di chuyển thực tế vào các mô hình văn bản hiện có mang lại "lợi thế ngữ cảnh" rõ rệt. Khi đánh giá hiệu suất mô hình trên các địa điểm thử nghiệm chưa từng thấy, việc tích hợp ME-POIs đã dẫn đến những cải thiện đáng kể về độ chính xác, liên tục vượt trội hơn cả các mô hình cơ sở chỉ dựa trên văn bản và chỉ dựa trên dữ liệu di chuyển trong tất cả các tác vụ dự đoán.
Ngoài việc vượt trội hơn các mô hình cơ sở tiêu chuẩn, một trong những phát hiện đáng chú ý nhất xuất hiện khi so sánh một mô hình được huấn luyện độc quyền trên dữ liệu di chuyển với những mô hình chỉ có quyền truy cập vào siêu dữ liệu văn bản. Trong một số trường hợp, như phân loại mức giá, mô hình chỉ dựa trên dữ liệu di chuyển đã vượt qua các mô hình ngôn ngữ chỉ dựa trên văn bản. Điều này tiết lộ một sự thật thú vị và thường bị bỏ qua về động lực đô thị: hành động tập thể của chúng ta tại một địa điểm vật lý thường mang tính mô tả cao hơn nhiều so với những từ ngữ chính thức được sử dụng để gắn nhãn cho nó.
Kết luận
Bằng cách vượt qua thành công các nhãn kỹ thuật số tĩnh, khung làm việc ME-POIs chứng minh một cách thức mới để cho phép AI mô hình hóa và hiểu thế giới vật lý. Điều quan trọng cần nhấn mạnh là khung làm việc này tập trung vào việc hiểu các sự vật trên thế giới ở dạng tổng hợp — nó không thể đưa ra kết luận về người dùng cá nhân hoặc bất kỳ điều gì mang tính cá nhân hóa. Nghĩa là, khung làm việc ME-POIs có thể cung cấp một biểu diễn toàn diện về một địa điểm hoặc doanh nghiệp, nắm bắt cách nó được ghé thăm bởi đông đảo người dân và trong các khung thời gian khác nhau; nó không thể được sử dụng cho cá nhân hóa cá nhân. Thay vào đó, sức mạnh của nó nằm ở việc tạo ra các chữ ký số tổng hợp phong phú về các địa điểm, giúp giảm bớt gánh nặng tính toán cho các hệ thống hạ nguồn khi chúng cần đưa ra suy luận về các địa điểm đó.
Cuối cùng, ME-POIs đặt nền móng cho các mô hình AI thực sự hiểu được nhịp điệu của các thành phố. Đây cũng là một phần trong nỗ lực Google Earth AI rộng lớn hơn của chúng tôi nhằm tạo ra các mô hình và bộ dữ liệu không gian địa lý giúp biến dữ liệu hành tinh thành thông tin tình báo có thể hành động.
Lời cảm ơn
Chúng tôi cảm ơn các đồng tác giả của bài báo này: Neha Arora (Google Research), cùng với Giáo sư Cyrus Shahabi và nghiên cứu sinh Tiến sĩ Shang Ling Hsu từ Đại học Nam California (USC).



Bài viết được AI dịch và tổng hợp tự động từ Google Research: Blog (Web). Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.