Nghiên cứu
Google Research giới thiệu ME-POIs: Tối ưu hóa dữ liệu địa điểm nhờ phân tích hành vi di chuyển
(giờ Việt Nam)
Tóm tắt AI
Google Research và USC ra mắt khung ME-POIs, tích hợp dữ liệu di chuyển thực tế vào mô hình nhúng địa điểm, giúp cải thiện đáng kể độ chính xác trong các tác vụ bản đồ với mức tăng F1 lên tới 81,9%.
Bản dịch AI

Một nhóm nghiên cứu từ Google Research và USC đã công bố Mobility-Embedded POIs (ME-POIs), một khung làm việc tích hợp dữ liệu di chuyển tổng hợp của con người vào các embedding địa điểm dựa trên văn bản. Tiền đề ở đây là các mô hình ngôn ngữ mô tả địa điểm đó là gì, nhưng không mô tả cách nó được sử dụng. Hai quán cà phê có thể cùng danh mục, cùng khối địa chỉ và cùng vector văn bản, trong khi một quán có lưu lượng khách thay đổi liên tục và quán kia giữ chân khách hàng trong chín mươi phút. ME-POIs mã hóa mỗi lượt ghé thăm thành một vector theo ngữ cảnh, sau đó sử dụng học tương phản (contrastive learning) để căn chỉnh các lượt ghé thăm đó với một nguyên mẫu (prototype) có thể học được cho mỗi POI. Qua năm tác vụ làm giàu bản đồ trên dữ liệu di chuyển tại Los Angeles và Houston, việc bổ sung ME-POIs vào các bộ mã hóa văn bản mạnh mẽ đã cải thiện 34 trên 35 cặp mô hình-tác vụ tại Los Angeles, với mức tăng tương đối lên tới 81,9% F1 về mục đích ghé thăm và giảm 24,7% MAE về độ bận rộn. Đáng chú ý, một biến thể chỉ được huấn luyện trên dữ liệu di chuyển đã vượt qua các embedding của Gemini trong việc phân loại mức giá.
Nó có thể triển khai được không?
Một phần, đây là một khung làm việc mà bạn phải xây dựng lại, không phải là một checkpoint mà bạn có thể tải xuống. Tính đến thời điểm xuất bản, Google Research đã công bố bài báo nhưng chưa có mã nguồn hoặc trọng số công khai. Rào cản về tính toán khá thấp: mô hình có khoảng 53,7 triệu tham số và được huấn luyện trước trên một GPU NVIDIA Tesla V100 16GB duy nhất. Rào cản thực sự nằm ở dữ liệu — bạn cần dữ liệu lưu lượng người đi bộ được cấp phép hoặc nhật ký ghé thăm từ bên thứ nhất cộng với các đa giác POI (POI polygons).
Khung làm việc hoạt động như thế nào
Mỗi lượt ghé thăm là một bộ ba: tọa độ, thời gian đến và thời gian đi. Ba bộ mã hóa phân tách (factorized encoders) xử lý chúng: Space2Vec cho vị trí đa quy mô, và hai bộ mã hóa Time2Vec cho thời gian đến và thời gian đi riêng biệt, nhờ đó thời điểm bắt đầu và thời gian lưu trú vẫn có thể phân biệt được. Các vector được nối lại sẽ trải qua mã hóa vị trí hình sin (sinusoidal positional encoding) và đi qua một Transformer 4 lớp, 8 đầu (d_h = 512) để tạo ra các embedding lượt ghé thăm theo ngữ cảnh.
Mục tiêu cốt lõi là học tương phản. Mỗi POI sở hữu một nguyên mẫu có thể học được, và hàm mất mát InfoNCE kéo mỗi embedding lượt ghé thăm về phía nguyên mẫu của POI đó, đồng thời đẩy các POI khác trong minibatch ra xa. Nguyên mẫu trở thành một tâm hàm (functional centroid) giúp làm phẳng các lịch trình cá nhân của người dùng.
Sự thưa thớt là phần khó khăn nhất. Chỉ 9,07% POI tại Los Angeles và 7,04% POI tại Houston vượt qua ngưỡng neo (lần lượt là 100 và 50 lượt ghé thăm). Đối với phần đuôi dài (long tail), ME-POIs tính toán các nhân Gaussian chuẩn hóa tại ba băng thông — 0,3 km, 1,0 km, 3,0 km — và chuyển các biểu đồ tần suất ghé thăm của các điểm neo sang các POI thưa thớt, sau đó thêm một số hạng KL buộc embedding thưa thớt phải dự đoán phân phối ưu tiên đó. Một số hạng KL thứ hai giám sát các điểm neo dựa trên phân phối thực nghiệm của chính chúng. Một hàm mất mát thứ tư tối đa hóa độ tương đồng cosine với các embedding văn bản đã được chiếu, với các prompt tuân theo công thức của GeoLLM: tọa độ, danh mục, địa chỉ và mười POI gần nhất kèm khoảng cách và hướng.
Các con số nói lên điều gì
Đánh giá bao gồm hai tập dữ liệu di chuyển ẩn danh — Los Angeles (39.557 POI, 6,9 triệu lượt ghé thăm, cả năm 2019) và Houston (28.419 POI, 715.604 lượt ghé thăm, 20 ngày trong tháng 3 năm 2020) — trên năm tác vụ làm giàu bản đồ với phương pháp thăm dò embedding đóng băng (frozen-embedding probing). Các nhãn được lấy từ SafeGraph cho giờ mở cửa và đóng cửa, và Google Maps cho mục đích ghé thăm, độ bận rộn và mức giá.
Việc bổ sung ME-POIs đã cải thiện 34 trên 35 cặp mô hình-tác vụ tại Los Angeles. Mức tăng tương đối cao nhất: 16,2% F1 về giờ mở cửa hàng tuần (OpenAI-large), 81,9% F1 về mục đích ghé thăm (Gemini), 6,5% F1 về đóng cửa vĩnh viễn (E5) và giảm 24,7% MAE về độ bận rộn (Gemini). Tại Houston, F1 về mức giá tăng 75,1% đối với GTR-T5. Trường hợp hồi quy duy nhất bị giảm là Gemini về đóng cửa vĩnh viễn, giảm 0,4%.
Kết quả thú vị hơn là biến thể chỉ sử dụng dữ liệu di chuyển. Được huấn luyện mà không cần căn chỉnh văn bản, nó đạt độ chính xác 0,600 về mức giá tại Los Angeles so với 0,559 của Gemini — hành vi tập thể vượt trội hơn cả những từ ngữ dùng để gắn nhãn địa điểm đó. Nó cũng đánh bại mọi mô hình cơ sở dựa trên quỹ đạo (trajectory-based baseline) trong mọi tác vụ.
Giải thích: cơ chế, từng bước một
Những điểm chính cần lưu ý
Hãy xem bài báo và các chi tiết kỹ thuật. Đừng ngần ngại ghé thăm trang GitHub của chúng tôi để xem các hướng dẫn, mã nguồn và Notebook.
Ngoài ra, hãy thoải mái theo dõi chúng tôi trên Twitter và đừng quên tham gia SubReddit ML 150k+ thành viên của chúng tôi và đăng ký nhận bản tin. Khoan đã! Bạn có dùng Telegram không? Bây giờ bạn cũng có thể tham gia cùng chúng tôi trên Telegram.
Cần hợp tác với chúng tôi để quảng bá GitHub Repo, trang Hugging Face, sản phẩm mới hoặc hội thảo trực tuyến của bạn? Hãy kết nối với chúng tôi.

Michal Sutter là một chuyên gia khoa học dữ liệu với bằng Thạc sĩ Khoa học Dữ liệu từ Đại học Padova. Với nền tảng vững chắc về phân tích thống kê, học máy và kỹ thuật dữ liệu, Michal xuất sắc trong việc chuyển đổi các tập dữ liệu phức tạp thành những thông tin chi tiết có thể hành động được.
Bài viết được AI dịch và tổng hợp tự động từ MarkTechPost. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.