Hugging Face: Blog
85

Tin ngành

Ra mắt OlmoEarth Embeddings: Xuất dữ liệu nhúng tùy chỉnh từ OlmoEarth Studio cho phân tích chuyên sâu

(giờ Việt Nam)

Tóm tắt AI

Hugging Face giới thiệu tính năng xuất dữ liệu nhúng (embeddings) từ OlmoEarth Studio, cho phép người dùng dễ dàng tích hợp dữ liệu địa lý vào các mô hình AI và quy trình phân tích chuyên sâu.

Bản dịch AI

Introducing OlmoEarth embeddings: Custom embedding exports from OlmoEarth Studio for downstream analysis

Quay lại các bài viết

📄 Báo cáo kỹ thuật: https://allenai.org/papers/olmoearth | 📊 Tài liệu: https://docs.olmoearth.allenai.org/embeddings | 💻 Tìm hiểu thêm về OlmoEarth: https://allenai.org/olmoearth

OlmoEarth embeddings concept illustration: a grid of numeric embedding values connected by lines to points on a globe

OlmoEarth Studio, nền tảng của chúng tôi dùng để xây dựng các mô hình quan sát Trái Đất, hiện đã cho phép bạn tính toán và xuất các vectơ nhúng (embedding vectors)—những biểu diễn số học nhỏ gọn của dữ liệu quan sát Trái Đất được tạo ra bởi các mô hình nền tảng OlmoEarth mã nguồn mở của chúng tôi. Mã nguồn và trọng số mô hình được công khai cùng với bài báo nghiên cứu, để cộng đồng có thể kiểm tra chính xác cách các vectơ nhúng này được tạo ra như thế nào.

Các vectơ nhúng là điểm khởi đầu nhanh chóng và tiết kiệm chi phí để tận dụng OlmoEarth: chúng hỗ trợ nhiều tác vụ hạ nguồn, từ tìm kiếm sự tương đồng, phân đoạn cho đến khám phá không giám sát. Các vị trí có đặc điểm bề mặt tương tự sẽ có vectơ gần giống nhau; các vị trí khác biệt sẽ nằm cách xa nhau. Các vectơ nhúng OlmoEarth đã cho thấy hiệu suất mạnh mẽ trong các bài kiểm chuẩn của chúng tôi và trong các đánh giá độc lập. Các tệp Cloud-Optimized GeoTIFFs (COGs) được xuất ra rất nhẹ và dễ chia sẻ. Hãy chọn khu vực bạn quan tâm, phạm vi thời gian, biến thể bộ mã hóa, độ phân giải và nguồn ảnh thông qua giao diện Studio hoặc API để nhận về tệp COG mà bạn có thể sử dụng tùy ý. Nếu ứng dụng của bạn yêu cầu hiệu suất cao hơn, Studio cũng hỗ trợ tinh chỉnh có giám sát (SFT).

Các vectơ nhúng tính toán tùy chỉnh hiện đã có sẵn cho người dùng OlmoEarth Studio. Hãy liên hệ nếu bạn muốn được cấp quyền truy cập. Hướng dẫn sử dụng các mô hình OlmoEarth công khai để tự tính toán vectơ nhúng của riêng bạn có sẵn tại đây.

Tính toán vectơ nhúng trong Studio

World map of OlmoEarth embeddings with each land pixel colored by its k-means cluster, revealing coherent biome and land-cover structure across continents

Cấu trúc toàn cầu trong các vectơ nhúng OlmoEarth từ dữ liệu ảnh Sentinel-2 theo mùa trên 1,1 triệu mẫu. Màu sắc biểu thị 15 cụm k-means trong không gian nhúng đã giảm chiều bằng PCA.

Việc tính toán vectơ nhúng tuân theo quy trình tương tự như bất kỳ dự đoán nào khác trong Studio. Đầu tiên, hãy cấu hình mô hình và chạy nó, sau đó tải xuống kết quả. Một số tham số giúp tùy chỉnh đầu ra:

Four false-color renderings of the same embedding raster side by side, each mapping the embedding bands to color differently

Các tùy chọn trực quan hóa khác nhau được áp dụng cho cùng một raster nhúng.

Studio cung cấp tệp COG với mỗi dải (band) tương ứng với một chiều của vectơ nhúng. Các vectơ được lưu trữ dưới dạng số nguyên 8-bit có dấu (int8). Giá trị nằm trong khoảng từ -127 đến +127, với -128 được dành riêng cho dữ liệu trống (nodata). Để khôi phục các vectơ số thực dấu phẩy động, hãy xem dequantize_embeddings trong olmoearth_pretrain.

Vì mọi thứ được tính toán theo yêu cầu thay vì lấy từ kho lưu trữ toàn cầu được tính toán sẵn, các vectơ nhúng của bạn phản ánh chính xác các điều kiện mà bạn quan tâm. Bạn có thể tạo các vectơ nhúng hàng tháng để nắm bắt các biến động theo mùa, thay vì chỉ là những ảnh chụp nhanh hàng năm.

Những gì bạn có thể làm với các vectơ nhúng OlmoEarth

Các ví dụ dưới đây đều sử dụng các vectơ nhúng OlmoEarth-v1-Tiny (192 chiều) ở độ phân giải 40 mét với dữ liệu tổng hợp Sentinel-2 L2A (hàng năm cho hầu hết các ví dụ; hàng tháng cho việc phát hiện thay đổi). Tiny là một bộ mã hóa nhẹ nhưng vẫn đạt hiệu suất cao; đối với các ứng dụng của riêng mình, bạn có thể thay thế nó bằng một biến thể lớn hơn với chi phí tính toán và lưu trữ cao hơn.

Tìm kiếm sự tương đồng: Tìm "những thứ tương tự"

Chọn một pixel truy vấn, trích xuất vectơ nhúng của nó và tính toán độ tương đồng cosine với mọi pixel khác. Kết quả là một bản đồ nhiệt cho thấy nơi nào có cảnh quan trông giống và khác nhất so với pixel truy vấn của bạn.

Sentinel-2 imagery of farmland around Merced, California with the query pixel boxed in blue, beside the matching cosine-similarity heatmap in which the urban core and road corridors glow yellow agains

Truy vấn này nằm gần trung tâm đô thị Merced ở California. Các cấu trúc đô thị và hành lang đường bộ sáng lên một cách nhất quán trong khi các thửa ruộng nông nghiệp vẫn tối. Mô hình phân biệt được các bề mặt xây dựng với đất canh tác mà không cần bất kỳ nhãn nào.

Chuyển truy vấn sang một cửa sổ nông nghiệp nhỏ, chúng ta xác định vectơ truy vấn là trung bình của các vectơ nhúng trên cửa sổ đó, sau đó lấy dữ liệu ảnh Sentinel-2 tại các vị trí có độ tương đồng cao nhất và thấp nhất để xem mô hình coi cái gì là tương tự và không tương tự.

Embedding cosine similarity, query versus highest and lowest: an overview tile and the blue query patch above three high-similarity agricultural patches at 0.91, 0.89, and 0.89, and three low-similari

Các mảng tương tự nhất (từ 0,89 trở lên) đều là các thửa ruộng nông nghiệp có tưới tiêu. Các mảng ít tương tự nhất (gần bằng 0) là một sân bay với mặt đất trống xung quanh, một hồ chứa nước với địa hình khô cằn và vùng đồng cỏ khô hạn. Không cần dữ liệu huấn luyện, không cần nhãn, chỉ là tích vô hướng trong không gian nhúng.

Phân đoạn ít mẫu (Few-shot segmentation): Gán nhãn cho cảnh quan

Tìm kiếm sự tương đồng cho bạn biết "nơi nào giống như thế này?", nhưng đôi khi bạn cần các nhãn rời rạc trên toàn bộ khu vực. Vì các biểu diễn đã rất phong phú, một bộ phân loại tuyến tính đơn giản có thể tạo ra bản đồ che phủ đất toàn diện từ rất ít pixel được gán nhãn.

Để kiểm tra điều này, chúng tôi đã gán nhãn chỉ 60 pixel (20 pixel mỗi lớp) tại Cà Mau, Việt Nam, một vùng rừng ngập mặn ven biển. Sử dụng ESA WorldCover 2021 làm nguồn nhãn cho ba lớp (rừng ngập mặn, nước, khác), chúng tôi lấy mẫu ngẫu nhiên 20 pixel mỗi lớp, huấn luyện một mô hình hồi quy logistic với chuẩn hóa theo đặc trưng và dự đoán cho mọi pixel trong khu vực.

Từ 60 pixel được gán nhãn, bộ phân loại tạo ra một bản đồ nhất quán với F1 có trọng số = 0,84. Các dải rừng ngập mặn, kênh rạch thủy triều và vùng nước mở được phân định rõ ràng trên toàn bộ khu vực. Bộ phân loại đạt ngưỡng nhanh chóng: tăng từ 30 lên 300 nhãn hầu như không làm thay đổi độ chính xác, vì các vectơ nhúng đã thực hiện hầu hết các công việc nặng nhọc.

Cốt lõi của phân tích chỉ là vài dòng mã Python:

Đây là một "linear probe" (thăm dò tuyến tính), một đánh giá tiêu chuẩn cho các mô hình nền tảng. Việc hồi quy logistic trên 192 chiều có thể khôi phục các ranh giới che phủ đất từ rất ít nhãn có nghĩa là bộ mã hóa Tiny đã tự tổ chức các phân biệt sinh thái này trong quá trình tiền huấn luyện. Các biến thể lớn hơn (Base, 768 chiều) mã hóa các biểu diễn phong phú hơn nữa.

Nếu bạn có các đa giác thực địa (ground-truth), các điểm khảo sát thực địa hoặc một bản đồ thô hiện có, bạn có thể huấn luyện một bộ phân loại tương tự và tạo ra bản đồ toàn diện cho khu vực bạn quan tâm.

Phát hiện thay đổi: Xác định những gì đã dịch chuyển

Vì Studio có thể tạo các vectơ nhúng ở bất kỳ độ phân giải thời gian nào (từ hàng tháng đến hàng năm), bạn có thể so sánh trực tiếp hai khoảng thời gian để xác định nơi điều kiện bề mặt đã thay đổi. Dưới đây, chúng tôi đã tính toán các vectơ nhúng Sentinel-2 hàng tháng cho cùng một khu vực vào tháng 9 năm 2023 và tháng 9 năm 2024, sau đó đo khoảng cách cosine trên mỗi pixel. Vết cháy của vụ cháy Park Fire (tháng 7-9 năm 2024) tại Quận Butte, California hiện lên rõ rệt.

Không cần nhãn hay huấn luyện—chỉ cần hai tệp COG nhúng và vài dòng mã Python.

Khám phá không giám sát: Nhìn thấy những gì mô hình nhìn thấy

Đôi khi bạn không có vị trí truy vấn hoặc nhãn tham chiếu. Bạn chỉ muốn hiểu cấu trúc nào tồn tại trong các vectơ nhúng. Phân tích thành phần chính (PCA) là một cách gọn gàng để làm điều này: giảm xuống ba chiều, ánh xạ sang R/G/B và hiển thị dưới dạng hình ảnh màu giả. Các vectơ nhúng tương tự sẽ tự động có màu sắc tương tự.

Flevoland, ở Hà Lan, là một cảnh quan lấn biển với lưới các thửa ruộng nông nghiệp đều đặn. Hình ảnh màu giả PCA tái tạo các ranh giới đó với độ trung thực cao. Các loại cây trồng, thủy vực và khu vực đô thị khác nhau đều có các sắc thái riêng biệt. Vectơ nhúng đã tự nội hóa cấu trúc cảnh quan mà không cần được chỉ dẫn thế nào là một thửa ruộng hay một loại cây trồng.

Kiểu xem không giám sát này là một cách nhanh chóng để thấy được cấu trúc mà mô hình đã nắm bắt được trên khu vực bạn quan tâm.

Từ xuất dữ liệu đến hiểu biết sâu sắc

Tìm kiếm sự tương đồng, phân đoạn ít mẫu, phát hiện thay đổi và khám phá bằng PCA là các thao tác đơn giản trên dữ liệu raster tiêu chuẩn và chỉ mất vài giây để chạy. Sức mạnh đến từ các vectơ nhúng: những biểu diễn đã học giúp nén dữ liệu quan sát Trái Đất thành các vectơ chứa đựng thông tin phong phú về từng vị trí từ nhiều cảm biến và hàng triệu ví dụ huấn luyện.

OlmoEarthDữ liệu nhúngAI địa lýHugging FacePhân tích dữ liệu
Đọc bài gốc

Bài viết được AI dịch và tổng hợp tự động từ Hugging Face: Blog. Liên kết bài gốc ở phía trên. Dữ liệu đồng bộ qua API công khai được ghi nguồn tại AI HOT (canonical) ↗. AIHOT.vn luôn dẫn nguồn đầy đủ — nếu bạn thấy điểm cần chỉnh sửa, hãy gửi ý kiến tại trang phản hồi.