Nền tảng OlmoEarth- Suy luận không gian địa lý ở quy mô hành tinh
Giới thiệu nền tảng OlmoEarth giúp thực hiện suy luận không gian địa lý ở quy mô hành tinh.
- 15 min read
Nền tảng OlmoEarth: Suy luận không gian địa lý ở quy mô hành tinh
🌍 Tìm hiểu thêm về Nền tảng OlmoEarth: https://allenai.org/olmoearth
Các mô hình OlmoEarth là dòng mô hình nền tảng quan sát Trái Đất của chúng tôi, được huấn luyện trước trên khoảng 10 terabyte dữ liệu vệ tinh đa phương thức. Các chính phủ, tổ chức phi chính phủ và các tổ chức định hướng sứ mệnh khác đang ứng dụng OlmoEarth vào các lĩnh vực như giám sát nạn phá rừng, an ninh lương thực và rủi ro cháy rừng.
Tại Ai2, chúng tôi biết cách huấn luyện và phát hành các mô hình mở mạnh mẽ. Đối với các tổ chức có đội ngũ kỹ thuật mạnh, một mô hình mở là tất cả những gì họ cần để bắt tay vào việc. Tuy nhiên, phần lớn các tổ chức trong lĩnh vực môi trường – những nơi có vị thế tốt nhất để ứng dụng các mô hình này – lại không có cơ sở hạ tầng hoặc đội ngũ kỹ thuật có khả năng quản lý toàn bộ vòng đời: gán nhãn dữ liệu, tinh chỉnh mô hình và chạy suy luận quy mô lớn. Chúng tôi đã dành hơn một thập kỷ để vận hành các nền tảng như Skylight và EarthRanger – những phần mềm mà người dùng trên toàn thế giới tin cậy mỗi ngày, vì vậy chúng phải hoạt động ổn định liên tục. Trải nghiệm đó đã dạy cho chúng tôi cách tạo ra tác động thực sự: chạy mô hình một cách hiệu quả về mặt chi phí tại đúng thời điểm và địa điểm, giám sát hiệu suất, biến các đầu ra thô thành thông tin chi tiết có thể hành động, và xác minh rằng các đầu ra đó thúc đẩy được kết quả mà đối tác mong muốn.
Đó là lý do tại sao chúng tôi xây dựng Nền tảng OlmoEarth: cơ sở hạ tầng để đưa các mô hình không gian địa lý từ giai đoạn tinh chỉnh, đánh giá đến suy luận quy mô lớn.
Suy luận ở quy mô này đi kèm với những thách thức riêng. Hình ảnh vệ tinh phải được tìm kiếm và truy cập từ nhiều nhà cung cấp, được căn chỉnh theo các phép chiếu và độ phân giải, đồng thời được xử lý hiệu quả. Kết quả sau đó phải được ghép lại thành các bản đồ nhất quán về mặt địa lý, trong khi cơ sở hạ tầng phải tự động khôi phục từ các sự cố định tuyến thông thường của điện toán phân tán.
Hiện tại, nền tảng này có thể chạy suy luận trên các khu vực có quy mô bằng cả lục địa chỉ trong khoảng một ngày, xử lý hàng chục terabyte hình ảnh với chi phí chưa đến một xu cho mỗi kilômét vuông. Quá trình phát triển nó đồng nghĩa với việc phải đối mặt với hàng loạt thách thức kỹ thuật mà những ai làm việc về hệ thống không gian địa lý quy mô lớn cũng sẽ gặp phải. Bài viết này sẽ đi qua những thách thức đó và các giải pháp chúng tôi đã đúc kết được.
Bản đồ rủi ro cháy rừng gần đây được tạo trên Nền tảng OlmoEarth, kèm theo các số liệu thống kê.
Tại sao suy luận vệ tinh lại thách thức?
Hầu hết các mô hình học máy (ML) nhận vào một vài megabyte dữ liệu và tạo ra kết quả trong vòng chưa đầy một giây — hãy nghĩ đến LLM xử lý một đoạn văn bản hoặc mô hình thị giác máy tính phân tích ảnh chụp từ điện thoại thông minh. Suy luận quan sát Trái Đất hoạt động ở một quy mô hoàn toàn khác — một tác vụ đơn lẻ tinh chỉnh mô hình nền tảng để đạt hiệu suất tối đa có thể di chuyển hàng terabyte dữ liệu và chạy trong nhiều giờ. Dữ liệu đầu vào có thể bao gồm nhiều dải quang phổ, loại cảm biến và mốc thời gian trên một khu vực địa lý rộng lớn. Chúng có thể đến từ một số nhà cung cấp, mỗi nơi sử dụng các phép chiếu và độ phân giải khác nhau, đồng thời có thể bao gồm các quan sát bị thiếu hoặc bị che khuất bởi mây. Bản thân kết quả đầu ra cũng là một bản đồ, do đó mọi dự đoán phải được căn chỉnh chính xác với cùng một phép chiếu và lưới tọa độ như các khu vực xung quanh.
Ngay cả việc thu thập dữ liệu cũng có thể là một thách thức lớn. Các tác vụ dự đoán thường tốn nhiều thời gian cho việc tải xuống và chuẩn bị hình ảnh hơn là chạy chính mô hình đó, điều này làm cho các luồng dữ liệu (data pipeline) hiệu quả trở nên cực kỳ quan trọng. Các luồng này phải xử lý I/O (nhập/xuất) khối lượng lớn đồng thời cung cấp khả năng tính toán cần thiết để chiếu lại (reproject) và lấy mẫu lại (resample) hình ảnh.
Phần cứng phù hợp cho tác vụ phù hợp
Vì việc thu thập và chuẩn bị dữ liệu thường chiếm phần lớn thời gian chạy của một tác vụ suy luận, nên việc giao công việc đó cho GPU sẽ khiến phần cứng đắt tiền nhất của hệ thống phải làm những nhiệm vụ phù hợp hơn với CPU. Do đó, chúng tôi chia mỗi tác vụ thành ba giai đoạn, mỗi giai đoạn tương ứng với một cấu hình phần cứng riêng biệt:
- Thu thập và tiền xử lý dữ liệu (CPU, I/O cao): Lấy, chiếu lại, căn chỉnh và chuẩn hóa hình ảnh, sau đó ghi lại ở định dạng được tối ưu hóa để tải nhanh trong quá trình suy luận.
- Suy luận (GPU): Chạy lệnh chuyển tiếp (forward pass) của mô hình và ghi các đầu ra được xử lý tối thiểu trực tiếp vào bộ nhớ.
- Hậu xử lý (CPU): Ghép các đầu ra theo từng cửa sổ (window) lại với nhau, áp dụng mặt nạ hoặc điều chỉnh tỷ lệ, và xuất chúng sang các định dạng thân thiện với người dùng như Zarr, GeoTIFF hoặc GeoJSON.
Nền tảng OlmoEarth phân phối các giai đoạn này trên nhiều máy móc trong khi vẫn giữ cho GPU hoạt động hết công suất. Các trình tải dữ liệu đa tiến trình liên tục cung cấp dữ liệu cho từng GPU, trong khi các đầu ra hoàn chỉnh được truyền trực tiếp đến bộ nhớ lưu trữ dạng khối (blob storage).
Một yêu cầu, hàng trăm worker và hàng nghìn tiến trình
OlmoEarth Run, lớp thực thi của nền tảng dành cho các tác vụ suy luận quy mô lớn, chia khu vực địa lý được bao phủ bởi mỗi tác vụ thành các phân vùng có kích thước phù hợp với từng phiên bản tính toán (worker), sau đó chia nhỏ các phân vùng đó thành các cửa sổ nhỏ hơn mà các mô hình OlmoEarth xử lý. Vì mỗi cửa sổ có thể được xử lý độc lập trong một lượt chuyển tiếp riêng biệt, công việc ở phần này của bản đồ không cần phải đợi phần khác.
Trong thực tế, một khu vực có kích thước bằng một bang có thể được chia thành khoảng một trăm phân vùng, trong khi một lần chạy quy mô lục địa có thể tạo ra hàng nghìn phân vùng. Các phân vùng liền kề chồng lên nhau một chút, và chúng tôi sẽ hòa giải khoảng chồng chéo đó khi các đầu ra được lắp ráp lại để không xuất hiện đường nối (seam) trên ảnh mẻ (raster) cuối cùng.
Vì các phân vùng độc lập với nhau, cùng một giai đoạn có thể chạy trên hàng nghìn phiên bản tính toán cùng một lúc. Gần đây, chúng tôi đã sử dụng phương pháp này để tạo bản đồ rủi ro cháy rừng bao phủ toàn bộ Bắc Mỹ. Vào thời điểm cao điểm, quá trình chạy đã sử dụng khoảng 19.600 CPU và 994 GPU song song, với thông lượng mạng vượt quá 168 GB/s. Mức độ song song hóa đó đã giảm ước tính 4.737 giờ tính toán tuần tự xuống còn khoảng 30,5 giờ thời gian thực tế (wall-clock time) — nhanh hơn gấp 155 lần.
Tuy nhiên, việc phân nhánh (fan-out) không phải là không có giới hạn. Quá nhiều worker sẽ chạm ngưỡng giới hạn của đám mây, vì vậy mức độ song song hóa là một nút điều chỉnh cho mỗi lần chạy, một trong số nhiều thông số mà chúng tôi có thể tinh chỉnh cho các tác vụ riêng lẻ. Độ phân giải đầu ra đánh đổi giữa thể tích dữ liệu, khả năng tính toán và độ chi tiết; kích thước mô hình đánh đổi thời gian GPU lấy độ chính xác; việc lưu trữ đệm (caching) hình ảnh thô đánh đổi dung lượng lưu trữ lấy tốc độ cho các lần chạy lặp lại trên cùng một khu vực. Cài đặt phù hợp phụ thuộc vào nhiệm vụ – và ngân sách – hiện tại.
Tìm kiếm và lấy các pixel phù hợp
Cho trước một vùng địa lý và khoảng thời gian, trước tiên nền tảng phải xác định những cảnh vệ tinh nào nên được đưa vào mô hình. Điều đó có nghĩa là xác định cái gì đã được chụp, ở đâu và khi nào trên các nhà cung cấp có danh mục, định dạng và độ trễ công bố khác nhau. Các tiêu chí lựa chọn cũng phụ thuộc vào nguồn: đối với hình ảnh quang học như Sentinel-2, chúng ta thường muốn các cảnh ít mây nhất có sẵn, trong khi đối với radar khẩu độ tổng hợp (SAR), các kênh phân cực có sẵn có thể quan trọng hơn.
Chúng tôi dựa vào các danh mục STAC công khai và các tiêu chuẩn mở bất cứ khi nào có thể. Nhưng một tác vụ suy luận lớn có thể tạo ra hàng nghìn truy vấn siêu dữ liệu (metadata) cùng một lúc — vượt xa khả năng xử lý đồng thời của các dịch vụ bên ngoài như API STAC của ESA hoặc Microsoft Planetary Computer.
Để tránh làm quá tải các dịch vụ đó, Nền tảng OlmoEarth duy trì chỉ mục siêu dữ liệu của riêng mình, được cập nhật khi có hình ảnh mới được công bố. Đối với các tập dữ liệu được lưu trữ thông qua AWS Open Data, chúng tôi nhận được thông báo SNS cho mỗi cảnh mới. Khi nhà cung cấp không cung cấp luồng thay đổi (change stream), chúng tôi sẽ thăm dò (poll) chỉ mục thượng nguồn của họ vài phút một lần. Do đó, các yêu cầu của chúng tôi tới các dịch vụ bên ngoài tuân theo nhịp độ ổn định của các ấn phẩm mới thay vì sự bùng nổ đột ngột do một tác vụ suy luận lớn tạo ra.
Mỗi mục trong chỉ mục lưu trữ siêu dữ liệu cảnh cùng với các con trỏ đến mọi vị trí có sẵn các pixel cơ sở. Tại thời điểm chạy, nền tảng chọn nguồn tốt nhất và thực hiện đọc theo cửa sổ (windowed reads) đối với các định dạng được tối ưu hóa cho đám mây như COG hoặc Zarr, chỉ truy xuất các byte cần thiết cho một phân vùng cho trước thay vì tải xuống toàn bộ cảnh.
Chỉ mục này cũng hỗ trợ các công cụ chú thích (annotation tools) của chúng tôi. Vì nó duy trì các con trỏ đến hình ảnh Sentinel-1, Sentinel-2, Landsat và NISAR ở các định dạng tối ưu hóa cho đám mây, chúng tôi có thể phục vụ các ô dữ liệu (tiles) từ bất kỳ cảnh nào được lập chỉ mục thông qua cùng một hệ thống đọc theo cửa sổ, mà không cần xây dựng một đường ống nạp dữ liệu riêng biệt.
Các nhà cung cấp làm cho quy trình làm việc này trở nên dễ dàng nhất có điểm chung là ba đặc điểm mà chúng tôi muốn khuyến nghị như các phương pháp hay nhất (best practices) để xuất bản dữ liệu quan sát Trái Đất: thông báo dựa trên hàng đợi khi có hình ảnh mới, lưu trữ trên các nền tảng đám mây lớn mà không có giới hạn tốc độ tùy chỉnh hoặc tắc nghẽn tính khả dụng, và các định dạng được tối ưu hóa cho đám mây hỗ trợ đọc theo dải (ranged reads).
Một truy vấn mẫu đối với chỉ mục hình ảnh vệ tinh OlmoEarth, tìm kiếm hình ảnh Sentinel-2 ít mây nhất ở San Francisco trong tuần đầu tiên của tháng Sáu. Dịch vụ trả về hình ảnh tốt nhất có sẵn cùng với con trỏ tới tệp GeoTIFF trong một Amazon S3 bucket.
Xử lý lỗi ở quy mô lớn
Nền tảng OlmoEarth được thiết kế để tự động khôi phục sau sự cố. Đối với mỗi tác vụ trong một giai đoạn và phân vùng địa lý, nó tự động cấp phát động một máy ảo chạy vùng chứa Docker trình chạy (runner). runner sẽ truy xuất các tham số tác vụ, thực hiện công việc, trả về kết quả và tắt. Bởi vì mọi tác vụ đều có khả năng lặp lại (reentrant) và bất biến (idempotent), các sự cố gián đoạn có thể được xử lý an toàn bằng cách chạy lại nó.
Ở quy mô này, lỗi là điều được dự tính trước: nhà cung cấp có thể chậm hoặc tạm thời không khả dụng; siêu dữ liệu có thể cho biết hình ảnh tồn tại ngay cả khi thiếu dải hoặc cửa sổ bắt buộc; độ phủ của mây có thể để lại quá ít quan sát khả dụng; hoặc một tác vụ có thể bị sập hoàn toàn. Nền tảng phản hồi bằng tính năng theo dõi tác vụ, tự động thử lại (retry), chuyển đổi dự phòng sang các nhà cung cấp thay thế khi có sẵn, và phân biệt rõ ràng giữa lỗi có thể thử lại và lỗi nghiêm trọng. Một quá trình giám sát riêng biệt sẽ phát hiện các runner bị treo hoặc dừng và khởi động lại các tác vụ của chúng.
Hướng đi tiếp theo
Lộ trình phát triển của chúng tôi được định hình bởi những khoảng trống mà các đối tác đã xác định và các khả năng họ cần nhất. Trong số các lĩnh vực chúng tôi đang làm việc:
- Chạy mô hình tự động: Lên lịch các tác vụ suy luận trước hoặc kích hoạt chúng bất cứ khi nào chỉ mục hình ảnh ghi lại một cảnh mới trên khu vực quan tâm.
- Phát hiện thay đổi và cảnh báo: Thông báo cho người dùng khi cảnh quan họ giám sát thay đổi, để các sự kiện như phá rừng hoặc lũ lụt nổi lên dưới dạng cảnh báo thay vì các ảnh mẻ (raster) mà ai đó phải tìm kiếm và kiểm tra thủ công.
- Các công cụ và giao diện dạng tác nhân (Agentic tools): Các tác nhân có thể hạ thấp rào cản khi sử dụng các mô hình không gian địa lý, từ việc quản lý dữ liệu và kỹ thuật đặc trưng (feature engineering) đến việc xác định cách cải thiện mô hình được tinh chỉnh. Chúng tôi muốn người dùng ở mọi cấp độ kỹ thuật có thể thực hiện công việc mà trước đây đòi hỏi một nhà nghiên cứu ML có kinh nghiệm.
- Mô hình nhanh hơn: Làm việc với nhóm nghiên cứu của chúng tôi về các kiến trúc hiệu quả hơn giúp giảm thời gian GPU cho mỗi cửa sổ.
- Nhiều phương thức hơn: Thêm các cảm biến vệ tinh mới và nguồn dữ liệu vào cả mô hình OlmoEarth và chỉ mục hình ảnh hỗ trợ chúng. Hiện tại, chúng tôi đang tập trung tích hợp dữ liệu thời tiết (ERA-5) và các vệ tinh cung cấp nhiều chi tiết hơn về các yếu tố môi trường.
- Embedding (Véc-tơ hóa): Phát triển một mô hình embedding chuyên dụng và tính toán trước embedding ở quy mô toàn cầu. Đối với nhiều tác vụ, việc chạy suy luận dựa trên các embedding đó có thể thay thế một lệnh chuyển tiếp toàn diện qua hình ảnh thô, giúp khối lượng công việc nhanh hơn đáng kể và ít tốn kém hơn. Việc tinh chỉnh và suy luận trực tiếp vẫn quan trọng để đạt hiệu suất tối đa trong các tác vụ khó, nhưng embedding có thể mở ra một phạm vi ứng dụng hiệu quả rộng lớn hơn nhiều.
- Chạy ở mọi nơi: OlmoEarth Run chỉ yêu cầu các máy ảo có khả năng chạy hình ảnh Docker và quyền truy cập vào bộ nhớ lưu trữ dạng khối. Hiện tại chúng tôi vận hành nó trên Google Cloud, nhưng kiến trúc được thiết kế để hỗ trợ nhiều nền tảng đám mây và việc triển khai trong chính tài khoản và môi trường tính toán của đối tác.
Đây chỉ là khởi đầu. Các mô hình nền tảng không gian địa lý, và đặc biệt là việc đưa chúng vào vận hành, vẫn là một công nghệ mới nổi, và nhiều tổ chức có vị trí tốt nhất để sử dụng chúng – những người làm việc trong lĩnh vực bảo tồn, an ninh lương thực, ứng phó thảm họa và khí hậu – chưa bao giờ có quyền truy cập vào cơ sở hạ tầng như thế này. Khoảng cách giữa những gì các nhóm này cần hiểu về hành tinh và những gì ngân sách cũng như nguồn lực kỹ thuật của họ cho phép vẫn còn rất lớn.
Chúng tôi đang xây dựng OlmoEarth để giúp thu hẹp khoảng cách đó.
Link bài viết gốc
- Tags:
- Ai
- 28 Tháng 7, 2026
- Huggingface.co





