{"as_of":"2026-08-21T00:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:483e92a3b68c249e785e8971070fd700a5b8370778c87065822890e5a0966e76","coverage":[{"denominator":135,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T13:16:12.768793Z","state":"measured"},{"denominator":102,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":102,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T21:55:54.489563Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.10819","snapshot_observed_at":"2026-08-01T21:55:54.489563Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15942","last_updated":"2026-07-17T13:25:44Z","snapshot_observed_at":"2026-08-19T07:13:46.241480Z","submitted_at":"2026-07-17T13:25:44Z","title":"More with Less: a Large Scale Remote Sensing VLM with a Simple Recipe","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T21:55:54.489563Z"},"links":{"cited_paper":"/paper/2606.10819","citing_paper":"/paper/2607.15942"},"observation_digest":"sha256:467bfd1b9dcaddcdea9a79f18fb1b0cc3c8a9de778fdab267e79a38d5d2656d7","observation_id":"749cae9a-5248-49b4-b0a8-0d7825edcbe6","resolution":{"observed_at":"2026-08-01T21:55:54.489563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.10819","snapshot_observed_at":"2026-08-01T10:21:05.350170Z","title":"arXiv preprint arXiv:2606.10819 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-19T00:57:05.891290Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":116,"source":"arxiv_source","source_observed_at":"2026-08-01T10:21:05.350170Z"},"links":{"cited_paper":"/paper/2606.10819","citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:c17b1861c3569a1f11b8d65a325dd6f8f8a1dec55cedbb53310540eef813361f","observation_id":"35ab4666-b714-4cca-9080-7412f5cbf9c0","resolution":{"observed_at":"2026-08-01T10:21:05.350170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.10819/citation-record","integrity":"/paper/2606.10819/integrity","json":"/paper/2606.10819/citation-record.json","paper":"/paper/2606.10819"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Integrating machine learning and remote sensing in disaster management: A decadal review of post-disaster building damage assessment,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:f99a9d5b5e6336045150851d5a2bf04b4eb92a94a8130be4fb12fc389b3a6633","observation_id":"61c2421a-76a6-468e-8f1b-61b3418734d5","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:d124018be97288ef52779a8aa5de5f5b4bdf42976215df5f11e9983424208906","observation_id":"ae3206bc-a732-4419-bec4-079157b02280","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Improved baselines with visual instruction tuning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:249259a6583d51210f111c48032c593f23886977ff305e4e1446a336273e79e6","observation_id":"c0328b76-33f5-4b4c-ae94-aa1096126ed9","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-20T15:31:01.041088Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":"2309.16609","doi":"10.48550/arxiv.2309.16609","metadata_source":"pith","pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen Technical Report","venue":"cs.CL","work_id":"bb1fd52f-6b2f-437c-9516-37bdf6eb9be8","year":2023},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:8070175e53563700cf13e64c70291d376e65c7878ee906e400966bc7e37f53c2","observation_id":"f7ddd9a2-01b3-47e1-878b-b75b1c4c6dfa","resolution":{"observed_at":"2026-07-03T05:27:40.018232Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-17T16:38:14.101106+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-17T16:38:14.101106+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":"2412.05271","doi":"10.48550/arxiv.2412.05271","metadata_source":"pith","pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","venue":"cs.CV","work_id":"ee70bdc8-4656-4849-ada7-ce42a2278d70","year":2024},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:f2b2d918ef38b77c95dda49190d921576a10fde65017c0f9d5177b9c246933b1","observation_id":"cb91f388-4649-4fff-91f9-38768110e73f","resolution":{"observed_at":"2026-07-03T05:27:39.999145Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Llava-onevision: Easy visual task transfer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:00b788066171a454e41860f309d4e355ab8e2727882cd5d013ddef98a448e31d","observation_id":"2700ba85-6b0f-4838-b5b0-80190af42d66","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Lisa: Reasoning segmentation via large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:4ed8c973c68da67f28864211bedeef62c3399c27eb5c29eb63e1d6d5bd67f226","observation_id":"b9e5e350-6a15-4c11-b1dc-120fea751b78","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Rsgpt: A remote sensing vision language model and benchmark,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:d0eddaab7e8ace848962a34fa5c44d7688a9ad5eb4d97b4f02544a0ff796170a","observation_id":"bc151fb7-dd8b-4cbd-9aa7-a0bbf247918d","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Geochat: Grounded large vision-language model for remote sensing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:80929602a5e09826211dd606366e0b295cd0add8a797ac8e4d487dc5dada469b","observation_id":"eb13db04-ebf6-4e14-a1f5-0ed1c503563c","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Earthgpt: A universal multimodal large language model for multisensor image comprehension in remote sensing domain,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:61bd4ed17f282ff31aaba00dc2f993b51a80797b1124495e140bd74e6c27a3e5","observation_id":"8b766f15-06e9-4411-9b94-047e78fe9d2d","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10100","last_updated":"2024-07-08T04:33:37Z","snapshot_observed_at":"2026-08-16T13:42:55.361342Z","submitted_at":"2024-06-14T14:57:07Z","title":"SkySenseGPT: A Fine-Grained Instruction Tuning Dataset and Model for Remote Sensing Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":"2406.10100","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.10100","snapshot_observed_at":"2026-07-03T09:47:59.545083Z","title":"Skysensegpt: A fine-grained in- struction tuning dataset and model for remote sensing vision- language understanding.arXiv preprint arXiv:2406.10100","venue":null,"work_id":"7e943dbe-53ff-448e-9058-3b37224aadbd","year":2024},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"cited_paper":"/paper/2406.10100","citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:c50b8d040ffe019032dfcdd2a01ce492f2102bf759fdecbda2e457b8781632d5","observation_id":"cb299905-9bb4-4fc5-a604-aad2fde7a52f","resolution":{"observed_at":"2026-07-03T05:27:40.010548Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.23332","last_updated":"2026-05-11T14:21:31Z","snapshot_observed_at":"2026-08-19T21:25:17.747950Z","submitted_at":"2025-11-28T16:40:08Z","title":"UniGeoSeg: Towards Unified Open-World Segmentation for Geospatial Scenes","version":3},"cited_work":{"arxiv_id":"2511.23332","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.23332","snapshot_observed_at":"2026-07-03T05:27:40.018151Z","title":"UniGeoSeg: Towards Unified Open-World Segmentation for Geospatial Scenes","venue":"cs.CV","work_id":"b951a0a4-4aa1-4345-b39b-7d503d14230a","year":2025},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"cited_paper":"/paper/2511.23332","citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:4b40d3b4eb9fc71fb173b885859f761a1439fd0f4b33e60a0d36a3dec7c7be53","observation_id":"9063c53a-44a3-4286-a89a-79a678e5368f","resolution":{"observed_at":"2026-07-03T05:27:40.019369Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Dynamicvl: Benchmarking multimodal large language models for dynamic city understanding,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:9318d706dc604786384780003613e662621111cd6b7584ee837396a56c389806","observation_id":"62007c59-2dc6-4cfa-a599-0659d1ac569d","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Earthdial: Turning multi- sensory earth observations to interactive dialogues,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:06ba4273921d7035dd95e3fb62aa5467fb6ac617963b60f04f60f8b464f81e8e","observation_id":"89b3dfa2-9fb7-4ff1-9bc6-91cf57d6e459","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Teochat: A large vision-language assistant for temporal earth observation data,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:9e198fcc96c93eb9e5a418d09ad8ce20cf88fb667ecfbe7eb5129fbb062aec10","observation_id":"64d568ec-2b13-4783-9591-362d206786a9","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Earthmarker: A visual prompting multimodal large language model for remote sensing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:5dc88597897a63e6d9b8408438e79dc6a22199f010c657a9f4e070af2ae7fc6f","observation_id":"ea0b91ed-ed0f-406d-ad16-20d0f6b5928d","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Earthgpt-x: A spatial mllm for multilevel multisource remote sensing imagery understanding with visual prompting,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:27b7e62532ef18b6e69f52b70e8e6046953b5e4b127196edca0e402522c10a27","observation_id":"6c1cbce1-940f-481b-ac84-c50054d3b6c7","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.22221","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T09:47:59.435106Z","title":"To- wards faithful reasoning in remote sensing: A perceptually- grounded geospatial chain-of-thought for vision-language models","venue":null,"work_id":"78eeb1a6-a0a6-459f-a097-bd99e5e75698","year":2025},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:6da37941a928721ab332d571e4730376ab63705313bb3e4eba11380ce3e09737","observation_id":"c45f65e4-f8c3-46db-9232-813c139e5f8f","resolution":{"observed_at":"2026-07-03T05:27:40.020811Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:45e74f806d68f9e6b5a2224d9d8b3ecd928d77f94b38d5ae86e8b101bcda96df","observation_id":"cf482700-4cb9-4ecd-83fb-50cdf33e7152","resolution":{"observed_at":"2026-07-03T05:27:39.980039Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:730edae38de6df423331c325677493f2c3afeb80ba6bb7b38b53b03909247fd0","observation_id":"34a50a51-187c-42a1-9e34-c249abee98ca","resolution":{"observed_at":"2026-07-03T05:27:39.977268Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:17.350515+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:17.350515+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:2906deb5abfc9bf947abdde98e936450a43410fa1b695981a718c0b5c9d7d443","observation_id":"550938c5-d5c0-43fe-80c1-0991e704292b","resolution":{"observed_at":"2026-07-03T05:27:39.984993Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Dota: A large-scale dataset for object detection in aerial images,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:bdf944fd80b96768641841f01f6e10d8d2846562f9547d544c4617eafb4bd223","observation_id":"7c6cf4af-a56b-4f27-94ee-78a87d9178ef","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Deep learning in remote sensing: A comprehensive review and list of resources,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:f3a8328b73cb8f4e87e887bf4de077e368684a50b1f12a70bfb0533038f2d0f9","observation_id":"da82097b-7c35-4a12-bb2d-ebe5a00c80ef","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Deep learning in remote sensing applications: A meta-analysis and review,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:8a1a1ff09e07a1b8b36cf9600efefa97b895c9ff442aaa289acd02dd263688ee","observation_id":"185e7c48-f0bf-43f0-883d-31272b43cbb9","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Deep learning meets sar: Concepts, models, pitfalls, and perspectives,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:0a54e88999bb777e82aacd16de06ce50fd0fcfb65f7d29c7547ede5b3656818e","observation_id":"3378c55e-0e5c-4e7c-8922-221170b07717","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Oriented r-cnn for object detec- tion,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:728e23651399b4b0be764ab2f71c4c9672cb98e117d091748f3cbb9faccacd1f","observation_id":"2d0d55b6-55f6-4bff-b14f-c9ae704c4dc6","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"A fusion encoder with multi-task guidance for cross-modal text–image retrieval in remote sensing,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:dd885ebe5867f4709a0e9344ffffce79ba02b5a1ee57ac197b7239b3cab39916","observation_id":"e0b79d4a-f76d-43f8-95ce-77ff89221936","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Skyeyegpt: Unifying remote sens- ing vision-language tasks via instruction tuning with large language model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:bd7604674ccf420f3f53a4bfebe6e82970b5a1064256369d9bdd3a964e951895","observation_id":"5a48025e-d5b2-4530-87b0-6271f0671910","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.01667","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T09:47:59.425017Z","title":"Earthmind: Towards multi-granular and multi- sensor earth observation with large multimodal models","venue":null,"work_id":"ac67b65e-e7c0-4fe5-bf00-c97d38125181","year":2025},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:e56667a4994d54c2120614f19ec6bf2b2ffeaa51d08ffe297455a46131e2e630","observation_id":"d0d61add-6c01-46ff-bf7d-bc2417b073f7","resolution":{"observed_at":"2026-07-03T05:27:40.014353Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Croma: Remote sensing represen- tations with contrastive radar-optical masked autoencoders,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:06accc6737686aa635d621f3aa8272b856520a96d5f849db097112144be32921","observation_id":"b13925dd-ccb5-4586-bd51-85cea018a7b3","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Skyscript: A large and se- mantically diverse vision-language dataset for remote sensing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:3762f761b9615dfdee222733ee89a67214d56ca1e58df820d28515b4164a2899","observation_id":"1c9d0a29-2a27-4c64-b971-69d0a5b5ffc8","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"A unified sequence interface for vision tasks,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:66d12a50e3e58563da34248f6fc6a9376ca8679d9ec8d14364c5ed00b1ea344c","observation_id":"1e0a5d94-4a79-488a-92f9-42e34410e2eb","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-08-13T14:42:26.982679Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":"2306.15195","doi":"10.48550/arxiv.2306.15195","metadata_source":"pith","pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","venue":"cs.CV","work_id":"44525076-312a-4259-b79c-134cd7eeb297","year":2023},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:11803a165ac77c13c28f2d1aa9ecc5acc3508252f731ad313ea75fb559cc77b0","observation_id":"e14e430e-ad27-499d-8c2b-b8a35350c2a2","resolution":{"observed_at":"2026-07-03T05:27:39.993432Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Ferret: Refer and ground anything anywhere at any granularity,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:cf8aed005d54138989e2493c063271e6168b97bd63091a7de74b40e97553cb25","observation_id":"147dedbb-8ab6-43b2-9df9-6abae3ca139f","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Polyformer: Referring image segmenta- tion as sequential polygon generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:bceda24b8466f40d44d0a4e39fc10cdec4d1c5ef10b3acfe97e52b3c6684377a","observation_id":"da488c63-6f7b-4f93-996c-d16c0fcf3c37","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.12798","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T05:27:40.003735Z","title":"arXiv preprint arXiv:2510.12798 (2025)","venue":null,"work_id":"18a07d47-4390-4092-9958-8b1fab5c7aad","year":2025},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:7443151b7ac391646468016edd083df9328cd0c149723d2e6558d67c947d188b","observation_id":"cdc23048-5d1a-45e4-8b51-4e68ef9d3b4e","resolution":{"observed_at":"2026-07-03T05:27:40.005182Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:0509272885ac7fd808345d1339aaba87fb0b1996cbb3076e022a4517fef69c4d","observation_id":"043b23fd-88f6-4213-89ab-c0c5f1e179a3","resolution":{"observed_at":"2026-07-03T05:27:40.009401Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Deepstack: Deeply stacking visual tokens is surprisingly simple and effective for lmms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:caba0fa8b86885ab006b6f62686d1eb897e34bd57322fd1907ebe6c786296c17","observation_id":"384c5871-8ff3-44ef-8ba1-b4b0a7f4a2b0","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-17T13:26:10.378579Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:80e3057fa74f7d1aff9b713d61d0b08c9fa4e50378a4a2bc33d67b8904aa0568","observation_id":"16f6c5af-73fc-4a25-88fd-37f351871d29","resolution":{"observed_at":"2026-07-03T05:27:40.004438Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"SARLANG-1M: A benchmark for vision-language modeling in SAR image understanding,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:0e99ed98ef11c2ff2f26a5f1a1ee8ed0073aff6426c66191cb08e785138a5d68","observation_id":"0c9983fb-41bb-4352-a56a-398e462e8e58","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Vrsbench: A versatile vision- language benchmark dataset for remote sensing image understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:f170283b51892b0b6bc8e1c1951910353dd7a9df1189f23c5564d91836d4db91","observation_id":"41237447-4c02-49c2-a294-728a5a7d21ab","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-17T09:56:52.502317Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":"2504.10479","doi":"10.48550/arxiv.2504.10479","metadata_source":"pith","pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","venue":"cs.CV","work_id":"fe8637aa-12bc-4434-8d36-9f57b5eebcbe","year":2025},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:7ff948690a4ef8cbc9187e6850336046a6a1072111e3c4152603c16239a338a6","observation_id":"ac6aee57-a544-4a70-95b3-dcc493b565a8","resolution":{"observed_at":"2026-07-03T05:27:39.974292Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Nwpu- captions dataset and mlca-net for remote sensing image captioning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:75972046a9a0f288380cc2892ed1aa0d8f8a6c66c9700848d98c96fb16a1473f","observation_id":"0becda63-0137-4133-9d41-43e38597a054","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Exploring models and data for remote sensing image caption generation,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:a0df38b7f6d01faf115f83f3c82be134ef1b80301149313624cc58e3791d0b92","observation_id":"05beb7f5-2f05-447c-b134-c6804228a679","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Remoteclip: A vision language foundation model for remote sensing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:df3ff07c34af8cd5efe6dc8f741e1d4d7a9408eb489a5b055b4b77f678aece7f","observation_id":"b4030087-21d5-4e29-bf01-547cac0a71cc","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-17T13:39:21.106573Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"cited_work":{"arxiv_id":"2507.16716","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.16716","snapshot_observed_at":"2026-07-03T05:27:39.981179Z","title":"Enhancing remote sensing vision-language models through mllm and llm-based high-quality image-text dataset generation","venue":null,"work_id":"afb15462-8637-4d13-bca1-3eaabc3ae9dd","year":2025},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"cited_paper":"/paper/2507.16716","citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:ac1e049bdd760d074ed2fd999864a9664d46b8b507711759e0aff3714e161ae2","observation_id":"845c2058-bf22-452e-9da9-5916dbfac331","resolution":{"observed_at":"2026-07-03T05:27:39.982689Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Towards natural language-guided drones: Geotext-1652 benchmark with spatial relation matching,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:583b81e34e6b82a504fd4c4b676caad78da3690cf1ecd1c404c4d5a17d02be93","observation_id":"fa49b788-2e9a-4752-a07a-45961509508b","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Accurate object localization in remote sensing images based on convolutional neural networks,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:7ac9d8033321043ce4e0fe0280444bd558bc3ee4526d7c222e218f6d74912507","observation_id":"9b71dd73-b8f4-4040-a84e-054d7b7cb8e2","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Object detection in optical remote sensing images: A survey and a new benchmark,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:874a97497cc70d8694b417360970efac73997be21c45cabe19c4f361cd951f53","observation_id":"6b0b17f1-988e-4ea7-945a-ad63b50e4335","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Whu-rs19 abzsl: An attribute-based dataset for remote sensing image understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:3aaafc48f15714ba23ecdbf285fff2fa335ab2c56fcdd8e9ce9ff80e7b6a4fb1","observation_id":"160f8fcd-98e0-468c-b528-48a737b9ac1d","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Xlrs-bench: Could your multimodal llms understand extremely large ultra-high-resolution remote sensing imagery?","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:73ed3b06de521f489d12ddb0a97027b1675a011cd938e99dc0a79074b3f58880","observation_id":"342b4eb9-e608-4a9d-93f4-87ff18560409","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Irgpt: Understanding real-world infrared image with bi-cross-modal curriculum on large-scale bench- mark,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:63e09b6b3524efca64d9408e9a1d15f2e16e837a70b24d6f7ccab26905fcf9f6","observation_id":"28e4181e-5cfd-4061-9966-709d6a7e8680","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.18743","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T05:27:40.014380Z","title":"Sar-text: A large-scale sar image-text dataset built with sar-narrator and progressive transfer learning","venue":null,"work_id":"d1aadaaa-dceb-49f5-b067-1f37336fda0c","year":2025},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:bb037ef290d2899a7be4c0fdb0751141937a97e4f276d1f191d70bcb469cd944","observation_id":"225d8e93-70de-4376-98f8-88bc29adb7c0","resolution":{"observed_at":"2026-07-03T05:27:40.015836Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Sarclip: A multimodal foundation framework for sar imagery via contrastive language-image pre-training,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:29f07fbaf775c3c6c4e8b7657c8045ffaf594e7b779bc2ef723cceead9d3ae9a","observation_id":"1bda4b8c-d87b-4441-8469-523ce2cf152d","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.08259","last_updated":"2021-04-25T04:11:55Z","snapshot_observed_at":"2026-08-16T18:38:53.578530Z","submitted_at":"2021-03-15T10:22:46Z","title":"The QXS-SAROPT Dataset for Deep Learning in SAR-Optical Data Fusion","version":2},"cited_work":{"arxiv_id":"2103.08259","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2103.08259","snapshot_observed_at":"2026-07-03T05:27:40.015402Z","title":"The qxs-saropt dataset for deep learning in sar-optical data fusion. arxiv 2021","venue":null,"work_id":"0a3d8f37-82ee-4ae8-91c0-b2e5b5a037eb","year":2021},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"cited_paper":"/paper/2103.08259","citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:e9e5332b4398f6d4da83bf333feb18deead2309a4e9a6e924e267cdc109726f4","observation_id":"3ca92801-60bb-4127-af5f-b41cb8a51b7f","resolution":{"observed_at":"2026-07-03T05:27:40.016995Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01002","last_updated":"2025-02-03T02:51:30Z","snapshot_observed_at":"2026-08-19T19:34:59.128680Z","submitted_at":"2025-02-03T02:51:30Z","title":"Multi-Resolution SAR and Optical Remote Sensing Image Registration Methods: A Review, Datasets, and Future Perspectives","version":1},"cited_work":{"arxiv_id":"2502.01002","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.01002","snapshot_observed_at":"2026-07-03T09:47:59.512399Z","title":"Multi-resolution sar and optical remote sensing image registration methods: A review, datasets, and future perspectives","venue":null,"work_id":"0552c990-fc99-41ce-9a26-5996e768a75c","year":2025},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"cited_paper":"/paper/2502.01002","citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:a2d3735f51041f9aa64d0d382fd508bc8b122d67e81f1a860d03743361fa1b72","observation_id":"e93e0f83-a286-4a1f-8231-da3982026c1c","resolution":{"observed_at":"2026-07-03T05:27:39.982934Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Mgfnet: An mlp-dominated gated fusion network for semantic segmentation of high-resolution multi- modal remote sensing images,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:8ffae5460628ce60513f4f03e1c5ba9679bb77c4766d793d52d34caa423f5501","observation_id":"27d135cf-4f74-4fc1-b056-a236e681444a","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Chatearthnet: A global- scale image-text dataset empowering vision-language geo-foundation models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:3b6aaa489a5a03cd47eecea6b3babe692324996bc0189edc65e8e463d0d1ceee","observation_id":"e4e2b6e5-8448-466e-9460-174aedbc4d50","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Change-agent: Toward interactive comprehensive remote sensing change interpretation and analysis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:3a9eb349e158e506205fc8820ad8b5dcf15a1e8a921c1d7f4884c41493a5fa24","observation_id":"043b2528-fa58-40fc-bd68-c81a152b4678","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"A multitask network and two large-scale datasets for change detection and captioning in remote sensing images,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:e8b8b5dd5a0440b0977de0ad93031a0553566dbeb868cbf24ef9d38e582857db","observation_id":"8eea4fef-8fc7-42d4-801a-59a03879689d","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Asymmetric siamese networks for semantic change detection in aerial images,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:0f48f82aadf4d954e50f7b19c1dfe8edde2b3017e2fcd13b962161f8352051ba","observation_id":"b938c813-48d3-4f82-86ab-3f686ad5ae65","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"S2looking: A satellite side-looking dataset for building change detection,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:9e95437008769a790023bdd3f30d9fd775107a23847e143449f9a44fcdded4d0","observation_id":"8039f313-77cf-4309-a9ea-069c2bce5d31","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"A deeply supervised attention metric-based network and an open aerial image dataset for remote sensing change detection,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:6e5efde6cb44ea76e6e09898a737b8278ad2ad247037de46aa77429a1033c9ba","observation_id":"9b2a2fcb-6255-4315-97f7-16c5d19faa4e","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.03247","last_updated":"2020-12-28T01:47:48Z","snapshot_observed_at":"2026-08-16T19:07:43.935235Z","submitted_at":"2020-11-06T09:20:54Z","title":"Hi-UCD: A Large-scale Dataset for Urban Semantic Change Detection in Remote Sensing Imagery","version":7},"cited_work":{"arxiv_id":"2011.03247","doi":"10.48550/arxiv.2011.03247","metadata_source":"arxiv_reference","pith_arxiv_id":"2011.03247","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hi -UCD: A Large -scale Dataset for Urban Semantic Change Detection in Remote Sensing Imagery","venue":"arXiv (Cornell University)","work_id":"201cbe34-d703-4c84-9447-1ddb2413a313","year":2011},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"cited_paper":"/paper/2011.03247","citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:605cd02ba574da2ea2f38ed6e60a2ae33e56c9f06ec85c5b26c6b762c4584aa3","observation_id":"ad4b97cf-1b60-45ae-889a-650e46b73fd8","resolution":{"observed_at":"2026-07-03T05:27:40.013270Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Multi-temporal urban semantic understanding based on gf-2 remote sensing imagery: from tri-temporal datasets to multi-task mapping,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:78d86db248a0ca38dc64c49a9ccf76c32960a7160c5bfa5ca6d975f07757fd2b","observation_id":"ed0661b9-4443-4e76-8b3e-d5f8f4364a5d","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"TAMMs: Change understanding and forecasting in satellite image time series with temporal-aware multimodal models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:aa7896e8b094bc96af2112d213ffe356f3d554919a9e454d11cff5f09adc6417","observation_id":"7442181f-259f-49cd-8be2-d40861b12fee","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Rsvg: Exploring data and models for visual grounding on remote sensing data,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:94a95c4ceaa22e31504274966beaf869b44bf3bd444f720ae24b6397d1157139","observation_id":"5a10d295-dd62-40a7-ad73-5ecc47bdcbfd","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Language-guided progressive attention for visual grounding in remote sensing images,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:b53dbc47146c02e82d3b32a7855d42eaeecb72443feaf428b9c5cb141a0a38ad","observation_id":"12957a4b-5caa-4cda-bb74-a70881d136b1","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Language query- based transformer with multiscale cross-modal alignment for visual grounding on remote sensing images,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:ce8baef8225e4fe6b136862b558ff0e93e31ffdc4690e6154b08f04759d806af","observation_id":"08140ab8-60c0-4cd9-b096-8c523bebd470","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Vgrss: Datasets and models for visual grounding in remote sensing ship images,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:e11a2f1715fc3205503dc7668ee2869969d0e3934485e7c33ee7aa6ec72e70c3","observation_id":"7cc95d63-b629-47bd-8306-29655033a6f2","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.25654","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T05:27:39.927576Z","title":"Describeearth: Describe anything for remote sensing images,","venue":null,"work_id":"968911d9-eddb-413f-9416-82dd328a8bcf","year":2025},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:9dbf86ef25e272f4d56a7335d31a51cfe4db3c76a1040620780b59b31894019b","observation_id":"6ee5fce8-9ca9-45fd-9329-a698ec5f51ed","resolution":{"observed_at":"2026-07-03T05:27:39.929593Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Changechat: An interactive model for remote sensing change analysis via multimodal instruction tuning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:8c28f790bf5d0bcafa2f37e13aa0376c01aee1112a6ad8d0a60e2498dff3f0ee","observation_id":"17fe7c5f-a6d8-47d8-a75f-20470219a0cf","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Robust change captioning in remote sensing: Second-cc dataset and mmodalcc framework,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:9c678f8a031cbbb7b8de78bcd4e6beb39be5b1dbfdc9c0077c0ad7e9f07a7f01","observation_id":"469d222b-a6ff-4deb-a8bb-3e33d4dbb43e","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Rscc: A large-scale remote sensing change caption dataset for disaster events,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:09c8554aba162a249bce995c19ed37ed7b37d2a8c4854b7be953e652142b60de","observation_id":"7a1884da-022c-448b-b29e-8fee61e18ba5","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19552","last_updated":"2025-05-21T19:12:41Z","snapshot_observed_at":"2026-08-16T13:05:57.120510Z","submitted_at":"2024-10-25T13:26:32Z","title":"GeoLLaVA: Efficient Fine-Tuned Vision-Language Models for Temporal Change Detection in Remote Sensing","version":2},"cited_work":{"arxiv_id":"2410.19552","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.19552","snapshot_observed_at":"2026-07-03T05:27:40.000390Z","title":"Available: https://arxiv.org/abs/2410.19552","venue":null,"work_id":"30e9ae43-d80e-4a6c-9c94-269c906b3ef2","year":2024},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"cited_paper":"/paper/2410.19552","citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:bb4d0ce610e0538719bcdaf1a77d1be32108db2b89f12d87514ed94379964bdb","observation_id":"1c4c35a3-592e-479f-b4e3-23a7cf71ce3e","resolution":{"observed_at":"2026-07-03T05:27:40.002549Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Disasterm3: A remote sensing vision-language dataset for disaster damage assessment and response,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:69b1b91794038653878fd4255c6bf004acd8f4207b1e6cfab389bca4e26cba78","observation_id":"4a8bdac9-876b-49ea-9992-d41fec01f8dc","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Landsat30-au: A vision-language dataset for australian landsat imagery,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:d36222e3122baf275b8eba1a89092fee78f45c3f76c54ceadb954f8fe20cdbf0","observation_id":"3d997ef1-5db2-4beb-a884-086ce365054e","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Hit-uav: A high-altitude infrared thermal dataset for unmanned aerial vehicle- based object detection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:cca410f9b923e0048d371c4b51ac7f47c4e85a8205e8a2ad145ef2e64846b8fd","observation_id":"af81b12d-c168-4824-8e62-3c4f73fa346e","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Capera: Captioning events in aerial videos,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:3e4cafc85b4407b026cb09a2b16a032f4df92ff1b62fac29f6e903b09f5a48b9","observation_id":"660de365-24e5-43db-a537-e6afa645361a","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Satellite video multi- label scene classification with spatial and temporal feature cooperative encoding: A benchmark dataset and method,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:789ae2bc57842cdc79cf50e207adf6eba6dc3775fc4c7f1c7b2cfa86f270e755","observation_id":"53fccfd9-8cca-40ec-aad8-765f709a8517","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Satsot: A benchmark dataset for satellite video single object tracking,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:4642c657c7a4778e5ecd23ef5f85c8dd356a24cf3224815e92bbd2599dcf0d1c","observation_id":"9e87ab10-6d06-4964-ae24-6307409bf82c","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Rsvqa: Visual question answering for remote sensing data,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:463c401dcff6e07ef2890ae6dbdcc68d9a27b038684e62842bc1f92dbcec2d1d","observation_id":"b0d6573f-fb86-400a-a6ca-56622691f851","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Earthvqa: Towards queryable earth via relational reasoning-based remote sensing visual question answering,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:87f5f2746b6d925deec3712c9c05624a42fbae83197e88c32b5e809e2776a254","observation_id":"e91118f2-63e9-45ae-8548-3a45f0c55b45","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Floodnet: A high resolution aerial imagery dataset for post flood scene understanding,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:fc9758bf25c87c49b00c752a8592e8214f44f9c9afd9f43f13c74c49159c4506","observation_id":"5d62ae4e-545e-45fc-b379-d9f496837b87","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Rescuenet: A high resolution uav semantic segmentation dataset for natural disaster damage assessment,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:b4f69dbb4c3d56c881e858ed0580424587e2128c8affba092cecb571ed16dfe4","observation_id":"b60cd3b5-5ea8-4889-90df-fde77b1dc834","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Text-guided coarse-to-fine fusion network for robust remote sensing visual question answering,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:c29f2e9186ddc4a7c428b0ce55c5a2b91002ac6314dc7725b6f73370cdb9c59b","observation_id":"4c15f8f2-108c-44b4-9c5b-8b89779064ed","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Rsvlm-qa: A benchmark dataset for remote sensing vision language model-based question answering,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:db1fbef37470f35c23b965358ade03d61e3d9451e6bf88f13609b58cf66e3b72","observation_id":"138da699-a566-4adc-abd8-a6dcfd4f4d4d","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Geollava-8k: scaling remote-sensing multimodal large language models to 8k resolution,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:96fee1b06dcaf1b14d51c3ffeff05732b6add353d73e8ea0b06bbfebee0b7f70","observation_id":"a02167b1-08d5-48c7-9c9f-219c68dd1c7c","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12479","last_updated":"2024-06-18T10:34:28Z","snapshot_observed_at":"2026-08-18T21:58:26.310119Z","submitted_at":"2024-06-18T10:34:28Z","title":"RS-GPT4V: A Unified Multimodal Instruction-Following Dataset for Remote Sensing Image Understanding","version":1},"cited_work":{"arxiv_id":"2406.12479","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.12479","snapshot_observed_at":"2026-07-03T05:27:39.992089Z","title":"Rs- gpt4v: A unified multimodal instruction-following dataset 12 for remote sensing image understanding","venue":null,"work_id":"e23aa766-f3bd-40a6-8faf-ecb8d908172c","year":2024},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"cited_paper":"/paper/2406.12479","citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:39d8df71ce4eb2fcb13a3cdc2e09539a29fd862e6fd2f5abfc497cfaf4a31790","observation_id":"c3b7e2df-fb52-4088-8464-e9f1477270ee","resolution":{"observed_at":"2026-07-03T05:27:39.993530Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Vhm: Versatile and honest vision language model for remote sensing image analysis,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:19b6ee4008c3a3c09140741095419e0acca2c0448dfa2403d0a0d40b05121f11","observation_id":"f0dfc924-c55e-497e-aade-dfc3e47c7652","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.12267","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T05:27:39.989410Z","title":"Zoomearth: Active perception for ultra-high-resolution geospatial vision-language tasks","venue":null,"work_id":"ed2c8189-cc00-4577-95e4-d7c11193ad69","year":2025},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:47cbfe5554d3aa13a7376f4cdf943fb825ad1992cc1ec97e535aeaac5a89507a","observation_id":"ff166462-2c14-46cf-b153-8fdae89b8466","resolution":{"observed_at":"2026-07-03T05:27:39.991013Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"A large-scale image–text dataset benchmark for farmland segmentation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:d83f65476438d17852e940ada6baa685d5cfb192edb67189d471c4cab0502129","observation_id":"c9dc94ff-3c00-4479-a030-4a238371dc68","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Mme-realworld: Could your multimodal llm challenge high-resolution real-world scenarios that are difficult for humans?","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:26d95dd612fbdbbcc482023314b30e59aa59d7bcb33428359807fd17a3770750","observation_id":"7aa78dab-bbec-4d36-b768-7424e12dc0e8","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Geollama_instruct,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:52188a6cc7059663d5e3b1f1672ce663bc2bddb97b20853431bc120e2ac2454c","observation_id":"d25c2699-7a9e-478c-a6b7-4b3f65be9386","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Era: A data set and deep learning benchmark for event recognition in aerial videos [software and data sets],","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:89289a391ff364af9071fa52fb80b30ca27895e646e1904335abcbb813e6be2d","observation_id":"f0b0491b-a6c2-46b9-bd7b-61406ddf89d2","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Remote sensing image scene classifi- cation: Benchmark and state of the art,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:d30edfc4ac72c2f6d02cdf9b3a71c53607be5644b5c451eec41a4f3402e6a9bd","observation_id":"afe122e7-c635-4bf5-9d32-8a433fe2d21f","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Introducing eurosat: A novel dataset and deep learning benchmark for land use and land cover classification,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:ebfa06b194161b2025b45e102395cdfbea99da4fcefa0c3adc3107b68396fda7","observation_id":"4589dd7c-ea88-48b0-adc4-2be8b4cb7b98","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Patternnet: A benchmark dataset for performance evaluation of remote sensing image retrieval,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:a53aea25d586331c611a16d21176805359cd8c2141ca95bdfb2289c433afa2a5","observation_id":"1b42eb5f-8d99-4d35-afbf-a25d2ca53219","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T13:16:12.768793Z","title":"Functional map of the world,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:fa69c1a32e4ac1bb29a4440b7f21bf8f88b19cea937abb02318d887c1e7ab058","observation_id":"8aab2d03-ad24-4356-be81-e72a9418efb4","resolution":{"observed_at":"2026-06-27T13:16:12.768793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.07856","last_updated":"2018-02-22T00:26:46Z","snapshot_observed_at":"2026-08-14T19:43:30.523356Z","submitted_at":"2018-02-22T00:26:46Z","title":"xView: Objects in Context in Overhead Imagery","version":1},"cited_work":{"arxiv_id":"1802.07856","doi":"10.48550/arxiv.1802.07856","metadata_source":"pith","pith_arxiv_id":"1802.07856","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"xView: Objects in Context in Overhead Imagery","venue":"cs.CV","work_id":"68129a93-f9be-4e6c-b9b9-d3a4c258d2ed","year":2018},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"cited_paper":"/paper/1802.07856","citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:b1dfb060e382a14bba17bafaa257d347e26433a25fedc2f8e788219a33a2e9c4","observation_id":"5e0bd0fd-8b8f-460c-bb9f-a126269f2d7e","resolution":{"observed_at":"2026-07-03T05:27:40.011723Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T19:39:55.065170Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":76,"verified_exact":22,"verified_fuzzy":0},"total_outbound_references":135},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 100 of 135 outbound references and 2 inbound Pith citation observations for arXiv:2606.10819."}