{"as_of":"2026-08-09T02:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1e2ce9ed2e202c8a75ce96d6d00ceef9dfd2679c3867d664be08ff53aefebdc6","coverage":[{"denominator":299,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:38:55.619271Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-01T05:11:58.947649Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T10:45:42.279098Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"cited_work":{"arxiv_id":"2505.14361","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14361","snapshot_observed_at":"2026-07-01T10:45:42.279098Z","title":"arXiv preprint arXiv:2505.14361 , year=","venue":null,"work_id":"4cff9b26-75b2-474f-bbb3-7a8126bbb934","year":null},"citing_paper":{"arxiv_id":"2606.31976","last_updated":"2026-06-30T17:16:59Z","snapshot_observed_at":"2026-08-06T09:54:03.531912Z","submitted_at":"2026-06-30T17:16:59Z","title":"TreeAgent: A Generalizable Multi-Agent Framework for Automated Bias Labeling in Forestry via Compiled Expert Rules and Vision-Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-01T05:11:58.947649Z"},"links":{"cited_paper":"/paper/2505.14361","citing_paper":"/paper/2606.31976"},"observation_digest":"sha256:2e1f543f07241045c3b16068fc95bf6444b29c06edecd6b11277287dec23f08d","observation_id":"f489b34b-47d3-4a3c-8fb1-24e0b4a0f13a","resolution":{"observed_at":"2026-07-01T10:45:42.280738Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.14361/citation-record","integrity":"/paper/2505.14361/integrity","json":"/paper/2505.14361/citation-record.json","paper":"/paper/2505.14361"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:43.064939Z","title":"Rsgpt: A remote sensing vision language model and benchmark,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:43.064939Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:38cc99c4b826f352ccd6ff815744860f34fc81263b7bec6aeeb81b04f17540f1","observation_id":"3c13e333-f01a-4f75-a0a5-affae0186252","resolution":{"observed_at":"2026-08-07T15:38:43.064939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:43.156146Z","title":"Remoteclip: A vision language foundation model for remote sensing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:43.156146Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:8fff5b5962f4e2bfafbf668f95c03cdefc0e2fb56f5276bd268564fa7e627db9","observation_id":"4d061b49-c907-4ddc-8d88-e98eff39cea3","resolution":{"observed_at":"2026-08-07T15:38:43.156146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:43.283004Z","title":"Geochat: Grounded large vision-language model for remote sensing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:43.283004Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:ae22316bfced4f79f699d3489df4b0d0d6563f6f122396e083e3e6b086faa5fd","observation_id":"28528bda-18a9-4da0-9c19-e9106bba1398","resolution":{"observed_at":"2026-08-07T15:38:43.283004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:43.452270Z","title":"Remote sensing vision-language foundation models without annotations via ground remote alignment,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:43.452270Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:ea48647fb2a2fc72eba97307a889a5f1bc36b97cf76e9e6d10a404a143d043d0","observation_id":"7edb7424-6f49-4b1a-844d-b3c0ca45e78f","resolution":{"observed_at":"2026-08-07T15:38:43.452270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:43.608411Z","title":"Skyeyegpt: Unifying remote sens- ing vision-language tasks via instruction tuning with large language model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:43.608411Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:17fcdc4413793bb3cd934c4bccc25100e44c2ad84db3d7a2fbe4a3ed28c71eaf","observation_id":"80c7a8fa-64c7-4355-a09c-ba621b435a22","resolution":{"observed_at":"2026-08-07T15:38:43.608411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:43.778323Z","title":"Earthgpt: A universal multimodal large language model for multisensor image com- prehension in remote sensing domain,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:43.778323Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:e799af010081221d22036d2c5c241d8fe1490fe401f26041431223724fc7e1e1","observation_id":"8317d75c-4ee6-4c4c-aa23-a0b09e186326","resolution":{"observed_at":"2026-08-07T15:38:43.778323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:43.900412Z","title":"Rs5m and georsclip: A large scale vision-language dataset and a large vision-language model for remote sensing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:43.900412Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:1167a3432764cf40311ba34c737abf7875f2d92369817780d285c1e409164ada","observation_id":"9f968775-1c81-4dba-934d-ea48443625d5","resolution":{"observed_at":"2026-08-07T15:38:43.900412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:44.024239Z","title":"Skyscript: A large and semantically diverse vision-language dataset for remote sensing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:44.024239Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:2fdb5415f0824fc71cf5a7e61c59f73cfcb8258cdf5c6c5c99aa6605163bfe92","observation_id":"7991c0ca-874f-437a-bf88-f02088e1cb2d","resolution":{"observed_at":"2026-08-07T15:38:44.024239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:44.181611Z","title":"Lhrs-bot: Empowering remote sensing with vgi-enhanced large multimodal language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:44.181611Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:6882e378c86d9bceaeee3e3f38d08453c961e9b3b86a0026fe2da26aa2718646","observation_id":"85e592d4-8a4d-4a9b-8181-be5747a519a5","resolution":{"observed_at":"2026-08-07T15:38:44.181611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:44.289917Z","title":"Rs- llava: A large vision-language model for joint captioning and question answering in remote sensing imagery,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:44.289917Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:6d2db404a4e026a735176e2cd811dbd5a4b92535e7345f9d46ef3f61e2c8ed9d","observation_id":"6cf05be3-18b1-49f7-9990-60f465189842","resolution":{"observed_at":"2026-08-07T15:38:44.289917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10100","last_updated":"2024-07-08T04:33:37Z","snapshot_observed_at":"2026-07-06T18:31:04.425917Z","submitted_at":"2024-06-14T14:57:07Z","title":"SkySenseGPT: A Fine-Grained Instruction Tuning Dataset and Model for Remote Sensing Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10100","snapshot_observed_at":"2026-08-07T15:38:44.401424Z","title":"Skysensegpt: A fine-grained instruction tuning dataset and model for remote sensing vision-language understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:44.401424Z"},"links":{"cited_paper":"/paper/2406.10100","citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:461ec1612233b5d61dbc8ff0b14224a4d2204006bdc75890f4d4669ab46b9bfb","observation_id":"9ae29f85-5d1f-4171-9a1e-bd4620c1b678","resolution":{"observed_at":"2026-08-07T15:38:44.401424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:44.510141Z","title":"Vrsbench: A versatile vision- language benchmark dataset for remote sensing image understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:44.510141Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:d88be4443c2103978faf145b85eca78facdd59445c0efda9aae17980421a36c1","observation_id":"ff8d6127-e1ca-42d2-a67d-78004064ca42","resolution":{"observed_at":"2026-08-07T15:38:44.510141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:44.622345Z","title":"Changeclip: Remote sens- ing change detection with multimodal vision-language representation learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:44.622345Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:7dc94068165ee79f36a31d3935f06763299807b2c34e44e04870ee68e8baf578","observation_id":"7e6441a9-928e-4ed8-ab1a-d9411385a790","resolution":{"observed_at":"2026-08-07T15:38:44.622345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:44.787635Z","title":"Rs-clip: Zero shot remote sensing scene classification via contrastive vision-language supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:44.787635Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:fe3c49e45ad679bf736482cb0735e281f6478a910b572a2bb479bd151cdfffa2","observation_id":"21ec66ba-65ee-4a29-8c3a-e81b9062f7dc","resolution":{"observed_at":"2026-08-07T15:38:44.787635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09816","last_updated":"2025-07-18T11:42:52Z","snapshot_observed_at":"2026-07-06T17:30:29.731830Z","submitted_at":"2024-02-15T09:31:07Z","title":"Mind the Modality Gap: Towards a Remote Sensing Vision-Language Model via Cross-modal Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09816","snapshot_observed_at":"2026-08-07T15:38:44.914015Z","title":"Mind the modality gap: Towards a remote sensing vision-language model via cross-modal alignment,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:44.914015Z"},"links":{"cited_paper":"/paper/2402.09816","citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:882cab424a2a6f2e5b92c4eb0f7279e615a389663d53c99526e96199d59dd3aa","observation_id":"cb51dcff-43d7-4a42-8371-a7f4ee1c1383","resolution":{"observed_at":"2026-08-07T15:38:44.914015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:45.014750Z","title":"Towards vision-language geo-foundation model: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:45.014750Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:04a69b0bda8192da85088af7845ef9875b86237a44cccd44e464378ae0059bae","observation_id":"c5713cf3-7683-4486-8685-24b06828bc24","resolution":{"observed_at":"2026-08-07T15:38:45.014750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:45.170587Z","title":"Vision-language models in remote sensing: Current progress and future trends,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:45.170587Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:c42b38ed24e7fbc197ecda9e0d6aa9c1f0c9a5d78ce703532c1ddee9586999f5","observation_id":"58a77bdf-717b-4601-bf47-2ba6fece9281","resolution":{"observed_at":"2026-08-07T15:38:45.170587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:45.235768Z","title":"S-clip: Semi-supervised vision- language learning using few specialist captions,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:45.235768Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:360f86d1c45cdf62a214f8bd2c55fd34486f51e38aee6f546ce347979685a419","observation_id":"2ddba138-6449-4a73-a96c-46fe659847aa","resolution":{"observed_at":"2026-08-07T15:38:45.235768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:45.332966Z","title":"Multi-view feature fusion and visual prompt for remote sensing image captioning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:45.332966Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:65ae9977792d05d22f63a0574d73aa16a0179dc9291af50cb6097c664b470bed","observation_id":"962fc3d3-1b70-4987-8969-f0e56291152f","resolution":{"observed_at":"2026-08-07T15:38:45.332966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:45.468804Z","title":"Vision- language models for zero-shot classification of remote sensing images,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:45.468804Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:b7b58fe699b4b7e664282f8e4386245e93e51ad0203cd192bed935b33f457c9f","observation_id":"34fe4cf5-db90-46af-aa20-a628f1c79d1a","resolution":{"observed_at":"2026-08-07T15:38:45.468804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:45.646020Z","title":"Detecting cloud presence in satellite images using the rgb-based clip vision-language model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:45.646020Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:c897ead8ff5f14f49c2e1e0f05c8eba544cbe54f55afac852c50ade443624a81","observation_id":"4591f1d6-c747-4afb-a06f-509911022cc7","resolution":{"observed_at":"2026-08-07T15:38:45.646020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:45.809267Z","title":"Chatearthnet: a global- scale image-text dataset empowering vision-language geo-foundation models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:45.809267Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:c28b81cdbff1c93998b3d863dc6d9f55a898d4f4c3ac87f9b5bb847c5ac6a6a1","observation_id":"8fa01820-6df0-413f-8c19-17a775d5a98f","resolution":{"observed_at":"2026-08-07T15:38:45.809267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:45.933746Z","title":"Bi-modal transformer-based approach for visual question answering in remote sensing imagery,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:45.933746Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:54cd6431a580add597dd65516f47aff658f1e1d437da27bb5884993155d38853","observation_id":"9e13967b-f96d-4e1f-8a9b-3c50c95f9267","resolution":{"observed_at":"2026-08-07T15:38:45.933746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:46.052643Z","title":"Popeye: A unified visual-language model for multi-source ship detection from remote sensing imagery,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:46.052643Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:80dcc3003f18bcc54067c91e1382ba7b9187a8d1c4f918fcfd72d1f2187a1908","observation_id":"e010fd27-cd52-4b66-9022-b49a6f7b66c6","resolution":{"observed_at":"2026-08-07T15:38:46.052643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:46.198276Z","title":"Deep semantic-visual alignment for zero-shot remote sensing image scene classification,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:46.198276Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:5625e4878df37564c0b7c825f128b034baa1351bcb6a8788dde810e51cd0a42a","observation_id":"f5d64ec1-2d08-49b0-9e2b-c884b2e27c38","resolution":{"observed_at":"2026-08-07T15:38:46.198276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05766","last_updated":"2024-09-21T09:50:33Z","snapshot_observed_at":"2026-08-04T13:44:44.710592Z","submitted_at":"2024-06-09T12:41:14Z","title":"Set-CLIP: Exploring Aligned Semantic From Low-Alignment Multimodal Data Through A Distribution View","version":2},"cited_work":{"arxiv_id":"2406.05766","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.05766","snapshot_observed_at":"2026-08-07T15:39:23.060219Z","title":"Set-CLIP: Exploring Aligned Semantic From Low-Alignment Multimodal Data Through A Distribution View","venue":"cs.LG","work_id":"434f7b15-a933-4d1e-8a28-8372a5ffb18f","year":2024},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:46.336526Z"},"links":{"cited_paper":"/paper/2406.05766","citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:3c18e684cd7bb204bce6331546ec36d0eb425521a4c8f70c8ff78e2a895cfc01","observation_id":"50a34e47-9fbc-4ba5-b65b-6eb24e18de1f","resolution":{"observed_at":"2026-08-07T15:39:23.164372Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:46.502942Z","title":"Segment change model (scm) for unsupervised change detection in vhr remote sensing images: a case study of buildings,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:46.502942Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:ef449b48db903a30b46f043f232613c4b56592444618e7e6cd27392682d1931f","observation_id":"069b0439-49c8-441e-9d6e-9e43c7c134ad","resolution":{"observed_at":"2026-08-07T15:38:46.502942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:46.641308Z","title":"A new learning paradigm for foundation model-based remote-sensing change detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:46.641308Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:4c6e073e1cd2277f8c4b6971216b80d8045d8ab7a2b10f7cf99d1fc07e94a745","observation_id":"dc1962f1-fe34-4f97-86b0-e2b6d62e2dde","resolution":{"observed_at":"2026-08-07T15:38:46.641308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:46.750482Z","title":"Vlca: vision-language aligning model with cross-modal attention for bilingual remote sensing image captioning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:46.750482Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:42c69902228bab0e8ad51bdcb57eb8a68604567c4a0f9b9324ee82c2f8c782bb","observation_id":"2cc03d95-bcea-4853-aaac-ce83c706e8de","resolution":{"observed_at":"2026-08-07T15:38:46.750482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12479","last_updated":"2024-06-18T10:34:28Z","snapshot_observed_at":"2026-07-06T18:32:53.080027Z","submitted_at":"2024-06-18T10:34:28Z","title":"RS-GPT4V: A Unified Multimodal Instruction-Following Dataset for Remote Sensing Image Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12479","snapshot_observed_at":"2026-08-07T15:38:46.888234Z","title":"Rs-gpt4v: A unified multimodal instruction-following dataset for remote sensing image understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:46.888234Z"},"links":{"cited_paper":"/paper/2406.12479","citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:8b578c618ee77a884c3f03fdb076b3404cd1bc8f90fe28005567bf2034b96c95","observation_id":"1c232cf3-5270-4340-81cf-8ad1dd03c2ae","resolution":{"observed_at":"2026-08-07T15:38:46.888234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:47.040530Z","title":"Luojiahog: A hierarchy oriented geo-aware image caption dataset for remote sensing image–text retrieval,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:47.040530Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:c6d65ffda7d6e18107ccf2f0bf181c87cb74133684ef166fca0dff6853f17ef2","observation_id":"0ddae0ae-3251-4bcb-a412-0779d4648ae9","resolution":{"observed_at":"2026-08-07T15:38:47.040530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11619","last_updated":"2023-04-23T11:23:05Z","snapshot_observed_at":"2026-08-08T16:00:14.056110Z","submitted_at":"2023-04-23T11:23:05Z","title":"SATIN: A Multi-Task Metadataset for Classifying Satellite Imagery using Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11619","snapshot_observed_at":"2026-08-07T15:38:47.152096Z","title":"Satin: A multi-task meta- dataset for classifying satellite imagery using vision-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:47.152096Z"},"links":{"cited_paper":"/paper/2304.11619","citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:186a6c639653b70ee12fc8b314e3e237c49443279d08df70eda8903ffd50349a","observation_id":"2df3449b-f06b-4bfa-9f43-30aabb12c296","resolution":{"observed_at":"2026-08-07T15:38:47.152096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:47.311652Z","title":"Rsvg: Exploring data and models for visual grounding on remote sensing data,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:47.311652Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:86fc9ea62a0ee76d13062a4e9aa7383073c574165a7592286a986ca79380e5fd","observation_id":"5f9f3b49-df9d-41cb-84d2-ad5c436dd404","resolution":{"observed_at":"2026-08-07T15:38:47.311652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:47.462892Z","title":"Good at captioning bad at counting: Bench- marking gpt-4v on earth observation data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:47.462892Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:a6c849ab8d777fdab76779da704400f303df9e22cfa76f24f62dea0cf408c5c7","observation_id":"7fca31d7-7a71-41d2-8110-f68cd29bebeb","resolution":{"observed_at":"2026-08-07T15:38:47.462892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:47.610998Z","title":"Satclip: Global, general-purpose location embeddings with satellite imagery,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:47.610998Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:21e5454d0440a0a8fb0ae485bb23ebb17371488436f428e162c94cee2f0ecb63","observation_id":"240f4edb-64b2-4d99-8446-17152f569de6","resolution":{"observed_at":"2026-08-07T15:38:47.610998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:47.742008Z","title":"GeoCLIP: Clip-inspired alignment between locations and images for effective worldwide geo- localization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:47.742008Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:a1e737e165a92667cfee0b4dba312afc008ce027edf66363fe31eb99a79f490d","observation_id":"c9e19baa-94ff-4442-b24d-75d4b146fd5b","resolution":{"observed_at":"2026-08-07T15:38:47.742008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:47.857469Z","title":"Csp: Self-supervised contrastive spatial pre-training for geospatial-visual representations,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:47.857469Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:388ea39d6529bfebb94e08e0899b9f040d5aabc25d55d7eb323530885229d496","observation_id":"b222e3fc-c3be-4be3-9492-1c3235c67cf6","resolution":{"observed_at":"2026-08-07T15:38:47.857469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:47.942387Z","title":"Diffusionsat: A generative foundation model for satellite imagery,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:47.942387Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:c72b29c78bdfc6642819eb606099f93675074baa484815cc7f42abfb2bfc361c","observation_id":"5d3d29a9-925a-4789-a9e6-abb55d56fc23","resolution":{"observed_at":"2026-08-07T15:38:47.942387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:48.144141Z","title":"Crs-diff: Controllable remote sensing image generation with diffusion model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:48.144141Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:10a96de4756c37befe1b64031b602143e63781ff8052f7efccd3163ac68704ec","observation_id":"d0624a66-64f5-40d7-a41d-597b684d9ab1","resolution":{"observed_at":"2026-08-07T15:38:48.144141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:48.276207Z","title":"Practical techniques for vision- language segmentation model in remote sensing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:48.276207Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:294c6ed096b1fd276e559cc4dad994f40346b87d959eab6a6cf2dc03860280c6","observation_id":"431fd769-708a-4b4e-a89a-6f1e0aa122f9","resolution":{"observed_at":"2026-08-07T15:38:48.276207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:48.421970Z","title":"Text2seg: Zero-shot remote sensing image semantic segmentation via text-guided visual foundation models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:48.421970Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:740c9a6f0c2bc1a73f9923320d79805d544621e0b84764c6b42fc560798e074a","observation_id":"023dc923-3566-4b26-b689-2de62c972118","resolution":{"observed_at":"2026-08-07T15:38:48.421970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:48.564888Z","title":"A decoupling paradigm with prompt learning for remote sensing image change captioning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:48.564888Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:5c604983c8ef4866d8751041548fb96b9abac206d1aa833967a0c36a63a1aad1","observation_id":"261f59c7-267d-4a7e-96e2-a68940a51f15","resolution":{"observed_at":"2026-08-07T15:38:48.564888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:48.738237Z","title":"Bootstrapping interactive image-text alignment for remote sensing image captioning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:48.738237Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:28afe55d0e91c55bff398f4e2b5f7d4da70b86197c146d1a9a7da8dddd69a7da","observation_id":"97d41679-a69e-41ca-81bb-4d27abffb58a","resolution":{"observed_at":"2026-08-07T15:38:48.738237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:48.945772Z","title":"Text- guided diverse image synthesis for long-tailed remote sensing object classification,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:48.945772Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:2a39dbff90cfcfbfab8aecc270be1ee0b47982ab64fdb361f11ca71402268316","observation_id":"92996c50-923f-42e7-8516-296d00d0c1d0","resolution":{"observed_at":"2026-08-07T15:38:48.945772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:49.158228Z","title":"Object detection in aerial images: A large-scale benchmark and challenges,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:49.158228Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:c451941573a98e971894dab1ef9a8fc2d5d7e6becf21f73c12a71d4f626673b0","observation_id":"16f4bd2c-0ffd-4064-b3b6-752a3595ac07","resolution":{"observed_at":"2026-08-07T15:38:49.158228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:49.305788Z","title":"InstructBLIP: Towards general-purpose vision-language models with instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:49.305788Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:6a74ae382df086d98765642a22354b918a1c89d517cbb7d95289939403fe424e","observation_id":"977c3415-671e-43ac-87f8-48948426a08b","resolution":{"observed_at":"2026-08-07T15:38:49.305788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:49.424549Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:49.424549Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:c2ff51d5009ec748643d4d6396ea2d1bd0bb13d4dfeb2c74ee22652d77966a5a","observation_id":"2865e876-251a-47f7-8822-0dba7d917d7c","resolution":{"observed_at":"2026-08-07T15:38:49.424549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:49.623916Z","title":"Learning to rank question answer pairs with holographic dual lstm architecture,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:49.623916Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:6dad1c1ae0888e4f34a396bb2a1859d9e062b56f25a644a8bfc987f7e1bd2e87","observation_id":"dd525767-374d-41b4-90ae-70d878c23db1","resolution":{"observed_at":"2026-08-07T15:38:49.623916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:49.777690Z","title":"Improved baselines with visual instruction tuning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:49.777690Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:a6bf6b22aa4254ec50b6eea415d3d2ae4ae2e1c8736b0c3fc2f418a1acbd5fa4","observation_id":"83d2cb6a-951f-4d5b-a5ad-3acb6ec24634","resolution":{"observed_at":"2026-08-07T15:38:49.777690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:49.897162Z","title":"Lora: Low-rank adaptation of large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:49.897162Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:bf5dcd2f7db4fa47fa8b1b412877b3936a577b2d7ebdc4d07876fb38e3295698","observation_id":"9c5386c5-479e-4fd6-b4ee-5584bb0148ef","resolution":{"observed_at":"2026-08-07T15:38:49.897162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:49.957361Z","title":"Object detection in optical remote sensing images: A survey and a new benchmark,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:49.957361Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:2fd71dd224e28da424d011c3da0febdb04a30ff41ce933193f2476ca04702c5e","observation_id":"e2d88973-a7c8-495d-926d-da6955896f03","resolution":{"observed_at":"2026-08-07T15:38:49.957361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:50.035586Z","title":"Fair1m: A benchmark dataset for fine-grained object recognition in high-resolution remote sensing imagery,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:50.035586Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:8a6ba985965ede763fe68c09ab5030c6ed003b20b92b67e7297f2ba7ddf293b3","observation_id":"c585a361-a717-4c94-a5f9-7885947955af","resolution":{"observed_at":"2026-08-07T15:38:50.035586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:50.099116Z","title":"Remote sensing image scene classifi- cation: Benchmark and state of the art,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:50.099116Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:ff32f3cf37b8150212e44ed3254903ace1ab65adc1b6c6c52f26c8c09e36e9ab","observation_id":"1929c793-e415-4b4d-9a32-587ad25b5520","resolution":{"observed_at":"2026-08-07T15:38:50.099116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:50.178928Z","title":"Rsvqa: Visual question answering for remote sensing data,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:50.178928Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:f63bbe3e5da0c85c44a76c1590d74e6dfbea7abfa9227a23ae8578e817b19628","observation_id":"0a3af32e-b7a6-4bd1-a80a-7a6cdc3a5518","resolution":{"observed_at":"2026-08-07T15:38:50.178928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:50.251075Z","title":"Floodnet: A high resolution aerial imagery dataset for post flood scene understanding,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:50.251075Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:b413245ab38063324bd045cf8171ebaf3bc076dd11c7206f65ed19b32ab9fab9","observation_id":"7dc08abe-90cb-4c6b-b0d0-77e74f7a23d9","resolution":{"observed_at":"2026-08-07T15:38:50.251075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:50.331731Z","title":"Eva: Exploring the limits of masked visual representation learning at scale,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:50.331731Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:5014c34c185b0b7423aec45e8b50e9036fd5465251a5c47fb10876b497cc96ed","observation_id":"5500eab6-e1e9-4c38-9631-29edbf09d0df","resolution":{"observed_at":"2026-08-07T15:38:50.331731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T15:38:50.389463Z","title":"Llama 2: Open foundation and fine-tuned chat models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:50.389463Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:6ab81c480860590277bdba5634962eb88bb1463f2befb46ebe9e245565fb07e3","observation_id":"1c4f9e10-9e25-444d-86ff-83b58f8829a4","resolution":{"observed_at":"2026-08-07T15:38:50.389463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T15:38:50.452910Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:50.452910Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:2740e10e464c3cce223bf482326a30299940cad19f24e7ea262bd9251c3867dc","observation_id":"d4b0ffc7-3a98-4cb9-96ee-0dd05d2b16e0","resolution":{"observed_at":"2026-08-07T15:38:50.452910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-06T12:38:03.720232Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-07T15:38:50.540598Z","title":"Minigpt-v2: large language model as a unified interface for vision-language multi-task learning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:50.540598Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:6315cca09861681db2ae826e033d5519706a685368ce5abb9e90b92474584d68","observation_id":"c88bc01b-3d2c-4893-8763-3df3bf9063a1","resolution":{"observed_at":"2026-08-07T15:38:50.540598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:50.620624Z","title":"Exploring models and data for remote sensing image caption generation,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:50.620624Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:7135fb66583031359791c88d405466661056b43e83c397223e97766f42fb6da0","observation_id":"31a8632f-e268-4e83-93ab-9ab05bc6b133","resolution":{"observed_at":"2026-08-07T15:38:50.620624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:50.727487Z","title":"Exploring a fine-grained multiscale method for cross-modal remote sensing image retrieval,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:50.727487Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:7a304494cf0268a041315fdb318eb2e4ec0e2c7292e1bad0af95778df44862c4","observation_id":"1440f466-6029-4b44-b24c-01920da4a6d2","resolution":{"observed_at":"2026-08-07T15:38:50.727487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:50.886595Z","title":"Deep semantic understanding of high resolution remote sensing image,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:50.886595Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:47edbd56e0a6d9029e28268f7c103c591e2db157d4612416a0ab782b1269d292","observation_id":"89e8dec0-2306-41a3-8e16-e1017e737596","resolution":{"observed_at":"2026-08-07T15:38:50.886595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:51.023865Z","title":"Nwpu- captions dataset and mlca-net for remote sensing image captioning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:51.023865Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:d24ae55fc6cda317e84e97d134201f906ae18d94334095e67dee12e8cad99604","observation_id":"d18e7c63-ea7e-4c00-8f97-e88ef95621ac","resolution":{"observed_at":"2026-08-07T15:38:51.023865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:51.137450Z","title":"Capera: Captioning events in aerial videos,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:51.137450Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:660af77dd0bf54579b5a59a6f6e516b73a154fa05ea8ff5900b70830f100d221","observation_id":"7f3341c5-52cf-46e0-8ea0-0256fed5e53e","resolution":{"observed_at":"2026-08-07T15:38:51.137450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:51.255800Z","title":"Mutual attention inception network for remote sensing visual question answering,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:51.255800Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:a21f0ea06ed1e7931499855cc9bd3c2805bad2c5811be40e80528706d2f6e0ab","observation_id":"25f376d8-5c9c-435d-bc12-7a7ed19908a3","resolution":{"observed_at":"2026-08-07T15:38:51.255800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:51.389367Z","title":"Visual grounding in remote sensing images,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:51.389367Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:e64cc488536322e6d932d06f0a1dc860ad2e40ddc8e35d60a7111192f29ea366","observation_id":"b6989cdd-a7e0-46fe-a1e1-60f529be1bc9","resolution":{"observed_at":"2026-08-07T15:38:51.389367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:51.485572Z","title":"Dinov2: Learning robust visual features without supervision,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:51.485572Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:aab57d7252bc6e0fda9e083e9098ddf6f06891c9d42bc58caa3295df01df7377","observation_id":"a2e78898-96b9-4583-a0a5-d2aba730a934","resolution":{"observed_at":"2026-08-07T15:38:51.485572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:51.603773Z","title":"Multistep question-driven visual question answering for remote sensing,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:51.603773Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:bce081f12bd102ac3723ead7ea2a40ffd72142ed24ebd0cf10664e1cdf1556c8","observation_id":"9d34bc30-b6d2-4f1d-aebf-8a53983c8299","resolution":{"observed_at":"2026-08-07T15:38:51.603773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:51.743120Z","title":"Eurosat: A novel dataset and deep learning benchmark for land use and land cover classification,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:51.743120Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:eeff8f8b3403f178c9fbb0b7a9c18505e0f6c3920967c0442da417a3e9f4905c","observation_id":"ccf42811-0ac5-4cd3-8ef2-9250060d525c","resolution":{"observed_at":"2026-08-07T15:38:51.743120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:51.805151Z","title":"Bag-of-visual-words and spatial extensions for land-use classification,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:51.805151Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:f9b8488dc297206018ce7e0b7c70c5a977778faf78e700388dccdbb45fcd0c79","observation_id":"3ea23881-6c26-41c5-9df3-ad95e3888724","resolution":{"observed_at":"2026-08-07T15:38:51.805151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:51.888925Z","title":"Satellite image classification via two-layer sparse coding with biased image representation,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:51.888925Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:d3d2258aa2b87e7d2c531c09c0337181002857a0b1dc9186357c569867a5b211","observation_id":"58fa19a6-1021-4da3-bed6-8d4e35b57de7","resolution":{"observed_at":"2026-08-07T15:38:51.888925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:52.018569Z","title":"Deep learning based feature selection for remote sensing scene classification,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:52.018569Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:77b833ad9d146447435dafdcc879b4482c28e3df17cb09a173c23434a2e8d874","observation_id":"7c38ff30-6b01-4a80-b7e1-d6e732b0cb26","resolution":{"observed_at":"2026-08-07T15:38:52.018569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:52.137785Z","title":"A public dataset for ship classification in remote sensing images,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:52.137785Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:5c13cd2cf397d13488cef8e3c7c177d022fcce463df7b3c0839ce6262d880116","observation_id":"10335210-ebb5-4d98-9f17-e7c17fa4500d","resolution":{"observed_at":"2026-08-07T15:38:52.137785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:52.252457Z","title":"A public dataset for fine-grained ship classification in optical remote sensing images,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:52.252457Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:27de71b415aa9318321768a36b74807ab37a420031e7da76a5eff8cc6ec2d3b0","observation_id":"feb5e806-9622-4061-ad42-36407c2f244d","resolution":{"observed_at":"2026-08-07T15:38:52.252457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:52.381176Z","title":"Rotation-insensitive and context- augmented object detection in remote sensing images,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:52.381176Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:3863a1424d0f2a8322ca0193dd36e34260803351bdb53dc44befcd892ba5141a","observation_id":"0d191b95-75dc-4fbe-845b-24ce179a9a42","resolution":{"observed_at":"2026-08-07T15:38:52.381176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:52.474659Z","title":"Hierarchical and robust convolutional neural network for very high-resolution remote sensing object detection,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:52.474659Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:30f448fec1cd0eee15f16ed9600f9aeca3348823a5b0767357f1865ca142dbdc","observation_id":"987be9d5-082a-450f-a7de-9a3295fa2199","resolution":{"observed_at":"2026-08-07T15:38:52.474659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:52.600351Z","title":"Orientation robust object detection in aerial images using deep convolutional neural network,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:52.600351Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:85f919a4b9a0d053fac6ef28e7beb615a5cef99b06733796cf97e70f0c51348b","observation_id":"38664c2c-4e0d-44bc-bc9f-1bfaab473bec","resolution":{"observed_at":"2026-08-07T15:38:52.600351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:52.772576Z","title":"Detection and tracking meet drones challenge,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:52.772576Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:e18bf4d9d69ec9283d90c2253bc87ce2b5eb23f0799959f9cac5c2d13b8da0a1","observation_id":"81d5eaa9-da89-4d24-89c5-e57d9c5408c1","resolution":{"observed_at":"2026-08-07T15:38:52.772576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:52.902513Z","title":"Sar ship detection dataset (ssdd): Official release and comprehensive data analysis,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:52.902513Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:3f3291833f623414b7cd476b52812a1a11b3ed1669e737ba53e11c2a6d26710d","observation_id":"d30c5c91-1183-494a-82a4-8f749811cec9","resolution":{"observed_at":"2026-08-07T15:38:52.902513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:53.061271Z","title":"Hit-uav: A high-altitude infrared thermal dataset for unmanned aerial vehicle- based object detection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:53.061271Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:42e24b38458dc3e773e0b2db59e012e87cd0fc64dbdaf76879689616c0fb5fc3","observation_id":"d759d29c-a0ae-45d9-881c-8c582e48f16b","resolution":{"observed_at":"2026-08-07T15:38:53.061271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:53.201727Z","title":"Sea-shipping,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:53.201727Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:6693eb905944a762fd1ffa8686b40ae1d63bc16c3c07eb101c87ae3eb6132810","observation_id":"208bc1da-2418-4272-9cf4-39f93be24714","resolution":{"observed_at":"2026-08-07T15:38:53.201727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:53.334467Z","title":"Infrared-security,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:53.334467Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:07f684aa912b4870ea85585c30d6101c2d56cf52afab5c1e430cec04b9d6a009","observation_id":"799f5ea0-37b9-4163-8f3e-e1e650e6c49d","resolution":{"observed_at":"2026-08-07T15:38:53.334467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:53.458005Z","title":"Aerial-mancar,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:53.458005Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:586f7cb798950e6c1392f4d6f3bb4c94b69f029f6e4c61593a9ee9eb0eb216b3","observation_id":"22d82886-fbba-4fa1-aa18-76e1ab140edd","resolution":{"observed_at":"2026-08-07T15:38:53.458005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:53.615236Z","title":"Double-light-vehicle,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:53.615236Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:deb4d0399dc52c53747913b674efb67a543724a41a96643b5362cd3ea0016a4d","observation_id":"934f876c-0fa5-459f-9829-7b47cf2efbb0","resolution":{"observed_at":"2026-08-07T15:38:53.615236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:53.767902Z","title":"Oceanic-ship,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:53.767902Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:93c5b5ea4f2309e7cec68570d038191df01d0af0cd7fffc708439325e154b441","observation_id":"c9252e02-6cb8-4857-a81d-dabf6f28d5f6","resolution":{"observed_at":"2026-08-07T15:38:53.767902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:53.856194Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:53.856194Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:dc572a202f385c57b958ed3f631bec331b95660eedf233972a2da74711c55f3f","observation_id":"bd39e153-1de2-4451-b5bf-85dd1427fe7e","resolution":{"observed_at":"2026-08-07T15:38:53.856194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:53.940975Z","title":"A novel svm-based decoder for remote sensing image captioning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:53.940975Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:9a64fa25a89843c161ee8dcdc7cb9db9e98623a5676cc6daa0706a8e487bed67","observation_id":"8d669b70-2684-4702-98cd-2f6004dbf9cc","resolution":{"observed_at":"2026-08-07T15:38:53.940975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:54.042866Z","title":"Star: A first- ever dataset and a large-scale benchmark for scene graph generation in large-size satellite imagery,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:54.042866Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:7365bb64a53dc7c5584c88832de4f1c6b681e0521b7af5a350f237384b401eb3","observation_id":"f94161d5-5c71-4a9e-a1f3-0b29eebc6008","resolution":{"observed_at":"2026-08-07T15:38:54.042866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:54.193358Z","title":"Fine-grained recognition for oriented ship against complex scenes in optical remote sensing images,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:54.193358Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:804b69e34c4cefec89283e95cbc1549c94f7a2b699cbac84a35c8f43c6922fe5","observation_id":"0f6ab84d-fb29-4562-8e98-555a0e36d4b6","resolution":{"observed_at":"2026-08-07T15:38:54.193358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:54.375287Z","title":"Hrsid: A high-resolution sar images dataset for ship detection and instance segmentation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:54.375287Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:194fe8a6f5ceb15aeae5a02ff76d5c65e6d23a4e1eb2a92db0afe14f0d1b32e0","observation_id":"12e4f184-fb94-4dd7-a226-7c059ac8fdb4","resolution":{"observed_at":"2026-08-07T15:38:54.375287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:54.541073Z","title":"Deepsat: a learning framework for satellite imagery,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:54.541073Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:d0076f3b9adc0b1528a4d28ad2f8b7d8553090f018d0dbd71f60f83040e58b8d","observation_id":"9767e98b-45c8-4f16-bb92-16656e945f49","resolution":{"observed_at":"2026-08-07T15:38:54.541073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:54.677808Z","title":"Nasc-tg2: Natural scene classification with tiangong-2 remotely sensed imagery,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:54.677808Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:c2ce2c55169e0974a9eef388a8053c24b255ea0ebd1f9f0f6594465d35e86c64","observation_id":"092404e3-5ee1-4800-9439-a696adec9209","resolution":{"observed_at":"2026-08-07T15:38:54.677808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:54.847291Z","title":"Feature significance-based multibag- of-visual-words model for remote sensing image scene classification,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:54.847291Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:080a3d940abef4dd0fe68cea877e2aa0b17d3463028aa1f2467bb08639e50f99","observation_id":"24ddc95e-49e5-4702-afdd-33cfdf9e1ce2","resolution":{"observed_at":"2026-08-07T15:38:54.847291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:54.995650Z","title":"Dirichlet-derived multiple topic scene classification model for high spatial resolution remote sensing imagery,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:54.995650Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:1f5bd677d98245bd4047205fcd64b66f192e52cf6638b7541241106116a213e3","observation_id":"6b49a768-8919-4179-afc5-6c7c478e92c9","resolution":{"observed_at":"2026-08-07T15:38:54.995650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:55.164443Z","title":"Patternnet: A benchmark dataset for performance evaluation of remote sensing image retrieval,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:55.164443Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:2d8dee69088921d3a505dbfb8141cf2693ef874d0c25d4bf97f962bbf1b6482c","observation_id":"25deeedd-14ab-498b-a3d1-7a4f4784a03f","resolution":{"observed_at":"2026-08-07T15:38:55.164443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:55.256524Z","title":"Accurate object localization in remote sensing images based on convolutional neural networks,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:55.256524Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:c992ffbba3d7b3ed6a39ac8cb3d2caa3f08651644a2355c728bcefe842384970","observation_id":"3a7e90a7-a976-4e2f-ba1d-b185f8b532f6","resolution":{"observed_at":"2026-08-07T15:38:55.256524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:55.326585Z","title":"Land-cover classification with high-resolution remote sensing images using transferable deep models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:55.326585Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:3de9c325294cb996ee3455fedac9bff26816780e1a042ee27128f6f2892c902f","observation_id":"d7d6f5c8-e6fa-446a-b1cc-fb89c5014327","resolution":{"observed_at":"2026-08-07T15:38:55.326585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:55.387112Z","title":"Scene classification with recurrent attention of vhr remote sensing images,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:55.387112Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:0174ff6d0d30c7b2abc24459cb2a1edde5d4c9a134553e1b9e3415f296ca52a4","observation_id":"101371cc-8551-4285-99eb-cec4523d8062","resolution":{"observed_at":"2026-08-07T15:38:55.387112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:55.503910Z","title":"Clrs: Continual learning benchmark for remote sensing image scene classification,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:55.503910Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:65bfc31fed80b5b681c45bffc7707ba001abbc76218d47066252bb6492813483","observation_id":"3e4482f4-aff9-45e9-b94c-ed82e06fa7af","resolution":{"observed_at":"2026-08-07T15:38:55.503910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:55.619271Z","title":"On creating benchmark dataset for aerial image interpreta- tion: Reviews, guidances, and million-aid,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:55.619271Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:f8fe8f695f5e098d085045aa4600f8182853a301f16e98bb170f2401a9237641","observation_id":"29b7051a-932f-48f1-8806-dfd06eb16a7c","resolution":{"observed_at":"2026-08-07T15:38:55.619271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T15:33:25.523386Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":99,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":299},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 100 of 299 outbound references and 1 inbound Pith citation observation for arXiv:2505.14361."}