{"as_of":"2026-08-07T06:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0a4994496f65cd15409d8060f9a747d22ae29c37c38d9d82bb8ec67081e3728c","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T20:58:23.547519Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T19:54:51.780848Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2510.22665","last_updated":"2026-05-15T05:24:29Z","snapshot_observed_at":"2026-07-06T22:34:08.878520Z","submitted_at":"2025-10-26T13:04:50Z","title":"SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery","version":3},"cited_work":{"arxiv_id":"2510.22665","doi":"10.48550/arxiv.2510.22665","metadata_source":"arxiv_reference","pith_arxiv_id":"2510.22665","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SARVLM: A vision language foundation model for semantic understanding and target recognition in SAR imagery","venue":"ArXiv.org","work_id":"69553902-4b4f-47db-b63d-b8dc1fed8c04","year":2025},"citing_paper":{"arxiv_id":"2605.10739","last_updated":"2026-05-11T15:42:09Z","snapshot_observed_at":"2026-07-06T23:22:37.355450Z","submitted_at":"2026-05-11T15:42:09Z","title":"Geospatial-Temporal Sensemaking of Remote Sensing Activity Detections with Multimodal Large Language Model","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-12T04:33:31.231685Z"},"links":{"cited_paper":"/paper/2510.22665","citing_paper":"/paper/2605.10739"},"observation_digest":"sha256:3466925006a6b3b6d0a2af91d847ce3cddb3b628dd9546a7757ae292451d98e8","observation_id":"03ed5731-6026-4e92-95f7-f5986f87b064","resolution":{"observed_at":"2026-05-20T00:00:26.580375Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.22665","last_updated":"2026-05-15T05:24:29Z","snapshot_observed_at":"2026-07-06T22:34:08.878520Z","submitted_at":"2025-10-26T13:04:50Z","title":"SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.22665","snapshot_observed_at":"2026-08-01T19:54:51.780848Z","title":"Sarclip: A vision language foundation model for semantic understanding and target recognition in sar imagery","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16819","last_updated":"2026-07-18T13:31:11Z","snapshot_observed_at":"2026-08-06T20:47:39.628471Z","submitted_at":"2026-07-18T13:31:11Z","title":"FUSAR-R1: A Large-Scale Reasoning Model for Intelligent Interpretation of SAR Images","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T19:54:51.780848Z"},"links":{"cited_paper":"/paper/2510.22665","citing_paper":"/paper/2607.16819"},"observation_digest":"sha256:4413e320bb8b9b7c482a07ebba668d8af442c9c4d418fa5ae780810a7937ee35","observation_id":"f1acadad-ad01-4719-b2d9-ac266179bb55","resolution":{"observed_at":"2026-08-01T19:54:51.780848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.22665","last_updated":"2026-05-15T05:24:29Z","snapshot_observed_at":"2026-07-06T22:34:08.878520Z","submitted_at":"2025-10-26T13:04:50Z","title":"SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.22665","snapshot_observed_at":"2026-08-01T10:27:20.420271Z","title":"arXivpreprint arXiv:2510.22665","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20238","last_updated":"2026-07-22T14:59:02Z","snapshot_observed_at":"2026-08-06T06:37:06.721096Z","submitted_at":"2026-07-22T14:59:02Z","title":"Not All Patches are Equal: Sampling Matters for Visible-Infrared Pre-Training","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-01T10:27:20.420271Z"},"links":{"cited_paper":"/paper/2510.22665","citing_paper":"/paper/2607.20238"},"observation_digest":"sha256:e1ff99dcc933c8190a6ee884ea5063d3fd81f348ce97c78a525c44d81af340b0","observation_id":"079263cd-40ce-46ee-95bf-fd2d8cb81b38","resolution":{"observed_at":"2026-08-01T10:27:20.420271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.22665","last_updated":"2026-05-15T05:24:29Z","snapshot_observed_at":"2026-07-06T22:34:08.878520Z","submitted_at":"2025-10-26T13:04:50Z","title":"SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.22665","snapshot_observed_at":"2026-08-01T03:22:09.867274Z","title":"Available: https://arxiv.org/abs/2510.22665","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23238","last_updated":"2026-07-25T14:51:05Z","snapshot_observed_at":"2026-08-06T20:47:38.707333Z","submitted_at":"2026-07-25T14:51:05Z","title":"SARATR-X-v2: Scale-Aware Structural Pre-Training for SAR Foundation Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-01T03:22:09.867274Z"},"links":{"cited_paper":"/paper/2510.22665","citing_paper":"/paper/2607.23238"},"observation_digest":"sha256:69e4f6e9a8965fe524602d53189c35ec3bd37e58c63efc597e0e636475c25557","observation_id":"1758c2eb-759e-4dc9-a6e1-48b025b2a09d","resolution":{"observed_at":"2026-08-01T03:22:09.867274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2510.22665/citation-record","integrity":"/paper/2510.22665/integrity","json":"/paper/2510.22665/citation-record.json","paper":"/paper/2510.22665"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The air force moving and stationary target recog- nition database.https://www.sdms.afrl.af.mil/ index.php?collection=mstar","venue":null,"work_id":"8f5e2415-7744-4caf-94d7-8afddabf353d","year":1995},"citing_paper":{"arxiv_id":"2510.22665","last_updated":"2026-05-15T05:24:29Z","snapshot_observed_at":"2026-07-06T22:34:08.878520Z","submitted_at":"2025-10-26T13:04:50Z","title":"SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-21T20:58:23.547519Z"},"links":{"citing_paper":"/paper/2510.22665"},"observation_digest":"sha256:34b2754ca3522cc4278a979849023110525ddd9836b74070b61a6aa66a209480","observation_id":"595db2c0-959c-44a1-abea-6405a5f34b89","resolution":{"observed_at":"2026-05-21T21:05:37.872598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Omnisat: Self-supervised modality fusion for earth observation","venue":null,"work_id":"7b7b76f1-648a-4edf-bd11-0f288c7fc209","year":2024},"citing_paper":{"arxiv_id":"2510.22665","last_updated":"2026-05-15T05:24:29Z","snapshot_observed_at":"2026-07-06T22:34:08.878520Z","submitted_at":"2025-10-26T13:04:50Z","title":"SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-21T20:58:23.547519Z"},"links":{"citing_paper":"/paper/2510.22665"},"observation_digest":"sha256:82ef4ff0d790460931fe54b9f4e45425bc90e9b3a912b54b7da7b5f78c740691","observation_id":"44c55f8d-fdc6-4ff6-bb60-28b03a4d53ec","resolution":{"observed_at":"2026-05-21T21:05:37.816405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Meteor: An automatic metric for mt evaluation with improved correlation with hu- man judgments","venue":null,"work_id":"08cbef10-1290-4af5-a5e2-af2a841ea069","year":2005},"citing_paper":{"arxiv_id":"2510.22665","last_updated":"2026-05-15T05:24:29Z","snapshot_observed_at":"2026-07-06T22:34:08.878520Z","submitted_at":"2025-10-26T13:04:50Z","title":"SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-21T20:58:23.547519Z"},"links":{"citing_paper":"/paper/2510.22665"},"observation_digest":"sha256:53813de050bdb0c23e40fcb91290f38d0ee66607823eb21016ca4a0b2601a7df","observation_id":"90f80383-8bc5-4e01-a173-dea580560bd1","resolution":{"observed_at":"2026-05-21T21:05:37.827043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tar- get classification using the deep convolutional networks for sar images.IEEE Transactions on Geoscience and Remote Sensing, 54(8):4806–4817","venue":null,"work_id":"3f83e26a-c52e-43ff-9108-5de680482b33","year":2016},"citing_paper":{"arxiv_id":"2510.22665","last_updated":"2026-05-15T05:24:29Z","snapshot_observed_at":"2026-07-06T22:34:08.878520Z","submitted_at":"2025-10-26T13:04:50Z","title":"SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-21T20:58:23.547519Z"},"links":{"citing_paper":"/paper/2510.22665"},"observation_digest":"sha256:46687e73f55eb0b24feb6151e6bdbd4a360dc0c5189a9c8bea5b1f35c05e91d2","observation_id":"58a55fca-f833-4229-8f61-fc741b4503ba","resolution":{"observed_at":"2026-05-21T21:05:37.829110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A simple framework for contrastive learn- ing of visual representations","venue":null,"work_id":"a98e08b4-3025-449c-a71c-a6e48a2aa1a3","year":2020},"citing_paper":{"arxiv_id":"2510.22665","last_updated":"2026-05-15T05:24:29Z","snapshot_observed_at":"2026-07-06T22:34:08.878520Z","submitted_at":"2025-10-26T13:04:50Z","title":"SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-21T20:58:23.547519Z"},"links":{"citing_paper":"/paper/2510.22665"},"observation_digest":"sha256:f8b48e146cd1d18cbf4af6130719c9e23cd6237dd14a5e2cf5513cc65d3e19ae","observation_id":"02c234b2-47f6-4807-b6d8-d157e0d94efd","resolution":{"observed_at":"2026-05-21T21:05:37.862654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reproducible scal- ing laws for contrastive language-image learning","venue":null,"work_id":"3d825d09-7b73-4857-8068-ae92acbffd66","year":2023},"citing_paper":{"arxiv_id":"2510.22665","last_updated":"2026-05-15T05:24:29Z","snapshot_observed_at":"2026-07-06T22:34:08.878520Z","submitted_at":"2025-10-26T13:04:50Z","title":"SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-21T20:58:23.547519Z"},"links":{"citing_paper":"/paper/2510.22665"},"observation_digest":"sha256:5415c613c339a6e7155916b300860ac673018b3c5c7721529d7017dcd08422b5","observation_id":"b93bb8c0-9c83-48e1-8c60-bc9e89c447e8","resolution":{"observed_at":"2026-05-21T21:05:37.797711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rouge: A package for automatic evaluation of summaries","venue":null,"work_id":"6c477ec4-f1e6-40b2-8afe-33d04a40c111","year":2004},"citing_paper":{"arxiv_id":"2510.22665","last_updated":"2026-05-15T05:24:29Z","snapshot_observed_at":"2026-07-06T22:34:08.878520Z","submitted_at":"2025-10-26T13:04:50Z","title":"SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-21T20:58:23.547519Z"},"links":{"citing_paper":"/paper/2510.22665"},"observation_digest":"sha256:71db5cc1c2d3dd6d640cdacb41b0dd785e9149fa7daa40ab586923589d5fc9ed","observation_id":"1d0303a7-12d8-4b37-9c56-62657eb06c75","resolution":{"observed_at":"2026-05-21T21:05:37.810059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Satmae: Pre-training transformers for tem- poral and multi-spectral satellite imagery.Advances in Neu- ral Information Processing Systems, 35:197–211","venue":null,"work_id":"edf1cc12-8e8c-4521-b1bb-77a538a37d80","year":2022},"citing_paper":{"arxiv_id":"2510.22665","last_updated":"2026-05-15T05:24:29Z","snapshot_observed_at":"2026-07-06T22:34:08.878520Z","submitted_at":"2025-10-26T13:04:50Z","title":"SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-21T20:58:23.547519Z"},"links":{"citing_paper":"/paper/2510.22665"},"observation_digest":"sha256:9759fbd373c44151abda5419e2a1c6b6b9f01bfdf1bc81177113a879cb77dc46","observation_id":"34660128-aa3e-4b8b-bae0-13d70febd330","resolution":{"observed_at":"2026-05-21T21:05:37.852174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hyperspectral and sar image classification via graph convolutional fusion network.IEEE Transactions on Geoscience and Remote Sensing","venue":null,"work_id":"fe42f556-46f4-4291-b1ed-922c6f7b4b16","year":2024},"citing_paper":{"arxiv_id":"2510.22665","last_updated":"2026-05-15T05:24:29Z","snapshot_observed_at":"2026-07-06T22:34:08.878520Z","submitted_at":"2025-10-26T13:04:50Z","title":"SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-21T20:58:23.547519Z"},"links":{"citing_paper":"/paper/2510.22665"},"observation_digest":"sha256:4eb4ea6c7347efcf5061dc49f2678501f825b550d970d26840cff583e7f17ebe","observation_id":"96e45adf-3e6a-49f8-a9f1-5cf87e548e3c","resolution":{"observed_at":"2026-05-21T21:05:37.848027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rethinking remote sensing clip: Lever- aging multimodal large language models for high-quality vision-language dataset","venue":null,"work_id":"12bb8435-5f83-4ce0-acaa-0dfd951c5d53","year":null},"citing_paper":{"arxiv_id":"2510.22665","last_updated":"2026-05-15T05:24:29Z","snapshot_observed_at":"2026-07-06T22:34:08.878520Z","submitted_at":"2025-10-26T13:04:50Z","title":"SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-21T20:58:23.547519Z"},"links":{"citing_paper":"/paper/2510.22665"},"observation_digest":"sha256:d8c3bd4da4a775e87d951af0006137b45faacb7dc510893d99c479dc285a1658","observation_id":"29f3c5cd-b0ad-4ca9-8043-01a8f16e06d2","resolution":{"observed_at":"2026-05-21T21:05:37.864751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-07T01:24:30.524241Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"cited_work":{"arxiv_id":"2507.16716","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.16716","snapshot_observed_at":"2026-07-03T05:27:39.981179Z","title":"Enhancing remote sensing vision-language models through mllm and llm-based high-quality image-text dataset generation","venue":null,"work_id":"afb15462-8637-4d13-bca1-3eaabc3ae9dd","year":2025},"citing_paper":{"arxiv_id":"2510.22665","last_updated":"2026-05-15T05:24:29Z","snapshot_observed_at":"2026-07-06T22:34:08.878520Z","submitted_at":"2025-10-26T13:04:50Z","title":"SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-21T20:58:23.547519Z"},"links":{"cited_paper":"/paper/2507.16716","citing_paper":"/paper/2510.22665"},"observation_digest":"sha256:1c078e3d10b1945f0c308ef1808ad13dc64c22321afa052c4a5a9823ca895db8","observation_id":"ad87c5ab-c97f-485a-bc60-f317710a0b24","resolution":{"observed_at":"2026-05-21T21:00:39.069199Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fusar-ship: Building a high-resolution sar-ais matchup dataset of gaofen-3 for ship detection and recog- nition.Science China Information Sciences, 63(4):140303","venue":null,"work_id":"e52bcb56-f48f-4fc3-8676-2b6c871b5c8e","year":null},"citing_paper":{"arxiv_id":"2510.22665","last_updated":"2026-05-15T05:24:29Z","snapshot_observed_at":"2026-07-06T22:34:08.878520Z","submitted_at":"2025-10-26T13:04:50Z","title":"SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-21T20:58:23.547519Z"},"links":{"citing_paper":"/paper/2510.22665"},"observation_digest":"sha256:353e4c1a8e181fb13ffe46dd7c0822818c0c4b7189ee2eadbfbf7151567d84ce","observation_id":"bb02fe89-e5da-41b1-890b-91f962c218ba","resolution":{"observed_at":"2026-05-21T21:05:37.860630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d91932d3-095b-47f4-813d-0089b11d8242","year":2022},"citing_paper":{"arxiv_id":"2510.22665","last_updated":"2026-05-15T05:24:29Z","snapshot_observed_at":"2026-07-06T22:34:08.878520Z","submitted_at":"2025-10-26T13:04:50Z","title":"SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-21T20:58:23.547519Z"},"links":{"citing_paper":"/paper/2510.22665"},"observation_digest":"sha256:4eaf6b1bece0974b4bd128e64d0c206d017f2b253feae24ae36c4f283ed62140","observation_id":"35179151-b2ac-46dd-8c33-4d2302d3467a","resolution":{"observed_at":"2026-05-21T21:05:37.866565Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sfr-net: Scattering feature relation network for aircraft detection in complex sar images.IEEE Transactions on Geo- science and Remote Sensing, 60:1–17","venue":null,"work_id":"c04af5b2-fb42-4098-aaa0-84e889f3604d","year":2021},"citing_paper":{"arxiv_id":"2510.22665","last_updated":"2026-05-15T05:24:29Z","snapshot_observed_at":"2026-07-06T22:34:08.878520Z","submitted_at":"2025-10-26T13:04:50Z","title":"SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-21T20:58:23.547519Z"},"links":{"citing_paper":"/paper/2510.22665"},"observation_digest":"sha256:4d2d0ddfb021111abba3122c20a88c516af93f7164f7407329455d155012d2fa","observation_id":"cf815b1b-4d35-4100-ada0-034423b2972b","resolution":{"observed_at":"2026-05-21T21:05:37.883081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Geochat: Grounded large vision-language model for remote sensing","venue":null,"work_id":"39a989b8-a0be-417d-9469-67ff6cd719ad","year":2024},"citing_paper":{"arxiv_id":"2510.22665","last_updated":"2026-05-15T05:24:29Z","snapshot_observed_at":"2026-07-06T22:34:08.878520Z","submitted_at":"2025-10-26T13:04:50Z","title":"SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-21T20:58:23.547519Z"},"links":{"citing_paper":"/paper/2510.22665"},"observation_digest":"sha256:42040f05bc6cb52c1567a0f52ae596128140dd3e9d239f8cd1728c51facb50e2","observation_id":"d6bd5864-c6dd-49eb-8136-5929a31f5307","resolution":{"observed_at":"2026-05-21T21:05:37.856173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Synthetic sar image generation using sensor, terrain and target models","venue":null,"work_id":"a3f23781-a7e0-44cd-88ff-39f392c6b16b","year":2016},"citing_paper":{"arxiv_id":"2510.22665","last_updated":"2026-05-15T05:24:29Z","snapshot_observed_at":"2026-07-06T22:34:08.878520Z","submitted_at":"2025-10-26T13:04:50Z","title":"SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-21T20:58:23.547519Z"},"links":{"citing_paper":"/paper/2510.22665"},"observation_digest":"sha256:44935ab7c27650bc8801de77cfb91cd4debcfd122b5fe00ce22e61ebd9459f21","observation_id":"a41b4b7b-ce3f-4422-a36c-2ae3fdd3f5ba","resolution":{"observed_at":"2026-05-21T21:05:37.858503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A sar dataset for atr development: the synthetic and measured paired labeled experiment (sample)","venue":null,"work_id":"616d121b-5bd7-44b8-8df5-81e82e740be2","year":null},"citing_paper":{"arxiv_id":"2510.22665","last_updated":"2026-05-15T05:24:29Z","snapshot_observed_at":"2026-07-06T22:34:08.878520Z","submitted_at":"2025-10-26T13:04:50Z","title":"SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-21T20:58:23.547519Z"},"links":{"citing_paper":"/paper/2510.22665"},"observation_digest":"sha256:93da52544fd4061e6e48bb26288b25de358fcd9b9a643b9e3b9fd70ead579302","observation_id":"d50d88e7-8a85-459f-9201-2d2131cff9c5","resolution":{"observed_at":"2026-05-21T21:05:37.850085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Opensarship 2.0: A large-volume dataset for deeper interpretation of ship targets in sentinel-1 imagery","venue":null,"work_id":"4208e17e-8158-4576-a4e0-30a18e97dfc1","year":2017},"citing_paper":{"arxiv_id":"2510.22665","last_updated":"2026-05-15T05:24:29Z","snapshot_observed_at":"2026-07-06T22:34:08.878520Z","submitted_at":"2025-10-26T13:04:50Z","title":"SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-21T20:58:23.547519Z"},"links":{"citing_paper":"/paper/2510.22665"},"observation_digest":"sha256:cd820f0770bd644f2b70d29b0396214c096e6155edded1165c75e376032e8e96","observation_id":"a9eacb8a-540e-43f2-aa67-6adcc63ae1c8","resolution":{"observed_at":"2026-05-21T21:05:37.814129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"788bbf6e-7018-4ea7-8758-7fd5a7f48430","year":2024},"citing_paper":{"arxiv_id":"2510.22665","last_updated":"2026-05-15T05:24:29Z","snapshot_observed_at":"2026-07-06T22:34:08.878520Z","submitted_at":"2025-10-26T13:04:50Z","title":"SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-21T20:58:23.547519Z"},"links":{"citing_paper":"/paper/2510.22665"},"observation_digest":"sha256:6a4f3412075db15a85808c05e7cc8ac82b62585213a5c01646e754e68733a6ad","observation_id":"ac4931f7-8d54-4c8c-ac22-6ed9d39017d3","resolution":{"observed_at":"2026-05-21T21:05:37.854104Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Saratr-x: Towards building a foundation model for sar target recognition.IEEE Transactions on Im- age Processing","venue":null,"work_id":"82e62cd8-4100-403e-b277-14c702ed134d","year":2025},"citing_paper":{"arxiv_id":"2510.22665","last_updated":"2026-05-15T05:24:29Z","snapshot_observed_at":"2026-07-06T22:34:08.878520Z","submitted_at":"2025-10-26T13:04:50Z","title":"SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-21T20:58:23.547519Z"},"links":{"citing_paper":"/paper/2510.22665"},"observation_digest":"sha256:b81cfe76dc18a0a15b4c7f9c8287c6aa04aa4e378c1458b330475a143452d0aa","observation_id":"cec96f08-8074-49c1-a745-0dfa883b47f8","resolution":{"observed_at":"2026-05-21T21:05:37.799878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06534","last_updated":"2025-08-09T02:18:42Z","snapshot_observed_at":"2026-08-03T03:14:52.494240Z","submitted_at":"2024-03-11T09:20:40Z","title":"SARDet-100K: Towards Open-Source Benchmark and ToolKit for Large-Scale SAR Object Detection","version":3},"cited_work":{"arxiv_id":"2403.06534","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.06534","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sardet-100k: Towards open- source benchmark and toolkit for large-scale sar object de- tection","venue":null,"work_id":"8022c14f-1cfb-4763-831f-9f2fa9468f3f","year":2024},"citing_paper":{"arxiv_id":"2510.22665","last_updated":"2026-05-15T05:24:29Z","snapshot_observed_at":"2026-07-06T22:34:08.878520Z","submitted_at":"2025-10-26T13:04:50Z","title":"SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-21T20:58:23.547519Z"},"links":{"cited_paper":"/paper/2403.06534","citing_paper":"/paper/2510.22665"},"observation_digest":"sha256:510d473fa83b2cb6dccdc5bc9a256b22dc1f791e21b6b34cbd82941825f79ea8","observation_id":"658cef66-1e9e-406c-9406-b95406e55496","resolution":{"observed_at":"2026-05-21T21:00:39.062484Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Re- moteclip: A vision language foundation model for remote sensing.IEEE Transactions on Geoscience and Remote Sensing","venue":null,"work_id":"077ba962-beb3-467a-a31f-07610d7ecc3b","year":2024},"citing_paper":{"arxiv_id":"2510.22665","last_updated":"2026-05-15T05:24:29Z","snapshot_observed_at":"2026-07-06T22:34:08.878520Z","submitted_at":"2025-10-26T13:04:50Z","title":"SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-21T20:58:23.547519Z"},"links":{"citing_paper":"/paper/2510.22665"},"observation_digest":"sha256:8a1e7f0234100fed67d865ba37951e668cd585486ba100a25e329e2555c566c3","observation_id":"dafbb708-18a2-4e6b-b8a2-7249d97f980b","resolution":{"observed_at":"2026-05-21T21:05:37.801949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual instruction tuning.Advances in Neural Information Processing Systems, 36:34892–34916","venue":null,"work_id":"4279ed30-8501-4f05-b2d3-0ca62e55c060","year":2023},"citing_paper":{"arxiv_id":"2510.22665","last_updated":"2026-05-15T05:24:29Z","snapshot_observed_at":"2026-07-06T22:34:08.878520Z","submitted_at":"2025-10-26T13:04:50Z","title":"SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-21T20:58:23.547519Z"},"links":{"citing_paper":"/paper/2510.22665"},"observation_digest":"sha256:6a3717f8d80badc55a2064f305baf46d5cbb60bfdfdbe40a1dd27996bbd23fcf","observation_id":"bde9bda4-cfad-4323-8111-2c8efeda4fc1","resolution":{"observed_at":"2026-05-21T21:05:37.868539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13458","last_updated":"2025-04-18T04:24:47Z","snapshot_observed_at":"2026-07-06T21:11:20.262007Z","submitted_at":"2025-04-18T04:24:47Z","title":"Learning from Noisy Pseudo-labels for All-Weather Land Cover Mapping","version":1},"cited_work":{"arxiv_id":"2504.13458","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.13458","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning from noisy pseudo- labels for all-weather land cover mapping","venue":null,"work_id":"4eff6b83-5da2-4840-a51f-f574b369dd6d","year":2025},"citing_paper":{"arxiv_id":"2510.22665","last_updated":"2026-05-15T05:24:29Z","snapshot_observed_at":"2026-07-06T22:34:08.878520Z","submitted_at":"2025-10-26T13:04:50Z","title":"SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-21T20:58:23.547519Z"},"links":{"cited_paper":"/paper/2504.13458","citing_paper":"/paper/2510.22665"},"observation_digest":"sha256:fe40d960346ce2c5b2b71597b9c2308280c7768b82ea2dc12717142d57370e22","observation_id":"e94ab6c3-c3c9-4e33-9820-53913729d089","resolution":{"observed_at":"2026-05-21T21:00:39.065953Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Atrnet-star: A large dataset and bench- mark towards remote sensing object recognition in the wild","venue":null,"work_id":"8fd041b0-841f-4826-b293-aa8eac83b388","year":null},"citing_paper":{"arxiv_id":"2510.22665","last_updated":"2026-05-15T05:24:29Z","snapshot_observed_at":"2026-07-06T22:34:08.878520Z","submitted_at":"2025-10-26T13:04:50Z","title":"SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-21T20:58:23.547519Z"},"links":{"citing_paper":"/paper/2510.22665"},"observation_digest":"sha256:4ca6db19a82cf8b773c4231ae0621633e54abd978e32cb4374656f28a54a2acb","observation_id":"7a5670da-ed3b-4147-a273-2828f378877b","resolution":{"observed_at":"2026-05-21T21:05:37.820448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exploring models and data for remote sensing im- age caption generation.IEEE Transactions on Geoscience and Remote Sensing, 56(4):2183–2195","venue":null,"work_id":"5d920902-26ba-4db7-bfc2-aac08e7c790c","year":2017},"citing_paper":{"arxiv_id":"2510.22665","last_updated":"2026-05-15T05:24:29Z","snapshot_observed_at":"2026-07-06T22:34:08.878520Z","submitted_at":"2025-10-26T13:04:50Z","title":"SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-21T20:58:23.547519Z"},"links":{"citing_paper":"/paper/2510.22665"},"observation_digest":"sha256:1ddda64f5dd8bff73d61ccc5239a2acd0c4390220efe8b18edc85499b80b48c5","observation_id":"9efe556d-afa3-465b-a3bc-9b9667275e63","resolution":{"observed_at":"2026-05-21T21:05:37.831497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08168","last_updated":"2025-03-04T01:07:55Z","snapshot_observed_at":"2026-07-06T20:35:11.864261Z","submitted_at":"2025-02-12T07:19:36Z","title":"SARChat-Bench-2M: A Multi-Task Vision-Language Benchmark for SAR Image Interpretation","version":5},"cited_work":{"arxiv_id":"2502.08168","doi":"10.48550/arxiv.2502.08168","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.08168","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sarchat-bench-2m: A multi-task vision-language benchmark for sar image inter- pretation","venue":"ArXiv.org","work_id":"8149248a-6341-443e-b91b-f281ff740e08","year":2025},"citing_paper":{"arxiv_id":"2510.22665","last_updated":"2026-05-15T05:24:29Z","snapshot_observed_at":"2026-07-06T22:34:08.878520Z","submitted_at":"2025-10-26T13:04:50Z","title":"SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-21T20:58:23.547519Z"},"links":{"cited_paper":"/paper/2502.08168","citing_paper":"/paper/2510.22665"},"observation_digest":"sha256:2f077bde3677d46e756b58108a2b42b8add97f03a458c3ac9396a4cc621245eb","observation_id":"672ac5de-67e8-4e57-9766-4edc52e0a402","resolution":{"observed_at":"2026-05-21T21:00:39.059323Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visualizing data using t-sne.Journal of Machine Learning Research, 9 (Nov):2579–2605","venue":null,"work_id":"1b77a602-5345-406f-be10-33c6a2f8d464","year":2008},"citing_paper":{"arxiv_id":"2510.22665","last_updated":"2026-05-15T05:24:29Z","snapshot_observed_at":"2026-07-06T22:34:08.878520Z","submitted_at":"2025-10-26T13:04:50Z","title":"SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-21T20:58:23.547519Z"},"links":{"citing_paper":"/paper/2510.22665"},"observation_digest":"sha256:01c409bbc0a171454fe28c19a2fbfbb2b93f99110f93490355e1d7c9d9872235","observation_id":"9b76e170-6b3a-4b40-90ce-4cfdeb94a0d4","resolution":{"observed_at":"2026-05-21T21:05:37.838235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06960","last_updated":"2023-12-12T03:39:07Z","snapshot_observed_at":"2026-07-06T17:00:11.930733Z","submitted_at":"2023-12-12T03:39:07Z","title":"Remote Sensing Vision-Language Foundation Models without Annotations via Ground Remote Alignment","version":1},"cited_work":{"arxiv_id":"2312.06960","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06960","snapshot_observed_at":"2026-06-29T08:13:16.012751Z","title":"P., Liu, M","venue":null,"work_id":"288f946f-f03b-4ad4-a2eb-8947da9382ce","year":2023},"citing_paper":{"arxiv_id":"2510.22665","last_updated":"2026-05-15T05:24:29Z","snapshot_observed_at":"2026-07-06T22:34:08.878520Z","submitted_at":"2025-10-26T13:04:50Z","title":"SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-21T20:58:23.547519Z"},"links":{"cited_paper":"/paper/2312.06960","citing_paper":"/paper/2510.22665"},"observation_digest":"sha256:bf3e83a74c2685cf5a3baa28c6aefb16669f77eb9a8aab7704ffe328c4a3ef20","observation_id":"816adf27-7594-4126-997d-523ba6b80709","resolution":{"observed_at":"2026-05-21T21:00:39.055874Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improving sar automatic target recognition models with transfer learning from simulated data.IEEE Geoscience and Remote Sensing Letters, 14(9):1484–1488","venue":null,"work_id":"75df58b8-6118-4f4c-b6e1-63081c27328e","year":2017},"citing_paper":{"arxiv_id":"2510.22665","last_updated":"2026-05-15T05:24:29Z","snapshot_observed_at":"2026-07-06T22:34:08.878520Z","submitted_at":"2025-10-26T13:04:50Z","title":"SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-21T20:58:23.547519Z"},"links":{"citing_paper":"/paper/2510.22665"},"observation_digest":"sha256:60fe60a3e25d001c81855aa8cb0ebee97f018a945b3797e00c287fb008e7e12f","observation_id":"b686b35c-7114-492a-9715-01b4edbd6e4f","resolution":{"observed_at":"2026-05-21T21:05:37.834045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lhrs-bot: Empowering remote sensing with vgi-enhanced large multimodal language model","venue":null,"work_id":"009a8427-de6e-4e5f-8b91-9d192ad69416","year":2024},"citing_paper":{"arxiv_id":"2510.22665","last_updated":"2026-05-15T05:24:29Z","snapshot_observed_at":"2026-07-06T22:34:08.878520Z","submitted_at":"2025-10-26T13:04:50Z","title":"SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-21T20:58:23.547519Z"},"links":{"citing_paper":"/paper/2510.22665"},"observation_digest":"sha256:173d6745a95789a575099949c790812f027845474b76a8c474c7e015a9f58a55","observation_id":"724078c5-b1aa-492c-8101-c872f9165470","resolution":{"observed_at":"2026-05-21T21:05:37.836166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T16:45:08.098053Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":"2670955d-43d2-4a62-9370-91b0ea9b3281","year":null},"citing_paper":{"arxiv_id":"2510.22665","last_updated":"2026-05-15T05:24:29Z","snapshot_observed_at":"2026-07-06T22:34:08.878520Z","submitted_at":"2025-10-26T13:04:50Z","title":"SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-21T20:58:23.547519Z"},"links":{"citing_paper":"/paper/2510.22665"},"observation_digest":"sha256:542131b6e431322039b085deb4adc80d93d9dfaa9a02e104083e211de2172140","observation_id":"9ce74970-2d8a-4ca7-a6d5-0d9e6f43e493","resolution":{"observed_at":"2026-05-21T21:05:37.843672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"6d9cd1f3-fcee-41e5-89ae-68b2ceb4f477","year":2021},"citing_paper":{"arxiv_id":"2510.22665","last_updated":"2026-05-15T05:24:29Z","snapshot_observed_at":"2026-07-06T22:34:08.878520Z","submitted_at":"2025-10-26T13:04:50Z","title":"SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-21T20:58:23.547519Z"},"links":{"citing_paper":"/paper/2510.22665"},"observation_digest":"sha256:5cc9d1b223cdfb1ed430cf5317cb565b555d8b17c611c2c67804e4304b37eb80","observation_id":"c29af940-8d35-45dc-96b7-5ed8e882fed1","resolution":{"observed_at":"2026-05-21T21:05:37.878548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scale-mae: A scale-aware masked autoencoder for multiscale geospatial representation learning","venue":null,"work_id":"396b0aa0-96db-4369-9fe8-3c1867e91b58","year":2023},"citing_paper":{"arxiv_id":"2510.22665","last_updated":"2026-05-15T05:24:29Z","snapshot_observed_at":"2026-07-06T22:34:08.878520Z","submitted_at":"2025-10-26T13:04:50Z","title":"SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-21T20:58:23.547519Z"},"links":{"citing_paper":"/paper/2510.22665"},"observation_digest":"sha256:ff13f6900cfe92bd6e9120a0cd1e1436aca9d95103403d9879c2b6974e215cad","observation_id":"9203da91-24e0-49ef-a0bd-bb92ffe0f048","resolution":{"observed_at":"2026-05-21T21:05:37.840277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"abc5f549-4d91-44c3-98f5-1139626c2561","year":2022},"citing_paper":{"arxiv_id":"2510.22665","last_updated":"2026-05-15T05:24:29Z","snapshot_observed_at":"2026-07-06T22:34:08.878520Z","submitted_at":"2025-10-26T13:04:50Z","title":"SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-21T20:58:23.547519Z"},"links":{"citing_paper":"/paper/2510.22665"},"observation_digest":"sha256:12751d73e9041b654f91846a92f327ceebd4c64a374c4c1c280d7ef589cdb567","observation_id":"e7b6325e-822f-4a6d-9f1e-313ce05c3133","resolution":{"observed_at":"2026-05-21T21:05:37.818408Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ringmo: A remote sensing foundation model with masked image modeling.IEEE Transactions on Geo- science and Remote Sensing, 61:1–22","venue":null,"work_id":"fc1a5015-23a5-4702-97af-576c12067392","year":2022},"citing_paper":{"arxiv_id":"2510.22665","last_updated":"2026-05-15T05:24:29Z","snapshot_observed_at":"2026-07-06T22:34:08.878520Z","submitted_at":"2025-10-26T13:04:50Z","title":"SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-21T20:58:23.547519Z"},"links":{"citing_paper":"/paper/2510.22665"},"observation_digest":"sha256:0940fd111ada5a554e3c853524eb228c0b14a2721e58cf68d6874cdd2662a212","observation_id":"b4e42bf7-0193-4ece-9be4-92851600c8fb","resolution":{"observed_at":"2026-05-21T21:05:37.880521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cross-scale mae: A tale of multiscale exploita- tion in remote sensing.Advances in Neural Information Pro- cessing Systems, 36:20054–20066","venue":null,"work_id":"e1e29b27-c0af-4665-905d-b1b12833760e","year":2023},"citing_paper":{"arxiv_id":"2510.22665","last_updated":"2026-05-15T05:24:29Z","snapshot_observed_at":"2026-07-06T22:34:08.878520Z","submitted_at":"2025-10-26T13:04:50Z","title":"SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-21T20:58:23.547519Z"},"links":{"citing_paper":"/paper/2510.22665"},"observation_digest":"sha256:6092c288dd0d3d4887d08b8d7f058d06367a3cde3a6c38bc3c4a761ac0cd1fd6","observation_id":"43bbb105-a707-4cf1-8397-e59691918904","resolution":{"observed_at":"2026-05-21T21:05:37.808020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cider: Consensus-based image description evalua- tion","venue":null,"work_id":"79e70640-a026-4489-840a-c364f0fa2dfc","year":2015},"citing_paper":{"arxiv_id":"2510.22665","last_updated":"2026-05-15T05:24:29Z","snapshot_observed_at":"2026-07-06T22:34:08.878520Z","submitted_at":"2025-10-26T13:04:50Z","title":"SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-21T20:58:23.547519Z"},"links":{"citing_paper":"/paper/2510.22665"},"observation_digest":"sha256:2a5bd2c111336b18eb08840b9f2a4a9e117b5b1aa12c2cac70664eadd11eff98","observation_id":"b64762f9-1aa5-460c-b530-ffb7d314b52d","resolution":{"observed_at":"2026-05-21T21:05:37.824822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.08733","last_updated":"2022-05-31T11:03:05Z","snapshot_observed_at":"2026-07-06T11:58:42.901223Z","submitted_at":"2021-10-17T06:12:48Z","title":"LoveDA: A Remote Sensing Land-Cover Dataset for Domain Adaptive Semantic Segmentation","version":6},"cited_work":{"arxiv_id":"2110.08733","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2110.08733","snapshot_observed_at":"2026-07-04T19:30:07.448594Z","title":"Loveda: A remote sensing land-cover dataset for domain adaptive semantic segmentation","venue":null,"work_id":"b4d04f38-8eb7-4273-84f0-876f5a43c698","year":2021},"citing_paper":{"arxiv_id":"2510.22665","last_updated":"2026-05-15T05:24:29Z","snapshot_observed_at":"2026-07-06T22:34:08.878520Z","submitted_at":"2025-10-26T13:04:50Z","title":"SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-21T20:58:23.547519Z"},"links":{"cited_paper":"/paper/2110.08733","citing_paper":"/paper/2510.22665"},"observation_digest":"sha256:fbec4b591298bedfc9405a4713335eb21835cef87926e7644bafe6693f80caeb","observation_id":"f762fd6c-4631-4944-825e-3f26df37cee8","resolution":{"observed_at":"2026-05-21T21:00:39.052291Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Skyscript: A large and seman- tically diverse vision-language dataset for remote sensing","venue":null,"work_id":"0c1b95e4-a516-4a22-8107-fbb971da034e","year":2024},"citing_paper":{"arxiv_id":"2510.22665","last_updated":"2026-05-15T05:24:29Z","snapshot_observed_at":"2026-07-06T22:34:08.878520Z","submitted_at":"2025-10-26T13:04:50Z","title":"SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-21T20:58:23.547519Z"},"links":{"citing_paper":"/paper/2510.22665"},"observation_digest":"sha256:73805eb0f0047db16952a22ea4b3b74d5640a92b71685a38b687ae4c262532bd","observation_id":"40f5e9a7-7a52-495e-bc19-504f593812f6","resolution":{"observed_at":"2026-05-21T21:05:37.885906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.03254","last_updated":"2025-04-04T08:09:53Z","snapshot_observed_at":"2026-07-06T21:04:11.067292Z","submitted_at":"2025-04-04T08:09:53Z","title":"SARLANG-1M: A Benchmark for Vision-Language Modeling in SAR Image Understanding","version":1},"cited_work":{"arxiv_id":"2504.03254","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.03254","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sarlang-1m: A benchmark for vision-language modeling in sar image un- derstanding","venue":null,"work_id":"f0f15154-fff8-4537-94de-751e521fdb1b","year":2025},"citing_paper":{"arxiv_id":"2510.22665","last_updated":"2026-05-15T05:24:29Z","snapshot_observed_at":"2026-07-06T22:34:08.878520Z","submitted_at":"2025-10-26T13:04:50Z","title":"SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-21T20:58:23.547519Z"},"links":{"cited_paper":"/paper/2504.03254","citing_paper":"/paper/2510.22665"},"observation_digest":"sha256:21bc9080c78c515cd136f100013e290f12af30d663aa8eb6e9dcd5afa0728708","observation_id":"d5e745fc-d866-4d90-a39a-610ae8cc25bc","resolution":{"observed_at":"2026-05-21T21:00:39.048711Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robust fine-tuning of zero-shot models","venue":null,"work_id":"175954ac-8ddf-4453-b82a-61b6cca72df0","year":2022},"citing_paper":{"arxiv_id":"2510.22665","last_updated":"2026-05-15T05:24:29Z","snapshot_observed_at":"2026-07-06T22:34:08.878520Z","submitted_at":"2025-10-26T13:04:50Z","title":"SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-21T20:58:23.547519Z"},"links":{"citing_paper":"/paper/2510.22665"},"observation_digest":"sha256:1ae9575b61492a44942762deccd572d1414f2f96f8cafe77088e7ea3e317a5c1","observation_id":"f85b0a50-7d4e-47b4-88b6-6e7ed7fafa50","resolution":{"observed_at":"2026-05-21T21:05:37.887946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fair-csar: A benchmark dataset for fine-grained object detection and recognition based on single look complex sar images.IEEE Transactions on Geoscience and Remote Sensing","venue":null,"work_id":"03140e9f-a37d-41dd-ab9a-66d7ae9a195d","year":2024},"citing_paper":{"arxiv_id":"2510.22665","last_updated":"2026-05-15T05:24:29Z","snapshot_observed_at":"2026-07-06T22:34:08.878520Z","submitted_at":"2025-10-26T13:04:50Z","title":"SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-21T20:58:23.547519Z"},"links":{"citing_paper":"/paper/2510.22665"},"observation_digest":"sha256:12bad2917c0b3b4e14415809e5500582c5ecf727712fb198db2f49f79810a9cd","observation_id":"aade4117-29eb-4e43-80e1-4b9c410f7107","resolution":{"observed_at":"2026-05-21T21:05:37.804007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dota: A large-scale dataset for object detection in aerial images","venue":null,"work_id":"0cafc2eb-d221-4940-9781-63f3a0cd2e5d","year":2018},"citing_paper":{"arxiv_id":"2510.22665","last_updated":"2026-05-15T05:24:29Z","snapshot_observed_at":"2026-07-06T22:34:08.878520Z","submitted_at":"2025-10-26T13:04:50Z","title":"SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-21T20:58:23.547519Z"},"links":{"citing_paper":"/paper/2510.22665"},"observation_digest":"sha256:770f19c33dbf53c98a9c456d3015c4b96eb753edb289ded7d8b100c284efaa52","observation_id":"37684e29-33a8-42e8-b4fb-fdb991bdf5db","resolution":{"observed_at":"2026-05-21T21:05:37.805879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-07-06T13:06:27.153765Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"cited_work":{"arxiv_id":"2205.01917","doi":"10.48550/arxiv.2205.01917","metadata_source":"pith","pith_arxiv_id":"2205.01917","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","venue":"cs.CV","work_id":"5dd5bf10-d548-40ff-9b6c-6735129b27ee","year":2022},"citing_paper":{"arxiv_id":"2510.22665","last_updated":"2026-05-15T05:24:29Z","snapshot_observed_at":"2026-07-06T22:34:08.878520Z","submitted_at":"2025-10-26T13:04:50Z","title":"SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-21T20:58:23.547519Z"},"links":{"cited_paper":"/paper/2205.01917","citing_paper":"/paper/2510.22665"},"observation_digest":"sha256:fcf8e6695d338ec57e2b5047d14c209a89aac487f9ad2c0d9c94f81d8866357c","observation_id":"6617c505-adc6-4bfd-9fd1-5ce214477d90","resolution":{"observed_at":"2026-05-21T21:00:39.045218Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-05-22T13:22:43.398968+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T13:22:43.398968+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Selo v2: Toward for higher and faster semantic localization.IEEE Geoscience and Remote Sensing Letters, 20:1–5","venue":null,"work_id":"1af869e1-980a-4658-854d-d5082e01c432","year":2023},"citing_paper":{"arxiv_id":"2510.22665","last_updated":"2026-05-15T05:24:29Z","snapshot_observed_at":"2026-07-06T22:34:08.878520Z","submitted_at":"2025-10-26T13:04:50Z","title":"SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-21T20:58:23.547519Z"},"links":{"citing_paper":"/paper/2510.22665"},"observation_digest":"sha256:c15014191ed1328647080c7151648594dfb5db408967f500f380690a29594173","observation_id":"e56ef695-2798-4491-a94d-e8b03aefa583","resolution":{"observed_at":"2026-05-21T21:05:37.876598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning to evaluate performance of multimodal semantic localization.IEEE Transactions on Geoscience and Remote Sensing, 60:1–18","venue":null,"work_id":"a9088289-45e4-448b-a14a-cdb0b5b40c07","year":2022},"citing_paper":{"arxiv_id":"2510.22665","last_updated":"2026-05-15T05:24:29Z","snapshot_observed_at":"2026-07-06T22:34:08.878520Z","submitted_at":"2025-10-26T13:04:50Z","title":"SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-21T20:58:23.547519Z"},"links":{"citing_paper":"/paper/2510.22665"},"observation_digest":"sha256:4377ce48561c9860d6b86cf9f452e40064ac2183a7956f625d253f6c5f54cbf7","observation_id":"1c246da5-9e85-4c7a-a3ca-a9d95cc6ca1a","resolution":{"observed_at":"2026-05-21T21:05:37.812137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sar ship detection dataset (ssdd): Offi- cial release and comprehensive data analysis.Remote Sens- ing, 13(18):3690","venue":null,"work_id":"edbffeaf-eea4-4703-b2dc-e5570536a9a5","year":2021},"citing_paper":{"arxiv_id":"2510.22665","last_updated":"2026-05-15T05:24:29Z","snapshot_observed_at":"2026-07-06T22:34:08.878520Z","submitted_at":"2025-10-26T13:04:50Z","title":"SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-21T20:58:23.547519Z"},"links":{"citing_paper":"/paper/2510.22665"},"observation_digest":"sha256:76f9f2edd12bf6959f033fb78f21ba3bfeb7aa2193c78a21f9f5dc176f26da85","observation_id":"eb194f4d-c8d2-4df2-8c35-9be6c9c3119b","resolution":{"observed_at":"2026-05-21T21:05:37.874619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Earthgpt: A universal multi-modal large lan- guage model for multi-sensor image comprehension in re- mote sensing domain.IEEE Transactions on Geoscience and Remote Sensing","venue":null,"work_id":"d4f599e6-8fbd-4405-ba14-c1d766ec4a0f","year":2024},"citing_paper":{"arxiv_id":"2510.22665","last_updated":"2026-05-15T05:24:29Z","snapshot_observed_at":"2026-07-06T22:34:08.878520Z","submitted_at":"2025-10-26T13:04:50Z","title":"SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-21T20:58:23.547519Z"},"links":{"citing_paper":"/paper/2510.22665"},"observation_digest":"sha256:4beccc88216ae82210ea184777efe4a8ba541f62f5be76b90dbda7a84b3bbaac","observation_id":"6d2303b8-db7b-4075-ac33-d8f989734b0d","resolution":{"observed_at":"2026-05-21T21:05:37.845934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04440","last_updated":"2025-01-08T11:41:47Z","snapshot_observed_at":"2026-08-06T22:30:52.526410Z","submitted_at":"2025-01-08T11:41:47Z","title":"RSAR: Restricted State Angle Resolver and Rotated SAR Benchmark","version":1},"cited_work":{"arxiv_id":"2501.04440","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.04440","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rsar: Restricted state an- gle resolver and rotated sar benchmark","venue":null,"work_id":"8fae97c9-c365-421a-abd0-9057f0c23d34","year":2025},"citing_paper":{"arxiv_id":"2510.22665","last_updated":"2026-05-15T05:24:29Z","snapshot_observed_at":"2026-07-06T22:34:08.878520Z","submitted_at":"2025-10-26T13:04:50Z","title":"SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-21T20:58:23.547519Z"},"links":{"cited_paper":"/paper/2501.04440","citing_paper":"/paper/2510.22665"},"observation_digest":"sha256:8cb694e1085e2f71e7a074c1b0dbf18a8d069c5effcd30ee905d9d31d0aa04b0","observation_id":"6a422e3d-0dfa-4aba-867b-cc7d8a017c9f","resolution":{"observed_at":"2026-05-21T21:00:39.041826Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rs5m and georsclip: A large scale vision-language dataset and a large vision-language model for remote sensing.IEEE Transactions on Geoscience and Remote Sensing","venue":null,"work_id":"994999f2-5b04-44c9-82e6-9b1b4550042a","year":2024},"citing_paper":{"arxiv_id":"2510.22665","last_updated":"2026-05-15T05:24:29Z","snapshot_observed_at":"2026-07-06T22:34:08.878520Z","submitted_at":"2025-10-26T13:04:50Z","title":"SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-21T20:58:23.547519Z"},"links":{"citing_paper":"/paper/2510.22665"},"observation_digest":"sha256:9181188a75efa77b0ca07fd9ba268228623ee1afac36d5ea39f6a9a11322228a","observation_id":"fb45d4ad-d686-44d9-9e23-51088b9a49b8","resolution":{"observed_at":"2026-05-21T21:05:37.870630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2510.22665","last_updated":"2026-05-15T05:24:29Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T22:34:08.878520Z","submitted_at":"2025-10-26T13:04:50Z","title":"SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":3,"verified_exact":8,"verified_fuzzy":39},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 4 inbound Pith citation observations for arXiv:2510.22665."}