{"as_of":"2026-08-12T17:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fecf5292b319b98032ab09f7eb185dfeed62e23449b3b8231ee5efa4caca122c","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T23:25:10.376115Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.02531/citation-record","integrity":"/paper/2412.02531/integrity","json":"/paper/2412.02531/citation-record.json","paper":"/paper/2412.02531"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.229124Z","title":"Deep learning for remote sensing image scene classification: A review and meta-analysis,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-12T16:59:04.394076Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.229124Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:5ad45ff657aae924f15d2fbfc8d7e60c4f762060c794be14e5fa7909265d3a06","observation_id":"7071abf1-6c2f-486f-9014-4107d615da74","resolution":{"observed_at":"2026-08-11T23:25:10.229124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.874455Z","title":"Scene and environment monitoring using aerial imagery and deep learning,","venue":null,"work_id":"13ee14b8-aa8e-4c2d-bbb1-03198473624a","year":2019},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-12T16:59:04.394076Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.233407Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:5b7521dc13c2830e5f7455a13dfce0a60bae7c4204b978934710dade47d6d416","observation_id":"527e1dd8-255b-4880-bccb-718267df7479","resolution":{"observed_at":"2026-08-11T23:25:10.877827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.864427Z","title":"Spatial context-aware method for urban land use classification using street view images,","venue":null,"work_id":"e7b3d1f1-5580-49bd-b922-f6264c6251b0","year":2022},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-12T16:59:04.394076Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.237070Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:8c8df90b10b1bd21379a3703033bafbf13d27c0a1f055110b582bf4272aaef94","observation_id":"7212442e-d9ac-4b65-abb3-523425eee87a","resolution":{"observed_at":"2026-08-11T23:25:10.868141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.854014Z","title":"Urban scene understanding based on semantic and socioeconomic features: From high-resolution remote sensing imagery to multi-source geographic datasets,","venue":null,"work_id":"ff8eeae9-a82c-4a1b-a419-3c857ac59f31","year":2021},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-12T16:59:04.394076Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.240960Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:6cc1aadd70bf52d2b52201ddfa5e515b0a9d01eced8c2549ed56b7370d08f83f","observation_id":"05b9dae7-3a75-4c1a-8286-27dd85fd1598","resolution":{"observed_at":"2026-08-11T23:25:10.857464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.844094Z","title":"A survey on deep learning-driven remote sensing image scene understanding: Scene classification, scene retrieval and scene-guided object detection,","venue":null,"work_id":"de5cc543-a7b3-4c83-af52-70677a479054","year":2019},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-12T16:59:04.394076Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.244642Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:8878a96bd7297f069d559dd7bc1a60e88908691be40445ac3387b52b14ee06fb","observation_id":"28541f4f-d411-41b0-b11e-a7d2d2c02d7e","resolution":{"observed_at":"2026-08-11T23:25:10.847730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.834400Z","title":"Evaluating the potential of texture and color descriptors for remote sensing image retrieval and classification,","venue":null,"work_id":"8f9915ce-b9ae-431f-8745-9b4032d629d3","year":2010},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-12T16:59:04.394076Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.248249Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:f7c19b3564df8f7f1a078d308f52b54972f5bc8f23940174f6f732ea0779336f","observation_id":"2410f6e5-b6ba-4c04-ac03-4d9cfec9ad72","resolution":{"observed_at":"2026-08-11T23:25:10.838031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.824443Z","title":"Indexing of remote sensing images with different resolutions by multiple features,","venue":null,"work_id":"1efd93ed-6ab6-4d86-adca-b233b3759bef","year":1912},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-12T16:59:04.394076Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.252196Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:a6a162e79892ea9af7d89b1d79e20481a723ee2b8d3b2326560727b01085825c","observation_id":"010b672d-a5bd-4dbf-9510-83834df5fac8","resolution":{"observed_at":"2026-08-11T23:25:10.828162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.814726Z","title":"High-resolution satellite scene classification using a sparse coding based multiple feature combination,","venue":null,"work_id":"9e28798f-82f2-4b5d-8e35-a4bb246aaea6","year":2012},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-12T16:59:04.394076Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.255697Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:ae573e2e7a2766548a72a1eca79ad670c5438c055a421b5545376b5a6c619acc","observation_id":"2a2bf74e-c86c-4c47-86cd-481d6a9a096f","resolution":{"observed_at":"2026-08-11T23:25:10.818269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.259030Z","title":"Remote sensing image scene classification meets deep learning: Challenges, methods, benchmarks, and opportunities,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-12T16:59:04.394076Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.259030Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:ebaee3c8b964f71bca3b167dae1cefa89c773ccd220508a1891de7237378a1e8","observation_id":"ba22cb26-5dba-4745-ac5f-ac9a67248489","resolution":{"observed_at":"2026-08-11T23:25:10.259030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.798275Z","title":"Scene classification based on multiscale convolutional neural network,","venue":null,"work_id":"ef328887-edf8-4ab3-8a87-4a263e6f2f9f","year":2018},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-12T16:59:04.394076Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.262380Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:e2ff9c302d1c3b707cfe79b04211b53a643b561fac1f885af3bd4e8988bac358","observation_id":"49046a35-f649-43e9-8e76-6bfea94693c2","resolution":{"observed_at":"2026-08-11T23:25:10.801839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.788602Z","title":"Gan-based semisupervised scene classifi- cation of remote sensing image,","venue":null,"work_id":"4cdb0635-30a6-476e-b8a3-65b768c776f5","year":2020},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-12T16:59:04.394076Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.265554Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:39d5bec1ea27fd3c0268442f83992bc1f29211eb2baa7ee274f5061f25bc900d","observation_id":"0a0b01d1-c752-4d27-bf41-b941df70e6f3","resolution":{"observed_at":"2026-08-11T23:25:10.792178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.778943Z","title":"Scvit: A spatial-channel feature preserving vision transformer for remote sensing image scene classification,","venue":null,"work_id":"d1e8ce36-06c1-49a5-bd9c-b374897700e0","year":2022},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-12T16:59:04.394076Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.269031Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:fda4abb7d07cc3f6dd2b2d52943252c33a4c7a68c671d49324b8897f0710fffb","observation_id":"e7b264d0-4fd4-4d44-8d17-6190cd718c63","resolution":{"observed_at":"2026-08-11T23:25:10.782374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.769633Z","title":"Vision transformer with contrastive learning for remote sensing image scene classification,","venue":null,"work_id":"7629faf0-3357-4ba6-8ed4-e2a4957a805d","year":2022},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-12T16:59:04.394076Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.272302Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:b6593371f4c24ebb19bf5550320c6f5a2f6b3bc4e1a6b02ce56d8533748aa5bd","observation_id":"e7619c2e-677c-4029-a957-1d1e4a755059","resolution":{"observed_at":"2026-08-11T23:25:10.772943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.759531Z","title":"Deep learning-a new approach for multi-label scene classification in plan- etscope and sentinel-2 imagery,","venue":null,"work_id":"456a5d8a-f59c-4b75-a6b5-f25efaa814d9","year":2018},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-12T16:59:04.394076Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.275625Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:fa67ad4dad3a2dd9928a737ff0a5091ba91c565dd8948aa5b90d1060e0eab8d2","observation_id":"17e4a056-52c8-47bd-a3ed-22c767a01698","resolution":{"observed_at":"2026-08-11T23:25:10.763313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.278716Z","title":"A multi- level label-aware semi-supervised framework for remote sensing scene classification,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-12T16:59:04.394076Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.278716Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:8adb39694fbfb1736dccb3ea34695c061c4be6f9abfe3d1bf575483167f8dee1","observation_id":"441c68e4-96bc-4e07-911f-356a7cf9cf4b","resolution":{"observed_at":"2026-08-11T23:25:10.278716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.744200Z","title":"He and Q","venue":null,"work_id":"f9ea88f7-40a2-415b-b5d2-67c73be56dad","year":2018},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-12T16:59:04.394076Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.281890Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:212c5138ceed57131b714911644ee4fc5975de6706c17d71542e14b34b25c13a","observation_id":"2a250829-f0c9-41c7-ac3e-bfda466284fc","resolution":{"observed_at":"2026-08-11T23:25:10.747640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.734063Z","title":"A lightweight multi-scale crossmodal text-image retrieval method in remote sensing,","venue":null,"work_id":"71c1d870-681b-476c-8e23-181cfd307f22","year":2021},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-12T16:59:04.394076Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.285092Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:b12f0644c9b3e23b8f0f734c55d4bcae1b17d69903f9efc886f62512d3ad157d","observation_id":"711cc84a-e56f-4dbd-bfac-3865f06ea4dc","resolution":{"observed_at":"2026-08-11T23:25:10.737549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.724416Z","title":"Multi-label semantic feature fusion for remote sensing image captioning,","venue":null,"work_id":"7b2bf7b4-76c6-4f4b-9267-6dee73615b92","year":2022},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-12T16:59:04.394076Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.288191Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:76510d8c695c43e9d6de2863c78440978d2895e0fbdd2c87914f9d9a59d50e9d","observation_id":"48b40467-48a4-495b-9d03-6b880c100835","resolution":{"observed_at":"2026-08-11T23:25:10.727851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.714572Z","title":"Teaw: Text-aware few-shot remote sensing image scene classification,","venue":null,"work_id":"8bc21e27-b4a2-4341-bf49-184e2d397d39","year":2023},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-12T16:59:04.394076Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.291364Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:5c58cf87e1f78444c48e9ac559340205927080a2f3e87f620ec8eff6ac7f5a51","observation_id":"58169b2b-4533-4cab-ac3d-e44861e1151f","resolution":{"observed_at":"2026-08-11T23:25:10.718106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.294762Z","title":"Remoteclip: A vision language foundation model for remote sensing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-12T16:59:04.394076Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.294762Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:3d2d5dba230d07aae1c280c93033af2edaf1d4593414ceeb8b296fd4296a4b67","observation_id":"4e715f2b-7443-4163-9a93-995601a9a425","resolution":{"observed_at":"2026-08-11T23:25:10.294762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.699308Z","title":"Land-cover classification with high-resolution remote sensing images using transferable deep models,","venue":null,"work_id":"a2f25a5f-048f-4d7d-b214-e4f11f1f5098","year":2020},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-12T16:59:04.394076Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.297929Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:628a4422365cb0b95ccedc69d37574716a952685b382767bb2b723046d60d3a4","observation_id":"bbccb5ff-034d-402f-884d-77d00a688a07","resolution":{"observed_at":"2026-08-11T23:25:10.702609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.689941Z","title":"A dual- model architecture with grouping-attention-fusion for remote sensing scene classification,","venue":null,"work_id":"2196fd67-ac41-4a85-ad05-5192c25c12c2","year":2021},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-12T16:59:04.394076Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.301005Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:9c3711921bf983365d9ce8e70e94392f209641a6058c0d81d9ffbb553869877f","observation_id":"4f9966a2-fa2b-4011-864c-199deac4b070","resolution":{"observed_at":"2026-08-11T23:25:10.693529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.680904Z","title":"Scene classification with recurrent attention of vhr remote sensing images,","venue":null,"work_id":"fd786b3c-18e7-446b-9056-687eb2863ced","year":2018},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-12T16:59:04.394076Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.304137Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:566e5849dd4c62d7169aaaac32b3ef7c4c9232e245e52932e1bba0af9f34fb46","observation_id":"bd3c34a4-8aa0-4bef-9741-1be01d262657","resolution":{"observed_at":"2026-08-11T23:25:10.684148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.671884Z","title":"Classification of remote sensing images using efficientnet-b3 cnn model with attention,","venue":null,"work_id":"9592d24a-2c4e-4c60-88a9-72a7fbe7c324","year":2021},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-12T16:59:04.394076Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.307138Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:de6aa0899b9fc4a68ec52b86184633c91da5fb017d0ce5d2a389c1a175c84617","observation_id":"2dc92c41-72be-498f-8556-d556561b435b","resolution":{"observed_at":"2026-08-11T23:25:10.675233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.662812Z","title":"Rs-deepsuperlearner: fusion of cnn ensemble for remote sensing scene classification,","venue":null,"work_id":"a6552b99-853c-48e7-9423-c29da834fbfa","year":2023},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-12T16:59:04.394076Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.310320Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:f2c3c1f771964e35decc202e98889d42b2db8abcc3d313dbb17efe43bd2b7b94","observation_id":"7fb639c1-91dc-49ac-8e32-69e74a0c8722","resolution":{"observed_at":"2026-08-11T23:25:10.666022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.653414Z","title":"Contextual spatial-channel attention network for remote sensing scene classification,","venue":null,"work_id":"a685b873-4ee0-43ca-8123-f68dc6283159","year":2023},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-12T16:59:04.394076Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.313382Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:0e8e46b1564a11502a39f6e394a6e3a48edc975da576721a7d1686ddbeef96e0","observation_id":"f157f96c-6b35-445a-b4c4-d9fb71c36280","resolution":{"observed_at":"2026-08-11T23:25:10.656970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.643609Z","title":"A local–global interactive vision trans- former for aerial scene classification,","venue":null,"work_id":"2eca305d-016e-4106-8ee9-63c673f6a22d","year":2023},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-12T16:59:04.394076Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.316600Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:cc370a50c6b4b4dcd9ff71a89edfe66c95ecfc6c3ebe63ae9e597a0881cdec4c","observation_id":"78461957-93eb-4f2d-a992-370049753e55","resolution":{"observed_at":"2026-08-11T23:25:10.647236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.633667Z","title":"Nir/rgb image fusion for scene classification using deep neural networks,","venue":null,"work_id":"4519c142-5d46-4413-b382-1062bbfd66a9","year":2023},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-12T16:59:04.394076Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.319967Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:0bb53772a59d600b6f30219bcced79a5030c3abf2a53a6012e9b0f3491ff8b36","observation_id":"753af8c8-49a9-410e-b950-ef4ead80cb6c","resolution":{"observed_at":"2026-08-11T23:25:10.637260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.623888Z","title":"Mrssc: a benchmark dataset for multimodal remote sensing scene classification,","venue":null,"work_id":"2a1bf802-b278-4854-acad-928dcfdb32d0","year":2021},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-12T16:59:04.394076Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.323038Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:5948b059e29b29293ea5f9c5eb8bda86afda241284f44c5cb773fa11d253c6d6","observation_id":"c746d677-d954-478a-a1d1-2aa7ff562e09","resolution":{"observed_at":"2026-08-11T23:25:10.627429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.613685Z","title":"An optical image-aided approach for zero-shot sar image scene classifica- tion,","venue":null,"work_id":"543f9de5-f94e-4446-9937-733124a2596c","year":2023},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-12T16:59:04.394076Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.326298Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:31de7eac5b3594729a0201331b8d4d40cf7a27ac1ddbccf70a379d627cb5561b","observation_id":"63606dcf-7ef1-48ca-96c8-42c6ef88bc77","resolution":{"observed_at":"2026-08-11T23:25:10.617723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.603840Z","title":"Alignment and fusion using distinct sensor data for multimodal aerial scene classification,","venue":null,"work_id":"2f250528-c72e-4b6d-95d8-ed271402c29b","year":2024},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-12T16:59:04.394076Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.329375Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:49abead28292632d4eb24a07ab31379227ee9dee931dd0bb050142a47b600c7f","observation_id":"a1a2c3d8-c511-4dae-a7ec-1a7bdb13eaf7","resolution":{"observed_at":"2026-08-11T23:25:10.607260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.332515Z","title":"Text2seg: Remote sensing image semantic segmentation via text-guided visual foundation models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-12T16:59:04.394076Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.332515Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:cc2c40826f09389090a299f7317e49036e1a5b6431ee1a512c880a90acc2a7e4","observation_id":"a75a814f-958d-4879-9e2a-90e740063b27","resolution":{"observed_at":"2026-08-11T23:25:10.332515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.593870Z","title":"Parameter-efficient transfer learning for remote sensing image-text retrieval,","venue":null,"work_id":"363f56a2-5b1a-4262-a8db-cc9b187bf6e7","year":2023},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-12T16:59:04.394076Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.335765Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:8ce57001d92b45a72cda2ea0ad636d5f8841fa3d587df0b5f22d2ac8c8e97dd3","observation_id":"4de625c1-270d-4dbe-b0df-17d64887ab11","resolution":{"observed_at":"2026-08-11T23:25:10.597502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.583998Z","title":"Interacting- enhancing feature transformer for cross-modal remote-sensing image and text retrieval,","venue":null,"work_id":"8e31b96d-82a2-41c2-9e56-21a70233ba37","year":2023},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-12T16:59:04.394076Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.338847Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:21661f86cf7e36e9d5efadcf99966bb3ca1f8642e4e2b1efcdf55b208d876c7c","observation_id":"f7b8332f-69e6-4264-b83f-52d170207ec3","resolution":{"observed_at":"2026-08-11T23:25:10.587501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.573962Z","title":"Few-shot remote sensing image scene classification: Recent advances, new baselines, and future trends,","venue":null,"work_id":"408b032e-eb42-4a0e-a1ea-345e33b7606b","year":2024},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-12T16:59:04.394076Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.341993Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:0184981601f323f5d8f4fa58fa5319cf2bb71d9731437fb8d0f4a003c1bd73ed","observation_id":"1f16899c-85ef-45dd-a398-b31376b6ccbb","resolution":{"observed_at":"2026-08-11T23:25:10.577824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04005","last_updated":"2023-08-08T02:48:46Z","snapshot_observed_at":"2026-08-11T22:08:50.774801Z","submitted_at":"2023-08-08T02:48:46Z","title":"Few-shot medical image classification with simple shape and texture text descriptors using vision-language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.04005","snapshot_observed_at":"2026-08-11T23:25:10.345426Z","title":"Few-shot medical image classification with simple shape and texture text descriptors using vision- language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-12T16:59:04.394076Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.345426Z"},"links":{"cited_paper":"/paper/2308.04005","citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:cb09a5f59584ee9338afb2d5d5f7287a7f1b60d5ed32ef7cad63d14014156faf","observation_id":"18f3fbe3-8b87-4d28-a26f-8ac5abeffb9c","resolution":{"observed_at":"2026-08-11T23:25:10.345426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.563886Z","title":"Vision-language model for generating textual descriptions from clinical images: model development and validation study,","venue":null,"work_id":"a671bb64-73d5-46d6-946d-89c2cd18b84c","year":2024},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-12T16:59:04.394076Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.349243Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:a764b41d55807eb2fef0fa457e27a5f4533bf4b4877818a8516cc6313153159d","observation_id":"c94b1f13-b0d8-48a9-860f-f6d705d5e643","resolution":{"observed_at":"2026-08-11T23:25:10.567331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.553891Z","title":"Medical image understanding with pretrained vision language models: A comprehensive study,","venue":null,"work_id":"12abc977-7bf1-4653-a85c-357965656ad9","year":2023},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-12T16:59:04.394076Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.352529Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:bc5bae4096d5298dd026302121d41a656d465be5dd25f0c0112d3a7acb800ac2","observation_id":"da38a411-eb5e-4bb6-9795-dbdbf2926c31","resolution":{"observed_at":"2026-08-11T23:25:10.557266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15836","last_updated":"2025-07-29T02:33:12Z","snapshot_observed_at":"2026-08-03T10:58:43.509887Z","submitted_at":"2024-03-23T13:24:30Z","title":"VLM-CPL: Consensus Pseudo Labels from Vision-Language Models for Annotation-Free Pathological Image Classification","version":3},"cited_work":{"arxiv_id":"2403.15836","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.15836","snapshot_observed_at":"2026-08-11T23:25:10.413986Z","title":"VLM-CPL: Consensus Pseudo Labels from Vision-Language Models for Annotation-Free Pathological Image Classification","venue":"cs.CV","work_id":"fb23fc0f-f8f3-4df6-b973-32ffe19ae4ba","year":2024},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-12T16:59:04.394076Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.355724Z"},"links":{"cited_paper":"/paper/2403.15836","citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:e316201d310aae7cc12691c44ea1ed7b02dcc78bc5e902213c0c31c11d280959","observation_id":"64a15a57-9d45-4872-9e6a-b2d36ecd8e68","resolution":{"observed_at":"2026-08-11T23:25:10.419574Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.543739Z","title":"Improved zero-shot classification by adapting vlms with text descriptions,","venue":null,"work_id":"596390eb-aaf4-4a63-b217-fb4c67869e44","year":2024},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-12T16:59:04.394076Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.359331Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:ef0f96529b7cba28098a13c095ce1843744142230829cbac1eb7da5acad71681","observation_id":"42cf6449-0ff5-4167-a4f4-40965193b14d","resolution":{"observed_at":"2026-08-11T23:25:10.547199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.533030Z","title":"Exploiting lmm-based knowledge for image classification tasks,","venue":null,"work_id":"594d165c-337d-4cd6-ba2a-9ca579df53d0","year":2024},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-12T16:59:04.394076Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.362556Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:89e7ef9ec24e395dfb2ece81320ca5a2809b69dffb2fdbd73a408a43aa643bd3","observation_id":"33fd1be0-9798-49a7-b681-d2b250db52ac","resolution":{"observed_at":"2026-08-11T23:25:10.536941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.523081Z","title":"Visual instruction tuning,","venue":null,"work_id":"638f74fe-89d7-48b6-bc71-7332808c7517","year":2024},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-12T16:59:04.394076Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.366014Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:c66f2b1a64dad0c32ed08daf5577f05ecbe207194bffc1cabc8aa1062eb9dbe1","observation_id":"72d59773-5176-4f51-8408-cf63cff6aafa","resolution":{"observed_at":"2026-08-11T23:25:10.526594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-11T23:25:10.369305Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-12T16:59:04.394076Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.369305Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:8901f029884ded318b43d8ab25d28f80fd47e17824c7973deca5e6290b6514f2","observation_id":"80dc399b-2693-4174-ad2f-2f4381ea9fdf","resolution":{"observed_at":"2026-08-11T23:25:10.369305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.372826Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-12T16:59:04.394076Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.372826Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:bd53c91fcb898aabb2741171f32e4aa7c6304f46abad441f88b6839e307fc736","observation_id":"6a9a74f2-f280-466b-a6cb-68413ec2a2f5","resolution":{"observed_at":"2026-08-11T23:25:10.372826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.376115Z","title":"Segment anything,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-12T16:59:04.394076Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.376115Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:d29ba96a7d8b32a3e47c5907321c14a8e94839fe359b349534845cf239076fe5","observation_id":"f43a904c-1605-4580-8050-66cb49da067f","resolution":{"observed_at":"2026-08-11T23:25:10.376115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T16:59:04.394076Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":1,"verified_fuzzy":35},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2412.02531."}