{"as_of":"2026-08-09T04:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dea169e181c50a286ee106a985ec73935d2d4d1437af9de1e2f7f3b28fe5bd86","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:21:57.827375Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.15401/citation-record","integrity":"/paper/2505.15401/integrity","json":"/paper/2505.15401/citation-record.json","paper":"/paper/2505.15401"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:58.573957Z","title":"Visual Question An- swering for Wishart H-Alpha Classification of Polarimetric SAR Images","venue":null,"work_id":"2dc9b930-14de-4e94-9214-e506785b4183","year":2024},"citing_paper":{"arxiv_id":"2505.15401","last_updated":"2025-05-21T11:42:47Z","snapshot_observed_at":"2026-08-07T22:46:26.750692Z","submitted_at":"2025-05-21T11:42:47Z","title":"Visual Question Answering on Multiple Remote Sensing Image Modalities","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:57.619777Z"},"links":{"citing_paper":"/paper/2505.15401"},"observation_digest":"sha256:204569a9736f897d93422b0b33ca9e3c67e46a42324077eb6e6f99d1878a4a8d","observation_id":"ee5f9f08-db8f-49f3-aa17-aae05f21407d","resolution":{"observed_at":"2026-08-07T15:21:58.579321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:58.561156Z","title":"Bottom-up and top-down attention for image captioning and visual question answering","venue":null,"work_id":"e95d35e7-1941-464a-9275-aedc9e1f699e","year":2018},"citing_paper":{"arxiv_id":"2505.15401","last_updated":"2025-05-21T11:42:47Z","snapshot_observed_at":"2026-08-07T22:46:26.750692Z","submitted_at":"2025-05-21T11:42:47Z","title":"Visual Question Answering on Multiple Remote Sensing Image Modalities","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:57.626013Z"},"links":{"citing_paper":"/paper/2505.15401"},"observation_digest":"sha256:e0ed08398eb5f48c43d0e5ab3fd85c0673873c859e9d15cf778a9ed6d8e36321","observation_id":"72cd52bd-54da-406e-a04e-f8f67f362add","resolution":{"observed_at":"2026-08-07T15:21:58.565503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:58.547507Z","title":"VQA: Visual question answering","venue":null,"work_id":"e6ace4e0-3b35-4619-b2c5-007e13e7bc40","year":2015},"citing_paper":{"arxiv_id":"2505.15401","last_updated":"2025-05-21T11:42:47Z","snapshot_observed_at":"2026-08-07T22:46:26.750692Z","submitted_at":"2025-05-21T11:42:47Z","title":"Visual Question Answering on Multiple Remote Sensing Image Modalities","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:57.631059Z"},"links":{"citing_paper":"/paper/2505.15401"},"observation_digest":"sha256:423f9de0ef2c253416fdff760a6753e073d4d493bdfccb3e3230d7b1d6508d4d","observation_id":"cbb3dcdb-0f39-4df0-af7e-50773d900597","resolution":{"observed_at":"2026-08-07T15:21:58.552413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:58.533684Z","title":"Language trans- formers for remote sensing visual question answering","venue":null,"work_id":"3e9ea68a-c89d-4e3a-8ced-18a137ada65b","year":2022},"citing_paper":{"arxiv_id":"2505.15401","last_updated":"2025-05-21T11:42:47Z","snapshot_observed_at":"2026-08-07T22:46:26.750692Z","submitted_at":"2025-05-21T11:42:47Z","title":"Visual Question Answering on Multiple Remote Sensing Image Modalities","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:57.635584Z"},"links":{"citing_paper":"/paper/2505.15401"},"observation_digest":"sha256:6e54556a89624f3c98d1ca968b36163a7055d451ca20e50aceb3300b49d051e0","observation_id":"14b93957-a845-4c1d-901a-f47bb9a90d79","resolution":{"observed_at":"2026-08-07T15:21:58.538376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:58.519276Z","title":"Prompt-RSVQA: Prompting visual context to a language model for remote sensing visual question answering","venue":null,"work_id":"d2bcc2fb-68f3-4f32-8158-5f50a92868cc","year":2022},"citing_paper":{"arxiv_id":"2505.15401","last_updated":"2025-05-21T11:42:47Z","snapshot_observed_at":"2026-08-07T22:46:26.750692Z","submitted_at":"2025-05-21T11:42:47Z","title":"Visual Question Answering on Multiple Remote Sensing Image Modalities","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:57.641455Z"},"links":{"citing_paper":"/paper/2505.15401"},"observation_digest":"sha256:b45a1ab3c9269b0b27ecbc96fee97b13614e0bc26d42468b0a0a887f9e6ad7c9","observation_id":"1569f4e1-b7de-4fde-a3df-03e7d78eda25","resolution":{"observed_at":"2026-08-07T15:21:58.525109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:58.501854Z","title":"Multi-task prompt-RSVQA to explicitly count objects on aerial images","venue":null,"work_id":"2d06acb2-32c7-49c1-acca-0c6dabd6605f","year":2023},"citing_paper":{"arxiv_id":"2505.15401","last_updated":"2025-05-21T11:42:47Z","snapshot_observed_at":"2026-08-07T22:46:26.750692Z","submitted_at":"2025-05-21T11:42:47Z","title":"Visual Question Answering on Multiple Remote Sensing Image Modalities","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:57.646217Z"},"links":{"citing_paper":"/paper/2505.15401"},"observation_digest":"sha256:93f0695fa1c3855875112e7b75a9c96a17a6f967d3ff64fb48240ea693522cee","observation_id":"3a3acf35-426a-4159-b21a-8a5961d67822","resolution":{"observed_at":"2026-08-07T15:21:58.507890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16782","last_updated":"2023-11-28T13:45:15Z","snapshot_observed_at":"2026-07-06T16:53:47.748963Z","submitted_at":"2023-11-28T13:45:15Z","title":"The curse of language biases in remote sensing VQA: the role of spatial attributes, language diversity, and the need for clear evaluation","version":1},"cited_work":{"arxiv_id":"2311.16782","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.16782","snapshot_observed_at":"2026-08-07T15:21:57.941281Z","title":"The curse of language biases in remote sensing VQA: the role of spatial attributes, language diversity, and the need for clear evaluation","venue":"cs.CV","work_id":"b0207182-ab0a-4366-b651-01911eb71d68","year":2023},"citing_paper":{"arxiv_id":"2505.15401","last_updated":"2025-05-21T11:42:47Z","snapshot_observed_at":"2026-08-07T22:46:26.750692Z","submitted_at":"2025-05-21T11:42:47Z","title":"Visual Question Answering on Multiple Remote Sensing Image Modalities","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:57.650897Z"},"links":{"cited_paper":"/paper/2311.16782","citing_paper":"/paper/2505.15401"},"observation_digest":"sha256:60446f69b0e25e904b408a5c6e3b135c0a68d4c5f1602b3afcf0630b68669262","observation_id":"87075da6-15b3-43bc-a8d6-88ade9d3c2be","resolution":{"observed_at":"2026-08-07T15:21:57.948776Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-07T15:21:57.656270Z","title":"BERT: Pre-training of deep bidirectional transformers for language understanding.arXiv preprint arXiv:1810.04805, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.15401","last_updated":"2025-05-21T11:42:47Z","snapshot_observed_at":"2026-08-07T22:46:26.750692Z","submitted_at":"2025-05-21T11:42:47Z","title":"Visual Question Answering on Multiple Remote Sensing Image Modalities","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:57.656270Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2505.15401"},"observation_digest":"sha256:39945712427b097614e7ce94a8128101de066c6cf9d1cd22ba84e7c4cbb03e13","observation_id":"9c8c442e-917f-41f3-a6d5-0f50ec553a95","resolution":{"observed_at":"2026-08-07T15:21:57.656270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:58.485892Z","title":"PubMedCLIP: How Much Does CLIP Benefit Visual Ques- tion Answering in the Medical Domain? InEACL, pages 1151–1163, 2023","venue":null,"work_id":"d0683e75-05e4-4ca3-90ff-9310ab7ee8e7","year":2023},"citing_paper":{"arxiv_id":"2505.15401","last_updated":"2025-05-21T11:42:47Z","snapshot_observed_at":"2026-08-07T22:46:26.750692Z","submitted_at":"2025-05-21T11:42:47Z","title":"Visual Question Answering on Multiple Remote Sensing Image Modalities","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:57.661019Z"},"links":{"citing_paper":"/paper/2505.15401"},"observation_digest":"sha256:6ba58024a9c1fb210d7e861e3cc3590c8c44181b26e7094746e9093ff10e94c1","observation_id":"bad9fba5-c881-435c-bcba-c4c1ea3913c5","resolution":{"observed_at":"2026-08-07T15:21:58.492397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:58.471415Z","title":"S2 missionhttps : / / sentiwiki.copernicus.eu/web/s2- mission# S2Mission - RadiometricPerformanceS2 - Mission - Radiometric - Performancetrue","venue":null,"work_id":"e18b1cb0-53cf-4813-adc6-44201ace07c4","year":2024},"citing_paper":{"arxiv_id":"2505.15401","last_updated":"2025-05-21T11:42:47Z","snapshot_observed_at":"2026-08-07T22:46:26.750692Z","submitted_at":"2025-05-21T11:42:47Z","title":"Visual Question Answering on Multiple Remote Sensing Image Modalities","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:57.665264Z"},"links":{"citing_paper":"/paper/2505.15401"},"observation_digest":"sha256:989f67b493f6dfbcb180de5b4b5916c1d13c9d0ec49172433acc47b38b003d02","observation_id":"04287ee4-337b-413e-ab54-6e83bea5363a","resolution":{"observed_at":"2026-08-07T15:21:58.476357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:58.456984Z","title":"Cross- modal visual question answering for remote sensing data","venue":null,"work_id":"106b318e-7079-4571-8db9-f57ae55c17bd","year":2021},"citing_paper":{"arxiv_id":"2505.15401","last_updated":"2025-05-21T11:42:47Z","snapshot_observed_at":"2026-08-07T22:46:26.750692Z","submitted_at":"2025-05-21T11:42:47Z","title":"Visual Question Answering on Multiple Remote Sensing Image Modalities","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:57.669545Z"},"links":{"citing_paper":"/paper/2505.15401"},"observation_digest":"sha256:534394c7098c1a95dfc491d48b6a193536b13ac17c3633562e4b2189f1e9889a","observation_id":"ce95719a-c126-4d54-9a28-a069b0e37db5","resolution":{"observed_at":"2026-08-07T15:21:58.462321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:58.442750Z","title":"Making the V in VQA matter: El- evating the role of image understanding in visual question answering","venue":null,"work_id":"99d73859-5b52-4c2b-9f88-4a360628fe3a","year":2017},"citing_paper":{"arxiv_id":"2505.15401","last_updated":"2025-05-21T11:42:47Z","snapshot_observed_at":"2026-08-07T22:46:26.750692Z","submitted_at":"2025-05-21T11:42:47Z","title":"Visual Question Answering on Multiple Remote Sensing Image Modalities","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:57.673681Z"},"links":{"citing_paper":"/paper/2505.15401"},"observation_digest":"sha256:bbc67906738db17d94f1bbc1a10ad9f4572d364125efee8ed12392d4761d08f6","observation_id":"6167abf0-df47-4bd7-b9bb-470696cd188d","resolution":{"observed_at":"2026-08-07T15:21:58.447398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:58.427889Z","title":"Overview of image- CLEF 2018 medical domain visual question answering task","venue":null,"work_id":"dfd01020-c51f-4bb4-82c3-fb6f0fac2fe8","year":2018},"citing_paper":{"arxiv_id":"2505.15401","last_updated":"2025-05-21T11:42:47Z","snapshot_observed_at":"2026-08-07T22:46:26.750692Z","submitted_at":"2025-05-21T11:42:47Z","title":"Visual Question Answering on Multiple Remote Sensing Image Modalities","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:57.677840Z"},"links":{"citing_paper":"/paper/2505.15401"},"observation_digest":"sha256:8a42ad89064cdcd27c8c2e50b28ab8d525280301d4c7044348c95937473b382b","observation_id":"b14f041d-5c20-43d0-a7f6-b1d2c604712d","resolution":{"observed_at":"2026-08-07T15:21:58.433192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:58.409054Z","title":"PromptCap: Prompt-guided image captioning for SAR with GPT-3","venue":null,"work_id":"38d5ffdd-42a2-4ad2-aee0-507e2673324e","year":2023},"citing_paper":{"arxiv_id":"2505.15401","last_updated":"2025-05-21T11:42:47Z","snapshot_observed_at":"2026-08-07T22:46:26.750692Z","submitted_at":"2025-05-21T11:42:47Z","title":"Visual Question Answering on Multiple Remote Sensing Image Modalities","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:57.681918Z"},"links":{"citing_paper":"/paper/2505.15401"},"observation_digest":"sha256:e06cce3720c9408818fa2e54e149cd2fc02293a9a78f86369aa87bb6acc5292c","observation_id":"acab82ca-f225-44be-82a5-af778643655f","resolution":{"observed_at":"2026-08-07T15:21:58.416960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:58.388770Z","title":"CLEVR: A diagnostic dataset for compositional language and elementary visual reasoning","venue":null,"work_id":"d3a43204-1f41-4abb-a1f9-bfd0f9d5786f","year":2017},"citing_paper":{"arxiv_id":"2505.15401","last_updated":"2025-05-21T11:42:47Z","snapshot_observed_at":"2026-08-07T22:46:26.750692Z","submitted_at":"2025-05-21T11:42:47Z","title":"Visual Question Answering on Multiple Remote Sensing Image Modalities","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:57.686919Z"},"links":{"citing_paper":"/paper/2505.15401"},"observation_digest":"sha256:4cb74aab151dfc9ba64fe879bf37e47e528634b04108094cf5c3d4432c837edc","observation_id":"6b9b9f92-e9f7-404f-9574-b7ea41712f52","resolution":{"observed_at":"2026-08-07T15:21:58.395061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:58.373528Z","title":"Q: How to specialize large vision-language models to data-scarce VQA tasks? a: Self-train on unlabeled images! InCVPR Proceedings, pages 15005–15015, 2023","venue":null,"work_id":"2f63775c-eecf-4db2-8ea5-aa474bd92328","year":2023},"citing_paper":{"arxiv_id":"2505.15401","last_updated":"2025-05-21T11:42:47Z","snapshot_observed_at":"2026-08-07T22:46:26.750692Z","submitted_at":"2025-05-21T11:42:47Z","title":"Visual Question Answering on Multiple Remote Sensing Image Modalities","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:57.692176Z"},"links":{"citing_paper":"/paper/2505.15401"},"observation_digest":"sha256:c18599c8637e8e22bce8b0448bf394f73cbdf171ceb2be261f7faf6e6d857163","observation_id":"9b8a1a1a-3e0b-4894-a8e1-7a382063846c","resolution":{"observed_at":"2026-08-07T15:21:58.379262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:58.357761Z","title":"Deep learning in multi- modal remote sensing data fusion: A comprehensive review","venue":null,"work_id":"e2c85c2c-4f3d-4d45-856c-e0cf9edc5490","year":2022},"citing_paper":{"arxiv_id":"2505.15401","last_updated":"2025-05-21T11:42:47Z","snapshot_observed_at":"2026-08-07T22:46:26.750692Z","submitted_at":"2025-05-21T11:42:47Z","title":"Visual Question Answering on Multiple Remote Sensing Image Modalities","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:57.696242Z"},"links":{"citing_paper":"/paper/2505.15401"},"observation_digest":"sha256:cafd8585d2ce406f0e10e5edd82ea5b37728ae38e3a5bed6ab5e7147ba956b0d","observation_id":"158f617a-7fbd-4cdd-ab8d-5c937bae040b","resolution":{"observed_at":"2026-08-07T15:21:58.363362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03557","last_updated":"2019-08-09T17:57:13Z","snapshot_observed_at":"2026-08-07T01:39:40.489262Z","submitted_at":"2019-08-09T17:57:13Z","title":"VisualBERT: A Simple and Performant Baseline for Vision and Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03557","snapshot_observed_at":"2026-08-07T15:21:57.700445Z","title":"Visualbert: A simple and perfor- mant baseline for vision and language.arXiv preprint arXiv:1908.03557, 2019","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2505.15401","last_updated":"2025-05-21T11:42:47Z","snapshot_observed_at":"2026-08-07T22:46:26.750692Z","submitted_at":"2025-05-21T11:42:47Z","title":"Visual Question Answering on Multiple Remote Sensing Image Modalities","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:57.700445Z"},"links":{"cited_paper":"/paper/1908.03557","citing_paper":"/paper/2505.15401"},"observation_digest":"sha256:dcf23a1c277a3373a18f73444c2fdc8b233f1fca7276cdca3b98f82f7857fbb7","observation_id":"86e211b8-017c-46b3-899a-a9ae42449976","resolution":{"observed_at":"2026-08-07T15:21:57.700445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:58.343188Z","title":"A comprehensive study of GPT-4V’s multimodal capabilities in medical imaging","venue":null,"work_id":"f90488dc-2793-4eb3-8cd7-2fb865c94190","year":2023},"citing_paper":{"arxiv_id":"2505.15401","last_updated":"2025-05-21T11:42:47Z","snapshot_observed_at":"2026-08-07T22:46:26.750692Z","submitted_at":"2025-05-21T11:42:47Z","title":"Visual Question Answering on Multiple Remote Sensing Image Modalities","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:57.706239Z"},"links":{"citing_paper":"/paper/2505.15401"},"observation_digest":"sha256:a5ff68a46addfb144f6290708b44a003393e2e150a698dd667aa5b9791a614d0","observation_id":"1301e4cd-21d6-46a0-b1e2-3cfff6b3f5d0","resolution":{"observed_at":"2026-08-07T15:21:58.348262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:58.329531Z","title":"Medical visual question answering: A survey.Artificial In- telligence in Medicine, page 102611, 2023","venue":null,"work_id":"405c2591-d282-4615-8351-0614e3cb1384","year":2023},"citing_paper":{"arxiv_id":"2505.15401","last_updated":"2025-05-21T11:42:47Z","snapshot_observed_at":"2026-08-07T22:46:26.750692Z","submitted_at":"2025-05-21T11:42:47Z","title":"Visual Question Answering on Multiple Remote Sensing Image Modalities","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:57.711085Z"},"links":{"citing_paper":"/paper/2505.15401"},"observation_digest":"sha256:c72582692ebd5a0da30c8e92b2d9e3ff971ea44a30c1c6533f4aa8e3b40952de","observation_id":"12c92640-5b84-4a23-b599-6aafacffe9af","resolution":{"observed_at":"2026-08-07T15:21:58.333948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:58.316041Z","title":"RSVQA: Visual question answering for remote sensing data","venue":null,"work_id":"632b3198-0b0f-4549-8079-c01eb6da5ea0","year":2020},"citing_paper":{"arxiv_id":"2505.15401","last_updated":"2025-05-21T11:42:47Z","snapshot_observed_at":"2026-08-07T22:46:26.750692Z","submitted_at":"2025-05-21T11:42:47Z","title":"Visual Question Answering on Multiple Remote Sensing Image Modalities","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:57.715448Z"},"links":{"citing_paper":"/paper/2505.15401"},"observation_digest":"sha256:b464d147a4abd07c7bad61c058a6109e3752539d429da37849c3e19f26ac3f99","observation_id":"01596c57-bf5b-485a-ba05-ac31a85d6fbd","resolution":{"observed_at":"2026-08-07T15:21:58.320721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:58.299020Z","title":"RSVQA meets BigEarthNet: a new, large-scale, visual question an- swering dataset for remote sensing","venue":null,"work_id":"8f8c4aee-5502-4c30-8596-2587967ca6fe","year":null},"citing_paper":{"arxiv_id":"2505.15401","last_updated":"2025-05-21T11:42:47Z","snapshot_observed_at":"2026-08-07T22:46:26.750692Z","submitted_at":"2025-05-21T11:42:47Z","title":"Visual Question Answering on Multiple Remote Sensing Image Modalities","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:57.720420Z"},"links":{"citing_paper":"/paper/2505.15401"},"observation_digest":"sha256:fa6e70e0daa05a248d8f8154c702210b13b7220e1ece9faba4d473975d522720","observation_id":"ea858d96-e9e7-4634-85fd-bdbb2f754d66","resolution":{"observed_at":"2026-08-07T15:21:58.305404Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:58.282889Z","title":"Deep learning and earth observation to support the sustainable development goals: Current approaches, open challenges, and future opportunities.GRS, 10(2):172–200,","venue":null,"work_id":"09f177c1-ebd2-4e22-a00d-7aa72cfbef88","year":null},"citing_paper":{"arxiv_id":"2505.15401","last_updated":"2025-05-21T11:42:47Z","snapshot_observed_at":"2026-08-07T22:46:26.750692Z","submitted_at":"2025-05-21T11:42:47Z","title":"Visual Question Answering on Multiple Remote Sensing Image Modalities","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:57.725510Z"},"links":{"citing_paper":"/paper/2505.15401"},"observation_digest":"sha256:7e4d0693732ea8331b1dd3836f8d00ff722483bdee84d01e5fa0e7f4776786b6","observation_id":"a031490f-64a6-4c73-95d2-fff894e5a46c","resolution":{"observed_at":"2026-08-07T15:21:58.288909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:57.730126Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.15401","last_updated":"2025-05-21T11:42:47Z","snapshot_observed_at":"2026-08-07T22:46:26.750692Z","submitted_at":"2025-05-21T11:42:47Z","title":"Visual Question Answering on Multiple Remote Sensing Image Modalities","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:57.730126Z"},"links":{"citing_paper":"/paper/2505.15401"},"observation_digest":"sha256:f542e2a77f4889987b553bee2a42924f02018d37821e4bc530badc9065937cf6","observation_id":"e1a65670-4db2-4f13-850d-ef3ddd8017a3","resolution":{"observed_at":"2026-08-07T15:21:57.730126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01108","last_updated":"2020-03-01T02:57:50Z","snapshot_observed_at":"2026-08-07T19:07:36.327251Z","submitted_at":"2019-10-02T17:56:28Z","title":"DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01108","snapshot_observed_at":"2026-08-07T15:21:57.734380Z","title":"DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter.arXiv preprint arXiv:1910.01108, 2019","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2505.15401","last_updated":"2025-05-21T11:42:47Z","snapshot_observed_at":"2026-08-07T22:46:26.750692Z","submitted_at":"2025-05-21T11:42:47Z","title":"Visual Question Answering on Multiple Remote Sensing Image Modalities","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:57.734380Z"},"links":{"cited_paper":"/paper/1910.01108","citing_paper":"/paper/2505.15401"},"observation_digest":"sha256:3667dc6da439c0aa2122fb39ede6427ba946d660805fd52d7466b49a4caf4d30","observation_id":"b2d6b8fa-8ecb-491b-ab41-ac35a409a5b3","resolution":{"observed_at":"2026-08-07T15:21:57.734380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.06383","last_updated":"2021-07-13T20:48:12Z","snapshot_observed_at":"2026-08-07T22:40:13.912253Z","submitted_at":"2021-07-13T20:48:12Z","title":"How Much Can CLIP Benefit Vision-and-Language Tasks?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.06383","snapshot_observed_at":"2026-08-07T15:21:57.738692Z","title":"How much can clip benefit vision-and-language tasks?arXiv preprint arXiv:2107.06383, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.15401","last_updated":"2025-05-21T11:42:47Z","snapshot_observed_at":"2026-08-07T22:46:26.750692Z","submitted_at":"2025-05-21T11:42:47Z","title":"Visual Question Answering on Multiple Remote Sensing Image Modalities","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:57.738692Z"},"links":{"cited_paper":"/paper/2107.06383","citing_paper":"/paper/2505.15401"},"observation_digest":"sha256:fd4334f34f4c2fc38f0d20f76c46b5ca795a177445b55edeea971baa2e95c15a","observation_id":"7f51676e-46bc-46ab-a39e-c9b364ed7332","resolution":{"observed_at":"2026-08-07T15:21:57.738692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:58.259908Z","title":"BigEarthNet: A Large-Scale Benchmark Archive For Remote Sensing Image Understanding","venue":null,"work_id":"94f442cb-d521-42b1-bb16-1e9b51837075","year":2019},"citing_paper":{"arxiv_id":"2505.15401","last_updated":"2025-05-21T11:42:47Z","snapshot_observed_at":"2026-08-07T22:46:26.750692Z","submitted_at":"2025-05-21T11:42:47Z","title":"Visual Question Answering on Multiple Remote Sensing Image Modalities","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:57.742849Z"},"links":{"citing_paper":"/paper/2505.15401"},"observation_digest":"sha256:b7adabcb17c8b5efece2ecc98df0e97cadab0b471ac1371402b90c07fb5e1c82","observation_id":"33e86e99-5d9c-4be6-92c2-07820ee4a957","resolution":{"observed_at":"2026-08-07T15:21:58.265233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:58.244677Z","title":"BigEarthNet-MM: A large-scale, multimodal, multilabel benchmark archive for remote sensing image classification and retrieval [software and data sets].GRS, 9(3):174–180, 2021","venue":null,"work_id":"29bf607e-fbb5-4d8f-90ac-5f81005594bc","year":2021},"citing_paper":{"arxiv_id":"2505.15401","last_updated":"2025-05-21T11:42:47Z","snapshot_observed_at":"2026-08-07T22:46:26.750692Z","submitted_at":"2025-05-21T11:42:47Z","title":"Visual Question Answering on Multiple Remote Sensing Image Modalities","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:57.746878Z"},"links":{"citing_paper":"/paper/2505.15401"},"observation_digest":"sha256:a6a558157e7db9e8a9efecc1fd60ba9dcd7b0a305a3813cf36890d70a571a4a9","observation_id":"5414bcfe-b7c1-4eb3-9991-cbed8248c692","resolution":{"observed_at":"2026-08-07T15:21:58.249885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:58.229569Z","title":"LXMERT: Learning cross- modality encoder representations from transformers","venue":null,"work_id":"f943e5e5-8f7f-48dc-be42-cd9b8cf13368","year":2019},"citing_paper":{"arxiv_id":"2505.15401","last_updated":"2025-05-21T11:42:47Z","snapshot_observed_at":"2026-08-07T22:46:26.750692Z","submitted_at":"2025-05-21T11:42:47Z","title":"Visual Question Answering on Multiple Remote Sensing Image Modalities","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:57.752529Z"},"links":{"citing_paper":"/paper/2505.15401"},"observation_digest":"sha256:86e527c1b7f3fa24c65d520e427d67743675196a960d0db582163a96f6757998","observation_id":"ac91fa7a-49c9-428c-bace-78be154dbe7d","resolution":{"observed_at":"2026-08-07T15:21:58.234529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:58.215285Z","title":"Segmentation-guided attention for visual question answering from remote sensing images","venue":null,"work_id":"bfc6f442-8bc7-4025-b3d2-1c1bc000ff87","year":2024},"citing_paper":{"arxiv_id":"2505.15401","last_updated":"2025-05-21T11:42:47Z","snapshot_observed_at":"2026-08-07T22:46:26.750692Z","submitted_at":"2025-05-21T11:42:47Z","title":"Visual Question Answering on Multiple Remote Sensing Image Modalities","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:57.757403Z"},"links":{"citing_paper":"/paper/2505.15401"},"observation_digest":"sha256:35be44ab30daf6003970ff02cdd119ae1e733133e4afdbfc774d2aae1393ee83","observation_id":"479d1f48-f656-44c2-9d25-704d89862741","resolution":{"observed_at":"2026-08-07T15:21:58.220015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:58.198586Z","title":"Can SAR improve RSVQA performance? In EUSAR, pages 1287–1292","venue":null,"work_id":"58c3d03b-d14b-42ab-94f6-6f206ba21c98","year":2024},"citing_paper":{"arxiv_id":"2505.15401","last_updated":"2025-05-21T11:42:47Z","snapshot_observed_at":"2026-08-07T22:46:26.750692Z","submitted_at":"2025-05-21T11:42:47Z","title":"Visual Question Answering on Multiple Remote Sensing Image Modalities","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:57.762055Z"},"links":{"citing_paper":"/paper/2505.15401"},"observation_digest":"sha256:cd96d41dbd21266a34ed494506743cea9c64725b14d3b9f19a92a49226de2b46","observation_id":"33ff6f2d-ca6c-4bc6-8303-f71d08550ef9","resolution":{"observed_at":"2026-08-07T15:21:58.204385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01445","last_updated":"2024-11-03T06:03:39Z","snapshot_observed_at":"2026-07-06T19:44:12.347359Z","submitted_at":"2024-11-03T06:03:39Z","title":"A Visual Question Answering Method for SAR Ship: Breaking the Requirement for Multimodal Dataset Construction and Model Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2411.01445","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.01445","snapshot_observed_at":"2026-08-07T15:21:57.862739Z","title":"A Visual Question Answering Method for SAR Ship: Breaking the Requirement for Multimodal Dataset Construction and Model Fine-Tuning","venue":"cs.CV","work_id":"a4824334-5e56-44f5-91a1-c107a55fba14","year":2024},"citing_paper":{"arxiv_id":"2505.15401","last_updated":"2025-05-21T11:42:47Z","snapshot_observed_at":"2026-08-07T22:46:26.750692Z","submitted_at":"2025-05-21T11:42:47Z","title":"Visual Question Answering on Multiple Remote Sensing Image Modalities","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:57.767100Z"},"links":{"cited_paper":"/paper/2411.01445","citing_paper":"/paper/2505.15401"},"observation_digest":"sha256:b88927ab5447c878d2c0b544c3ffda9d836d43e49378b9edd68b4d4119d31d56","observation_id":"28086c65-172e-49b7-a07b-3d98ad54f09c","resolution":{"observed_at":"2026-08-07T15:21:57.871156Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:58.175488Z","title":"Labsar, a one- gcp coregistration tool for sar–insar local analysis in high- mountain regions.Frontiers in Remote Sensing, 3:935137,","venue":null,"work_id":"67d6d253-a99d-4105-a98a-f50174de2c85","year":null},"citing_paper":{"arxiv_id":"2505.15401","last_updated":"2025-05-21T11:42:47Z","snapshot_observed_at":"2026-08-07T22:46:26.750692Z","submitted_at":"2025-05-21T11:42:47Z","title":"Visual Question Answering on Multiple Remote Sensing Image Modalities","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:57.772554Z"},"links":{"citing_paper":"/paper/2505.15401"},"observation_digest":"sha256:7aef2480287eb6f19c2a5812c1248e472e4db2444fd2d15aa4019f1699df21fa","observation_id":"190efb43-6d6a-4629-a6e1-d16bb1bc55ff","resolution":{"observed_at":"2026-08-07T15:21:58.185744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:58.157949Z","title":"LabSAR, a one-GCP coregistration tool for SAR–InSAR local analysis in high- mountain regions.Frontiers in Remote Sensing, 3, 2022","venue":null,"work_id":"334ed8c3-5813-409e-a00c-8288a04f3feb","year":2022},"citing_paper":{"arxiv_id":"2505.15401","last_updated":"2025-05-21T11:42:47Z","snapshot_observed_at":"2026-08-07T22:46:26.750692Z","submitted_at":"2025-05-21T11:42:47Z","title":"Visual Question Answering on Multiple Remote Sensing Image Modalities","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:57.776892Z"},"links":{"citing_paper":"/paper/2505.15401"},"observation_digest":"sha256:4e480630e9c99eb9d08a6e130018f425bafce0b2e118aa3c132121dc079b706b","observation_id":"eefacd51-dccc-4db1-a41f-169c64f1d508","resolution":{"observed_at":"2026-08-07T15:21:58.165300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:58.142147Z","title":"Stacked attention networks for image question answering","venue":null,"work_id":"4150cb7c-796f-441b-a411-cea5f51b9042","year":2016},"citing_paper":{"arxiv_id":"2505.15401","last_updated":"2025-05-21T11:42:47Z","snapshot_observed_at":"2026-08-07T22:46:26.750692Z","submitted_at":"2025-05-21T11:42:47Z","title":"Visual Question Answering on Multiple Remote Sensing Image Modalities","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:57.781219Z"},"links":{"citing_paper":"/paper/2505.15401"},"observation_digest":"sha256:75ce269c8319dfa9a4bb64c425dc642fa1264dc518664260818bafdd6f8a30f3","observation_id":"4370f8d1-0e16-41e1-bde3-84d33c886329","resolution":{"observed_at":"2026-08-07T15:21:58.147493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:58.126041Z","title":"Self- paced curriculum learning for visual question answering on remote sensing data","venue":null,"work_id":"3fdef95c-19c6-40cb-b5c1-dcbf980e86b1","year":null},"citing_paper":{"arxiv_id":"2505.15401","last_updated":"2025-05-21T11:42:47Z","snapshot_observed_at":"2026-08-07T22:46:26.750692Z","submitted_at":"2025-05-21T11:42:47Z","title":"Visual Question Answering on Multiple Remote Sensing Image Modalities","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:57.785581Z"},"links":{"citing_paper":"/paper/2505.15401"},"observation_digest":"sha256:43f050d51970341e7c54ccc2619f3698d370510d728e2680023f4abc635329f6","observation_id":"481cc563-b99c-4592-8e44-1758d5739415","resolution":{"observed_at":"2026-08-07T15:21:58.131387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:58.104790Z","title":"Multi- lingual augmentation for robust visual question answering in remote sensing images","venue":null,"work_id":"32bd3210-1231-443d-bb99-2eb905e4be05","year":2023},"citing_paper":{"arxiv_id":"2505.15401","last_updated":"2025-05-21T11:42:47Z","snapshot_observed_at":"2026-08-07T22:46:26.750692Z","submitted_at":"2025-05-21T11:42:47Z","title":"Visual Question Answering on Multiple Remote Sensing Image Modalities","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:57.790056Z"},"links":{"citing_paper":"/paper/2505.15401"},"observation_digest":"sha256:5c3e9d4d129909e3423f849ecd8e87e89df319cdbbde0618963a47ddc4e6a3f5","observation_id":"4922c276-5ea5-4815-b7dc-0e8fc436f18a","resolution":{"observed_at":"2026-08-07T15:21:58.113860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:58.085090Z","title":"Frequency domain transfer learning for remote sensing visual question answering","venue":null,"work_id":"76523c63-55e4-47fb-a28e-125800a1cec8","year":null},"citing_paper":{"arxiv_id":"2505.15401","last_updated":"2025-05-21T11:42:47Z","snapshot_observed_at":"2026-08-07T22:46:26.750692Z","submitted_at":"2025-05-21T11:42:47Z","title":"Visual Question Answering on Multiple Remote Sensing Image Modalities","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:57.794006Z"},"links":{"citing_paper":"/paper/2505.15401"},"observation_digest":"sha256:a06c3f66137b5a29e2def19caf023d6987468e7d0daeade283dbb6f9b7a0cf5f","observation_id":"3639b5e5-987d-42e6-a45c-1158e4d87256","resolution":{"observed_at":"2026-08-07T15:21:58.090347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:58.069169Z","title":"Exploring data and models in SAR ship image captioning.IEEE Access, 10:pp","venue":null,"work_id":"b115b1d3-e864-43e2-a78a-b12c87d46de0","year":null},"citing_paper":{"arxiv_id":"2505.15401","last_updated":"2025-05-21T11:42:47Z","snapshot_observed_at":"2026-08-07T22:46:26.750692Z","submitted_at":"2025-05-21T11:42:47Z","title":"Visual Question Answering on Multiple Remote Sensing Image Modalities","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:57.798095Z"},"links":{"citing_paper":"/paper/2505.15401"},"observation_digest":"sha256:5e874d1d11feaac0cce99e0ffaafcdeff5cccd5c73e453bac685d17ee9b63337","observation_id":"d2f071f0-c906-4382-8fdf-342f25dfc8a7","resolution":{"observed_at":"2026-08-07T15:21:58.074940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:58.050378Z","title":"Mutual attention inception network for remote sensing visual question answering.TGRS, 60:1–14, 2021","venue":null,"work_id":"3df5efec-9d56-405b-a60e-d8570b92487a","year":2021},"citing_paper":{"arxiv_id":"2505.15401","last_updated":"2025-05-21T11:42:47Z","snapshot_observed_at":"2026-08-07T22:46:26.750692Z","submitted_at":"2025-05-21T11:42:47Z","title":"Visual Question Answering on Multiple Remote Sensing Image Modalities","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:57.802499Z"},"links":{"citing_paper":"/paper/2505.15401"},"observation_digest":"sha256:557b7253a428dc9f20028099e7b63e711398ef8038a361d52f4c1db258b4bc4c","observation_id":"404125af-856a-44de-885a-48d7e81ab912","resolution":{"observed_at":"2026-08-07T15:21:58.058588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:58.035187Z","title":"TRAR: Routing the attention spans in transformer for visual question answering","venue":null,"work_id":"d49f8e66-b636-4919-8ad0-5d0463a8d110","year":2021},"citing_paper":{"arxiv_id":"2505.15401","last_updated":"2025-05-21T11:42:47Z","snapshot_observed_at":"2026-08-07T22:46:26.750692Z","submitted_at":"2025-05-21T11:42:47Z","title":"Visual Question Answering on Multiple Remote Sensing Image Modalities","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:57.806834Z"},"links":{"citing_paper":"/paper/2505.15401"},"observation_digest":"sha256:ece5f3a607f5bdec0765cd8f0ec3f2edbdbb09048679e037eeee3abcdbdd4b37","observation_id":"2702e120-efee-4a32-aa7d-5874ef75d4fe","resolution":{"observed_at":"2026-08-07T15:21:58.040297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:58.020006Z","title":"To do so, we need the geographical position of the center of the VHR patch","venue":null,"work_id":"f94ce291-c366-481c-bbb1-17c6f4448753","year":null},"citing_paper":{"arxiv_id":"2505.15401","last_updated":"2025-05-21T11:42:47Z","snapshot_observed_at":"2026-08-07T22:46:26.750692Z","submitted_at":"2025-05-21T11:42:47Z","title":"Visual Question Answering on Multiple Remote Sensing Image Modalities","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:57.811034Z"},"links":{"citing_paper":"/paper/2505.15401"},"observation_digest":"sha256:62b5bc5b2e3247ed7ed9ce7c378e077ba0e30c0cf9b281ce080bfddf97aaf19b","observation_id":"08bba89e-9e50-447d-9c45-c26b9122cbbc","resolution":{"observed_at":"2026-08-07T15:21:58.025421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:58.006273Z","title":null,"venue":null,"work_id":"603d2248-1110-4063-b027-bf4073ef2f50","year":null},"citing_paper":{"arxiv_id":"2505.15401","last_updated":"2025-05-21T11:42:47Z","snapshot_observed_at":"2026-08-07T22:46:26.750692Z","submitted_at":"2025-05-21T11:42:47Z","title":"Visual Question Answering on Multiple Remote Sensing Image Modalities","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:57.815022Z"},"links":{"citing_paper":"/paper/2505.15401"},"observation_digest":"sha256:e7b64a1e0d3f9bdd8dd91c94864aabf79d8070edf4b43d3e875cacbdecb696c7","observation_id":"06147c63-591a-457c-8970-996923b93856","resolution":{"observed_at":"2026-08-07T15:21:58.010460Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:57.991477Z","title":"To find the correct swath, the projection of the geographical point is applied, using the meta-data linked to each swath","venue":null,"work_id":"4f1cbb3b-8677-4989-9fd1-56437c87e2d0","year":null},"citing_paper":{"arxiv_id":"2505.15401","last_updated":"2025-05-21T11:42:47Z","snapshot_observed_at":"2026-08-07T22:46:26.750692Z","submitted_at":"2025-05-21T11:42:47Z","title":"Visual Question Answering on Multiple Remote Sensing Image Modalities","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:57.818952Z"},"links":{"citing_paper":"/paper/2505.15401"},"observation_digest":"sha256:146dd1656e473e10e4631fe359ebcc0fdb44e4cbd2a63a864d481df7bbcb1b07","observation_id":"aa5e0a4b-d6f6-4b0c-ab9b-3e3eb4239863","resolution":{"observed_at":"2026-08-07T15:21:57.996401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:57.974955Z","title":"The S1 images need to be debursted (removing of the black line and of the overlap) to get a continuous image before to extract the S1 patch that is inputted in the model","venue":null,"work_id":"de147396-bfd0-4858-8ac4-181d3de4731a","year":null},"citing_paper":{"arxiv_id":"2505.15401","last_updated":"2025-05-21T11:42:47Z","snapshot_observed_at":"2026-08-07T22:46:26.750692Z","submitted_at":"2025-05-21T11:42:47Z","title":"Visual Question Answering on Multiple Remote Sensing Image Modalities","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:57.823227Z"},"links":{"citing_paper":"/paper/2505.15401"},"observation_digest":"sha256:c2eb74646f9fa6568144bf6d171d46617673a23f56f8e7c23a0152b60c84ce59","observation_id":"784ca467-5426-4cdd-b736-b85e603c9cbd","resolution":{"observed_at":"2026-08-07T15:21:57.979691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:21:57.960089Z","title":"A tail- value elimination procedure is performed on each chan- nel separately using statistics information extracted over the whole dataset","venue":null,"work_id":"f1efb937-22b9-4f84-8828-e5e8062c43d6","year":null},"citing_paper":{"arxiv_id":"2505.15401","last_updated":"2025-05-21T11:42:47Z","snapshot_observed_at":"2026-08-07T22:46:26.750692Z","submitted_at":"2025-05-21T11:42:47Z","title":"Visual Question Answering on Multiple Remote Sensing Image Modalities","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:57.827375Z"},"links":{"citing_paper":"/paper/2505.15401"},"observation_digest":"sha256:404742f61e430fde2900551ff4673c9d2f48ddfa5d3a9813926a82cb53f95adb","observation_id":"6b0b2b99-4316-4d9d-9902-264e0b7a7d45","resolution":{"observed_at":"2026-08-07T15:21:57.965667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.15401","last_updated":"2025-05-21T11:42:47Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T22:46:26.750692Z","submitted_at":"2025-05-21T11:42:47Z","title":"Visual Question Answering on Multiple Remote Sensing Image Modalities"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":2,"verified_fuzzy":38},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 0 inbound Pith citation observations for arXiv:2505.15401."}