{"as_of":"2026-08-13T13:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:080d48917da4e192e429b7a1850927c99fa6a9e153120a1617f3cd20c29a8334","coverage":[{"denominator":78,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":78,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T00:59:26.218778Z","state":"measured"},{"denominator":78,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":78,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.25993/citation-record","integrity":"/paper/2607.25993/integrity","json":"/paper/2607.25993/citation-record.json","paper":"/paper/2607.25993"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:59:16.872554Z","title":"Geollava-8k: Scaling remote-sensing multimodal large language models to 8k resolution","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:16.872554Z"},"links":{"citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:ddce8f1ae84af9c89c0525398c63c13c1cb7b87c0ed17516797332f54509139a","observation_id":"c11bfa9e-2aa5-4ea6-975d-4cb1758b7ac5","resolution":{"observed_at":"2026-08-01T00:59:16.872554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23771","last_updated":"2025-03-31T06:41:18Z","snapshot_observed_at":"2026-08-11T17:33:19.993684Z","submitted_at":"2025-03-31T06:41:18Z","title":"XLRS-Bench: Could Your Multimodal LLMs Understand Extremely Large Ultra-High-Resolution Remote Sensing Imagery?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23771","snapshot_observed_at":"2026-08-01T00:59:16.958440Z","title":"Xlrs-bench: Could your multimodal llms understand extremely large ultra-high-resolution remote sensing imagery?arXiv preprint arXiv:2503.23771, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:16.958440Z"},"links":{"cited_paper":"/paper/2503.23771","citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:dfec5ef060014101d76e46314b1e4c772c4bdf4b2bd7ee25f0836f14783e8838","observation_id":"52b5e044-50a9-4d0c-b289-e25af79c9551","resolution":{"observed_at":"2026-08-01T00:59:16.958440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:59:17.014362Z","title":"A benchmark for ultra-high-resolution remote sensing mllms.arXiv preprint arXiv:2512.17319, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:17.014362Z"},"links":{"citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:2e79ab941f1194d331bd5a261f1e86136844437e2d1aae1b3d1da3182e12704f","observation_id":"814304eb-51a7-4736-82ce-a7c1f09ffb4a","resolution":{"observed_at":"2026-08-01T00:59:17.014362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:59:17.090328Z","title":"Geochat: Grounded large vision-language model for remote sensing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:17.090328Z"},"links":{"citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:b1f0362ab0addf418609fa3dd803e380ee5feb3023beebfb480d9dea9e98d66e","observation_id":"1f60195a-2db3-4a4c-bf89-603f0b4f4429","resolution":{"observed_at":"2026-08-01T00:59:17.090328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:59:17.215092Z","title":"Earthgpt: A universal multi-modal large language model for multi-sensor image comprehension in remote sensing domain.IEEE Transactions on Geoscience and Remote Sensing, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:17.215092Z"},"links":{"citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:7aab1739b9e2f139af0d3c6f777d7509e4c1064a5ced8603e856ec6436adc98d","observation_id":"2f6ca9cc-3a94-4c7b-8b69-ad244cf260e6","resolution":{"observed_at":"2026-08-01T00:59:17.215092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:59:17.318819Z","title":"Rsgpt: A remote sensing vision language model and benchmark.ISPRS Journal of Photogrammetry and Remote Sensing, 224:272–286, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:17.318819Z"},"links":{"citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:85e349345962aec0212d563a9b98fef0341dd2b2ac5aa72319bc8a4d917c011f","observation_id":"12285465-c255-4adc-b81b-fb0327377206","resolution":{"observed_at":"2026-08-01T00:59:17.318819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:59:17.439421Z","title":"Skyeyegpt: Unifying remote sensing vision- language tasks via instruction tuning with large language model.ISPRS Journal of Photogram- metry and Remote Sensing, 221:64–77, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:17.439421Z"},"links":{"citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:e07e171d1555ddcb733a52c132299a5ac6f3fd7b355a1a2ffb632a776c90bc40","observation_id":"09b689b6-fee9-451c-8730-1b2f1e95c2aa","resolution":{"observed_at":"2026-08-01T00:59:17.439421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07588","last_updated":"2025-07-24T07:44:45Z","snapshot_observed_at":"2026-08-07T17:15:57.968218Z","submitted_at":"2025-03-10T17:51:16Z","title":"When Large Vision-Language Model Meets Large Remote Sensing Imagery: Coarse-to-Fine Text-Guided Token Pruning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07588","snapshot_observed_at":"2026-08-01T00:59:17.520344Z","title":"When large vision-language model meets large remote sensing imagery: Coarse- to-fine text-guided token pruning.arXiv preprint arXiv:2503.07588, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:17.520344Z"},"links":{"cited_paper":"/paper/2503.07588","citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:0c10381fb3e73da1a17b25bf3c7bdddf95f11735287e87d81391c89e02e93e3c","observation_id":"e8b1fcf9-a2d4-49f6-847d-d4841751cd23","resolution":{"observed_at":"2026-08-01T00:59:17.520344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14362","last_updated":"2026-03-01T04:59:56Z","snapshot_observed_at":"2026-08-02T12:23:34.946873Z","submitted_at":"2025-05-20T13:48:11Z","title":"DeepEyes: Incentivizing \"Thinking with Images\" via Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14362","snapshot_observed_at":"2026-08-01T00:59:17.566992Z","title":"thinking with images","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:17.566992Z"},"links":{"cited_paper":"/paper/2505.14362","citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:3e632fc4e31e9095fddf1c855b8c57ad892f5d1ecc5b1898c134392377962322","observation_id":"ece5afc0-163a-4312-8ea0-0ee64030683d","resolution":{"observed_at":"2026-08-01T00:59:17.566992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.05271","last_updated":"2026-03-11T08:46:41Z","snapshot_observed_at":"2026-07-06T22:35:13.699594Z","submitted_at":"2025-11-07T14:31:20Z","title":"DeepEyesV2: Toward Agentic Multimodal Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.05271","snapshot_observed_at":"2026-08-01T00:59:17.736485Z","title":"Deepeyesv2: Toward agentic multimodal model.arXiv preprint arXiv:2511.05271, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:17.736485Z"},"links":{"cited_paper":"/paper/2511.05271","citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:199ec8c8a42e34d6393db4b764146e2f618ee8dd9aa73c4c91159b560f499519","observation_id":"18bd7123-58d7-4a9a-a111-c29594e4941d","resolution":{"observed_at":"2026-08-01T00:59:17.736485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:59:17.889133Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:17.889133Z"},"links":{"citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:192c050c8016d2e1e853dcc25e12b6f9d5313f8db9c8a2c1259b4b095b604ebd","observation_id":"266e68f1-a109-4f4e-ba5c-636564131924","resolution":{"observed_at":"2026-08-01T00:59:17.889133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:59:18.019185Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:18.019185Z"},"links":{"citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:ef30aa5779cb2fe525fda54a6abe7f4d6ed2bd1aa524ac84a235d723e5ce8036","observation_id":"f8d5eb53-742d-41f6-aa39-8408a6330817","resolution":{"observed_at":"2026-08-01T00:59:18.019185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:59:18.151653Z","title":"Zoomearth: Active perception for ultra-high-resolution geospatial vision-language tasks.arXiv preprint arXiv:2511.12267, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:18.151653Z"},"links":{"citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:0148d820e524d918bc93565fc889217f738e71de043c170f85bb9d25ac0c95c4","observation_id":"08aba2c1-45c0-46a2-a252-526c7ffe7386","resolution":{"observed_at":"2026-08-01T00:59:18.151653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:59:18.214762Z","title":"Geoeyes: On-demand visual focusing for evidence-grounded understanding of ultra-high-resolution remote sensing imagery.arXiv preprint arXiv:2602.14201, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:18.214762Z"},"links":{"citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:893a5e15ccaec71e0545e2389275b00a3c247d372dfbd13c126beebadfb7624c","observation_id":"2d4f191d-b8e0-4086-bc56-bd4518801e57","resolution":{"observed_at":"2026-08-01T00:59:18.214762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:59:18.286594Z","title":"Codev: Code with images for faithful visual reasoning via tool-aware policy optimization.arXiv preprint arXiv:2511.19661, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:18.286594Z"},"links":{"citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:0145d08ce234cae2aa66263611644e1966a100237b40a5b23054f88d9f1dd988","observation_id":"045eb384-c08e-49d9-af74-e8ac2de503a9","resolution":{"observed_at":"2026-08-01T00:59:18.286594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:59:18.418541Z","title":"Zooming without zooming: Region-to-image distillation for fine-grained multimodal perception.arXiv preprint arXiv:2602.11858, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:18.418541Z"},"links":{"citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:3b444df461b8c3534c1f5ce9d336814f107616a5b3e1fe17d6dc339cab2cfe9d","observation_id":"7fbffac7-fd71-454a-857e-340f563b60cc","resolution":{"observed_at":"2026-08-01T00:59:18.418541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.01334","last_updated":"2026-05-21T13:03:08Z","snapshot_observed_at":"2026-08-10T10:27:06.939498Z","submitted_at":"2026-02-01T17:00:50Z","title":"What Does Vision Tool-Use Reinforcement Learning Really Learn? Disentangling Tool-Induced and Intrinsic Effects for Crop-and-Zoom","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.01334","snapshot_observed_at":"2026-08-01T00:59:18.518291Z","title":"What does vision tool-use reinforcement learning really learn? disentangling tool-induced and intrinsic effects for crop-and-zoom.arXiv preprint arXiv:2602.01334, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:18.518291Z"},"links":{"cited_paper":"/paper/2602.01334","citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:8d71c16ec34b2e7b966b1bb733eca0590d805334665ad6a2c99bb555c0217ce9","observation_id":"8d8d84ba-c45b-4320-850e-cf1df276870b","resolution":{"observed_at":"2026-08-01T00:59:18.518291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:59:18.640925Z","title":"Reinforced attention learning.arXiv preprint arXiv:2602.04884, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:18.640925Z"},"links":{"citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:f1ed160edd22ba8125f944c20f5b3b96a7448e6026eb55e3e3ef68dfbd639bbe","observation_id":"ab95e434-3b5a-4c3d-9e9b-bc7bfe185316","resolution":{"observed_at":"2026-08-01T00:59:18.640925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:59:18.738278Z","title":"Smith, and Ranjay Krishna","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:18.738278Z"},"links":{"citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:959eaa92ef4237b3d87b6e534bbcd1d72eee15bef92855de6a3b38150c7c25c9","observation_id":"68b5ea20-e143-40b3-a051-c50550194ebd","resolution":{"observed_at":"2026-08-01T00:59:18.738278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-01T00:59:18.845444Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection.arXiv preprint arXiv:2303.05499, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:18.845444Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:7d6875c477b851b4cb982a3f59cdadafecf2651a6c45a08c4d1893bb52672293","observation_id":"df08d272-e693-4579-855c-cdac8a691be9","resolution":{"observed_at":"2026-08-01T00:59:18.845444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:59:18.999170Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:18.999170Z"},"links":{"citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:42b695e1dd2c660fb10d484d934981e82c10fc6b2192879f475b4ffda678b0d0","observation_id":"13047702-0a6e-46ae-ae43-c7c2fe135170","resolution":{"observed_at":"2026-08-01T00:59:18.999170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:59:19.149637Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:19.149637Z"},"links":{"citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:44e957a15b6979201c25d86cb4fac09efd0887c69826204898abb30da48030ef","observation_id":"aff2f9cf-eeee-4b84-8efd-093bea6c8f14","resolution":{"observed_at":"2026-08-01T00:59:19.149637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:59:19.257501Z","title":"Lhrs-bot: Em- powering remote sensing with vgi-enhanced large multimodal language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:19.257501Z"},"links":{"citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:75a2671b85a52905b9421e81be917918c51f6539acf2976c7348510570ed90d1","observation_id":"4f68a163-986b-43dd-a9f1-828720e18bef","resolution":{"observed_at":"2026-08-01T00:59:19.257501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09301","last_updated":"2024-11-14T09:23:40Z","snapshot_observed_at":"2026-08-13T06:30:46.098333Z","submitted_at":"2024-11-14T09:23:40Z","title":"LHRS-Bot-Nova: Improved Multimodal Large Language Model for Remote Sensing Vision-Language Interpretation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.09301","snapshot_observed_at":"2026-08-01T00:59:19.359533Z","title":"Lhrs-bot-nova: Improved multimodal large language model for remote sensing vision-language interpretation.arXiv preprint arXiv:2411.09301, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:19.359533Z"},"links":{"cited_paper":"/paper/2411.09301","citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:c52fb62f719055fa244d96c435f7651146fe59b6e0c0380ee1d8e72c378da9ce","observation_id":"848e696c-d13d-4c81-8ba3-f004776e211c","resolution":{"observed_at":"2026-08-01T00:59:19.359533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:59:19.435240Z","title":"Earthmind: Leveraging cross-sensor data for advanced earth observation interpretation with a unified multimodal llm.arXiv preprint arXiv:2506.01667, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:19.435240Z"},"links":{"citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:26e8a8cbc76400b7fa624bff250b26f3cac4fdc00e4a002b7774dc22f5356697","observation_id":"b29b282b-bab2-41eb-835f-e708125f6286","resolution":{"observed_at":"2026-08-01T00:59:19.435240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:59:19.486302Z","title":"Klein, Salman Khan, and Fahad Khan","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:19.486302Z"},"links":{"citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:2742ebb2b2760b4a3cd6fcb485ed1bee17b82d66f280086e1e1939eda686a0bc","observation_id":"b5817d38-dbd8-4c31-aca0-310942558b45","resolution":{"observed_at":"2026-08-01T00:59:19.486302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:59:19.578996Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:19.578996Z"},"links":{"citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:2c56f20892b7163ad0d09f1d9b2ed3876050f9e8a0f41a0be2e6fb07b334b4d8","observation_id":"a97d61d4-c369-45e6-a60b-b6fa5fc67fb6","resolution":{"observed_at":"2026-08-01T00:59:19.578996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:59:19.658554Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:19.658554Z"},"links":{"citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:3bd159400e2a4c72f2f4cb91ad46269bd8e1de9278ae914e2200a021bd5311b7","observation_id":"d23355bd-07ba-4550-bdd9-d3925996e483","resolution":{"observed_at":"2026-08-01T00:59:19.658554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:59:19.789342Z","title":"Earthmarker: A visual prompting multi-modal large language model for remote sensing.IEEE Transactions on Geoscience and Remote Sensing, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:19.789342Z"},"links":{"citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:f6085283dfa622c5bda815a3591a127769e8daa87e357dd1f95b8dedb612c3d5","observation_id":"2563d57c-1345-4621-baed-f8ab87791800","resolution":{"observed_at":"2026-08-01T00:59:19.789342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:59:19.925428Z","title":"Rsunivlm: A unified vision-language model for remote sensing via granularity-oriented moe.Pattern Recognition, 179:113717, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:19.925428Z"},"links":{"citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:1372dca0a01cbe5a39dd19b51269e2ef80e13afff246e1e6a212a62635777a12","observation_id":"53f4792a-f73e-43c8-a7ad-4263692d2508","resolution":{"observed_at":"2026-08-01T00:59:19.925428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:59:20.039300Z","title":"Bermano, and Ohad Fried","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:20.039300Z"},"links":{"citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:0e8fd2d2d7612a342b4df099cc83f2c81c698a768f879b245440b0382b9490db","observation_id":"59ae6266-280f-4309-814a-f39ee181ff7e","resolution":{"observed_at":"2026-08-01T00:59:20.039300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:59:20.113408Z","title":"Chatearthnet: A global- scale image-text dataset empowering vision-language geo-foundation models.Earth System Science Data Discussions, pages 1–24, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:20.113408Z"},"links":{"citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:8e9730696f9933e0d64d9f234bba73e8ebba1790b4e658f6db2cccd98bbb4f43","observation_id":"bc98720a-f71e-4bdf-8341-3d066909722d","resolution":{"observed_at":"2026-08-01T00:59:20.113408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:59:20.219206Z","title":"Rsvqa: Visual question answering for remote sensing data.IEEE Transactions on Geoscience and Remote Sensing, 58(12):8555– 8566, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:20.219206Z"},"links":{"citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:70c341813d5d054bcc634abc95ae94f2839fb236008f91bfcfa6bd80d3415603","observation_id":"26665e13-7435-416b-8642-190480e9833e","resolution":{"observed_at":"2026-08-01T00:59:20.219206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:59:20.396216Z","title":"Mutual attention inception network for remote sensing visual question answering.IEEE Transactions on Geoscience and Remote Sensing, 60:1–14, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:20.396216Z"},"links":{"citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:2fc61708c786f42348ff90e898f6f387ef378441ec3f3dd8dc45615b6b818416","observation_id":"a384ffea-9a3a-4e32-80c3-00cc45c5a7b0","resolution":{"observed_at":"2026-08-01T00:59:20.396216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:59:20.604144Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:20.604144Z"},"links":{"citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:07f5debdf288fc72a8682d817daf31e8c7edb0c04867a4032b5b51ba43b651aa","observation_id":"38bcf153-7b20-4316-b4a6-0ae3f5e5e6bd","resolution":{"observed_at":"2026-08-01T00:59:20.604144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20213","last_updated":"2024-12-19T13:46:40Z","snapshot_observed_at":"2026-08-13T00:42:14.577442Z","submitted_at":"2024-03-29T14:50:43Z","title":"VHM: Versatile and Honest Vision Language Model for Remote Sensing Image Analysis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20213","snapshot_observed_at":"2026-08-01T00:59:20.770802Z","title":"H2rsvlm: Towards helpful and honest remote sensing large vision language model.arXiv preprint arXiv:2403.20213, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:20.770802Z"},"links":{"cited_paper":"/paper/2403.20213","citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:ca5d100f9981374684e5beb5849a3fa10f094d3066cee6f4ba8e419a5b68549f","observation_id":"6e171e44-4f04-46e4-97f5-1d0ae0d5def9","resolution":{"observed_at":"2026-08-01T00:59:20.770802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10100","last_updated":"2024-07-08T04:33:37Z","snapshot_observed_at":"2026-08-12T23:42:36.797128Z","submitted_at":"2024-06-14T14:57:07Z","title":"SkySenseGPT: A Fine-Grained Instruction Tuning Dataset and Model for Remote Sensing Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10100","snapshot_observed_at":"2026-08-01T00:59:20.911720Z","title":"Skysensegpt: A fine-grained instruction tuning dataset and model for remote sensing vision-language understanding.arXiv preprint arXiv:2406.10100, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:20.911720Z"},"links":{"cited_paper":"/paper/2406.10100","citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:8c81f06bf753e603f71ce264fc13f033021be81250f0d6d27a18467390f16bf1","observation_id":"efde5a10-6ec6-4f5a-a206-f4331c1d89bd","resolution":{"observed_at":"2026-08-01T00:59:20.911720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:59:21.061018Z","title":"Vhm: Versatile and honest vision language model for remote sensing image analysis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:21.061018Z"},"links":{"citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:76994f82e57b22729a3616c80ffed1c678ef18b3a3f901583758881b63522081","observation_id":"e31ab13a-0a6f-49c5-83a1-e314d39e4076","resolution":{"observed_at":"2026-08-01T00:59:21.061018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12384","last_updated":"2024-11-11T17:25:20Z","snapshot_observed_at":"2026-08-12T23:40:19.392783Z","submitted_at":"2024-06-18T08:15:21Z","title":"VRSBench: A Versatile Vision-Language Benchmark Dataset for Remote Sensing Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12384","snapshot_observed_at":"2026-08-01T00:59:21.171823Z","title":"Vrsbench: A versatile vision-language bench- mark dataset for remote sensing image understanding.arXiv preprint arXiv:2406.12384, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:21.171823Z"},"links":{"cited_paper":"/paper/2406.12384","citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:553b15277262e161e441c8d08aab8d636a55ba3734ccef42c34547f00da56c68","observation_id":"3dab8c60-d90d-4613-93e0-11591fb83241","resolution":{"observed_at":"2026-08-01T00:59:21.171823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23918","last_updated":"2025-07-03T16:49:39Z","snapshot_observed_at":"2026-08-11T12:22:14.746398Z","submitted_at":"2025-06-30T14:48:35Z","title":"Thinking with Images for Multimodal Reasoning: Foundations, Methods, and Future Frontiers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23918","snapshot_observed_at":"2026-08-01T00:59:21.369593Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:21.369593Z"},"links":{"cited_paper":"/paper/2506.23918","citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:fc6ea4350c75787b57505b91e80319cfb932b6f385527b74565ef269ce3371e9","observation_id":"8aae2d44-7d1e-4172-ad1c-c475cfd70279","resolution":{"observed_at":"2026-08-01T00:59:21.369593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20289","snapshot_observed_at":"2026-08-01T00:59:21.527737Z","title":"Visualtoolagent (vista): A reinforcement learning framework for visual tool selection.arXiv preprint arXiv:2505.20289, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:21.527737Z"},"links":{"cited_paper":"/paper/2505.20289","citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:7b646ea177b845cf0771a52227f86519a0954fa78eaa86581a5fcfbc95e63e8d","observation_id":"12c40016-1136-4111-a9a1-a24b220f201d","resolution":{"observed_at":"2026-08-01T00:59:21.527737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:59:21.686719Z","title":"Spacetools: Tool-augmented spatial reasoning via double interactive rl, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:21.686719Z"},"links":{"citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:abe7cd54852b1ab632afdb8fc67e151cb6dc92d89aec62d660557f08c12e5db4","observation_id":"b05c17d7-b308-4078-b392-782864e90a7f","resolution":{"observed_at":"2026-08-01T00:59:21.686719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14821","last_updated":"2025-08-05T03:49:33Z","snapshot_observed_at":"2026-08-13T08:58:17.203670Z","submitted_at":"2025-06-10T20:11:44Z","title":"Reinforcing VLMs to Use Tools for Detailed Visual Reasoning Under Resource Constraints","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14821","snapshot_observed_at":"2026-08-01T00:59:21.754125Z","title":"Reinforcing vlms to use tools for detailed visual reasoning under resource constraints.arXiv preprint arXiv:2506.14821, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:21.754125Z"},"links":{"cited_paper":"/paper/2506.14821","citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:3671f43750ddaf9d6001530a3087b6fc3b7cc725168118719af394ef15480890","observation_id":"b16b97a9-0b9a-4018-ab06-12f1346796d1","resolution":{"observed_at":"2026-08-01T00:59:21.754125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.19820","last_updated":"2026-04-13T18:49:58Z","snapshot_observed_at":"2026-08-11T02:46:41.234892Z","submitted_at":"2025-11-25T01:21:26Z","title":"CropVLM: Learning to Zoom for Fine-Grained Vision-Language Perception","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.19820","snapshot_observed_at":"2026-08-01T00:59:21.920265Z","title":"Cropvlm: Learning to zoom for fine-grained vision-language perception.arXiv preprint arXiv:2511.19820, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:21.920265Z"},"links":{"cited_paper":"/paper/2511.19820","citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:a8a150cb3ab6567f726bedec34f56dd0a4769779c3d20a707971d7043933322c","observation_id":"81d1eaf5-cb09-45af-abb6-2528bd1a5cad","resolution":{"observed_at":"2026-08-01T00:59:21.920265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15436","last_updated":"2025-12-05T05:44:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T12:18:15Z","title":"Adaptive Chain-of-Focus Reasoning via Dynamic Visual Search and Zooming for Efficient VLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15436","snapshot_observed_at":"2026-08-01T00:59:22.118346Z","title":"Adaptive chain-of-focus reasoning via dynamic visual search and zooming for efficient vlms.arXiv preprint arXiv:2505.15436, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:22.118346Z"},"links":{"cited_paper":"/paper/2505.15436","citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:ca410447f4baa009f198a58f43ff2fec1ad5c748d526858f156eed8cf4e8a1fa","observation_id":"b5c9ff74-6e74-48f0-b20a-0614f1eb827d","resolution":{"observed_at":"2026-08-01T00:59:22.118346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:59:22.279050Z","title":"Sensenova- mars: Empowering multimodal agentic reasoning and search via reinforcement learning.arXiv preprint arXiv:2512.24330, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:22.279050Z"},"links":{"citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:558b50eab3fec92e3c60464d647937bbc73ea690d48b1c481c29a1524144113f","observation_id":"5ea80939-15a8-41db-919c-9e1fd68a0d8b","resolution":{"observed_at":"2026-08-01T00:59:22.279050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15966","last_updated":"2025-10-24T09:35:22Z","snapshot_observed_at":"2026-07-06T21:28:06.120576Z","submitted_at":"2025-05-21T19:35:08Z","title":"Pixel Reasoner: Incentivizing Pixel-Space Reasoning with Curiosity-Driven Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15966","snapshot_observed_at":"2026-08-01T00:59:22.526800Z","title":"Pixel reasoner: Incentivizing pixel-space reasoning with curiosity-driven reinforcement learning.arXiv preprint arXiv:2505.15966, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:22.526800Z"},"links":{"cited_paper":"/paper/2505.15966","citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:526a5c442e2053086489b0b5e9d472392999857f455d21cae726186cdbcf060b","observation_id":"f3b598d4-7731-463b-9f71-738c39bc372d","resolution":{"observed_at":"2026-08-01T00:59:22.526800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:59:22.676414Z","title":"Reinforcing spatial reasoning in vision-language models with interwoven thinking and visual drawing, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:22.676414Z"},"links":{"citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:b605b5778228b3fa50ad6de82a92c746cb4532f5ceeb040bb23fc4ae9f2627aa","observation_id":"4da40ed0-c0d3-441c-9daa-7a8a0c18bd8f","resolution":{"observed_at":"2026-08-01T00:59:22.676414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-12T17:29:41.806995Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-01T00:59:22.748692Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:22.748692Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:fb65e28c1675339ccb771ae79da53910c1013c3995a4cb76c50826e9f9a3f198","observation_id":"9813b036-09b0-4d65-ac6a-ba7a1bd105bd","resolution":{"observed_at":"2026-08-01T00:59:22.748692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:59:22.837480Z","title":"Introducing gpt-5.4","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:22.837480Z"},"links":{"citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:8769f52ce5c61a92182930572763aa1447324de5ec01ee6064542033ba48be29","observation_id":"110b0c09-67c1-4d65-b886-2b4f74bfd8a8","resolution":{"observed_at":"2026-08-01T00:59:22.837480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:59:23.081848Z","title":"The claude 4.6 model family","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:23.081848Z"},"links":{"citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:24fc9a708f7f8da63c559e849f50b7680e4e30c7ef9d6ca320460d1ddc0123ae","observation_id":"969d2ab0-ff69-4ca3-ac98-c6f804f4bb31","resolution":{"observed_at":"2026-08-01T00:59:23.081848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-11T14:42:37.584016Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-01T00:59:23.284240Z","title":"Qwen3-vl technical report.arXiv preprint arXiv:2511.21631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:23.284240Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:f50217f0da13c8ba9960286aaf73c58d6b9f4c4056e8a2b82e49f641f12e8068","observation_id":"2f458609-188c-4961-b143-3132fb560d04","resolution":{"observed_at":"2026-08-01T00:59:23.284240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:59:23.420815Z","title":"Gpt-5.2: Advancing science and math","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:23.420815Z"},"links":{"citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:307e9d14a29eeaccfc4cb54a0a3705846f2bd3350f4cd1e53061fbae58ac3848","observation_id":"8fcdab0b-ec14-4b69-a1d5-7ab571857588","resolution":{"observed_at":"2026-08-01T00:59:23.420815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04236","last_updated":"2025-03-02T09:39:57Z","snapshot_observed_at":"2026-08-13T04:24:55.131656Z","submitted_at":"2024-02-06T18:43:48Z","title":"CogCoM: A Visual Language Model with Chain-of-Manipulations Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04236","snapshot_observed_at":"2026-08-01T00:59:23.594318Z","title":"Cogcom: Train large vision-language models diving into details through chain of manipulations.arXiv preprint arXiv:2402.04236, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:23.594318Z"},"links":{"cited_paper":"/paper/2402.04236","citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:b739f20ecf18341b9d869e392402a024bb43d306399b1c20a8999351c7935e15","observation_id":"ed036522-578f-41d6-b106-3daf4b5e86d6","resolution":{"observed_at":"2026-08-01T00:59:23.594318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-01T00:59:23.699554Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:23.699554Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:938fd8c84d3a5b9e08ce880e579fb7b4ec66c9ff4e92704f5a5af2c43934af4f","observation_id":"4623532c-32af-45c6-a840-567602617eb1","resolution":{"observed_at":"2026-08-01T00:59:23.699554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T09:12:54.999095Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-01T00:59:23.904221Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:23.904221Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:173f4c8f4ec926b3e904fd470ef9dc89fb4ed679635f0185f1dd4687839fc46a","observation_id":"173d56fb-755b-424c-afd9-e481bf4dd932","resolution":{"observed_at":"2026-08-01T00:59:23.904221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:59:24.119707Z","title":"Claude 3.7 sonnet.https://www.anthropic.com, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:24.119707Z"},"links":{"citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:69019c7ba051065ebce4b7e9737473793c3b5bf1e4125e78452c5ca336311800","observation_id":"c0ea6155-5476-498b-8c74-6e94153e5854","resolution":{"observed_at":"2026-08-01T00:59:24.119707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-01T00:59:24.259442Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and agentic capabilities.arXiv preprint arXiv:2507.06261, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:24.259442Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:e1a1963eb7355141075759b086c063678af2163a831fc29e6eaea3c1b448b11d","observation_id":"ce446c75-0f10-49c5-b742-d489d7fe1c7f","resolution":{"observed_at":"2026-08-01T00:59:24.259442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-01T00:59:24.347294Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models.arXiv preprint arXiv:2504.10479, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:24.347294Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:9d97ae89d02142bd6ef74585d35c8c17390baf3c44608fe41944a29cbf61a000","observation_id":"b27e1f69-2c10-42bc-8d0f-79df976f9b78","resolution":{"observed_at":"2026-08-01T00:59:24.347294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-01T00:59:24.455888Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:24.455888Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:da4d7bd53a8f65ccd71ac73e6279cf0b04ee04246e3262716895e3b6f7c5019f","observation_id":"e4edfa49-1e15-4af3-9132-b1e55c692976","resolution":{"observed_at":"2026-08-01T00:59:24.455888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:59:24.529399Z","title":"Internvl 2.5: Scaling up vision-language models with enhanced visual encoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:24.529399Z"},"links":{"citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:26da2cd8b3a05ebff8aefc18e395cdd2a965c453430d1e7c03ce76fde90998be","observation_id":"c2acb3f3-628c-4a4d-aec6-4e9aa2b459a4","resolution":{"observed_at":"2026-08-01T00:59:24.529399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:59:24.602875Z","title":"Intern-s1-mini","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:24.602875Z"},"links":{"citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:eea4b38d29c5c9d5c98cd87c0826e36819c0157d286cba4b70910527a37fdce7","observation_id":"ba836203-b390-4abe-9c4b-65f75ad38898","resolution":{"observed_at":"2026-08-01T00:59:24.602875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:59:24.712561Z","title":"Scaling vision pre-training to 4k resolution, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:24.712561Z"},"links":{"citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:933061314fe5b211480f1a6624d018d382209c38487169ac6e01eede7c35b6a1","observation_id":"04314910-d95d-46a0-ba5a-f4510459b4a7","resolution":{"observed_at":"2026-08-01T00:59:24.712561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-01T00:59:24.852448Z","title":"Minicpm-v: A gpt-4v level mllm on your phone.arXiv preprint arXiv:2408.01800, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:24.852448Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:3ab692c4c07a277014a07971d191244869b3bf86466152bc8852b40c0942f542","observation_id":"89cc5eed-8ea0-411f-b726-447b9a64a00f","resolution":{"observed_at":"2026-08-01T00:59:24.852448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-08-13T04:48:56.237545Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-01T00:59:24.958431Z","title":"Internvl3.5: Advancing open-source multimodal models in versatility, reasoning, and efficiency.arXiv preprint arXiv:2508.18265, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:24.958431Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:9459c04d21a02b5be1a7d68263584fb58795f20618a44e2cbda3c3c21b3c5c8d","observation_id":"65d12c25-be27-4cbb-a7bf-f55fddb49ef5","resolution":{"observed_at":"2026-08-01T00:59:24.958431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-10T14:07:02.234322Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-01T00:59:25.064532Z","title":"Phi-3 technical report: A highly capable language model locally on your phone.arXiv preprint arXiv:2404.14219, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:25.064532Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:9a34f147c2a7354330cf510be44d5c6086a6e2e34769b9ed2279bc306197b4ea","observation_id":"4cdacec1-aaf1-4bdd-ae93-d183aa36a112","resolution":{"observed_at":"2026-08-01T00:59:25.064532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-11T01:38:59.827005Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-01T00:59:25.168541Z","title":"Deepseek-vl: towards real-world vision-language understanding.arXiv preprint arXiv:2403.05525, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:25.168541Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:dcab2bd0d135e212aa2b93a781b0173c46055d1c29452267b054ce645eb15b04","observation_id":"131db01f-fad7-4211-b698-e3a62726865b","resolution":{"observed_at":"2026-08-01T00:59:25.168541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:59:25.243527Z","title":"Hello gpt-4o.https://openai.com/index/hello-gpt-4o, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:25.243527Z"},"links":{"citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:7025d2e33d6fe7844e202d81d77761d58e9790c895242f7a2a799e76e48b2003","observation_id":"fdd8507f-2f26-4c3f-84b7-6da8c8bacf4f","resolution":{"observed_at":"2026-08-01T00:59:25.243527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:59:25.345011Z","title":"Gpt-4o mini: advancing cost-efficient intelligence","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:25.345011Z"},"links":{"citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:b977a87addac5fe8b3799a61b4101a53e59db3652481e2a02d847d44366e1b35","observation_id":"d090fcbd-c8b2-458d-9669-43a09a9333b1","resolution":{"observed_at":"2026-08-01T00:59:25.345011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.23661","snapshot_observed_at":"2026-08-01T00:59:25.422944Z","title":"Llava-onevision-1.5: Fully open framework for democratized multimodal training.arXiv preprint arXiv:2509.23661, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:25.422944Z"},"links":{"cited_paper":"/paper/2509.23661","citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:b07162f37cd5fcf91cdfbde1e383cf4927c9fac5955a0f5b0432dfe6a74ddd64","observation_id":"75d0d3e2-ae73-4ecf-b933-363859c22b00","resolution":{"observed_at":"2026-08-01T00:59:25.422944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-01T00:59:25.492470Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:25.492470Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:b32bf7d8cab3f958238b843eee386cae011cf5a080dd4769d996e7752221c586","observation_id":"fe6a7bc3-b2ba-48e8-89bd-d1f06d7c25d6","resolution":{"observed_at":"2026-08-01T00:59:25.492470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03320","last_updated":"2024-07-03T17:59:21Z","snapshot_observed_at":"2026-08-13T05:45:31.410659Z","submitted_at":"2024-07-03T17:59:21Z","title":"InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03320","snapshot_observed_at":"2026-08-01T00:59:25.571086Z","title":"Internlm-xcomposer-2.5: A versatile large vision language model supporting long-contextual input and output.arXiv preprint arXiv:2407.03320, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:25.571086Z"},"links":{"cited_paper":"/paper/2407.03320","citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:eaeb6ac679f85b965d601dfb7669cfa962fc3b71f6dcf349b5f195200e3cfbb3","observation_id":"3ade99b4-5603-491e-b1ab-50aab15b220c","resolution":{"observed_at":"2026-08-01T00:59:25.571086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:59:25.630835Z","title":"Internlm2 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:25.630835Z"},"links":{"citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:e426ac35f3d9697521d2a76601e46d6eb972e59a9a874b0a6f5a5a451331702d","observation_id":"cffc18e7-6fd1-4e01-9dd5-0225277e5e2b","resolution":{"observed_at":"2026-08-01T00:59:25.630835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:59:25.734409Z","title":"Internlm3.https://github.com/InternLM, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:25.734409Z"},"links":{"citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:9f5b4edcc387e0c51438996c9451f593d4fc2c44dfc7e98a7c00b76dae75067d","observation_id":"f45abd77-c0e3-48b5-aa2a-f4fe01a12570","resolution":{"observed_at":"2026-08-01T00:59:25.734409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-01T00:59:25.930022Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90% chatgpt quality.arXiv preprint arXiv:2306.05685, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:25.930022Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:bf4453da6cd5162e2b26f5960a05109d2002f877bced4fd977eccd4284ac426f","observation_id":"5d6e9cef-d45f-4363-b862-c74f629bddba","resolution":{"observed_at":"2026-08-01T00:59:25.930022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16192","last_updated":"2025-05-30T06:35:34Z","snapshot_observed_at":"2026-08-13T10:35:27.168760Z","submitted_at":"2025-05-22T03:50:13Z","title":"VLM-R$^3$: Region Recognition, Reasoning, and Refinement for Enhanced Multimodal Chain-of-Thought","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.16192","snapshot_observed_at":"2026-08-01T00:59:25.996486Z","title":"Vlm-r 3: Region recognition, reasoning, and refinement for enhanced multimodal chain-of-thought.arXiv preprint arXiv:2505.16192, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:25.996486Z"},"links":{"cited_paper":"/paper/2505.16192","citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:80f8468cbb58c50bd5440a6af54c50ef200b7fab804be0154c445768f1564347","observation_id":"b360c749-1614-45a1-8676-f81404cd65e4","resolution":{"observed_at":"2026-08-01T00:59:25.996486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:59:26.104529Z","title":"Fair1m: A benchmark dataset for fine-grained object recognition in high-resolution remote sensing imagery.ISPRS Journal of Photogrammetry and Remote Sensing, 184:116–130, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:26.104529Z"},"links":{"citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:4aed1badc843e6c7a36aae772938d5e5f1538c02545d9cd94e5c351b7e565f73","observation_id":"eaae9c14-519a-480c-a673-644432dd9cd2","resolution":{"observed_at":"2026-08-01T00:59:26.104529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:59:26.218778Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-01T00:59:26.218778Z"},"links":{"citing_paper":"/paper/2607.25993"},"observation_digest":"sha256:8566723216f1939fc56b0d3d0d1550287df4c17750eaae37bafb7df51a76983f","observation_id":"2567ef06-e15a-40c5-b4c0-98febc8c1b2c","resolution":{"observed_at":"2026-08-01T00:59:26.218778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.25993","last_updated":"2026-07-28T17:09:16Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T12:27:46.074162Z","submitted_at":"2026-07-28T17:09:16Z","title":"Beyond Zooming: Learning Multi-Tool Visual Reasoning for Ultra-High-Resolution Remote Sensing"},"reference_resolution":{"displayed":78,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":78,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":78},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 78 of 78 outbound references and 0 inbound Pith citation observations for arXiv:2607.25993."}