{"as_of":"2026-08-11T11:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b0d59124c1361203372e97702930e034b44f1c706314217444b1dd6d78d5f3e8","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T13:53:13.255412Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2604.13565/citation-record","integrity":"/paper/2604.13565/integrity","json":"/paper/2604.13565/citation-record.json","paper":"/paper/2604.13565"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.08905","last_updated":"2024-12-12T03:37:41Z","snapshot_observed_at":"2026-08-05T04:04:21.846023Z","submitted_at":"2024-12-12T03:37:41Z","title":"Phi-4 Technical Report","version":1},"cited_work":{"arxiv_id":"2412.08905","doi":"10.48550/arxiv.2412.08905","metadata_source":"pith","pith_arxiv_id":"2412.08905","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Phi-4 Technical Report","venue":"cs.CL","work_id":"b6274271-7af9-4ee8-993b-ba1ba4205ba8","year":2024},"citing_paper":{"arxiv_id":"2604.13565","last_updated":"2026-04-15T07:21:37Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T07:21:37Z","title":"UHR-BAT: Budget-Aware Token Compression Vision-Language model for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T13:53:13.255412Z"},"links":{"cited_paper":"/paper/2412.08905","citing_paper":"/paper/2604.13565"},"observation_digest":"sha256:eb6077b98c0cbf62edb7db214ef13a0f6e1e30495b923b12fb0042e2bbdc8876","observation_id":"10d5bb70-009c-487f-98bd-1d4a92bbec88","resolution":{"observed_at":"2026-05-11T06:34:04.627981Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-02T03:08:11.323957+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T03:08:11.323957+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2604.13565","last_updated":"2026-04-15T07:21:37Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T07:21:37Z","title":"UHR-BAT: Budget-Aware Token Compression Vision-Language model for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T13:53:13.255412Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2604.13565"},"observation_digest":"sha256:adbdbb69f5db9646fd55575996e1f22395cfb9713aa1c5b4fdf29baf5cad75c9","observation_id":"b743bf03-f52b-4f71-af2f-94a6c4b40e93","resolution":{"observed_at":"2026-05-10T13:55:28.943074Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.06794","last_updated":"2023-06-05T17:55:12Z","snapshot_observed_at":"2026-08-10T09:03:43.940864Z","submitted_at":"2022-09-14T17:24:07Z","title":"PaLI: A Jointly-Scaled Multilingual Language-Image Model","version":4},"cited_work":{"arxiv_id":"2209.06794","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.06794","snapshot_observed_at":"2026-07-04T19:30:07.491958Z","title":"PaLI: A Jointly-Scaled Multilingual Language-Image Model","venue":"cs.CV","work_id":"29921cff-29c1-4aad-a27d-adac346027ec","year":2022},"citing_paper":{"arxiv_id":"2604.13565","last_updated":"2026-04-15T07:21:37Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T07:21:37Z","title":"UHR-BAT: Budget-Aware Token Compression Vision-Language model for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T13:53:13.255412Z"},"links":{"cited_paper":"/paper/2209.06794","citing_paper":"/paper/2604.13565"},"observation_digest":"sha256:e48ef4ded1b958e496a309b01129f81fa6343a7369326cd4ad5f80f66d1f1fda","observation_id":"e9eb6281-4bf4-4163-942a-6f70a5b2385d","resolution":{"observed_at":"2026-05-16T09:29:06.753688Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":"2412.05271","doi":"10.48550/arxiv.2412.05271","metadata_source":"pith","pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","venue":"cs.CV","work_id":"ee70bdc8-4656-4849-ada7-ce42a2278d70","year":2024},"citing_paper":{"arxiv_id":"2604.13565","last_updated":"2026-04-15T07:21:37Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T07:21:37Z","title":"UHR-BAT: Budget-Aware Token Compression Vision-Language model for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T13:53:13.255412Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2604.13565"},"observation_digest":"sha256:449b3b0537c7796fe2a967246ffd4dde192acca0e91602be51d660c8aac819fb","observation_id":"be95497e-1c19-49f7-984d-9c1a7e3db8a4","resolution":{"observed_at":"2026-05-10T13:55:28.882325Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.919385+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-08-09T19:28:34.281681Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"cited_work":{"arxiv_id":"2402.03766","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.03766","snapshot_observed_at":"2026-07-10T11:37:03.180051Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","venue":"cs.CV","work_id":"b2a31c77-14f8-424e-8168-db57f01b6736","year":2024},"citing_paper":{"arxiv_id":"2604.13565","last_updated":"2026-04-15T07:21:37Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T07:21:37Z","title":"UHR-BAT: Budget-Aware Token Compression Vision-Language model for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T13:53:13.255412Z"},"links":{"cited_paper":"/paper/2402.03766","citing_paper":"/paper/2604.13565"},"observation_digest":"sha256:dfd652b82ad1590304ac6b62bd4b28f44b9cbe5a8544c708f5b191e1782d4dc7","observation_id":"66deedc9-2dc7-486d-9b70-61735715618a","resolution":{"observed_at":"2026-05-18T15:27:52.297815Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":"2507.06261","doi":"10.48550/arxiv.2503.19","metadata_source":"pith","pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T03:17:51.364436Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","venue":"cs.CL","work_id":"008df105-2fdd-45d8-857a-8e35868aecb6","year":2025},"citing_paper":{"arxiv_id":"2604.13565","last_updated":"2026-04-15T07:21:37Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T07:21:37Z","title":"UHR-BAT: Budget-Aware Token Compression Vision-Language model for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T13:53:13.255412Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2604.13565"},"observation_digest":"sha256:712addaaaa63c265a71c38a3e9df0f8b5e4bbe28df36bc66bf2261962b0264bd","observation_id":"e6bf72af-f900-4464-94c8-2f652b3890ac","resolution":{"observed_at":"2026-05-10T13:55:28.886711Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02104","last_updated":"2024-12-03T02:54:31Z","snapshot_observed_at":"2026-08-11T02:03:00.199542Z","submitted_at":"2024-12-03T02:54:31Z","title":"Explainable and Interpretable Multimodal Large Language Models: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":"2412.02104","doi":"10.48550/arxiv.2412.02104","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.02104","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Explainable and interpretable multimodal large language models: A comprehensive survey","venue":"arXiv (Cornell University)","work_id":"ca6d8610-ceff-4c4d-beff-d2f876503d3e","year":2024},"citing_paper":{"arxiv_id":"2604.13565","last_updated":"2026-04-15T07:21:37Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T07:21:37Z","title":"UHR-BAT: Budget-Aware Token Compression Vision-Language model for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T13:53:13.255412Z"},"links":{"cited_paper":"/paper/2412.02104","citing_paper":"/paper/2604.13565"},"observation_digest":"sha256:7c88f65b6ae8cb1f357614d02ac4b03913279b1c16874ce5f8dd73b1bf7bfed8","observation_id":"9ada7a52-d94c-42ab-8348-381645d93efc","resolution":{"observed_at":"2026-05-10T13:55:28.864017Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.24022","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fuse-rsvlm: Feature fusion vision-language model for remote sensing","venue":null,"work_id":"dd840b12-5c12-45f8-9f12-dc8d0a1dfe1f","year":2025},"citing_paper":{"arxiv_id":"2604.13565","last_updated":"2026-04-15T07:21:37Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T07:21:37Z","title":"UHR-BAT: Budget-Aware Token Compression Vision-Language model for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T13:53:13.255412Z"},"links":{"citing_paper":"/paper/2604.13565"},"observation_digest":"sha256:9a0d87494ee503b0b87d36349d089771146e5c23c6ac9694e8a0688e1a391ac7","observation_id":"41dffd84-efdf-410f-a7cf-d3cda9244948","resolution":{"observed_at":"2026-05-10T13:55:28.859406Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":"2410.21276","doi":"10.1177/15248380231178756","metadata_source":"pith","pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4o System Card","venue":"cs.CL","work_id":"f37bf1c7-4964-4e56-9762-d20da8d9009f","year":2024},"citing_paper":{"arxiv_id":"2604.13565","last_updated":"2026-04-15T07:21:37Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T07:21:37Z","title":"UHR-BAT: Budget-Aware Token Compression Vision-Language model for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T13:53:13.255412Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2604.13565"},"observation_digest":"sha256:b0d17a62885b3da6092e46cdc93baf395fa8ee9fad4f997745adbd765239401b","observation_id":"e02b6a43-6fbf-4be8-9971-81e4cdcd2f23","resolution":{"observed_at":"2026-05-10T13:55:28.868449Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.14795","last_updated":"2022-03-15T22:37:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-30T17:53:34Z","title":"Perceiver IO: A General Architecture for Structured Inputs & Outputs","version":3},"cited_work":{"arxiv_id":"2107.14795","doi":"10.48550/arxiv.2107.14795","metadata_source":"pith","pith_arxiv_id":"2107.14795","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Perceiver IO: A General Architecture for Structured Inputs & Outputs","venue":"cs.LG","work_id":"92bf7a73-2bef-4de4-8957-a9233d60b416","year":2021},"citing_paper":{"arxiv_id":"2604.13565","last_updated":"2026-04-15T07:21:37Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T07:21:37Z","title":"UHR-BAT: Budget-Aware Token Compression Vision-Language model for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T13:53:13.255412Z"},"links":{"cited_paper":"/paper/2107.14795","citing_paper":"/paper/2604.13565"},"observation_digest":"sha256:a499068c1725f52264d373fee9ca8a1e453995c441a402eb159ef92ef065037d","observation_id":"43793d89-f142-4146-9280-b7ba2545f853","resolution":{"observed_at":"2026-05-15T19:47:14.368858Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":"2408.03326","doi":"10.48550/arxiv.2408.03326","metadata_source":"pith","pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","venue":"cs.CV","work_id":"f5f2452b-f2a9-49ac-b38d-c76e18cdfe49","year":2024},"citing_paper":{"arxiv_id":"2604.13565","last_updated":"2026-04-15T07:21:37Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T07:21:37Z","title":"UHR-BAT: Budget-Aware Token Compression Vision-Language model for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T13:53:13.255412Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2604.13565"},"observation_digest":"sha256:0141a2866d406b1b3ae33e239f87ff35304944fd66dcb21bc5ee9a50b6cb7ca3","observation_id":"803264ab-af06-49ee-bafc-52a41ccd21ae","resolution":{"observed_at":"2026-05-10T13:55:28.841281Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.12267","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T05:27:39.989410Z","title":"Zoomearth: Active perception for ultra-high-resolution geospatial vision-language tasks","venue":null,"work_id":"ed2c8189-cc00-4577-95e4-d7c11193ad69","year":2025},"citing_paper":{"arxiv_id":"2604.13565","last_updated":"2026-04-15T07:21:37Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T07:21:37Z","title":"UHR-BAT: Budget-Aware Token Compression Vision-Language model for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T13:53:13.255412Z"},"links":{"citing_paper":"/paper/2604.13565"},"observation_digest":"sha256:6e26f6d191bd811590292ea75ba1660c7ac53aeff892a379be0b3375d6e5f983","observation_id":"758ae707-d055-446e-a5f7-fef6647e10f9","resolution":{"observed_at":"2026-05-10T13:55:28.877832Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-11T01:38:59.827005Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":"2403.05525","doi":"10.48550/arxiv.2403.05525","metadata_source":"pith","pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","venue":"cs.AI","work_id":"30da36a4-b9ad-4618-8955-c09232b61343","year":2024},"citing_paper":{"arxiv_id":"2604.13565","last_updated":"2026-04-15T07:21:37Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T07:21:37Z","title":"UHR-BAT: Budget-Aware Token Compression Vision-Language model for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T13:53:13.255412Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2604.13565"},"observation_digest":"sha256:c5f0fb506ca04e8cf0698e783b07152fb11d671e94d375f3a59858dd5262834f","observation_id":"4694d5be-3c81-497e-80d9-5804e5b594f3","resolution":{"observed_at":"2026-05-11T17:58:54.896552Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-08-10T11:40:09.342794Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2403.03003","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-07-03T04:27:37.024796Z","title":"Feast your eyes: Mixture-of- resolution adaptation for multimodal large language models","venue":null,"work_id":"f100b81f-dd1f-471e-819a-bd7b0c74c063","year":2025},"citing_paper":{"arxiv_id":"2604.13565","last_updated":"2026-04-15T07:21:37Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T07:21:37Z","title":"UHR-BAT: Budget-Aware Token Compression Vision-Language model for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T13:53:13.255412Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2604.13565"},"observation_digest":"sha256:bc0415eebca978318ada147bdcb73777d1e3955071e360efbfefca843fe9f806","observation_id":"d7e78842-bf47-44bf-b04b-89513cee8a1e","resolution":{"observed_at":"2026-05-10T13:55:28.929452Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06960","last_updated":"2023-12-12T03:39:07Z","snapshot_observed_at":"2026-07-06T17:00:11.930733Z","submitted_at":"2023-12-12T03:39:07Z","title":"Remote Sensing Vision-Language Foundation Models without Annotations via Ground Remote Alignment","version":1},"cited_work":{"arxiv_id":"2312.06960","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06960","snapshot_observed_at":"2026-06-29T08:13:16.012751Z","title":"P., Liu, M","venue":null,"work_id":"288f946f-f03b-4ad4-a2eb-8947da9382ce","year":2023},"citing_paper":{"arxiv_id":"2604.13565","last_updated":"2026-04-15T07:21:37Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T07:21:37Z","title":"UHR-BAT: Budget-Aware Token Compression Vision-Language model for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T13:53:13.255412Z"},"links":{"cited_paper":"/paper/2312.06960","citing_paper":"/paper/2604.13565"},"observation_digest":"sha256:a09f460cd97668f8d77184c438030cb2d231b31210df618d799e47b1065ab6f9","observation_id":"05ac4714-57d8-430b-8b4c-7af0fb851665","resolution":{"observed_at":"2026-05-10T13:55:28.947914Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pang, C., Wu, J., Li, J., Liu, Y ., Sun, J., Li, W., Weng, X., Wang, S., Feng, L., Xia, G.-S., et al","venue":null,"work_id":"c34c3ab6-9354-4856-b345-774522c21f55","year":2025},"citing_paper":{"arxiv_id":"2604.13565","last_updated":"2026-04-15T07:21:37Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T07:21:37Z","title":"UHR-BAT: Budget-Aware Token Compression Vision-Language model for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T13:53:13.255412Z"},"links":{"citing_paper":"/paper/2604.13565"},"observation_digest":"sha256:45f8bbbb75aa15c9d1cc918d02ad376f0dc50c1c9032c4df9b81af707f948aee","observation_id":"1fe73360-2323-4e6d-b566-5b72059d795d","resolution":{"observed_at":"2026-05-18T20:32:51.638803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":"2312.11805","doi":"10.1038/nrn2888","metadata_source":"pith","pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini: A Family of Highly Capable Multimodal Models","venue":"cs.CL","work_id":"83f7c85b-3f11-450f-ac0c-64d9745220b2","year":2023},"citing_paper":{"arxiv_id":"2604.13565","last_updated":"2026-04-15T07:21:37Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T07:21:37Z","title":"UHR-BAT: Budget-Aware Token Compression Vision-Language model for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T13:53:13.255412Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2604.13565"},"observation_digest":"sha256:7acf34ccfaa7a51de185c9c267e879ed0838961f35926e5c59287b0ce8cefbd2","observation_id":"c67f5314-4cc2-4240-a3f8-dcd1b3d58f48","resolution":{"observed_at":"2026-05-10T13:55:28.895324Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.21375","doi":"10.48550/arxiv.2505.21375","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Geollava-8k: Scaling remote-sensing multimodal large language models to 8k resolution","venue":"ArXiv.org","work_id":"e8b770f4-ab0f-4fa1-9b6e-f9bd0e4e8960","year":2025},"citing_paper":{"arxiv_id":"2604.13565","last_updated":"2026-04-15T07:21:37Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T07:21:37Z","title":"UHR-BAT: Budget-Aware Token Compression Vision-Language model for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T13:53:13.255412Z"},"links":{"citing_paper":"/paper/2604.13565"},"observation_digest":"sha256:379d8f23b60e60282d6863a6f3281faf51b985635ec0bfa60186a0f3984d8718","observation_id":"e514c6c9-a609-403d-9c4c-39e1164a92fe","resolution":{"observed_at":"2026-05-10T13:55:28.919701Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":"2508.18265","doi":"10.48550/arxiv.2508.18265","metadata_source":"pith","pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","venue":"cs.CV","work_id":"b8f5e260-fff5-444e-bcf5-2c42cfefd83d","year":2025},"citing_paper":{"arxiv_id":"2604.13565","last_updated":"2026-04-15T07:21:37Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T07:21:37Z","title":"UHR-BAT: Budget-Aware Token Compression Vision-Language model for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T13:53:13.255412Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2604.13565"},"observation_digest":"sha256:72e036239adbb49a767cdbe3f3e9faefa9b2acd52972335d5e25ab53a51df353","observation_id":"3d400f2f-eff3-4772-a8dd-bb6c7efc96e3","resolution":{"observed_at":"2026-05-10T13:55:28.900179Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-10T17:38:12.771444+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T17:38:12.771444+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.23615","last_updated":"2026-07-08T09:59:15Z","snapshot_observed_at":"2026-08-10T15:08:39.459637Z","submitted_at":"2026-02-27T02:43:35Z","title":"HART: High-Resolution Annotation-Free Reasoning Technique through a Closed-loop Framework","version":3},"cited_work":{"arxiv_id":"2602.23615","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2602.23615","snapshot_observed_at":"2026-07-09T02:19:51.127350Z","title":"Annotation-free visual reasoning for high-resolution large multimodal models via rein- forcement learning.arXiv preprint arXiv:2602.23615","venue":null,"work_id":"fa53f23d-b500-442b-a7a0-393610ddb4fb","year":null},"citing_paper":{"arxiv_id":"2604.13565","last_updated":"2026-04-15T07:21:37Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T07:21:37Z","title":"UHR-BAT: Budget-Aware Token Compression Vision-Language model for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T13:53:13.255412Z"},"links":{"cited_paper":"/paper/2602.23615","citing_paper":"/paper/2604.13565"},"observation_digest":"sha256:ff1e089adfa5145ac6bbf2284ceb303465eb6c886e88b74944b6d47db00a5356","observation_id":"b093fa26-d4ce-4b8a-97aa-daa1ec2ec902","resolution":{"observed_at":"2026-07-09T02:19:51.127350Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":"2408.01800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-07-10T11:37:03.161139Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","venue":"cs.CV","work_id":"0f06e436-0c76-4e3c-be5e-6168f6bc4336","year":2024},"citing_paper":{"arxiv_id":"2604.13565","last_updated":"2026-04-15T07:21:37Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T07:21:37Z","title":"UHR-BAT: Budget-Aware Token Compression Vision-Language model for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T13:53:13.255412Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2604.13565"},"observation_digest":"sha256:601e96c4fa5c6d1a2ca9927c635fdc2fc2066375a52a2330e3b57ca4dd6f8147","observation_id":"1e1f7aad-727b-41f6-a4f9-25ea935e6e7f","resolution":{"observed_at":"2026-05-10T21:07:32.698795Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16862","last_updated":"2024-06-21T07:08:59Z","snapshot_observed_at":"2026-08-03T02:27:58.110775Z","submitted_at":"2023-12-28T07:11:41Z","title":"TinyGPT-V: Efficient Multimodal Large Language Model via Small Backbones","version":3},"cited_work":{"arxiv_id":"2312.16862","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.16862","snapshot_observed_at":"2026-06-28T19:12:34.660205Z","title":"Tinygpt-v: Efficient multi- modal large language model via small backbones","venue":null,"work_id":"5e80049a-08dd-48e7-a3c5-963d0d623d2b","year":2023},"citing_paper":{"arxiv_id":"2604.13565","last_updated":"2026-04-15T07:21:37Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T07:21:37Z","title":"UHR-BAT: Budget-Aware Token Compression Vision-Language model for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T13:53:13.255412Z"},"links":{"cited_paper":"/paper/2312.16862","citing_paper":"/paper/2604.13565"},"observation_digest":"sha256:8b0c687c4efce84ceb514d22ff0de9b0211d4c3ac7680cdde2244be53b38e5bf","observation_id":"f7842195-dade-46fb-95ff-89cf4b2f0476","resolution":{"observed_at":"2026-05-10T13:55:28.939019Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"cited_work":{"arxiv_id":"2309.15112","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.15112","snapshot_observed_at":"2026-07-04T16:29:56.656404Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","venue":"cs.CV","work_id":"04a19b12-b8c7-4e82-b278-84a4b4552d16","year":2023},"citing_paper":{"arxiv_id":"2604.13565","last_updated":"2026-04-15T07:21:37Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T07:21:37Z","title":"UHR-BAT: Budget-Aware Token Compression Vision-Language model for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T13:53:13.255412Z"},"links":{"cited_paper":"/paper/2309.15112","citing_paper":"/paper/2604.13565"},"observation_digest":"sha256:6a195484b03f18118f6fddca83903b40398b1b797131d2ffa96166db7f1eb264","observation_id":"9317b03e-b415-4d34-9062-8c89946060ef","resolution":{"observed_at":"2026-05-17T13:48:49.136768Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03320","last_updated":"2024-07-03T17:59:21Z","snapshot_observed_at":"2026-08-04T22:09:42.241578Z","submitted_at":"2024-07-03T17:59:21Z","title":"InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output","version":1},"cited_work":{"arxiv_id":"2407.03320","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.03320","snapshot_observed_at":"2026-07-03T20:38:56.215264Z","title":"InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output","venue":"cs.CV","work_id":"930005ca-91e5-4ee8-a634-1684c76d8cf9","year":2024},"citing_paper":{"arxiv_id":"2604.13565","last_updated":"2026-04-15T07:21:37Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T07:21:37Z","title":"UHR-BAT: Budget-Aware Token Compression Vision-Language model for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T13:53:13.255412Z"},"links":{"cited_paper":"/paper/2407.03320","citing_paper":"/paper/2604.13565"},"observation_digest":"sha256:e5eaa4c662c87414e55fd7da547cda61b14773fd81b38f5c2f22ef104c193568","observation_id":"3ff5b6d1-3237-43c4-840f-74ce213dd73e","resolution":{"observed_at":"2026-05-17T10:46:29.265418Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":"2304.10592","doi":"10.18653/v1/2024.findings-emnlp.692","metadata_source":"pith","pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","venue":"cs.CV","work_id":"a7e3a737-e007-42bc-be89-c4d34c5ee071","year":2023},"citing_paper":{"arxiv_id":"2604.13565","last_updated":"2026-04-15T07:21:37Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T07:21:37Z","title":"UHR-BAT: Budget-Aware Token Compression Vision-Language model for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T13:53:13.255412Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2604.13565"},"observation_digest":"sha256:293524fcf8e9d74ba36b28c2a0f2c78d4be92630a40d4b370bce668fca71d85c","observation_id":"f4ffe41d-642d-4a2d-98f9-0c39c02f2819","resolution":{"observed_at":"2026-05-10T20:37:02.028216Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-23T17:23:55.433296+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T17:23:55.433296+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":"2504.10479","doi":"10.48550/arxiv.2504.10479","metadata_source":"pith","pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","venue":"cs.CV","work_id":"fe8637aa-12bc-4434-8d36-9f57b5eebcbe","year":2025},"citing_paper":{"arxiv_id":"2604.13565","last_updated":"2026-04-15T07:21:37Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T07:21:37Z","title":"UHR-BAT: Budget-Aware Token Compression Vision-Language model for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T13:53:13.255412Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2604.13565"},"observation_digest":"sha256:d8803a301d4931ada77da37647e3f7aa0ee72620d3b7d65b6647bbc3d5b41731","observation_id":"813d64ae-fc82-4dce-abdf-2ebc52c07bc6","resolution":{"observed_at":"2026-05-10T13:55:28.951954Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T07:54:09.017512+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Background","venue":null,"work_id":"5c94ec0c-bc9b-42a1-8a54-b16cae00496f","year":2025},"citing_paper":{"arxiv_id":"2604.13565","last_updated":"2026-04-15T07:21:37Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T07:21:37Z","title":"UHR-BAT: Budget-Aware Token Compression Vision-Language model for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T13:53:13.255412Z"},"links":{"citing_paper":"/paper/2604.13565"},"observation_digest":"sha256:846de1abcff7506633fba80289b1454406d8ae919d2810ac09171e3edc2e8e1e","observation_id":"f085f98e-51fb-4643-ae48-a07375c0a9be","resolution":{"observed_at":"2026-05-18T20:32:51.644519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Regarding our model, in the case of XLRS-Bench, the budget Bs is assigned as 180,1320,1600 , and 8000 corresponding to the four resolutions","venue":null,"work_id":"0595af3b-a3ae-4702-81e5-2891e21a86f4","year":1967},"citing_paper":{"arxiv_id":"2604.13565","last_updated":"2026-04-15T07:21:37Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T07:21:37Z","title":"UHR-BAT: Budget-Aware Token Compression Vision-Language model for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T13:53:13.255412Z"},"links":{"citing_paper":"/paper/2604.13565"},"observation_digest":"sha256:b0a75cb4e93a1082809041cae942bc1fc04b275f527467f0c9c0f316c3a17b14","observation_id":"6cc63cf4-b307-4574-afd0-0f5c3cc17ba4","resolution":{"observed_at":"2026-05-18T20:32:51.641982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"By integrating spatial distance, the clustering process effectively groups tokens that are both semantically similar and geographically close","venue":null,"work_id":"b7cfdb14-44d3-4e28-9ceb-70b3d84c0ce8","year":2023},"citing_paper":{"arxiv_id":"2604.13565","last_updated":"2026-04-15T07:21:37Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T07:21:37Z","title":"UHR-BAT: Budget-Aware Token Compression Vision-Language model for Ultra-High-Resolution Remote Sensing","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T13:53:13.255412Z"},"links":{"citing_paper":"/paper/2604.13565"},"observation_digest":"sha256:82f5e9497565100df1c4c273373444905609546e8d3e957e9a2a348ec9993061","observation_id":"94aa12ee-4d6a-4e80-ae1f-c0c9e6d44b19","resolution":{"observed_at":"2026-05-18T20:32:51.647864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.13565","last_updated":"2026-04-15T07:21:37Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T07:21:37Z","title":"UHR-BAT: Budget-Aware Token Compression Vision-Language model for Ultra-High-Resolution Remote Sensing"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":5,"parse_uncertain":0,"unresolved":0,"verified_exact":20,"verified_fuzzy":4},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 0 inbound Pith citation observations for arXiv:2604.13565."}