{"as_of":"2026-08-08T06:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:97ed93c0efdecfaa79c107407009b6188df137c6de3cff9d3776d2aa74a0e434","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:40:40.290572Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T20:30:58.091365Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-19T14:27:24.213919Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.10202","last_updated":"2025-07-14T12:14:53Z","snapshot_observed_at":"2026-08-06T17:34:42.369677Z","submitted_at":"2025-07-14T12:14:53Z","title":"A Training-Free, Task-Agnostic Framework for Enhancing MLLM Performance on High-Resolution Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.10202","snapshot_observed_at":"2026-08-02T20:30:58.091365Z","title":"A training-free, task- agnostic framework for enhancing mllm performance on high-resolution images,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00171","last_updated":"2026-05-30T15:21:48Z","snapshot_observed_at":"2026-08-08T05:48:48.902254Z","submitted_at":"2026-02-26T15:41:26Z","title":"LookWise: Knowing When and Where to Look for Fine-Grained Visual Reasoning in Multimodal Large Language Models","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T20:30:58.091365Z"},"links":{"cited_paper":"/paper/2507.10202","citing_paper":"/paper/2603.00171"},"observation_digest":"sha256:397d41cf15cc843c6dd7bf2cf7c1153f7b8ee7608a333f55811bc26d7dfea863","observation_id":"4e58942a-f5e4-4b74-93c2-ab7e7c0e8702","resolution":{"observed_at":"2026-08-02T20:30:58.091365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.10202","last_updated":"2025-07-14T12:14:53Z","snapshot_observed_at":"2026-08-06T17:34:42.369677Z","submitted_at":"2025-07-14T12:14:53Z","title":"A Training-Free, Task-Agnostic Framework for Enhancing MLLM Performance on High-Resolution Images","version":1},"cited_work":{"arxiv_id":"2507.10202","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.10202","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A training-free, task-agnostic framework for enhancing mllm performance on high-resolution images","venue":null,"work_id":"8e70a226-2da7-4f15-b01b-098e7639526b","year":2025},"citing_paper":{"arxiv_id":"2605.15542","last_updated":"2026-05-15T02:27:41Z","snapshot_observed_at":"2026-08-01T22:59:27.797060Z","submitted_at":"2026-05-15T02:27:41Z","title":"DRS-GUI: Dynamic Region Search for Training-Free GUI Grounding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-19T14:24:48.938948Z"},"links":{"cited_paper":"/paper/2507.10202","citing_paper":"/paper/2605.15542"},"observation_digest":"sha256:9442f8e5dba969e1584fba2e359efd5caab775e823aff11e46a007142fcbb6a3","observation_id":"058f0829-90fb-46e2-aaf3-6ba1586c3262","resolution":{"observed_at":"2026-05-19T14:27:24.215449Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.10202/citation-record","integrity":"/paper/2507.10202/integrity","json":"/paper/2507.10202/citation-record.json","paper":"/paper/2507.10202"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T17:40:34.116748Z","title":"Qwen-vl: A versatile vision-language model for un- derstanding, localization, text reading, and beyond","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10202","last_updated":"2025-07-14T12:14:53Z","snapshot_observed_at":"2026-08-06T17:34:42.369677Z","submitted_at":"2025-07-14T12:14:53Z","title":"A Training-Free, Task-Agnostic Framework for Enhancing MLLM Performance on High-Resolution Images","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T17:40:34.116748Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2507.10202"},"observation_digest":"sha256:04b6271336260a3b4aa45ffd52b3c538bbc6a0e9e90fbda52f14d9065b1d5cea","observation_id":"851cbd77-5559-4208-8134-c10a629ff47c","resolution":{"observed_at":"2026-08-06T17:40:34.116748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:40:40.177712Z","title":"Lan- guage models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2507.10202","last_updated":"2025-07-14T12:14:53Z","snapshot_observed_at":"2026-08-06T17:34:42.369677Z","submitted_at":"2025-07-14T12:14:53Z","title":"A Training-Free, Task-Agnostic Framework for Enhancing MLLM Performance on High-Resolution Images","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T17:40:40.177712Z"},"links":{"citing_paper":"/paper/2507.10202"},"observation_digest":"sha256:77d403d322582222f37b649601c4dfecf4515abfe544099eefa92011534ff831","observation_id":"c9606cab-eb93-46b2-b7b9-3a150b16005e","resolution":{"observed_at":"2026-08-06T17:40:40.177712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:40:40.183319Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10202","last_updated":"2025-07-14T12:14:53Z","snapshot_observed_at":"2026-08-06T17:34:42.369677Z","submitted_at":"2025-07-14T12:14:53Z","title":"A Training-Free, Task-Agnostic Framework for Enhancing MLLM Performance on High-Resolution Images","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T17:40:40.183319Z"},"links":{"citing_paper":"/paper/2507.10202"},"observation_digest":"sha256:80e32a9f043ae5474b996ce4d2df3151cf55d6cb7555091c44b4d41f4c485081","observation_id":"e6b6550d-3f4b-4a44-b865-a89967a88b5e","resolution":{"observed_at":"2026-08-06T17:40:40.183319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:40:40.762745Z","title":"Internvl: Scaling up vision foundation mod- els and aligning for generic visual-linguistic tasks","venue":null,"work_id":"5a328554-1046-4015-9fdc-3aa1357b3efe","year":2024},"citing_paper":{"arxiv_id":"2507.10202","last_updated":"2025-07-14T12:14:53Z","snapshot_observed_at":"2026-08-06T17:34:42.369677Z","submitted_at":"2025-07-14T12:14:53Z","title":"A Training-Free, Task-Agnostic Framework for Enhancing MLLM Performance on High-Resolution Images","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T17:40:40.189046Z"},"links":{"citing_paper":"/paper/2507.10202"},"observation_digest":"sha256:824d5890e47c62f3cd476296f251447f6794f0f01a60aa0bc99178925cedd855","observation_id":"9c6bd09c-3ad6-419c-84ac-49eb1fbe995f","resolution":{"observed_at":"2026-08-06T17:40:40.767037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10935","last_updated":"2024-02-23T04:36:51Z","snapshot_observed_at":"2026-08-08T03:28:12.161766Z","submitted_at":"2024-01-17T08:10:35Z","title":"SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10935","snapshot_observed_at":"2026-08-06T17:40:40.195059Z","title":"Seeclick: Har- nessing gui grounding for advanced visual gui agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10202","last_updated":"2025-07-14T12:14:53Z","snapshot_observed_at":"2026-08-06T17:34:42.369677Z","submitted_at":"2025-07-14T12:14:53Z","title":"A Training-Free, Task-Agnostic Framework for Enhancing MLLM Performance on High-Resolution Images","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T17:40:40.195059Z"},"links":{"cited_paper":"/paper/2401.10935","citing_paper":"/paper/2507.10202"},"observation_digest":"sha256:291ca62aadd982732f15f3c0f527e36fa533734d59a3b0d7a2091f644a932df8","observation_id":"5fcf4a7d-c972-46ca-980c-90db114f6b68","resolution":{"observed_at":"2026-08-06T17:40:40.195059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:40:40.745018Z","title":"Palm: Scaling language modeling with pathways","venue":null,"work_id":"907505b9-9c62-4013-b1bb-7e24174a79ad","year":2023},"citing_paper":{"arxiv_id":"2507.10202","last_updated":"2025-07-14T12:14:53Z","snapshot_observed_at":"2026-08-06T17:34:42.369677Z","submitted_at":"2025-07-14T12:14:53Z","title":"A Training-Free, Task-Agnostic Framework for Enhancing MLLM Performance on High-Resolution Images","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T17:40:40.200279Z"},"links":{"citing_paper":"/paper/2507.10202"},"observation_digest":"sha256:9d3151c31907dae8af68017c21562524197aa98dac84b39b2fc9918a065bf015","observation_id":"62070ed8-9b1d-41c4-bde5-dcaef039002a","resolution":{"observed_at":"2026-08-06T17:40:40.750712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:40:40.727972Z","title":"Llava-uhd: an lmm perceiving any aspect ratio and high- resolution images, 2024","venue":null,"work_id":"3474d8da-d1ce-41ec-8033-6ee82c8bd24c","year":2024},"citing_paper":{"arxiv_id":"2507.10202","last_updated":"2025-07-14T12:14:53Z","snapshot_observed_at":"2026-08-06T17:34:42.369677Z","submitted_at":"2025-07-14T12:14:53Z","title":"A Training-Free, Task-Agnostic Framework for Enhancing MLLM Performance on High-Resolution Images","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T17:40:40.205362Z"},"links":{"citing_paper":"/paper/2507.10202"},"observation_digest":"sha256:cb068dd7a8a93bb3dec633ce0d35a3a555caec92f0c3911a51cfd27240a27188","observation_id":"8519e9a4-b332-4971-bb49-87a39693aade","resolution":{"observed_at":"2026-08-06T17:40:40.732322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-06T17:40:40.210305Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10202","last_updated":"2025-07-14T12:14:53Z","snapshot_observed_at":"2026-08-06T17:34:42.369677Z","submitted_at":"2025-07-14T12:14:53Z","title":"A Training-Free, Task-Agnostic Framework for Enhancing MLLM Performance on High-Resolution Images","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T17:40:40.210305Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2507.10202"},"observation_digest":"sha256:ee541f4a54db462a4862ebacc879da08030e71d86929b6ec80674ce19704476c","observation_id":"e48fe762-3355-4422-ad46-75249e10b127","resolution":{"observed_at":"2026-08-06T17:40:40.210305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:40:40.709023Z","title":"Screenspot-pro: Gui grounding for professional high- resolution computer use, 2025","venue":null,"work_id":"6214656f-beb8-4a19-84e3-b408db256d05","year":2025},"citing_paper":{"arxiv_id":"2507.10202","last_updated":"2025-07-14T12:14:53Z","snapshot_observed_at":"2026-08-06T17:34:42.369677Z","submitted_at":"2025-07-14T12:14:53Z","title":"A Training-Free, Task-Agnostic Framework for Enhancing MLLM Performance on High-Resolution Images","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T17:40:40.215124Z"},"links":{"citing_paper":"/paper/2507.10202"},"observation_digest":"sha256:4f1ee6c91b82ee9d30e5d3e7791775b0d993dc9eed49012133d15aa7155cc79d","observation_id":"499b9c21-a768-4a9a-ad3c-35bb8e1c4779","resolution":{"observed_at":"2026-08-06T17:40:40.714507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:40:40.692971Z","title":"Visual instruction tuning","venue":null,"work_id":"2effa538-9c6e-4b2d-aa63-7ec75da6f137","year":2023},"citing_paper":{"arxiv_id":"2507.10202","last_updated":"2025-07-14T12:14:53Z","snapshot_observed_at":"2026-08-06T17:34:42.369677Z","submitted_at":"2025-07-14T12:14:53Z","title":"A Training-Free, Task-Agnostic Framework for Enhancing MLLM Performance on High-Resolution Images","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T17:40:40.219197Z"},"links":{"citing_paper":"/paper/2507.10202"},"observation_digest":"sha256:9d0dba79e659f67d679d01ab018d02131595500b07ee3d56a924d3c3db8827ea","observation_id":"c92f28e4-58b9-4c27-b487-cc5733b7bae1","resolution":{"observed_at":"2026-08-06T17:40:40.697299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01487","last_updated":"2024-03-03T11:39:41Z","snapshot_observed_at":"2026-08-05T00:56:14.682059Z","submitted_at":"2024-03-03T11:39:41Z","title":"InfiMM-HD: A Leap Forward in High-Resolution Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01487","snapshot_observed_at":"2026-08-06T17:40:40.225281Z","title":"Infimm-hd: A leap forward in high-resolution multimodal understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10202","last_updated":"2025-07-14T12:14:53Z","snapshot_observed_at":"2026-08-06T17:34:42.369677Z","submitted_at":"2025-07-14T12:14:53Z","title":"A Training-Free, Task-Agnostic Framework for Enhancing MLLM Performance on High-Resolution Images","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T17:40:40.225281Z"},"links":{"cited_paper":"/paper/2403.01487","citing_paper":"/paper/2507.10202"},"observation_digest":"sha256:e0b33671cdaf4ac06038af97c0ada56abd5cae67b4560d7c96ba10ba7d9e2fbc","observation_id":"b02df333-5030-4d93-a675-c96a714e8558","resolution":{"observed_at":"2026-08-06T17:40:40.225281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-07-06T17:39:53.791209Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-08-06T17:40:40.230169Z","title":"Feast your eyes: Mixture-of- resolution adaptation for multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10202","last_updated":"2025-07-14T12:14:53Z","snapshot_observed_at":"2026-08-06T17:34:42.369677Z","submitted_at":"2025-07-14T12:14:53Z","title":"A Training-Free, Task-Agnostic Framework for Enhancing MLLM Performance on High-Resolution Images","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T17:40:40.230169Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2507.10202"},"observation_digest":"sha256:35dd766879c48ff3208067e025fcafa2b61e0c802327532353b99b7d885df525","observation_id":"04f92453-e9e4-4bf9-8fd9-dafccf4c7bdc","resolution":{"observed_at":"2026-08-06T17:40:40.230169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16198","last_updated":"2024-07-23T06:02:30Z","snapshot_observed_at":"2026-07-06T18:50:31.528338Z","submitted_at":"2024-07-23T06:02:30Z","title":"INF-LLaVA: Dual-perspective Perception for High-Resolution Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.16198","snapshot_observed_at":"2026-08-06T17:40:40.235754Z","title":"Inf-llava: Dual- perspective perception for high-resolution multimodal large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10202","last_updated":"2025-07-14T12:14:53Z","snapshot_observed_at":"2026-08-06T17:34:42.369677Z","submitted_at":"2025-07-14T12:14:53Z","title":"A Training-Free, Task-Agnostic Framework for Enhancing MLLM Performance on High-Resolution Images","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T17:40:40.235754Z"},"links":{"cited_paper":"/paper/2407.16198","citing_paper":"/paper/2507.10202"},"observation_digest":"sha256:3a51738dcd620578dcbce122860fbc489b565b382f18c9a2072757e3eba04e97","observation_id":"66d49876-07ef-42ef-8be7-b7c6ef2ba733","resolution":{"observed_at":"2026-08-06T17:40:40.235754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:40:40.672228Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"a3ade9ab-f303-4c9d-a952-c09d915090d3","year":2021},"citing_paper":{"arxiv_id":"2507.10202","last_updated":"2025-07-14T12:14:53Z","snapshot_observed_at":"2026-08-06T17:34:42.369677Z","submitted_at":"2025-07-14T12:14:53Z","title":"A Training-Free, Task-Agnostic Framework for Enhancing MLLM Performance on High-Resolution Images","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T17:40:40.240963Z"},"links":{"citing_paper":"/paper/2507.10202"},"observation_digest":"sha256:66b887de8e0c45e2ad6a56a298b2811f54a31bd8c489f7c09de90ef06c66db95","observation_id":"683aaed2-2f3e-4711-80e6-a086e56633b6","resolution":{"observed_at":"2026-08-06T17:40:40.679550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:40:40.654224Z","title":"Divide and conquer: High-resolution industrial anomaly de- tection via memory efficient tiled ensemble","venue":null,"work_id":"4c73183a-e0f3-42bd-a481-6e8842df0475","year":2024},"citing_paper":{"arxiv_id":"2507.10202","last_updated":"2025-07-14T12:14:53Z","snapshot_observed_at":"2026-08-06T17:34:42.369677Z","submitted_at":"2025-07-14T12:14:53Z","title":"A Training-Free, Task-Agnostic Framework for Enhancing MLLM Performance on High-Resolution Images","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T17:40:40.244930Z"},"links":{"citing_paper":"/paper/2507.10202"},"observation_digest":"sha256:3283e95296d6d781df71eeeda5766c481e18ace23352f9542513aac920f919e0","observation_id":"bd70a414-2818-4b9c-a681-e26a7def89d4","resolution":{"observed_at":"2026-08-06T17:40:40.658842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-06T17:40:40.251610Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of con- text","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10202","last_updated":"2025-07-14T12:14:53Z","snapshot_observed_at":"2026-08-06T17:34:42.369677Z","submitted_at":"2025-07-14T12:14:53Z","title":"A Training-Free, Task-Agnostic Framework for Enhancing MLLM Performance on High-Resolution Images","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T17:40:40.251610Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2507.10202"},"observation_digest":"sha256:fb64590241efce248c9844890c940195d6b9dbfccd675e235d7b27dbf00ebfe1","observation_id":"127f03cd-3421-4825-a581-56623e3d8213","resolution":{"observed_at":"2026-08-06T17:40:40.251610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:40:40.638175Z","title":"Fixing the train-test resolution discrepancy.Advances in neural information processing systems, 32, 2019","venue":null,"work_id":"9be3598e-d0b7-4500-aa6f-939ca6496de6","year":2019},"citing_paper":{"arxiv_id":"2507.10202","last_updated":"2025-07-14T12:14:53Z","snapshot_observed_at":"2026-08-06T17:34:42.369677Z","submitted_at":"2025-07-14T12:14:53Z","title":"A Training-Free, Task-Agnostic Framework for Enhancing MLLM Performance on High-Resolution Images","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T17:40:40.256814Z"},"links":{"citing_paper":"/paper/2507.10202"},"observation_digest":"sha256:32266a702e79386698ab54ab77411e8e69a815d2d02c807eee274d8640b68877","observation_id":"6a15456b-100f-4342-8ffe-776f179f7449","resolution":{"observed_at":"2026-08-06T17:40:40.643180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T17:40:40.261877Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10202","last_updated":"2025-07-14T12:14:53Z","snapshot_observed_at":"2026-08-06T17:34:42.369677Z","submitted_at":"2025-07-14T12:14:53Z","title":"A Training-Free, Task-Agnostic Framework for Enhancing MLLM Performance on High-Resolution Images","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T17:40:40.261877Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2507.10202"},"observation_digest":"sha256:3e2234c3b6c8cf510c22164b7a665ea4c78393d9505e6b39fad216b1e82853cc","observation_id":"40b55d28-a80c-4212-86e1-64cb93d305b8","resolution":{"observed_at":"2026-08-06T17:40:40.261877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T17:40:40.266695Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10202","last_updated":"2025-07-14T12:14:53Z","snapshot_observed_at":"2026-08-06T17:34:42.369677Z","submitted_at":"2025-07-14T12:14:53Z","title":"A Training-Free, Task-Agnostic Framework for Enhancing MLLM Performance on High-Resolution Images","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T17:40:40.266695Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.10202"},"observation_digest":"sha256:29e3738636a5a495eb4c8616673407db090e229388dd632f269cced7fa6dc4e1","observation_id":"54d99456-7761-4120-999a-633afa533ff2","resolution":{"observed_at":"2026-08-06T17:40:40.266695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15556","last_updated":"2024-08-28T06:09:02Z","snapshot_observed_at":"2026-08-06T20:48:41.058327Z","submitted_at":"2024-08-28T06:09:02Z","title":"Divide, Conquer and Combine: A Training-Free Framework for High-Resolution Image Perception in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15556","snapshot_observed_at":"2026-08-06T17:40:40.270764Z","title":"Divide, conquer and combine: A training-free framework for high-resolution im- age perception in multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10202","last_updated":"2025-07-14T12:14:53Z","snapshot_observed_at":"2026-08-06T17:34:42.369677Z","submitted_at":"2025-07-14T12:14:53Z","title":"A Training-Free, Task-Agnostic Framework for Enhancing MLLM Performance on High-Resolution Images","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T17:40:40.270764Z"},"links":{"cited_paper":"/paper/2408.15556","citing_paper":"/paper/2507.10202"},"observation_digest":"sha256:fbe07d0db2e5694733d9509c0dc48b076d1a88bc8cc90599f055866c80cd01ed","observation_id":"fd65673c-bd1a-4940-8b85-dd4bc318fbda","resolution":{"observed_at":"2026-08-06T17:40:40.270764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23218","last_updated":"2024-10-30T17:10:19Z","snapshot_observed_at":"2026-08-05T06:30:40.974506Z","submitted_at":"2024-10-30T17:10:19Z","title":"OS-ATLAS: A Foundation Action Model for Generalist GUI Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23218","snapshot_observed_at":"2026-08-06T17:40:40.276025Z","title":"Os-atlas: A foundation action model for generalist gui agents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.10202","last_updated":"2025-07-14T12:14:53Z","snapshot_observed_at":"2026-08-06T17:34:42.369677Z","submitted_at":"2025-07-14T12:14:53Z","title":"A Training-Free, Task-Agnostic Framework for Enhancing MLLM Performance on High-Resolution Images","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T17:40:40.276025Z"},"links":{"cited_paper":"/paper/2410.23218","citing_paper":"/paper/2507.10202"},"observation_digest":"sha256:eb7b6106f22067131a6505f7c6ab93adcc426ee4f9cb68bcef8f98cb6d672875","observation_id":"260882ba-87f2-4e7b-a439-4db25da6134c","resolution":{"observed_at":"2026-08-06T17:40:40.276025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:40:40.620348Z","title":"Omg-llava: Bridging image-level, object-level, pixel-level reasoning and understanding","venue":null,"work_id":"dd64b9ca-30f8-4e34-9014-282f1f361284","year":2025},"citing_paper":{"arxiv_id":"2507.10202","last_updated":"2025-07-14T12:14:53Z","snapshot_observed_at":"2026-08-06T17:34:42.369677Z","submitted_at":"2025-07-14T12:14:53Z","title":"A Training-Free, Task-Agnostic Framework for Enhancing MLLM Performance on High-Resolution Images","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T17:40:40.280786Z"},"links":{"citing_paper":"/paper/2507.10202"},"observation_digest":"sha256:3ee28b6cc77627ed5f9b702ad21d2441bf0bda8d235419b30d98219383984273","observation_id":"fa3342fe-f379-4b64-8168-773eb6a7445d","resolution":{"observed_at":"2026-08-06T17:40:40.626256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03882","last_updated":"2024-02-22T01:40:35Z","snapshot_observed_at":"2026-08-06T19:10:47.693909Z","submitted_at":"2023-09-07T17:44:56Z","title":"Large Language Models Are Not Robust Multiple Choice Selectors","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.03882","snapshot_observed_at":"2026-08-06T17:40:40.285125Z","title":"Large language models are not robust multi- ple choice selectors","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10202","last_updated":"2025-07-14T12:14:53Z","snapshot_observed_at":"2026-08-06T17:34:42.369677Z","submitted_at":"2025-07-14T12:14:53Z","title":"A Training-Free, Task-Agnostic Framework for Enhancing MLLM Performance on High-Resolution Images","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T17:40:40.285125Z"},"links":{"cited_paper":"/paper/2309.03882","citing_paper":"/paper/2507.10202"},"observation_digest":"sha256:f536f047d17e343840684cf186056a5287607caf03d0c008a723649f06591bba","observation_id":"cde3fcfd-ef63-43be-8f42-583d70769997","resolution":{"observed_at":"2026-08-06T17:40:40.285125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14776","last_updated":"2024-11-27T15:26:41Z","snapshot_observed_at":"2026-07-06T19:06:23.640089Z","submitted_at":"2024-08-27T04:45:53Z","title":"MROVSeg: Breaking the Resolution Curse of Vision-Language Models in Open-Vocabulary Image Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14776","snapshot_observed_at":"2026-08-06T17:40:40.290572Z","title":"Mrovseg: Breaking the resolution curse of vision-language models in open-vocabulary seman- tic segmentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10202","last_updated":"2025-07-14T12:14:53Z","snapshot_observed_at":"2026-08-06T17:34:42.369677Z","submitted_at":"2025-07-14T12:14:53Z","title":"A Training-Free, Task-Agnostic Framework for Enhancing MLLM Performance on High-Resolution Images","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T17:40:40.290572Z"},"links":{"cited_paper":"/paper/2408.14776","citing_paper":"/paper/2507.10202"},"observation_digest":"sha256:a63b5e4d8d4f35b8341885f8b562c59a7d1fb480bfdfd27345de3dd21bf3c9aa","observation_id":"350fa9db-b1dc-409a-8387-d220a0c7aefb","resolution":{"observed_at":"2026-08-06T17:40:40.290572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.10202","last_updated":"2025-07-14T12:14:53Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T17:34:42.369677Z","submitted_at":"2025-07-14T12:14:53Z","title":"A Training-Free, Task-Agnostic Framework for Enhancing MLLM Performance on High-Resolution Images"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":0,"verified_fuzzy":9},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 2 inbound Pith citation observations for arXiv:2507.10202."}