{"as_of":"2026-08-07T10:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2a1fc72a59e3da91eda5adeae12292ee1597ca12e298f4dcd609c11fd1a9bd81","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T16:51:33.440332Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T16:51:31.716332Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-04T16:51:31.439497Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.11548","snapshot_observed_at":"2026-08-04T16:51:31.716332Z","title":"Beyond identification, this task requires the model to output precise screen coordinates, such as a click point or a bounding box","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-04T16:51:31.439497Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T16:51:31.716332Z"},"links":{"cited_paper":"/paper/2509.11548","citing_paper":"/paper/2509.11548"},"observation_digest":"sha256:d8d83f4e2c65353c5803ce6f9e7ec9d149388aa128627c0841ca3251063eedca","observation_id":"f1101802-b286-4e4e-8bcc-225efeea8580","resolution":{"observed_at":"2026-08-04T16:51:31.716332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.11548/citation-record","integrity":"/paper/2509.11548/integrity","json":"/paper/2509.11548/citation-record.json","paper":"/paper/2509.11548"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-04T16:51:31.439497Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.11548","snapshot_observed_at":"2026-08-04T16:51:31.716332Z","title":"Beyond identification, this task requires the model to output precise screen coordinates, such as a click point or a bounding box","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-04T16:51:31.439497Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T16:51:31.716332Z"},"links":{"cited_paper":"/paper/2509.11548","citing_paper":"/paper/2509.11548"},"observation_digest":"sha256:d8d83f4e2c65353c5803ce6f9e7ec9d149388aa128627c0841ca3251063eedca","observation_id":"f1101802-b286-4e4e-8bcc-225efeea8580","resolution":{"observed_at":"2026-08-04T16:51:31.716332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:51:31.769371Z","title":"Where should I click if I want to {instruction}?","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-04T16:51:31.439497Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T16:51:31.769371Z"},"links":{"citing_paper":"/paper/2509.11548"},"observation_digest":"sha256:5a0e439e483f5329086d000078548396f7eb3e4261560a3caf735007a60e0e26","observation_id":"2428adad-0aa2-4f21-88b5-b0e31044ed98","resolution":{"observed_at":"2026-08-04T16:51:31.769371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:51:31.809828Z","title":"Experimental Settings This section describes the experimental setup used to evaluate the performance of our proposed auxiliary reasoning methods","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-04T16:51:31.439497Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T16:51:31.809828Z"},"links":{"citing_paper":"/paper/2509.11548"},"observation_digest":"sha256:a2e9bdf5723e0ed6913d728e0f69b8db88390a4ceacd32eebef2662053ce67d1","observation_id":"412adee4-5d9d-42c6-8645-788840c97b6b","resolution":{"observed_at":"2026-08-04T16:51:31.809828Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:51:31.890936Z","title":"The diagnostic Pointing Game demonstrates this gap","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-04T16:51:31.439497Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T16:51:31.890936Z"},"links":{"citing_paper":"/paper/2509.11548"},"observation_digest":"sha256:a8c11e32ba1ef13dc847f97b850544e6a01e44141e3ce4158502ab3c617a811b","observation_id":"02424194-7d15-411d-bfa6-b1394d5e5ca1","resolution":{"observed_at":"2026-08-04T16:51:31.890936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-04T16:51:31.949951Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-04T16:51:31.439497Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T16:51:31.949951Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2509.11548"},"observation_digest":"sha256:94f865c55c94e10707ee610dba860df16cdc12d9e9e22c5274ed87dd72b0ef35","observation_id":"780ac4a7-fdd2-459a-a009-5d8409dda7df","resolution":{"observed_at":"2026-08-04T16:51:31.949951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:51:32.032520Z","title":"SeeClick: Harnessing GUI grounding for advanced visual GUI agents,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-04T16:51:31.439497Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T16:51:32.032520Z"},"links":{"citing_paper":"/paper/2509.11548"},"observation_digest":"sha256:4c2d73aeeec180c0d6ffb650e195c90c812ebd20e5f9cc0b34ca0cd690709172","observation_id":"d71daf8c-24dc-4c0d-b67e-d8ed677eec67","resolution":{"observed_at":"2026-08-04T16:51:32.032520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:51:32.055900Z","title":"OS-ATLAS: Foundation action model for generalist GUI agents,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-04T16:51:31.439497Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T16:51:32.055900Z"},"links":{"citing_paper":"/paper/2509.11548"},"observation_digest":"sha256:d79c9549fb6abb7ac28bda4e363b526bfa60e3c7472a2cd1af34fe0354827f74","observation_id":"11cbf6c6-5bed-48af-a86c-32a122bcc91b","resolution":{"observed_at":"2026-08-04T16:51:32.055900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:51:32.117327Z","title":"Screenspot-pro: GUI grounding for professional high- resolution computer use,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-04T16:51:31.439497Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T16:51:32.117327Z"},"links":{"citing_paper":"/paper/2509.11548"},"observation_digest":"sha256:6aa77506f0cd138d11f802c8a6c8b3ab079345d6b738b788e07b38852b83e579","observation_id":"0d190fd9-ee5e-46ca-947b-3f7424ffee1e","resolution":{"observed_at":"2026-08-04T16:51:32.117327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:51:32.199486Z","title":"Top-down neural attention by excitation backprop,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-04T16:51:31.439497Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T16:51:32.199486Z"},"links":{"citing_paper":"/paper/2509.11548"},"observation_digest":"sha256:a4406a893374648e68beed962e9ea15c837cc0ce5fd84fb5a108c06f24e94303","observation_id":"4a261981-b3ab-4e36-a744-1a7cc546e397","resolution":{"observed_at":"2026-08-04T16:51:32.199486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:51:32.256010Z","title":"Navigating the digital world as humans do: Universal visual grounding for GUI agents,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-04T16:51:31.439497Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T16:51:32.256010Z"},"links":{"citing_paper":"/paper/2509.11548"},"observation_digest":"sha256:6dbe379f30f5e7393d42ba524df631381ea8169c7daa30169260ed93d4c06c6b","observation_id":"ab93901b-9904-4571-8189-143943588ccc","resolution":{"observed_at":"2026-08-04T16:51:32.256010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:51:32.284001Z","title":"Aguvis: Unified pure vision agents for autonomous GUI in- teraction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-04T16:51:31.439497Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T16:51:32.284001Z"},"links":{"citing_paper":"/paper/2509.11548"},"observation_digest":"sha256:5fd16765063a1d789517c1b83e74501f4c80016d61b38e63531952392ef411ef","observation_id":"5e057f7c-ab59-4f52-ad4f-80b954bf2456","resolution":{"observed_at":"2026-08-04T16:51:32.284001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:51:32.336815Z","title":"Cogagent: A visual language model for gui agents,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-04T16:51:31.439497Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T16:51:32.336815Z"},"links":{"citing_paper":"/paper/2509.11548"},"observation_digest":"sha256:dffcf08c11c9339f9a8f5e95dcc5b335b5397326099b18a3fcd65d4d652a296d","observation_id":"198c0156-8a34-40d8-92b5-625df90de3fa","resolution":{"observed_at":"2026-08-04T16:51:32.336815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:51:32.387650Z","title":"Omniparser: A unified framework for text spotting key infor- mation extraction and table recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-04T16:51:31.439497Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T16:51:32.387650Z"},"links":{"citing_paper":"/paper/2509.11548"},"observation_digest":"sha256:392d1d3b2fb7381e837858daf33008ba9f5ca4d3f979b13214b64878acfdbb58","observation_id":"d08b44be-6604-46e0-acd8-23f6afdb4b91","resolution":{"observed_at":"2026-08-04T16:51:32.387650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03143","last_updated":"2025-06-03T17:59:08Z","snapshot_observed_at":"2026-08-01T17:23:14.885858Z","submitted_at":"2025-06-03T17:59:08Z","title":"GUI-Actor: Coordinate-Free Visual Grounding for GUI Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03143","snapshot_observed_at":"2026-08-04T16:51:32.441413Z","title":"Gui-actor: Coordinate-free visual ground- ing for gui agents,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-04T16:51:31.439497Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T16:51:32.441413Z"},"links":{"cited_paper":"/paper/2506.03143","citing_paper":"/paper/2509.11548"},"observation_digest":"sha256:9e02730e08344bf7c4e544223005b562c58f4de7430864363eb06ba84e4c6e45","observation_id":"6a07ede7-d4fd-40a8-9fce-230268243ef8","resolution":{"observed_at":"2026-08-04T16:51:32.441413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:51:32.499728Z","title":"Infigui-g1: Advancing gui grounding with adaptive exploration policy optimization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-04T16:51:31.439497Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T16:51:32.499728Z"},"links":{"citing_paper":"/paper/2509.11548"},"observation_digest":"sha256:33ab2df7416673fd6a3c40316a52d63cff84cfea4632ede30b700dc1c42f206c","observation_id":"6d1bdc93-c6ff-4d8b-b81d-9dd8d23006fe","resolution":{"observed_at":"2026-08-04T16:51:32.499728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-07-06T20:06:43.917795Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10342","snapshot_observed_at":"2026-08-04T16:51:32.578220Z","title":"Iris: Breaking gui complexity with adap- tive focus and self-refining,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-04T16:51:31.439497Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T16:51:32.578220Z"},"links":{"cited_paper":"/paper/2412.10342","citing_paper":"/paper/2509.11548"},"observation_digest":"sha256:7aed23009a403d8361e4e86dbd82dd2ea08ff9527eaa07e403b9f06be159db72","observation_id":"5c57e7fd-9a60-4885-8155-74ba7bfae981","resolution":{"observed_at":"2026-08-04T16:51:32.578220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18270","last_updated":"2024-12-03T16:26:18Z","snapshot_observed_at":"2026-07-06T19:57:55.925634Z","submitted_at":"2024-11-27T12:05:34Z","title":"Grid-augmented vision: A simple yet effective approach for enhanced spatial understanding in multi-modal agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18270","snapshot_observed_at":"2026-08-04T16:51:32.663520Z","title":"Grid-augmented vision: A simple yet effective approach for enhanced spatial understanding in multi-modal agents,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-04T16:51:31.439497Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T16:51:32.663520Z"},"links":{"cited_paper":"/paper/2411.18270","citing_paper":"/paper/2509.11548"},"observation_digest":"sha256:bf1f539bd3eafe7fa10eb0b03accad53063fd8f2b958424e83c8fa8926c95dfc","observation_id":"958a67cc-ee55-4b13-9a38-8bf77d5d972b","resolution":{"observed_at":"2026-08-04T16:51:32.663520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:51:32.772908Z","title":"Scaffolding coordinates to promote vision-language co- ordination in large multi-modal models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-04T16:51:31.439497Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T16:51:32.772908Z"},"links":{"citing_paper":"/paper/2509.11548"},"observation_digest":"sha256:133ade55ace9a851e3fa469805f0bd6cfe6acdc7baff3fed7debbab37a6ffe1c","observation_id":"f2cc5ffa-b2ac-4b6f-8771-2e8474cbd2ed","resolution":{"observed_at":"2026-08-04T16:51:32.772908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:51:32.830662Z","title":"Attention-driven gui grounding: Leveraging pretrained multi- modal large language models without fine-tuning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-04T16:51:31.439497Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T16:51:32.830662Z"},"links":{"citing_paper":"/paper/2509.11548"},"observation_digest":"sha256:4f429ab4d7907624a28b85cfc7439538fffdbb1d0b8b097b33286a4bbbc271f5","observation_id":"ace21c35-5769-4e61-99e4-d1fff20f92bb","resolution":{"observed_at":"2026-08-04T16:51:32.830662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13591","last_updated":"2025-09-11T16:37:00Z","snapshot_observed_at":"2026-07-06T19:53:21.444233Z","submitted_at":"2024-11-18T05:47:12Z","title":"Improved GUI Grounding via Iterative Narrowing","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13591","snapshot_observed_at":"2026-08-04T16:51:32.915416Z","title":"Improved gui grounding via iterative nar- rowing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-04T16:51:31.439497Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T16:51:32.915416Z"},"links":{"cited_paper":"/paper/2411.13591","citing_paper":"/paper/2509.11548"},"observation_digest":"sha256:9e102773dbf302d0aba7f23aaba8331fa8d2d53074da33206216f9e14055cc42","observation_id":"dbd3589e-1b4a-47b8-8661-d1625fc818f6","resolution":{"observed_at":"2026-08-04T16:51:32.915416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15259","last_updated":"2025-05-24T15:08:35Z","snapshot_observed_at":"2026-07-06T21:27:37.409259Z","submitted_at":"2025-05-21T08:36:18Z","title":"ReGUIDE: Data Efficient GUI Grounding via Spatial Reasoning and Search","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15259","snapshot_observed_at":"2026-08-04T16:51:33.016798Z","title":"Reguide: Data efficient gui grounding via spatial reasoning and search,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-04T16:51:31.439497Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T16:51:33.016798Z"},"links":{"cited_paper":"/paper/2505.15259","citing_paper":"/paper/2509.11548"},"observation_digest":"sha256:6a78e286be10cd95d3dd0aba679b6ae496a74d59c7578422f8d552e7d2e002d1","observation_id":"c34960f7-0e94-4a7a-874c-94a8ed0359f3","resolution":{"observed_at":"2026-08-04T16:51:33.016798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:51:33.089323Z","title":"Grounded language- image pre-training,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-04T16:51:31.439497Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T16:51:33.089323Z"},"links":{"citing_paper":"/paper/2509.11548"},"observation_digest":"sha256:b99a39e41189191fc69c44d71dc0e106ebf16aa32139cdf90c59f467e517861c","observation_id":"0ce5746b-98f1-427c-99b4-4d10db173a51","resolution":{"observed_at":"2026-08-04T16:51:33.089323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:51:33.130872Z","title":"Ui-e2i- synth: Advancing gui grounding with large-scale instruction synthesis,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-04T16:51:31.439497Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T16:51:33.130872Z"},"links":{"citing_paper":"/paper/2509.11548"},"observation_digest":"sha256:05fe88e864d6047c34c9a7f5c8bf3c52fd4e62f93a4cb4b458ed69bde3ded801","observation_id":"225d51dd-681c-48f8-bd05-c758b3e3f37a","resolution":{"observed_at":"2026-08-04T16:51:33.130872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-04T16:51:33.182317Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long con- text, and next generation agentic capabilities,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-04T16:51:31.439497Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T16:51:33.182317Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2509.11548"},"observation_digest":"sha256:38f0a299bfea12278637b89add47375625365c6125c1bfbd1230d8ce860249bd","observation_id":"f99482e0-c06a-47f2-bdf3-0bf0605935da","resolution":{"observed_at":"2026-08-04T16:51:33.182317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:51:33.235657Z","title":"The claude 3 model family: Opus, Sonnet, Haiku,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-04T16:51:31.439497Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T16:51:33.235657Z"},"links":{"citing_paper":"/paper/2509.11548"},"observation_digest":"sha256:b6599b257cf74034cdcc01d2c90eeaea6917f939ef79ac7e4115f49c18d9e0b9","observation_id":"3ba0d6a7-87cd-479e-b954-4a65e76b6966","resolution":{"observed_at":"2026-08-04T16:51:33.235657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-04T16:51:33.313941Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-04T16:51:31.439497Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T16:51:33.313941Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2509.11548"},"observation_digest":"sha256:eac16eebd33d6fb68cbd460c6c9e4e7084ef2f5ddddffe391fc8e42a181ea3ba","observation_id":"8d2f4abd-5bc7-4a86-bc69-b60ac2840bf9","resolution":{"observed_at":"2026-08-04T16:51:33.313941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-04T16:51:33.366687Z","title":"Gemma 3 technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-04T16:51:31.439497Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T16:51:33.366687Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2509.11548"},"observation_digest":"sha256:ded8ef2c9f38d0c8ac6ccfabb2c396a49b118e23a94bffaae561c8466a96135b","observation_id":"08b35da1-3b4b-4926-ad3a-ef55bcd7cbe3","resolution":{"observed_at":"2026-08-04T16:51:33.366687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T16:51:33.440332Z","title":"Sigmoid loss for language image pre-training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-04T16:51:31.439497Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T16:51:33.440332Z"},"links":{"citing_paper":"/paper/2509.11548"},"observation_digest":"sha256:ec914fccbac9c6f2eb04738e22bd7a90387b6d844fe8e199e8196bac11024950","observation_id":"fea7b066-9552-46a2-8f11-bfa9cead366c","resolution":{"observed_at":"2026-08-04T16:51:33.440332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-04T16:51:31.439497Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 1 inbound Pith citation observation for arXiv:2509.11548."}