{"as_of":"2026-08-08T16:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:86310115533017a9517a85235288f7a78c5997fe7f7da6c658683e68c7ffbc81","coverage":[{"denominator":12,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:44:51.870568Z","state":"measured"},{"denominator":12,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":12,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.23491/citation-record","integrity":"/paper/2506.23491/integrity","json":"/paper/2506.23491/citation-record.json","paper":"/paper/2506.23491"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T21:44:50.843200Z","title":"Qwen2.5-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23491","last_updated":"2025-07-18T06:03:26Z","snapshot_observed_at":"2026-08-06T21:38:43.261031Z","submitted_at":"2025-06-30T03:33:02Z","title":"ZonUI-3B: A Lightweight Vision-Language Model for Cross-Resolution GUI Grounding","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:50.843200Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.23491"},"observation_digest":"sha256:95732cd8965e407052317846e719d20c984e7cd4f9b3a12e1b1b1234771d91ee","observation_id":"992594d9-e92b-4bc9-97ea-9ebde3e7b141","resolution":{"observed_at":"2026-08-06T21:44:50.843200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17490","last_updated":"2025-05-29T02:43:50Z","snapshot_observed_at":"2026-07-06T18:51:28.182977Z","submitted_at":"2024-07-03T17:59:58Z","title":"AMEX: Android Multi-annotation Expo Dataset for Mobile GUI Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17490","snapshot_observed_at":"2026-08-06T21:44:50.910470Z","title":"Amex: Android multi-annotation expo dataset for mobile gui agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23491","last_updated":"2025-07-18T06:03:26Z","snapshot_observed_at":"2026-08-06T21:38:43.261031Z","submitted_at":"2025-06-30T03:33:02Z","title":"ZonUI-3B: A Lightweight Vision-Language Model for Cross-Resolution GUI Grounding","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:50.910470Z"},"links":{"cited_paper":"/paper/2407.17490","citing_paper":"/paper/2506.23491"},"observation_digest":"sha256:ca3f8f91354b03da3688ea9f0671555833c3bd5cdae6ce8319a5099c1c0c1a00","observation_id":"4324f7a0-8bdd-4710-b96e-c080e1e20730","resolution":{"observed_at":"2026-08-06T21:44:50.910470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10935","last_updated":"2024-02-23T04:36:51Z","snapshot_observed_at":"2026-08-08T03:28:12.161766Z","submitted_at":"2024-01-17T08:10:35Z","title":"SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10935","snapshot_observed_at":"2026-08-06T21:44:51.037486Z","title":"Seeclick: Har- nessing gui grounding for advanced visual gui agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23491","last_updated":"2025-07-18T06:03:26Z","snapshot_observed_at":"2026-08-06T21:38:43.261031Z","submitted_at":"2025-06-30T03:33:02Z","title":"ZonUI-3B: A Lightweight Vision-Language Model for Cross-Resolution GUI Grounding","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:51.037486Z"},"links":{"cited_paper":"/paper/2401.10935","citing_paper":"/paper/2506.23491"},"observation_digest":"sha256:1d2f23b04e55efa4995face8f0b175dfba8d9e677abb825328a7163d245a8bd8","observation_id":"6e7e588f-5aa1-4c2b-95f4-f77288f202db","resolution":{"observed_at":"2026-08-06T21:44:51.037486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05243","last_updated":"2025-06-17T15:06:02Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T17:47:50Z","title":"Navigating the Digital World as Humans Do: Universal Visual Grounding for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05243","snapshot_observed_at":"2026-08-06T21:44:51.133054Z","title":"Navigating the digital world as humans do: Universal visual grounding for gui agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23491","last_updated":"2025-07-18T06:03:26Z","snapshot_observed_at":"2026-08-06T21:38:43.261031Z","submitted_at":"2025-06-30T03:33:02Z","title":"ZonUI-3B: A Lightweight Vision-Language Model for Cross-Resolution GUI Grounding","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:51.133054Z"},"links":{"cited_paper":"/paper/2410.05243","citing_paper":"/paper/2506.23491"},"observation_digest":"sha256:fb323c3ab45e661170051455d23b5207f4b204baca44cbbe490d7330aca519da","observation_id":"10bf4088-d97f-444f-af54-c6f7aa581c79","resolution":{"observed_at":"2026-08-06T21:44:51.133054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-07-06T17:01:40.744034Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-06T21:44:51.212777Z","title":"Cogagent: A visual language model for gui agents","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23491","last_updated":"2025-07-18T06:03:26Z","snapshot_observed_at":"2026-08-06T21:38:43.261031Z","submitted_at":"2025-06-30T03:33:02Z","title":"ZonUI-3B: A Lightweight Vision-Language Model for Cross-Resolution GUI Grounding","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:51.212777Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2506.23491"},"observation_digest":"sha256:2a3913aa1aae98bb85ea9d922e290a82535f15a7e4d702154a01da083a447229","observation_id":"cc4f8ab6-75d4-4a7d-bf8b-aa198f685dbe","resolution":{"observed_at":"2026-08-06T21:44:51.212777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-06T21:44:51.300123Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen- Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.23491","last_updated":"2025-07-18T06:03:26Z","snapshot_observed_at":"2026-08-06T21:38:43.261031Z","submitted_at":"2025-06-30T03:33:02Z","title":"ZonUI-3B: A Lightweight Vision-Language Model for Cross-Resolution GUI Grounding","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:51.300123Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2506.23491"},"observation_digest":"sha256:ca4cbdc16434b8b600449f5ffb2218ea4ebaa1cabec2d8c4237bb56f601c92e4","observation_id":"943b2969-9783-4047-8f10-92d7dd04fe24","resolution":{"observed_at":"2026-08-06T21:44:51.300123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07981","last_updated":"2025-04-04T14:25:17Z","snapshot_observed_at":"2026-08-07T16:08:52.673312Z","submitted_at":"2025-04-04T14:25:17Z","title":"ScreenSpot-Pro: GUI Grounding for Professional High-Resolution Computer Use","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07981","snapshot_observed_at":"2026-08-06T21:44:51.404442Z","title":"Screenspot-pro: Gui grounding for professional high- resolution computer use","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23491","last_updated":"2025-07-18T06:03:26Z","snapshot_observed_at":"2026-08-06T21:38:43.261031Z","submitted_at":"2025-06-30T03:33:02Z","title":"ZonUI-3B: A Lightweight Vision-Language Model for Cross-Resolution GUI Grounding","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:51.404442Z"},"links":{"cited_paper":"/paper/2504.07981","citing_paper":"/paper/2506.23491"},"observation_digest":"sha256:73f2741de2a9b4278e45588c95b3af286e141ae4bdbb8a8fc25c9f79eec9f99f","observation_id":"e3cbe5b5-0cc5-473a-8312-81e95ddd2e71","resolution":{"observed_at":"2026-08-06T21:44:51.404442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17465","last_updated":"2024-11-26T14:29:47Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T14:29:47Z","title":"ShowUI: One Vision-Language-Action Model for GUI Visual Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17465","snapshot_observed_at":"2026-08-06T21:44:51.512452Z","title":"Showui: One vision-language-action model for gui visual agent","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23491","last_updated":"2025-07-18T06:03:26Z","snapshot_observed_at":"2026-08-06T21:38:43.261031Z","submitted_at":"2025-06-30T03:33:02Z","title":"ZonUI-3B: A Lightweight Vision-Language Model for Cross-Resolution GUI Grounding","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:51.512452Z"},"links":{"cited_paper":"/paper/2411.17465","citing_paper":"/paper/2506.23491"},"observation_digest":"sha256:a9242aab28ef846bebaa23eab60c430dbec7442ef1643d537ff29ea40e2b9da2","observation_id":"44f450de-7495-43d0-9caa-5f74dfb736c0","resolution":{"observed_at":"2026-08-06T21:44:51.512452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12326","last_updated":"2025-01-21T17:48:10Z","snapshot_observed_at":"2026-07-06T20:23:58.426780Z","submitted_at":"2025-01-21T17:48:10Z","title":"UI-TARS: Pioneering Automated GUI Interaction with Native Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12326","snapshot_observed_at":"2026-08-06T21:44:51.637524Z","title":"Ui-tars: Pioneering automated gui inter- action with native agents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23491","last_updated":"2025-07-18T06:03:26Z","snapshot_observed_at":"2026-08-06T21:38:43.261031Z","submitted_at":"2025-06-30T03:33:02Z","title":"ZonUI-3B: A Lightweight Vision-Language Model for Cross-Resolution GUI Grounding","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:51.637524Z"},"links":{"cited_paper":"/paper/2501.12326","citing_paper":"/paper/2506.23491"},"observation_digest":"sha256:65b8a1e7ca76e039d43182640d4d58f474144f62de2a077a53d5d923e225fe8d","observation_id":"5db9d50c-133d-4525-9eb1-e66ec95fc4c8","resolution":{"observed_at":"2026-08-06T21:44:51.637524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23218","last_updated":"2024-10-30T17:10:19Z","snapshot_observed_at":"2026-08-05T06:30:40.974506Z","submitted_at":"2024-10-30T17:10:19Z","title":"OS-ATLAS: A Foundation Action Model for Generalist GUI Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23218","snapshot_observed_at":"2026-08-06T21:44:51.722301Z","title":"Os-atlas: A founda- tion action model for generalist gui agents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23491","last_updated":"2025-07-18T06:03:26Z","snapshot_observed_at":"2026-08-06T21:38:43.261031Z","submitted_at":"2025-06-30T03:33:02Z","title":"ZonUI-3B: A Lightweight Vision-Language Model for Cross-Resolution GUI Grounding","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:51.722301Z"},"links":{"cited_paper":"/paper/2410.23218","citing_paper":"/paper/2506.23491"},"observation_digest":"sha256:2e258881c4c9705077ea77f9176e84dcaf58078f9cd4e5faab919d37f44e2a10","observation_id":"1df72db2-919b-4610-876e-e429fe62d5e5","resolution":{"observed_at":"2026-08-06T21:44:51.722301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04454","last_updated":"2025-05-05T16:17:20Z","snapshot_observed_at":"2026-07-06T20:02:21.509050Z","submitted_at":"2024-12-05T18:58:26Z","title":"Aguvis: Unified Pure Vision Agents for Autonomous GUI Interaction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04454","snapshot_observed_at":"2026-08-06T21:44:51.798796Z","title":"Aguvis: Unified pure vision agents for autonomous gui interaction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23491","last_updated":"2025-07-18T06:03:26Z","snapshot_observed_at":"2026-08-06T21:38:43.261031Z","submitted_at":"2025-06-30T03:33:02Z","title":"ZonUI-3B: A Lightweight Vision-Language Model for Cross-Resolution GUI Grounding","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:51.798796Z"},"links":{"cited_paper":"/paper/2412.04454","citing_paper":"/paper/2506.23491"},"observation_digest":"sha256:cc10446c0b17b984929315c704e5a38c6668bf14460c4afea35692c47a9c15f6","observation_id":"ffa7ece6-be0e-4642-ae6d-871d955bb696","resolution":{"observed_at":"2026-08-06T21:44:51.798796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-06T21:44:51.870568Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23491","last_updated":"2025-07-18T06:03:26Z","snapshot_observed_at":"2026-08-06T21:38:43.261031Z","submitted_at":"2025-06-30T03:33:02Z","title":"ZonUI-3B: A Lightweight Vision-Language Model for Cross-Resolution GUI Grounding","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:51.870568Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.23491"},"observation_digest":"sha256:9202b981670762db0a4015bebf3563755095e37042b00e5084edb614dad5ede1","observation_id":"30a0a296-4d0d-4cc7-8987-ab2dfd049432","resolution":{"observed_at":"2026-08-06T21:44:51.870568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.23491","last_updated":"2025-07-18T06:03:26Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T21:38:43.261031Z","submitted_at":"2025-06-30T03:33:02Z","title":"ZonUI-3B: A Lightweight Vision-Language Model for Cross-Resolution GUI Grounding"},"reference_resolution":{"displayed":12,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":12},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 12 of 12 outbound references and 0 inbound Pith citation observations for arXiv:2506.23491."}