{"as_of":"2026-08-09T11:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:68817a591492857f836e292f8d0f1b97eb1f0183aba4dd55df8e19b1cc1e7ea5","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":40,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T11:05:06.126655Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.17465","last_updated":"2024-11-26T14:29:47Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T14:29:47Z","title":"ShowUI: One Vision-Language-Action Model for GUI Visual Agent","version":1},"cited_work":{"arxiv_id":"2411.17465","doi":"10.48550/arxiv.2411.17465","metadata_source":"pith","pith_arxiv_id":"2411.17465","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Showui: One vision-language-action model for gui visual agent","venue":"cs.CV","work_id":"71042786-afdb-43a7-914a-740003bfa258","year":2024},"citing_paper":{"arxiv_id":"2411.18279","last_updated":"2025-05-06T15:08:00Z","snapshot_observed_at":"2026-07-06T19:57:55.925634Z","submitted_at":"2024-11-27T12:13:39Z","title":"Large Language Model-Brained GUI Agents: A Survey","version":12},"reference_index":246,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:27.472508Z"},"links":{"cited_paper":"/paper/2411.17465","citing_paper":"/paper/2411.18279"},"observation_digest":"sha256:4c659d92d7ed6b53ecd364b8ccc3406a2232a557aaf02f60e616148dcd142ade","observation_id":"f94b606f-5219-435c-8c71-da418617373b","resolution":{"observed_at":"2026-05-19T11:08:27.838859Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17465","last_updated":"2024-11-26T14:29:47Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T14:29:47Z","title":"ShowUI: One Vision-Language-Action Model for GUI Visual Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17465","snapshot_observed_at":"2026-08-08T11:05:06.126655Z","title":"Showui: One vision-language-action model for gui visual agent.arXiv preprint arXiv:2411.17465, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08047","last_updated":"2026-05-23T20:19:43Z","snapshot_observed_at":"2026-08-08T10:59:08.634219Z","submitted_at":"2025-02-12T01:06:10Z","title":"WorldGUI: An Interactive Benchmark for Desktop GUI Automation from Any Starting Point","version":5},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T11:05:06.126655Z"},"links":{"cited_paper":"/paper/2411.17465","citing_paper":"/paper/2502.08047"},"observation_digest":"sha256:391f7520516c86ac5a4685b0a533ae3e9fca70b8b016a06b1bad75fde5393d81","observation_id":"2890b80e-82f0-4366-88df-721edd3d8bd6","resolution":{"observed_at":"2026-08-08T11:05:06.126655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17465","last_updated":"2024-11-26T14:29:47Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T14:29:47Z","title":"ShowUI: One Vision-Language-Action Model for GUI Visual Agent","version":1},"cited_work":{"arxiv_id":"2411.17465","doi":"10.48550/arxiv.2411.17465","metadata_source":"pith","pith_arxiv_id":"2411.17465","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Showui: One vision-language-action model for gui visual agent","venue":"cs.CV","work_id":"71042786-afdb-43a7-914a-740003bfa258","year":2024},"citing_paper":{"arxiv_id":"2505.10887","last_updated":"2026-05-01T07:44:01Z","snapshot_observed_at":"2026-08-02T13:02:06.325821Z","submitted_at":"2025-05-16T05:43:27Z","title":"InfantAgent-Next: A Multimodal Generalist Agent for Automated Computer Interaction","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-22T15:18:15.475294Z"},"links":{"cited_paper":"/paper/2411.17465","citing_paper":"/paper/2505.10887"},"observation_digest":"sha256:07951f85957bb09cce84ce1dcd9e33cb7429f1924379d827d5160ffc4717fad0","observation_id":"1ae04baf-0455-4b5a-bee0-d3446246659e","resolution":{"observed_at":"2026-05-22T15:21:45.076189Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17465","last_updated":"2024-11-26T14:29:47Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T14:29:47Z","title":"ShowUI: One Vision-Language-Action Model for GUI Visual Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17465","snapshot_observed_at":"2026-08-07T15:25:31.922315Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15259","last_updated":"2025-05-24T15:08:35Z","snapshot_observed_at":"2026-08-09T10:59:49.164484Z","submitted_at":"2025-05-21T08:36:18Z","title":"ReGUIDE: Data Efficient GUI Grounding via Spatial Reasoning and Search","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:25:31.922315Z"},"links":{"cited_paper":"/paper/2411.17465","citing_paper":"/paper/2505.15259"},"observation_digest":"sha256:f5969962d38eb128e262d6e17df22c1f0140c9d998e226b2e2f32c59b794549b","observation_id":"028484cb-2496-47b1-a36c-1d4c57e55cc7","resolution":{"observed_at":"2026-08-07T15:25:31.922315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17465","last_updated":"2024-11-26T14:29:47Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T14:29:47Z","title":"ShowUI: One Vision-Language-Action Model for GUI Visual Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17465","snapshot_observed_at":"2026-08-07T15:16:02.648058Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15810","last_updated":"2025-05-22T11:15:23Z","snapshot_observed_at":"2026-08-09T07:15:17.774887Z","submitted_at":"2025-05-21T17:59:09Z","title":"GUI-G1: Understanding R1-Zero-Like Training for Visual Grounding in GUI Agents","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:02.648058Z"},"links":{"cited_paper":"/paper/2411.17465","citing_paper":"/paper/2505.15810"},"observation_digest":"sha256:cb897f43786f06692dbeaa77829c5671b17ff85f053fe35e3afadb4ee6865cb7","observation_id":"d1892b3a-10fd-4e5a-8075-68b746c4343a","resolution":{"observed_at":"2026-08-07T15:16:02.648058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17465","last_updated":"2024-11-26T14:29:47Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T14:29:47Z","title":"ShowUI: One Vision-Language-Action Model for GUI Visual Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17465","snapshot_observed_at":"2026-08-07T13:53:39.067010Z","title":"In Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 881–905, Bangkok, Thailand","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20660","last_updated":"2025-05-27T03:09:06Z","snapshot_observed_at":"2026-08-07T13:47:25.551473Z","submitted_at":"2025-05-27T03:09:06Z","title":"BacktrackAgent: Enhancing GUI Agent with Error Detection and Backtracking Mechanism","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:39.067010Z"},"links":{"cited_paper":"/paper/2411.17465","citing_paper":"/paper/2505.20660"},"observation_digest":"sha256:8d18c935c79d23479370c55e11f0fc32d085ae08f9b5749ab3f608483da4f10e","observation_id":"82470402-8cf8-40f0-8292-4cdc19026485","resolution":{"observed_at":"2026-08-07T13:53:39.067010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17465","last_updated":"2024-11-26T14:29:47Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T14:29:47Z","title":"ShowUI: One Vision-Language-Action Model for GUI Visual Agent","version":1},"cited_work":{"arxiv_id":"2411.17465","doi":"10.48550/arxiv.2411.17465","metadata_source":"pith","pith_arxiv_id":"2411.17465","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Showui: One vision-language-action model for gui visual agent","venue":"cs.CV","work_id":"71042786-afdb-43a7-914a-740003bfa258","year":2024},"citing_paper":{"arxiv_id":"2505.23678","last_updated":"2026-05-15T17:27:46Z","snapshot_observed_at":"2026-08-02T04:30:21.704758Z","submitted_at":"2025-05-29T17:20:26Z","title":"Grounded Reinforcement Learning for Visual Reasoning","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-22T01:05:18.801388Z"},"links":{"cited_paper":"/paper/2411.17465","citing_paper":"/paper/2505.23678"},"observation_digest":"sha256:193e5b082cb09436131804e048d966c5dfd5707f7659e04824df8e05a60080e1","observation_id":"01f5e6b7-1193-492b-b807-c30c44dc20db","resolution":{"observed_at":"2026-05-22T01:05:51.951989Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17465","last_updated":"2024-11-26T14:29:47Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T14:29:47Z","title":"ShowUI: One Vision-Language-Action Model for GUI Visual Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17465","snapshot_observed_at":"2026-08-07T12:41:22.745953Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23762","last_updated":"2025-05-29T17:59:51Z","snapshot_observed_at":"2026-08-08T14:02:10.449991Z","submitted_at":"2025-05-29T17:59:51Z","title":"ZeroGUI: Automating Online GUI Learning at Zero Human Cost","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:41:22.745953Z"},"links":{"cited_paper":"/paper/2411.17465","citing_paper":"/paper/2505.23762"},"observation_digest":"sha256:9d51013e5da2f994489d4f86f82c16d257a524db94de94c66809a97958a55394","observation_id":"4fe73d73-f7ee-41c9-94e3-c0534fbcf123","resolution":{"observed_at":"2026-08-07T12:41:22.745953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17465","last_updated":"2024-11-26T14:29:47Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T14:29:47Z","title":"ShowUI: One Vision-Language-Action Model for GUI Visual Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17465","snapshot_observed_at":"2026-08-07T12:06:24.763166Z","title":"Showui: One vision-language-action model for gui visual agent.arXiv preprint arXiv:2411.17465, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00618","last_updated":"2025-06-20T01:24:06Z","snapshot_observed_at":"2026-08-07T11:59:19.422617Z","submitted_at":"2025-05-31T16:04:59Z","title":"RiOSWorld: Benchmarking the Risk of Multimodal Computer-Use Agents","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:24.763166Z"},"links":{"cited_paper":"/paper/2411.17465","citing_paper":"/paper/2506.00618"},"observation_digest":"sha256:770cb229b176a010fc3998f0a172fe69b94cf7fd480ac9786c117d371117140a","observation_id":"038741e4-74ad-4c5c-9a4a-56f7f7ac5b94","resolution":{"observed_at":"2026-08-07T12:06:24.763166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17465","last_updated":"2024-11-26T14:29:47Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T14:29:47Z","title":"ShowUI: One Vision-Language-Action Model for GUI Visual Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17465","snapshot_observed_at":"2026-08-07T11:14:51.672228Z","title":"Showui: One vision-language-action model for gui visual agent.arXiv preprint arXiv:2411.17465, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03143","last_updated":"2025-06-03T17:59:08Z","snapshot_observed_at":"2026-08-09T07:32:12.903499Z","submitted_at":"2025-06-03T17:59:08Z","title":"GUI-Actor: Coordinate-Free Visual Grounding for GUI Agents","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:14:51.672228Z"},"links":{"cited_paper":"/paper/2411.17465","citing_paper":"/paper/2506.03143"},"observation_digest":"sha256:ed56abec6b0e0b08027004e6701557c0995e958396a0206ec238d6ecbf932f3d","observation_id":"19d78170-56f1-40a2-b7d3-5490c874e824","resolution":{"observed_at":"2026-08-07T11:14:51.672228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17465","last_updated":"2024-11-26T14:29:47Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T14:29:47Z","title":"ShowUI: One Vision-Language-Action Model for GUI Visual Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17465","snapshot_observed_at":"2026-08-07T05:02:29.221294Z","title":"Q., Li, L., Gao, D., Yang, Z., Wu, S., Bai, Z., Lei, W., Wang, L., and Shou, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08933","last_updated":"2025-06-10T15:59:38Z","snapshot_observed_at":"2026-08-07T04:56:29.533924Z","submitted_at":"2025-06-10T15:59:38Z","title":"What Limits Virtual Agent Application? OmniBench: A Scalable Multi-Dimensional Benchmark for Essential Virtual Agent Capabilities","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T05:02:29.221294Z"},"links":{"cited_paper":"/paper/2411.17465","citing_paper":"/paper/2506.08933"},"observation_digest":"sha256:3cfd2f2f3f89c3334f4ca57fb4f10368701ba4f31f77412b4c8291a68f192ce9","observation_id":"83b75b66-3873-4d89-8e09-65c9ab7b1b8b","resolution":{"observed_at":"2026-08-07T05:02:29.221294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17465","last_updated":"2024-11-26T14:29:47Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T14:29:47Z","title":"ShowUI: One Vision-Language-Action Model for GUI Visual Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17465","snapshot_observed_at":"2026-08-07T05:04:04.513377Z","title":"Showui: One vision-language-action model for gui visual agent","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08972","last_updated":"2025-06-10T16:45:29Z","snapshot_observed_at":"2026-08-07T14:38:06.207367Z","submitted_at":"2025-06-10T16:45:29Z","title":"Atomic-to-Compositional Generalization for Mobile Agents with A New Benchmark and Scheduling System","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:04.513377Z"},"links":{"cited_paper":"/paper/2411.17465","citing_paper":"/paper/2506.08972"},"observation_digest":"sha256:599bf48590d073f44123312d644a09d28c131796770ecb52d0a702c51e1e3cbb","observation_id":"604549a2-8239-4c56-9bb1-6062220719f0","resolution":{"observed_at":"2026-08-07T05:04:04.513377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17465","last_updated":"2024-11-26T14:29:47Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T14:29:47Z","title":"ShowUI: One Vision-Language-Action Model for GUI Visual Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17465","snapshot_observed_at":"2026-08-07T00:22:52.869086Z","title":"Showui: One vision-language-action model for gui visual agent, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14477","last_updated":"2025-06-17T12:50:35Z","snapshot_observed_at":"2026-08-09T00:37:09.345499Z","submitted_at":"2025-06-17T12:50:35Z","title":"GUI-Robust: A Comprehensive Dataset for Testing GUI Agent Robustness in Real-World Anomalies","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:22:52.869086Z"},"links":{"cited_paper":"/paper/2411.17465","citing_paper":"/paper/2506.14477"},"observation_digest":"sha256:00b064b27cfaaba861e4cb4d24d15ad584e6961053716e7d8f0bbfbef75a7b08","observation_id":"a9b674cc-0ab6-4c3a-8888-a49c58b29e6f","resolution":{"observed_at":"2026-08-07T00:22:52.869086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17465","last_updated":"2024-11-26T14:29:47Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T14:29:47Z","title":"ShowUI: One Vision-Language-Action Model for GUI Visual Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17465","snapshot_observed_at":"2026-08-06T21:44:51.512452Z","title":"Showui: One vision-language-action model for gui visual agent","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23491","last_updated":"2025-07-18T06:03:26Z","snapshot_observed_at":"2026-08-06T21:38:43.261031Z","submitted_at":"2025-06-30T03:33:02Z","title":"ZonUI-3B: A Lightweight Vision-Language Model for Cross-Resolution GUI Grounding","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:51.512452Z"},"links":{"cited_paper":"/paper/2411.17465","citing_paper":"/paper/2506.23491"},"observation_digest":"sha256:a9242aab28ef846bebaa23eab60c430dbec7442ef1643d537ff29ea40e2b9da2","observation_id":"44f450de-7495-43d0-9caa-5f74dfb736c0","resolution":{"observed_at":"2026-08-06T21:44:51.512452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17465","last_updated":"2024-11-26T14:29:47Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T14:29:47Z","title":"ShowUI: One Vision-Language-Action Model for GUI Visual Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17465","snapshot_observed_at":"2026-08-06T20:01:29.076779Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04036","last_updated":"2025-07-05T13:24:15Z","snapshot_observed_at":"2026-08-07T22:33:32.445282Z","submitted_at":"2025-07-05T13:24:15Z","title":"PresentAgent: Multimodal Agent for Presentation Video Generation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T20:01:29.076779Z"},"links":{"cited_paper":"/paper/2411.17465","citing_paper":"/paper/2507.04036"},"observation_digest":"sha256:af2d1a7e86dc34ceeb5bb395f8f7dc8cd96ac4b1bfe995d0e7aa8d057a44242d","observation_id":"2fd21acb-63aa-437f-97d1-f4854ec9f7cb","resolution":{"observed_at":"2026-08-06T20:01:29.076779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17465","last_updated":"2024-11-26T14:29:47Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T14:29:47Z","title":"ShowUI: One Vision-Language-Action Model for GUI Visual Agent","version":1},"cited_work":{"arxiv_id":"2411.17465","doi":"10.48550/arxiv.2411.17465","metadata_source":"pith","pith_arxiv_id":"2411.17465","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Showui: One vision-language-action model for gui visual agent","venue":"cs.CV","work_id":"71042786-afdb-43a7-914a-740003bfa258","year":2024},"citing_paper":{"arxiv_id":"2507.04447","last_updated":"2025-08-26T08:23:50Z","snapshot_observed_at":"2026-08-05T16:56:52.400110Z","submitted_at":"2025-07-06T16:14:29Z","title":"DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-16T15:42:41.363422Z"},"links":{"cited_paper":"/paper/2411.17465","citing_paper":"/paper/2507.04447"},"observation_digest":"sha256:c2a62186bf4aa90c10b5b97d50e20ff054519db2950da4d572a7625e0d238a7f","observation_id":"f1cc3105-4402-434e-b218-a93148939593","resolution":{"observed_at":"2026-05-16T15:42:41.472571Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17465","last_updated":"2024-11-26T14:29:47Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T14:29:47Z","title":"ShowUI: One Vision-Language-Action Model for GUI Visual Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17465","snapshot_observed_at":"2026-08-06T15:29:11.808864Z","title":"Showui: One vision-language-action model for gui visual agent, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15846","last_updated":"2025-07-28T16:54:13Z","snapshot_observed_at":"2026-08-07T08:12:57.119379Z","submitted_at":"2025-07-21T17:53:42Z","title":"GUI-G$^2$: Gaussian Reward Modeling for GUI Grounding","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T15:29:11.808864Z"},"links":{"cited_paper":"/paper/2411.17465","citing_paper":"/paper/2507.15846"},"observation_digest":"sha256:9d4062012eda7af77426301454d4844bf60fdfe4d5832d4bfdafb39901e8da61","observation_id":"502ea755-018e-4996-ba99-3175a3291e2c","resolution":{"observed_at":"2026-08-06T15:29:11.808864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17465","last_updated":"2024-11-26T14:29:47Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T14:29:47Z","title":"ShowUI: One Vision-Language-Action Model for GUI Visual Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17465","snapshot_observed_at":"2026-08-06T15:08:35.653738Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16704","last_updated":"2025-07-22T15:38:12Z","snapshot_observed_at":"2026-08-07T17:17:14.473662Z","submitted_at":"2025-07-22T15:38:12Z","title":"Screen2AX: Vision-Based Approach for Automatic macOS Accessibility Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T15:08:35.653738Z"},"links":{"cited_paper":"/paper/2411.17465","citing_paper":"/paper/2507.16704"},"observation_digest":"sha256:3c14bd17459054fd38566d0d4f479f73a8e4419215b85f3db55a7da56cb60609","observation_id":"fb3aec4d-05fc-4eab-ba62-092c7b43bebb","resolution":{"observed_at":"2026-08-06T15:08:35.653738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17465","last_updated":"2024-11-26T14:29:47Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T14:29:47Z","title":"ShowUI: One Vision-Language-Action Model for GUI Visual Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17465","snapshot_observed_at":"2026-08-06T14:25:32.876994Z","title":"Tsung-Yi Lin, Michael Maire, Serge Belongie, James Hays, Pietro Perona, Deva Ramanan, Piotr Dollár, and C Lawrence Zitnick","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.19478","last_updated":"2025-07-25T17:59:26Z","snapshot_observed_at":"2026-08-07T22:33:01.602402Z","submitted_at":"2025-07-25T17:59:26Z","title":"MMBench-GUI: Hierarchical Multi-Platform Evaluation Framework for GUI Agents","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T14:25:32.876994Z"},"links":{"cited_paper":"/paper/2411.17465","citing_paper":"/paper/2507.19478"},"observation_digest":"sha256:6065bb77c50f3569ab48af182bc5a8b62114be4d8f90bd30b860763b16c65c8a","observation_id":"1faa229f-368a-4280-a1e4-b9a998812fdc","resolution":{"observed_at":"2026-08-06T14:25:32.876994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17465","last_updated":"2024-11-26T14:29:47Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T14:29:47Z","title":"ShowUI: One Vision-Language-Action Model for GUI Visual Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17465","snapshot_observed_at":"2026-08-05T23:55:49.349932Z","title":"Showui: One vision-language-action model for gui visual agent","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.04700","last_updated":"2025-08-12T15:11:53Z","snapshot_observed_at":"2026-08-07T09:56:01.664660Z","submitted_at":"2025-08-06T17:58:46Z","title":"SEAgent: Self-Evolving Computer Use Agent with Autonomous Learning from Experience","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T23:55:49.349932Z"},"links":{"cited_paper":"/paper/2411.17465","citing_paper":"/paper/2508.04700"},"observation_digest":"sha256:dbc529129c15f08b0d295e03a542fc0c6392dec8663ca613946a1ea16678cb8f","observation_id":"cc18a95a-d7f0-4b16-a168-4c714c8654e2","resolution":{"observed_at":"2026-08-05T23:55:49.349932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17465","last_updated":"2024-11-26T14:29:47Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T14:29:47Z","title":"ShowUI: One Vision-Language-Action Model for GUI Visual Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17465","snapshot_observed_at":"2026-08-05T15:19:50.672939Z","title":"Showui: One vision-language-action model for gui visual agent","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20096","last_updated":"2025-08-27T17:59:50Z","snapshot_observed_at":"2026-08-05T15:19:32.265779Z","submitted_at":"2025-08-27T17:59:50Z","title":"CODA: Coordinating the Cerebrum and Cerebellum for a Dual-Brain Computer Use Agent with Decoupled Reinforcement Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:50.672939Z"},"links":{"cited_paper":"/paper/2411.17465","citing_paper":"/paper/2508.20096"},"observation_digest":"sha256:043d90c0fb71b60df58369839a502e91ba97df3f96f4a34920c32a2afa2d5906","observation_id":"96710486-0104-4b5f-8a91-a545d55cb11b","resolution":{"observed_at":"2026-08-05T15:19:50.672939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17465","last_updated":"2024-11-26T14:29:47Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T14:29:47Z","title":"ShowUI: One Vision-Language-Action Model for GUI Visual Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17465","snapshot_observed_at":"2026-08-05T13:35:00.146538Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00531","last_updated":"2025-08-30T15:24:47Z","snapshot_observed_at":"2026-08-07T16:52:46.214045Z","submitted_at":"2025-08-30T15:24:47Z","title":"MobiAgent: A Systematic Framework for Customizable Mobile Agents","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T13:35:00.146538Z"},"links":{"cited_paper":"/paper/2411.17465","citing_paper":"/paper/2509.00531"},"observation_digest":"sha256:ff395a961f18c24966fa6d2f8d69adf59cdfddbfd00df258e6e2da9ad6954116","observation_id":"f93935eb-d7b6-4d83-823a-06fb7832e71c","resolution":{"observed_at":"2026-08-05T13:35:00.146538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17465","last_updated":"2024-11-26T14:29:47Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T14:29:47Z","title":"ShowUI: One Vision-Language-Action Model for GUI Visual Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17465","snapshot_observed_at":"2026-08-05T15:29:42.495412Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03536","last_updated":"2025-08-27T12:31:37Z","snapshot_observed_at":"2026-08-05T22:54:36.693074Z","submitted_at":"2025-08-27T12:31:37Z","title":"PG-Agent: An Agent Powered by Page Graph","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T15:29:42.495412Z"},"links":{"cited_paper":"/paper/2411.17465","citing_paper":"/paper/2509.03536"},"observation_digest":"sha256:6d5d3286e18176ee10fe3966d3ef4acbde467349154f1ca56e0abf4e5f63d4ea","observation_id":"3619084a-7ace-4ad1-92f4-9831062dc879","resolution":{"observed_at":"2026-08-05T15:29:42.495412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17465","last_updated":"2024-11-26T14:29:47Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T14:29:47Z","title":"ShowUI: One Vision-Language-Action Model for GUI Visual Agent","version":1},"cited_work":{"arxiv_id":"2411.17465","doi":"10.48550/arxiv.2411.17465","metadata_source":"pith","pith_arxiv_id":"2411.17465","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Showui: One vision-language-action model for gui visual agent","venue":"cs.CV","work_id":"71042786-afdb-43a7-914a-740003bfa258","year":2024},"citing_paper":{"arxiv_id":"2510.22102","last_updated":"2026-04-28T03:11:40Z","snapshot_observed_at":"2026-08-02T17:36:08.610766Z","submitted_at":"2025-10-25T00:58:47Z","title":"Mitigating Coordinate Prediction Bias from Positional Encoding Failures","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-18T05:11:30.734633Z"},"links":{"cited_paper":"/paper/2411.17465","citing_paper":"/paper/2510.22102"},"observation_digest":"sha256:806d4865c5f8c5bf7f6afb683016b48248a666acde21a8c57b98f6efd6d613ab","observation_id":"4573b04a-c972-4ab2-b201-0eee654c3d57","resolution":{"observed_at":"2026-05-18T05:12:23.537619Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17465","last_updated":"2024-11-26T14:29:47Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T14:29:47Z","title":"ShowUI: One Vision-Language-Action Model for GUI Visual Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17465","snapshot_observed_at":"2026-08-04T00:30:24.114175Z","title":"Showui: One vision-language-action model for gui visual agent.arXiv preprint arXiv:2411.17465,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.00810","last_updated":"2026-06-30T10:43:39Z","snapshot_observed_at":"2026-08-06T18:38:19.524231Z","submitted_at":"2025-11-02T05:34:21Z","title":"GUI-AIMA: Aligning Intrinsic Multimodal Attention with a Context Anchor for GUI Grounding","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T00:30:24.114175Z"},"links":{"cited_paper":"/paper/2411.17465","citing_paper":"/paper/2511.00810"},"observation_digest":"sha256:526ca281764613402a453a82c54d77b58f2fe0cc185ed6aeaa5f321a7179866f","observation_id":"c09c03e6-46bb-4a3a-b492-3c3eccfe00d0","resolution":{"observed_at":"2026-08-04T00:30:24.114175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17465","last_updated":"2024-11-26T14:29:47Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T14:29:47Z","title":"ShowUI: One Vision-Language-Action Model for GUI Visual Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17465","snapshot_observed_at":"2026-08-03T23:06:04.903445Z","title":"Showui: One vision-language-action model for gui visual agent, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-07T05:40:52.575532Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:04.903445Z"},"links":{"cited_paper":"/paper/2411.17465","citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:30fc0bae1b18178e75b8c7dcfc7434b18e5d9bf2693bfb292bd6714a6293fc24","observation_id":"8a3e9fe5-f353-494a-8a6d-e3914f42405a","resolution":{"observed_at":"2026-08-03T23:06:04.903445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17465","last_updated":"2024-11-26T14:29:47Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T14:29:47Z","title":"ShowUI: One Vision-Language-Action Model for GUI Visual Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17465","snapshot_observed_at":"2026-08-02T20:51:42.283887Z","title":"Showui: One vision-language-action model for gui visual agent, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.22190","last_updated":"2026-05-25T21:32:44Z","snapshot_observed_at":"2026-08-02T20:51:33.578240Z","submitted_at":"2026-02-25T18:34:57Z","title":"GUI-Libra: Training Native GUI Agents to Reason and Act with Action-aware Supervision and Partially Verifiable RL","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-02T20:51:42.283887Z"},"links":{"cited_paper":"/paper/2411.17465","citing_paper":"/paper/2602.22190"},"observation_digest":"sha256:ceb79b88d9a47e8ac6bc0af024850f690e39c53eef0fd16b4aba29002fc2f694","observation_id":"37e5ef16-a407-4fb9-bb37-3c778e521058","resolution":{"observed_at":"2026-08-02T20:51:42.283887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17465","last_updated":"2024-11-26T14:29:47Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T14:29:47Z","title":"ShowUI: One Vision-Language-Action Model for GUI Visual Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17465","snapshot_observed_at":"2026-07-13T17:40:03.471339Z","title":"arXiv preprint arXiv:2411.17465 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.26266","last_updated":"2026-06-30T04:47:42Z","snapshot_observed_at":"2026-08-09T09:54:39.177588Z","submitted_at":"2026-03-27T10:33:08Z","title":"GUIDE: Resolving Domain Bias in GUI Agents through Real-Time Web Video Retrieval and Plug-and-Play Annotation","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-13T17:40:03.471339Z"},"links":{"cited_paper":"/paper/2411.17465","citing_paper":"/paper/2603.26266"},"observation_digest":"sha256:b46a2ad4f7fc80302044c9fb6aa563ec33e16e652cacf5e279fdd5f80f2e2b88","observation_id":"d346d563-3f51-40b0-85a8-67c4c7a9f2db","resolution":{"observed_at":"2026-07-13T17:40:03.471339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17465","last_updated":"2024-11-26T14:29:47Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T14:29:47Z","title":"ShowUI: One Vision-Language-Action Model for GUI Visual Agent","version":1},"cited_work":{"arxiv_id":"2411.17465","doi":"10.48550/arxiv.2411.17465","metadata_source":"pith","pith_arxiv_id":"2411.17465","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Showui: One vision-language-action model for gui visual agent","venue":"cs.CV","work_id":"71042786-afdb-43a7-914a-740003bfa258","year":2024},"citing_paper":{"arxiv_id":"2604.14113","last_updated":"2026-04-15T17:32:28Z","snapshot_observed_at":"2026-07-06T23:02:00.082783Z","submitted_at":"2026-04-15T17:32:28Z","title":"UI-Zoomer: Uncertainty-Driven Adaptive Zoom-In for GUI Grounding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T14:06:55.472857Z"},"links":{"cited_paper":"/paper/2411.17465","citing_paper":"/paper/2604.14113"},"observation_digest":"sha256:d17f4ba50a2e352403b11c990551b32361ed4af678a5ae97b5ee8a0148323be9","observation_id":"d261bd46-3e49-43de-841f-377eba841c26","resolution":{"observed_at":"2026-05-10T14:10:28.917044Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17465","last_updated":"2024-11-26T14:29:47Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T14:29:47Z","title":"ShowUI: One Vision-Language-Action Model for GUI Visual Agent","version":1},"cited_work":{"arxiv_id":"2411.17465","doi":"10.48550/arxiv.2411.17465","metadata_source":"pith","pith_arxiv_id":"2411.17465","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Showui: One vision-language-action model for gui visual agent","venue":"cs.CV","work_id":"71042786-afdb-43a7-914a-740003bfa258","year":2024},"citing_paper":{"arxiv_id":"2604.21375","last_updated":"2026-04-24T17:01:08Z","snapshot_observed_at":"2026-08-02T05:47:52.335425Z","submitted_at":"2026-04-23T07:42:37Z","title":"VLAA-GUI: Knowing When to Stop, Recover, and Search, A Modular Framework for GUI Automation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-09T22:24:45.045405Z"},"links":{"cited_paper":"/paper/2411.17465","citing_paper":"/paper/2604.21375"},"observation_digest":"sha256:97e1dcf9301e471863c466dfb63c94ec2d432ec68c0e2e4001e28a7dad0e7717","observation_id":"5a0e84a0-0dd1-4ce2-a42e-d12a6024b301","resolution":{"observed_at":"2026-05-09T22:34:07.779203Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17465","last_updated":"2024-11-26T14:29:47Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T14:29:47Z","title":"ShowUI: One Vision-Language-Action Model for GUI Visual Agent","version":1},"cited_work":{"arxiv_id":"2411.17465","doi":"10.48550/arxiv.2411.17465","metadata_source":"pith","pith_arxiv_id":"2411.17465","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Showui: One vision-language-action model for gui visual agent","venue":"cs.CV","work_id":"71042786-afdb-43a7-914a-740003bfa258","year":2024},"citing_paper":{"arxiv_id":"2605.11223","last_updated":"2026-05-11T20:33:48Z","snapshot_observed_at":"2026-07-06T23:23:06.755816Z","submitted_at":"2026-05-11T20:33:48Z","title":"Do Vision-Language-Models show human-like logical problem-solving capability in point and click puzzle games?","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-13T01:58:39.476408Z"},"links":{"cited_paper":"/paper/2411.17465","citing_paper":"/paper/2605.11223"},"observation_digest":"sha256:c582f0a2d2140aeaf6744ff29dd1478fbbbbd245a7495e6ccb67ba29ca25119b","observation_id":"bcb010b6-2ea1-43bd-a68e-3974373b6513","resolution":{"observed_at":"2026-05-13T02:02:05.445608Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17465","last_updated":"2024-11-26T14:29:47Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T14:29:47Z","title":"ShowUI: One Vision-Language-Action Model for GUI Visual Agent","version":1},"cited_work":{"arxiv_id":"2411.17465","doi":"10.48550/arxiv.2411.17465","metadata_source":"pith","pith_arxiv_id":"2411.17465","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Showui: One vision-language-action model for gui visual agent","venue":"cs.CV","work_id":"71042786-afdb-43a7-914a-740003bfa258","year":2024},"citing_paper":{"arxiv_id":"2605.16565","last_updated":"2026-05-19T13:45:27Z","snapshot_observed_at":"2026-08-02T04:04:00.311045Z","submitted_at":"2026-05-15T19:12:43Z","title":"Skim: Speculative Execution for Fast and Efficient Web Agents","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-20T18:31:18.061863Z"},"links":{"cited_paper":"/paper/2411.17465","citing_paper":"/paper/2605.16565"},"observation_digest":"sha256:b51a500ed9a498545aadef8c81d7d684542b1971da9e8c1a532f0e8a84cd2bc6","observation_id":"1bd235fc-16b4-42df-99dd-ddaf0219dbca","resolution":{"observed_at":"2026-05-20T18:33:38.039247Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17465","last_updated":"2024-11-26T14:29:47Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T14:29:47Z","title":"ShowUI: One Vision-Language-Action Model for GUI Visual Agent","version":1},"cited_work":{"arxiv_id":"2411.17465","doi":"10.48550/arxiv.2411.17465","metadata_source":"pith","pith_arxiv_id":"2411.17465","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Showui: One vision-language-action model for gui visual agent","venue":"cs.CV","work_id":"71042786-afdb-43a7-914a-740003bfa258","year":2024},"citing_paper":{"arxiv_id":"2605.30884","last_updated":"2026-05-29T06:17:53Z","snapshot_observed_at":"2026-07-06T23:40:07.833692Z","submitted_at":"2026-05-29T06:17:53Z","title":"GUI-C$^2$: Coarse-to-Fine GUI Grounding via Difficulty-Aware Reinforcement Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-28T22:52:04.755523Z"},"links":{"cited_paper":"/paper/2411.17465","citing_paper":"/paper/2605.30884"},"observation_digest":"sha256:91ac8d3a48d8e2d1de50f4d499a564d035e27fa6297993823aeacccd3297b610","observation_id":"7cd99c0c-668e-45a6-a8d9-0625225c3568","resolution":{"observed_at":"2026-06-28T22:52:44.698903Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17465","last_updated":"2024-11-26T14:29:47Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T14:29:47Z","title":"ShowUI: One Vision-Language-Action Model for GUI Visual Agent","version":1},"cited_work":{"arxiv_id":"2411.17465","doi":"10.48550/arxiv.2411.17465","metadata_source":"pith","pith_arxiv_id":"2411.17465","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Showui: One vision-language-action model for gui visual agent","venue":"cs.CV","work_id":"71042786-afdb-43a7-914a-740003bfa258","year":2024},"citing_paper":{"arxiv_id":"2606.29537","last_updated":"2026-07-13T10:30:17Z","snapshot_observed_at":"2026-07-17T23:18:06.822637Z","submitted_at":"2026-06-28T17:59:17Z","title":"OSWorld 2.0: Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-30T07:10:38.909339Z"},"links":{"cited_paper":"/paper/2411.17465","citing_paper":"/paper/2606.29537"},"observation_digest":"sha256:3ba09dd1358a004ac7893c8da0c6671aa9867250521a115c2b855ce67ce27508","observation_id":"45d438a7-4e55-43d2-8f87-3af3cc421c45","resolution":{"observed_at":"2026-06-30T07:14:21.126877Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17465","last_updated":"2024-11-26T14:29:47Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T14:29:47Z","title":"ShowUI: One Vision-Language-Action Model for GUI Visual Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17465","snapshot_observed_at":"2026-07-15T10:24:53.345620Z","title":"ShowUI: One vision-language-action model for GUI visual agent","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.29537","last_updated":"2026-07-13T10:30:17Z","snapshot_observed_at":"2026-07-17T23:18:06.822637Z","submitted_at":"2026-06-28T17:59:17Z","title":"OSWorld 2.0: Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-15T10:24:53.345620Z"},"links":{"cited_paper":"/paper/2411.17465","citing_paper":"/paper/2606.29537"},"observation_digest":"sha256:05a1e0c93df3df9bb71bd06fbaa3381a047f0a38ae29ed808a6ee098cc0a1246","observation_id":"33244b6a-53c8-4fce-b7e7-641a23df1245","resolution":{"observed_at":"2026-07-15T10:24:53.345620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17465","last_updated":"2024-11-26T14:29:47Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T14:29:47Z","title":"ShowUI: One Vision-Language-Action Model for GUI Visual Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17465","snapshot_observed_at":"2026-07-11T20:00:19.123214Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04334","last_updated":"2026-07-18T16:56:38Z","snapshot_observed_at":"2026-08-02T08:46:57.997006Z","submitted_at":"2026-07-05T14:33:29Z","title":"Do GUI Agents Believe Their Eyes? Diagnosing State-Belief Reliance on Pixels versus Structure","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-11T20:00:19.123214Z"},"links":{"cited_paper":"/paper/2411.17465","citing_paper":"/paper/2607.04334"},"observation_digest":"sha256:41f4214eb6cfe771fdf9403e91d8516d15f5124e874d3080381919fd7862a6d0","observation_id":"cd1725ad-d3e7-4fe6-bb89-4f6507c86a23","resolution":{"observed_at":"2026-07-11T20:00:19.123214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17465","last_updated":"2024-11-26T14:29:47Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T14:29:47Z","title":"ShowUI: One Vision-Language-Action Model for GUI Visual Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17465","snapshot_observed_at":"2026-08-02T08:46:59.431501Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04334","last_updated":"2026-07-18T16:56:38Z","snapshot_observed_at":"2026-08-02T08:46:57.997006Z","submitted_at":"2026-07-05T14:33:29Z","title":"Do GUI Agents Believe Their Eyes? Diagnosing State-Belief Reliance on Pixels versus Structure","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T08:46:59.431501Z"},"links":{"cited_paper":"/paper/2411.17465","citing_paper":"/paper/2607.04334"},"observation_digest":"sha256:747d83f1e54b2f43b2c380abe1b88244cdc37bcd47dea61ebbbba89a4e669522","observation_id":"6ee9538c-55f7-44f6-a56c-cf5914914214","resolution":{"observed_at":"2026-08-02T08:46:59.431501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17465","last_updated":"2024-11-26T14:29:47Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T14:29:47Z","title":"ShowUI: One Vision-Language-Action Model for GUI Visual Agent","version":1},"cited_work":{"arxiv_id":"2411.17465","doi":"10.48550/arxiv.2411.17465","metadata_source":"pith","pith_arxiv_id":"2411.17465","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Showui: One vision-language-action model for gui visual agent","venue":"cs.CV","work_id":"71042786-afdb-43a7-914a-740003bfa258","year":2024},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":108,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"cited_paper":"/paper/2411.17465","citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:1110813d3ef2dc98c588cfa4eab8ad70ede1599ac39bfdd54a8c256aecb772e9","observation_id":"9a08a3d2-bf56-40cb-a8e0-2c9632d1a57e","resolution":{"observed_at":"2026-07-08T02:04:26.431023Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17465","last_updated":"2024-11-26T14:29:47Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T14:29:47Z","title":"ShowUI: One Vision-Language-Action Model for GUI Visual Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17465","snapshot_observed_at":"2026-08-01T16:31:11.287336Z","title":"ShowUI: One Vision-Language-Action Model for GUI Visual Agent","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22708","last_updated":"2026-07-20T14:14:44Z","snapshot_observed_at":"2026-08-07T12:37:24.746296Z","submitted_at":"2026-07-20T14:14:44Z","title":"StepX-Edge: An On-Device UI Vision-Language Model via Architecture-Training-Deployment Co-Design","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T16:31:11.287336Z"},"links":{"cited_paper":"/paper/2411.17465","citing_paper":"/paper/2607.22708"},"observation_digest":"sha256:ff089baaa785a8c27ca7beeacc47ed1c3875234bfc137183c9631be99d7859ae","observation_id":"db8235ac-0579-45c3-84ea-dcf60d4b40ca","resolution":{"observed_at":"2026-08-01T16:31:11.287336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17465","last_updated":"2024-11-26T14:29:47Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T14:29:47Z","title":"ShowUI: One Vision-Language-Action Model for GUI Visual Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17465","snapshot_observed_at":"2026-07-31T03:24:11.977217Z","title":"Zikang Liu, Junyi Li, Wayne Xin Zhao, Dawei Gao, Yaliang Li, and Ji rong Wen","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28573","last_updated":"2026-07-30T17:36:36Z","snapshot_observed_at":"2026-08-03T00:12:31.858915Z","submitted_at":"2026-07-30T17:36:36Z","title":"Rethinking Inference-Time Scaling in Local Computer-Use Agents: Failure Modes and Compute Tradeoffs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-31T03:24:11.977217Z"},"links":{"cited_paper":"/paper/2411.17465","citing_paper":"/paper/2607.28573"},"observation_digest":"sha256:7ebcd6c22e25b5b07d1e698b8e391e278d7cd6382e8de6e4e6b9553c4d509fc3","observation_id":"ba010f80-452c-400c-b9ce-9af0e7cc0593","resolution":{"observed_at":"2026-07-31T03:24:11.977217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.17465/citation-record","integrity":"/paper/2411.17465/integrity","json":"/paper/2411.17465/citation-record.json","paper":"/paper/2411.17465"},"outbound":[],"paper":{"arxiv_id":"2411.17465","last_updated":"2024-11-26T14:29:47Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T14:29:47Z","title":"ShowUI: One Vision-Language-Action Model for GUI Visual Agent"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 40 inbound Pith citation observations for arXiv:2411.17465."}