{"as_of":"2026-08-05T14:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c549addff233de5c1891c07848effa1f5d2b8b47eb5cc55c23b5460b5441b332","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":15,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":15,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":15,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T07:02:42.609364Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T19:50:10.493334Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.15661","last_updated":"2025-05-06T17:43:11Z","snapshot_observed_at":"2026-07-06T20:55:42.402903Z","submitted_at":"2025-03-19T19:26:17Z","title":"UI-Vision: A Desktop-centric GUI Benchmark for Visual Perception and Interaction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15661","snapshot_observed_at":"2026-08-04T07:02:42.609364Z","title":"Ui-vision: A desktop- centric gui benchmark for visual perception and interaction.arXiv preprint arXiv:2503.15661,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.27266","last_updated":"2026-05-27T02:32:58Z","snapshot_observed_at":"2026-08-04T07:02:38.694383Z","submitted_at":"2025-10-31T08:07:02Z","title":"Enhancing Trustworthy GUI Grounding via Self-Critiqued Reinforcement Learning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T07:02:42.609364Z"},"links":{"cited_paper":"/paper/2503.15661","citing_paper":"/paper/2510.27266"},"observation_digest":"sha256:f1f70282e6c526ec2c807bec8ef460ece812102f691e9bc92abdd924f6909a87","observation_id":"c330769a-c063-46c4-9e43-fbcc89713a65","resolution":{"observed_at":"2026-08-04T07:02:42.609364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15661","last_updated":"2025-05-06T17:43:11Z","snapshot_observed_at":"2026-07-06T20:55:42.402903Z","submitted_at":"2025-03-19T19:26:17Z","title":"UI-Vision: A Desktop-centric GUI Benchmark for Visual Perception and Interaction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15661","snapshot_observed_at":"2026-08-03T23:06:05.050263Z","title":"Rodriguez, Montek Kalsi, Rabiul Awal, Nicolas Chapados, M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:05.050263Z"},"links":{"cited_paper":"/paper/2503.15661","citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:6e23c98dc00b28b4f614a757b029d26772c257d95dfa8174c8768f8d5808406e","observation_id":"19cc78c7-807a-4275-a56d-bbaea56c9179","resolution":{"observed_at":"2026-08-03T23:06:05.050263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15661","last_updated":"2025-05-06T17:43:11Z","snapshot_observed_at":"2026-07-06T20:55:42.402903Z","submitted_at":"2025-03-19T19:26:17Z","title":"UI-Vision: A Desktop-centric GUI Benchmark for Visual Perception and Interaction","version":2},"cited_work":{"arxiv_id":"2503.15661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.15661","snapshot_observed_at":"2026-07-04T19:50:10.493334Z","title":"Ui- vision: A desktop-centric gui benchmark for visual perception and interaction","venue":null,"work_id":"228ff8a2-536b-4900-8c1a-d2eb54a5ccf8","year":2025},"citing_paper":{"arxiv_id":"2604.07413","last_updated":"2026-04-12T03:02:53Z","snapshot_observed_at":"2026-08-02T10:54:24.843668Z","submitted_at":"2026-04-08T12:23:27Z","title":"FORGE: Fine-grained Multimodal Evaluation for Manufacturing Scenarios","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T19:24:23.367540Z"},"links":{"cited_paper":"/paper/2503.15661","citing_paper":"/paper/2604.07413"},"observation_digest":"sha256:19b48264ef401aec344bcd7bdab43a2f1ae4f7301411834994442c9aa14ce181","observation_id":"7e24e4d6-ecd5-4db4-99be-207d548404e3","resolution":{"observed_at":"2026-05-10T23:00:50.215027Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15661","last_updated":"2025-05-06T17:43:11Z","snapshot_observed_at":"2026-07-06T20:55:42.402903Z","submitted_at":"2025-03-19T19:26:17Z","title":"UI-Vision: A Desktop-centric GUI Benchmark for Visual Perception and Interaction","version":2},"cited_work":{"arxiv_id":"2503.15661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.15661","snapshot_observed_at":"2026-07-04T19:50:10.493334Z","title":"Ui- vision: A desktop-centric gui benchmark for visual perception and interaction","venue":null,"work_id":"228ff8a2-536b-4900-8c1a-d2eb54a5ccf8","year":2025},"citing_paper":{"arxiv_id":"2604.14113","last_updated":"2026-04-15T17:32:28Z","snapshot_observed_at":"2026-07-06T23:02:00.082783Z","submitted_at":"2026-04-15T17:32:28Z","title":"UI-Zoomer: Uncertainty-Driven Adaptive Zoom-In for GUI Grounding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T14:06:55.472857Z"},"links":{"cited_paper":"/paper/2503.15661","citing_paper":"/paper/2604.14113"},"observation_digest":"sha256:292c9231bf5e90ee2555573142906669adf974f1741e7829ae5a0109e3038d04","observation_id":"28df16c6-fbc3-4cbc-bbf0-eba0dcb22d13","resolution":{"observed_at":"2026-05-10T14:10:28.871234Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15661","last_updated":"2025-05-06T17:43:11Z","snapshot_observed_at":"2026-07-06T20:55:42.402903Z","submitted_at":"2025-03-19T19:26:17Z","title":"UI-Vision: A Desktop-centric GUI Benchmark for Visual Perception and Interaction","version":2},"cited_work":{"arxiv_id":"2503.15661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.15661","snapshot_observed_at":"2026-07-04T19:50:10.493334Z","title":"Ui- vision: A desktop-centric gui benchmark for visual perception and interaction","venue":null,"work_id":"228ff8a2-536b-4900-8c1a-d2eb54a5ccf8","year":2025},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2503.15661","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:a8fb3328c6c68e04a263e7d3772ccb6978e9bdcc88c7544e596fb5a3eb4dc9b1","observation_id":"dddb2f6c-c819-4454-9fc3-713e578b7433","resolution":{"observed_at":"2026-05-11T14:16:05.642754Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15661","last_updated":"2025-05-06T17:43:11Z","snapshot_observed_at":"2026-07-06T20:55:42.402903Z","submitted_at":"2025-03-19T19:26:17Z","title":"UI-Vision: A Desktop-centric GUI Benchmark for Visual Perception and Interaction","version":2},"cited_work":{"arxiv_id":"2503.15661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.15661","snapshot_observed_at":"2026-07-04T19:50:10.493334Z","title":"Ui- vision: A desktop-centric gui benchmark for visual perception and interaction","venue":null,"work_id":"228ff8a2-536b-4900-8c1a-d2eb54a5ccf8","year":2025},"citing_paper":{"arxiv_id":"2604.27955","last_updated":"2026-04-30T14:51:49Z","snapshot_observed_at":"2026-07-06T23:13:20.516759Z","submitted_at":"2026-04-30T14:51:49Z","title":"GUI Agents with Reinforcement Learning: Toward Digital Inhabitants","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-07T05:48:00.486572Z"},"links":{"cited_paper":"/paper/2503.15661","citing_paper":"/paper/2604.27955"},"observation_digest":"sha256:8dd32dc6bcd4687b80b2a8838dfebf5da20974ef1ed034b067951955ce854c69","observation_id":"7a7304d0-733d-492f-8fd8-87a60ba4cd18","resolution":{"observed_at":"2026-05-12T10:31:29.596683Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15661","last_updated":"2025-05-06T17:43:11Z","snapshot_observed_at":"2026-07-06T20:55:42.402903Z","submitted_at":"2025-03-19T19:26:17Z","title":"UI-Vision: A Desktop-centric GUI Benchmark for Visual Perception and Interaction","version":2},"cited_work":{"arxiv_id":"2503.15661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.15661","snapshot_observed_at":"2026-07-04T19:50:10.493334Z","title":"Ui- vision: A desktop-centric gui benchmark for visual perception and interaction","venue":null,"work_id":"228ff8a2-536b-4900-8c1a-d2eb54a5ccf8","year":2025},"citing_paper":{"arxiv_id":"2605.00642","last_updated":"2026-05-10T03:40:15Z","snapshot_observed_at":"2026-08-02T17:34:14.464282Z","submitted_at":"2026-05-01T13:23:26Z","title":"Learn where to Click from Yourself: On-Policy Self-Distillation for GUI Grounding","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-09T19:36:42.309114Z"},"links":{"cited_paper":"/paper/2503.15661","citing_paper":"/paper/2605.00642"},"observation_digest":"sha256:eec0fc1629c7d78e7e5631ff3410a3dea7db1ba79a0e156af3e0c60a1f1ba85a","observation_id":"358bb96c-2764-440c-8a8f-66fb49084157","resolution":{"observed_at":"2026-05-11T15:36:08.005459Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15661","last_updated":"2025-05-06T17:43:11Z","snapshot_observed_at":"2026-07-06T20:55:42.402903Z","submitted_at":"2025-03-19T19:26:17Z","title":"UI-Vision: A Desktop-centric GUI Benchmark for Visual Perception and Interaction","version":2},"cited_work":{"arxiv_id":"2503.15661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.15661","snapshot_observed_at":"2026-07-04T19:50:10.493334Z","title":"Ui- vision: A desktop-centric gui benchmark for visual perception and interaction","venue":null,"work_id":"228ff8a2-536b-4900-8c1a-d2eb54a5ccf8","year":2025},"citing_paper":{"arxiv_id":"2605.00642","last_updated":"2026-05-10T03:40:15Z","snapshot_observed_at":"2026-08-02T17:34:14.464282Z","submitted_at":"2026-05-01T13:23:26Z","title":"Learn where to Click from Yourself: On-Policy Self-Distillation for GUI Grounding","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-12T02:01:51.292863Z"},"links":{"cited_paper":"/paper/2503.15661","citing_paper":"/paper/2605.00642"},"observation_digest":"sha256:1ac1a6d10f23a754f95258e2dd841dee1644918240b8994ebe3990ebdfa91b6b","observation_id":"b6e05bc1-50da-4fb9-b4af-0bd5eb538eb4","resolution":{"observed_at":"2026-05-12T07:46:26.387122Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15661","last_updated":"2025-05-06T17:43:11Z","snapshot_observed_at":"2026-07-06T20:55:42.402903Z","submitted_at":"2025-03-19T19:26:17Z","title":"UI-Vision: A Desktop-centric GUI Benchmark for Visual Perception and Interaction","version":2},"cited_work":{"arxiv_id":"2503.15661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.15661","snapshot_observed_at":"2026-07-04T19:50:10.493334Z","title":"Ui- vision: A desktop-centric gui benchmark for visual perception and interaction","venue":null,"work_id":"228ff8a2-536b-4900-8c1a-d2eb54a5ccf8","year":2025},"citing_paper":{"arxiv_id":"2605.12501","last_updated":"2026-05-12T17:59:58Z","snapshot_observed_at":"2026-08-02T22:39:49.566685Z","submitted_at":"2026-05-12T17:59:58Z","title":"Covering Human Action Space for Computer Use: Data Synthesis and Benchmark","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-13T05:18:23.310925Z"},"links":{"cited_paper":"/paper/2503.15661","citing_paper":"/paper/2605.12501"},"observation_digest":"sha256:82571b1ccc1d5717de091b31969dcd0916e873170a346430da4fbfd97ebedac7","observation_id":"93e6cbe4-ce13-4ae4-b77a-78dccde4d7a5","resolution":{"observed_at":"2026-05-13T05:27:19.070430Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15661","last_updated":"2025-05-06T17:43:11Z","snapshot_observed_at":"2026-07-06T20:55:42.402903Z","submitted_at":"2025-03-19T19:26:17Z","title":"UI-Vision: A Desktop-centric GUI Benchmark for Visual Perception and Interaction","version":2},"cited_work":{"arxiv_id":"2503.15661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.15661","snapshot_observed_at":"2026-07-04T19:50:10.493334Z","title":"Ui- vision: A desktop-centric gui benchmark for visual perception and interaction","venue":null,"work_id":"228ff8a2-536b-4900-8c1a-d2eb54a5ccf8","year":2025},"citing_paper":{"arxiv_id":"2605.12549","last_updated":"2026-05-10T07:04:07Z","snapshot_observed_at":"2026-08-01T19:38:23.111665Z","submitted_at":"2026-05-10T07:04:07Z","title":"What Happens Before Decoding? Prefill Determines GUI Grounding in VLMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-14T21:43:29.737867Z"},"links":{"cited_paper":"/paper/2503.15661","citing_paper":"/paper/2605.12549"},"observation_digest":"sha256:4505c514b8456f1d0a92fd9f41fb3e8adf9f2ce4335828cdd86e6d6ec9708b2e","observation_id":"89e70d6d-4fec-4ca2-b62a-60cfb431208a","resolution":{"observed_at":"2026-05-14T21:48:01.091623Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15661","last_updated":"2025-05-06T17:43:11Z","snapshot_observed_at":"2026-07-06T20:55:42.402903Z","submitted_at":"2025-03-19T19:26:17Z","title":"UI-Vision: A Desktop-centric GUI Benchmark for Visual Perception and Interaction","version":2},"cited_work":{"arxiv_id":"2503.15661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.15661","snapshot_observed_at":"2026-07-04T19:50:10.493334Z","title":"Ui- vision: A desktop-centric gui benchmark for visual perception and interaction","venue":null,"work_id":"228ff8a2-536b-4900-8c1a-d2eb54a5ccf8","year":2025},"citing_paper":{"arxiv_id":"2605.19260","last_updated":"2026-05-19T02:13:29Z","snapshot_observed_at":"2026-07-06T23:30:02.207108Z","submitted_at":"2026-05-19T02:13:29Z","title":"AQuaUI: Visual Token Reduction for GUI Agents with Adaptive Quadtrees","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-20T06:20:33.874919Z"},"links":{"cited_paper":"/paper/2503.15661","citing_paper":"/paper/2605.19260"},"observation_digest":"sha256:d8a23b231c76d7eaf8605470d0e1aba32a727a0f98963d9d30244de9c093d606","observation_id":"bccba9cc-b92e-477c-a26f-6fcd98eb17c0","resolution":{"observed_at":"2026-05-20T06:23:05.512430Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15661","last_updated":"2025-05-06T17:43:11Z","snapshot_observed_at":"2026-07-06T20:55:42.402903Z","submitted_at":"2025-03-19T19:26:17Z","title":"UI-Vision: A Desktop-centric GUI Benchmark for Visual Perception and Interaction","version":2},"cited_work":{"arxiv_id":"2503.15661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.15661","snapshot_observed_at":"2026-07-04T19:50:10.493334Z","title":"Ui- vision: A desktop-centric gui benchmark for visual perception and interaction","venue":null,"work_id":"228ff8a2-536b-4900-8c1a-d2eb54a5ccf8","year":2025},"citing_paper":{"arxiv_id":"2605.25571","last_updated":"2026-05-25T08:26:34Z","snapshot_observed_at":"2026-07-06T23:35:31.372756Z","submitted_at":"2026-05-25T08:26:34Z","title":"AnE: Pushing the Reasoning Frontier of Multimodal LLMs via Anchor Evolution","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-29T22:56:39.504430Z"},"links":{"cited_paper":"/paper/2503.15661","citing_paper":"/paper/2605.25571"},"observation_digest":"sha256:dcb504d3510e6cb64a624aac4e533cea8e1372f5994b9e7a3cf760eb68b56d6a","observation_id":"8f25b2d5-ace5-4d06-a28f-8fc3bf50e21a","resolution":{"observed_at":"2026-06-30T00:14:04.649378Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15661","last_updated":"2025-05-06T17:43:11Z","snapshot_observed_at":"2026-07-06T20:55:42.402903Z","submitted_at":"2025-03-19T19:26:17Z","title":"UI-Vision: A Desktop-centric GUI Benchmark for Visual Perception and Interaction","version":2},"cited_work":{"arxiv_id":"2503.15661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.15661","snapshot_observed_at":"2026-07-04T19:50:10.493334Z","title":"Ui- vision: A desktop-centric gui benchmark for visual perception and interaction","venue":null,"work_id":"228ff8a2-536b-4900-8c1a-d2eb54a5ccf8","year":2025},"citing_paper":{"arxiv_id":"2606.25760","last_updated":"2026-06-24T12:34:28Z","snapshot_observed_at":"2026-07-07T00:00:12.737052Z","submitted_at":"2026-06-24T12:34:28Z","title":"Uncertainty Quantification for Computer-Use Agents: A Benchmark across Vision-Language Models and GUI Grounding Datasets","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-25T20:59:47.212513Z"},"links":{"cited_paper":"/paper/2503.15661","citing_paper":"/paper/2606.25760"},"observation_digest":"sha256:0f65890dc04d0e3899a60aa1214699ab3f014dcacccea81523ea5aa276602c36","observation_id":"3a54e4ff-1da8-416a-815f-8e41722d6c5d","resolution":{"observed_at":"2026-07-04T19:50:10.495128Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15661","last_updated":"2025-05-06T17:43:11Z","snapshot_observed_at":"2026-07-06T20:55:42.402903Z","submitted_at":"2025-03-19T19:26:17Z","title":"UI-Vision: A Desktop-centric GUI Benchmark for Visual Perception and Interaction","version":2},"cited_work":{"arxiv_id":"2503.15661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.15661","snapshot_observed_at":"2026-07-04T19:50:10.493334Z","title":"Ui- vision: A desktop-centric gui benchmark for visual perception and interaction","venue":null,"work_id":"228ff8a2-536b-4900-8c1a-d2eb54a5ccf8","year":2025},"citing_paper":{"arxiv_id":"2606.30084","last_updated":"2026-06-29T10:20:39Z","snapshot_observed_at":"2026-08-05T10:34:24.326234Z","submitted_at":"2026-06-29T10:20:39Z","title":"One Forward Beats Two: InnerZoom for Accurate and Efficient GUI Grounding","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-06-30T06:58:01.734975Z"},"links":{"cited_paper":"/paper/2503.15661","citing_paper":"/paper/2606.30084"},"observation_digest":"sha256:4517b0a4c182bab81c59743133efea7feef5c8c8ddab7e8db392f4c64af8fb77","observation_id":"8ddad154-b359-416d-929b-ceb5a54c1a05","resolution":{"observed_at":"2026-06-30T07:04:21.744656Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15661","last_updated":"2025-05-06T17:43:11Z","snapshot_observed_at":"2026-07-06T20:55:42.402903Z","submitted_at":"2025-03-19T19:26:17Z","title":"UI-Vision: A Desktop-centric GUI Benchmark for Visual Perception and Interaction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15661","snapshot_observed_at":"2026-07-31T14:04:39.783867Z","title":"Rodriguez, Montek Kalsi, Rabiul Awal, Nicolas Chapados, M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28227","last_updated":"2026-07-30T13:58:41Z","snapshot_observed_at":"2026-08-04T06:59:54.896655Z","submitted_at":"2026-07-30T13:58:41Z","title":"Qwen-UI-Agent Technical Report: Toward Next-Generation Real-World Centric Foundation GUI Agents","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-07-31T14:04:39.783867Z"},"links":{"cited_paper":"/paper/2503.15661","citing_paper":"/paper/2607.28227"},"observation_digest":"sha256:4791b7c9f946572b5c8a54d95f5d5c36a00f0e1069c77abdc8b05b1b921be9fe","observation_id":"1b0bbdfb-ff9c-44ab-85a4-98f9555563da","resolution":{"observed_at":"2026-07-31T14:04:39.783867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2503.15661/citation-record","integrity":"/paper/2503.15661/integrity","json":"/paper/2503.15661/citation-record.json","paper":"/paper/2503.15661"},"outbound":[],"paper":{"arxiv_id":"2503.15661","last_updated":"2025-05-06T17:43:11Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T20:55:42.402903Z","submitted_at":"2025-03-19T19:26:17Z","title":"UI-Vision: A Desktop-centric GUI Benchmark for Visual Perception and Interaction"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 15 inbound Pith citation observations for arXiv:2503.15661."}