{"as_of":"2026-08-05T21:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1b1178bda2655a455193a2a8eff197565bc891c4a4b0cc7721aebf381a789103","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T00:30:26.196169Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T06:58:01.734975Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T07:04:21.780384Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.00810","last_updated":"2026-06-30T10:43:39Z","snapshot_observed_at":"2026-08-04T00:30:22.339802Z","submitted_at":"2025-11-02T05:34:21Z","title":"GUI-AIMA: Aligning Intrinsic Multimodal Attention with a Context Anchor for GUI Grounding","version":4},"cited_work":{"arxiv_id":"2511.00810","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.00810","snapshot_observed_at":"2026-07-01T02:17:17.481434Z","title":"arXiv preprint arXiv:2511.00810 , year=","venue":null,"work_id":"dfa7451f-928d-4c2c-9601-7325e50490bc","year":null},"citing_paper":{"arxiv_id":"2606.30084","last_updated":"2026-06-29T10:20:39Z","snapshot_observed_at":"2026-08-05T10:34:24.326234Z","submitted_at":"2026-06-29T10:20:39Z","title":"One Forward Beats Two: InnerZoom for Accurate and Efficient GUI Grounding","version":1},"reference_index":110,"source":"arxiv_source","source_observed_at":"2026-06-30T06:58:01.734975Z"},"links":{"cited_paper":"/paper/2511.00810","citing_paper":"/paper/2606.30084"},"observation_digest":"sha256:54fc580958745d58a0944bd6b4c8082a671c1998dd9a51a48b68f3e15bd1a156","observation_id":"785fbea9-5e6e-4eca-a103-25d691629df6","resolution":{"observed_at":"2026-07-01T02:17:17.481434Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2511.00810/citation-record","integrity":"/paper/2511.00810/integrity","json":"/paper/2511.00810/citation-record.json","paper":"/paper/2511.00810"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-04T00:30:23.309580Z","title":"Qwen2.5-vl technical report.arXiv preprint arXiv:2502.13923,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.00810","last_updated":"2026-06-30T10:43:39Z","snapshot_observed_at":"2026-08-04T00:30:22.339802Z","submitted_at":"2025-11-02T05:34:21Z","title":"GUI-AIMA: Aligning Intrinsic Multimodal Attention with a Context Anchor for GUI Grounding","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T00:30:23.309580Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2511.00810"},"observation_digest":"sha256:974e17474959ba822fe436d6d7e3e363a4cf5b4678d6eefd5098184db411c417","observation_id":"e39fffa7-6dcf-47d7-91b1-44da382ec99c","resolution":{"observed_at":"2026-08-04T00:30:23.309580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.04341","last_updated":"2019-06-11T01:31:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-06-11T01:31:41Z","title":"What Does BERT Look At? An Analysis of BERT's Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.04341","snapshot_observed_at":"2026-08-04T00:30:23.591433Z","title":"What does bert look at? an analysis of bert’s attention.arXiv preprint arXiv:1906.04341,","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2511.00810","last_updated":"2026-06-30T10:43:39Z","snapshot_observed_at":"2026-08-04T00:30:22.339802Z","submitted_at":"2025-11-02T05:34:21Z","title":"GUI-AIMA: Aligning Intrinsic Multimodal Attention with a Context Anchor for GUI Grounding","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T00:30:23.591433Z"},"links":{"cited_paper":"/paper/1906.04341","citing_paper":"/paper/2511.00810"},"observation_digest":"sha256:5d78d8253196b23eb8e0a326da38c98fd8bb57144d9fb68c0d8219368e05dd28","observation_id":"1e202318-0dce-4686-ba21-2209760da269","resolution":{"observed_at":"2026-08-04T00:30:23.591433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13896","last_updated":"2025-01-27T18:58:42Z","snapshot_observed_at":"2026-07-06T20:25:08.527025Z","submitted_at":"2025-01-23T18:16:21Z","title":"GUI-Bee: Align GUI Action Grounding to Novel Environments via Autonomous Exploration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13896","snapshot_observed_at":"2026-08-04T00:30:23.808488Z","title":"Gui-bee: Align gui action grounding to novel environments via autonomous exploration.arXiv preprint arXiv:2501.13896,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.00810","last_updated":"2026-06-30T10:43:39Z","snapshot_observed_at":"2026-08-04T00:30:22.339802Z","submitted_at":"2025-11-02T05:34:21Z","title":"GUI-AIMA: Aligning Intrinsic Multimodal Attention with a Context Anchor for GUI Grounding","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T00:30:23.808488Z"},"links":{"cited_paper":"/paper/2501.13896","citing_paper":"/paper/2511.00810"},"observation_digest":"sha256:dc326db141d479be2ac72f2388c84708e22021dbea485226b215f3be5566f02a","observation_id":"ee7cf3f2-2050-42e6-a0a9-a7781fdf09f4","resolution":{"observed_at":"2026-08-04T00:30:23.808488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05243","last_updated":"2025-06-17T15:06:02Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T17:47:50Z","title":"Navigating the Digital World as Humans Do: Universal Visual Grounding for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05243","snapshot_observed_at":"2026-08-04T00:30:23.903148Z","title":"Navigating the digital world as humans do: Universal visual grounding for gui agents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.00810","last_updated":"2026-06-30T10:43:39Z","snapshot_observed_at":"2026-08-04T00:30:22.339802Z","submitted_at":"2025-11-02T05:34:21Z","title":"GUI-AIMA: Aligning Intrinsic Multimodal Attention with a Context Anchor for GUI Grounding","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T00:30:23.903148Z"},"links":{"cited_paper":"/paper/2410.05243","citing_paper":"/paper/2511.00810"},"observation_digest":"sha256:8c01327f897c95f8403fa869944cd12a7c16239ac471dae95f68e81f02957906","observation_id":"13f1da45-8b1e-4948-8401-922d1044be0b","resolution":{"observed_at":"2026-08-04T00:30:23.903148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10323","last_updated":"2024-11-15T16:23:52Z","snapshot_observed_at":"2026-07-06T19:51:01.075884Z","submitted_at":"2024-11-15T16:23:52Z","title":"The Dawn of GUI Agent: A Preliminary Case Study with Claude 3.5 Computer Use","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10323","snapshot_observed_at":"2026-08-04T00:30:23.975168Z","title":"Daniel Jeffries and KentaurosAI Team","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.00810","last_updated":"2026-06-30T10:43:39Z","snapshot_observed_at":"2026-08-04T00:30:22.339802Z","submitted_at":"2025-11-02T05:34:21Z","title":"GUI-AIMA: Aligning Intrinsic Multimodal Attention with a Context Anchor for GUI Grounding","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T00:30:23.975168Z"},"links":{"cited_paper":"/paper/2411.10323","citing_paper":"/paper/2511.00810"},"observation_digest":"sha256:9a0f3d29f21397c0fdbb4fc0a438df79cd551b220cef6bca0a09da09ac7e0fff","observation_id":"a9f0c8f0-48a9-4953-b389-041c6ce702f9","resolution":{"observed_at":"2026-08-04T00:30:23.975168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07981","last_updated":"2025-04-04T14:25:17Z","snapshot_observed_at":"2026-07-06T21:07:29.062389Z","submitted_at":"2025-04-04T14:25:17Z","title":"ScreenSpot-Pro: GUI Grounding for Professional High-Resolution Computer Use","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07981","snapshot_observed_at":"2026-08-04T00:30:24.040770Z","title":"co/datasets/agentsea/wave-ui","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.00810","last_updated":"2026-06-30T10:43:39Z","snapshot_observed_at":"2026-08-04T00:30:22.339802Z","submitted_at":"2025-11-02T05:34:21Z","title":"GUI-AIMA: Aligning Intrinsic Multimodal Attention with a Context Anchor for GUI Grounding","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T00:30:24.040770Z"},"links":{"cited_paper":"/paper/2504.07981","citing_paper":"/paper/2511.00810"},"observation_digest":"sha256:b163a217b42acfe670d45fc5c84b496995aa63c09fd2d3e4fd0edc3fde25ecae","observation_id":"427bfb5f-5655-4bdb-b990-456100610178","resolution":{"observed_at":"2026-08-04T00:30:24.040770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17465","last_updated":"2024-11-26T14:29:47Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T14:29:47Z","title":"ShowUI: One Vision-Language-Action Model for GUI Visual Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17465","snapshot_observed_at":"2026-08-04T00:30:24.114175Z","title":"Showui: One vision-language-action model for gui visual agent.arXiv preprint arXiv:2411.17465,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.00810","last_updated":"2026-06-30T10:43:39Z","snapshot_observed_at":"2026-08-04T00:30:22.339802Z","submitted_at":"2025-11-02T05:34:21Z","title":"GUI-AIMA: Aligning Intrinsic Multimodal Attention with a Context Anchor for GUI Grounding","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T00:30:24.114175Z"},"links":{"cited_paper":"/paper/2411.17465","citing_paper":"/paper/2511.00810"},"observation_digest":"sha256:68dca249776aea3d624c9d0b498d52ed5c3c10f92ef3161788466f2eea1174c6","observation_id":"c09c03e6-46bb-4a3a-b492-3c3eccfe00d0","resolution":{"observed_at":"2026-08-04T00:30:24.114175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:30:24.190521Z","title":"Zhengxi Lu, Yuxiang Chai, Yaxuan Guo, Xi Yin, Liang Liu, Hao Wang, Han Xiao, Shuai Ren, Guanjing Xiong, and Hongsheng Li","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.00810","last_updated":"2026-06-30T10:43:39Z","snapshot_observed_at":"2026-08-04T00:30:22.339802Z","submitted_at":"2025-11-02T05:34:21Z","title":"GUI-AIMA: Aligning Intrinsic Multimodal Attention with a Context Anchor for GUI Grounding","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T00:30:24.190521Z"},"links":{"citing_paper":"/paper/2511.00810"},"observation_digest":"sha256:f3e6e0ad01306c3cdd0bb2f926669c331b604c9176f83af26ff53ee5337b792a","observation_id":"ff7587c0-23c4-45d5-8d79-755ec649c23e","resolution":{"observed_at":"2026-08-04T00:30:24.190521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10458","last_updated":"2025-10-01T04:55:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:45:54Z","title":"GUI-R1 : A Generalist R1-Style Vision-Language Action Model For GUI Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10458","snapshot_observed_at":"2026-08-04T00:30:24.329429Z","title":"Gui-r1: A generalist r1-style vision-language action model for gui agents.arXiv preprint arXiv:2504.10458,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.00810","last_updated":"2026-06-30T10:43:39Z","snapshot_observed_at":"2026-08-04T00:30:22.339802Z","submitted_at":"2025-11-02T05:34:21Z","title":"GUI-AIMA: Aligning Intrinsic Multimodal Attention with a Context Anchor for GUI Grounding","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T00:30:24.329429Z"},"links":{"cited_paper":"/paper/2504.10458","citing_paper":"/paper/2511.00810"},"observation_digest":"sha256:ff68ce97e54ffab5a191b70e39fd65596f25751e7a3bd248dad1db9e11cb0ac1","observation_id":"98aae9bd-f7d0-4022-9cd3-65f84eca9e4c","resolution":{"observed_at":"2026-08-04T00:30:24.329429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.11895","last_updated":"2022-09-24T00:43:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-09-24T00:43:19Z","title":"In-context Learning and Induction Heads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.11895","snapshot_observed_at":"2026-08-04T00:30:24.418295Z","title":"In-context learning and induction heads.arXiv preprint arXiv:2209.11895,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.00810","last_updated":"2026-06-30T10:43:39Z","snapshot_observed_at":"2026-08-04T00:30:22.339802Z","submitted_at":"2025-11-02T05:34:21Z","title":"GUI-AIMA: Aligning Intrinsic Multimodal Attention with a Context Anchor for GUI Grounding","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T00:30:24.418295Z"},"links":{"cited_paper":"/paper/2209.11895","citing_paper":"/paper/2511.00810"},"observation_digest":"sha256:55e237e537b1d41b051e4f37e58f0801ca9ef6ead724e9467f8a5149621d98de","observation_id":"dd2ccb4c-3cbe-41e9-8a43-82d05f607ef7","resolution":{"observed_at":"2026-08-04T00:30:24.418295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12326","last_updated":"2025-01-21T17:48:10Z","snapshot_observed_at":"2026-07-06T20:23:58.426780Z","submitted_at":"2025-01-21T17:48:10Z","title":"UI-TARS: Pioneering Automated GUI Interaction with Native Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12326","snapshot_observed_at":"2026-08-04T00:30:24.495470Z","title":"Yujia Qin, Yining Ye, Junjie Fang, Haoming Wang, Shihao Liang, Shizuo Tian, Junda Zhang, Jiahao Li, Yunxin Li, Shijue Huang, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.00810","last_updated":"2026-06-30T10:43:39Z","snapshot_observed_at":"2026-08-04T00:30:22.339802Z","submitted_at":"2025-11-02T05:34:21Z","title":"GUI-AIMA: Aligning Intrinsic Multimodal Attention with a Context Anchor for GUI Grounding","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T00:30:24.495470Z"},"links":{"cited_paper":"/paper/2501.12326","citing_paper":"/paper/2511.00810"},"observation_digest":"sha256:c15659bfb69215f086936700d9ecef57031441f127a3fd032524ac17860365e8","observation_id":"d9be6992-341a-4c3e-a02e-f43c2a27a6aa","resolution":{"observed_at":"2026-08-04T00:30:24.495470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14573","last_updated":"2025-04-06T20:37:50Z","snapshot_observed_at":"2026-07-06T18:18:39.093732Z","submitted_at":"2024-05-23T13:48:54Z","title":"AndroidWorld: A Dynamic Benchmarking Environment for Autonomous Agents","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14573","snapshot_observed_at":"2026-08-04T00:30:24.641300Z","title":"Androidworld: A dynamic benchmarking environment for autonomous agents.arXiv preprint arXiv:2405.14573,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.00810","last_updated":"2026-06-30T10:43:39Z","snapshot_observed_at":"2026-08-04T00:30:22.339802Z","submitted_at":"2025-11-02T05:34:21Z","title":"GUI-AIMA: Aligning Intrinsic Multimodal Attention with a Context Anchor for GUI Grounding","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T00:30:24.641300Z"},"links":{"cited_paper":"/paper/2405.14573","citing_paper":"/paper/2511.00810"},"observation_digest":"sha256:5b5c6b43f38818ecd5a9ec4f7c9546c59f4c146ef8e76af08d29ffea6524e306","observation_id":"ccb000bc-a6d2-4d22-b89b-f127dbd777ba","resolution":{"observed_at":"2026-08-04T00:30:24.641300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15846","last_updated":"2025-07-28T16:54:13Z","snapshot_observed_at":"2026-07-06T22:00:33.554745Z","submitted_at":"2025-07-21T17:53:42Z","title":"GUI-G$^2$: Gaussian Reward Modeling for GUI Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15846","snapshot_observed_at":"2026-08-04T00:30:24.763113Z","title":"GUI-G 2: Gaussian reward modeling for gui grounding.arXiv preprint arXiv:2507.15846,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.00810","last_updated":"2026-06-30T10:43:39Z","snapshot_observed_at":"2026-08-04T00:30:22.339802Z","submitted_at":"2025-11-02T05:34:21Z","title":"GUI-AIMA: Aligning Intrinsic Multimodal Attention with a Context Anchor for GUI Grounding","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T00:30:24.763113Z"},"links":{"cited_paper":"/paper/2507.15846","citing_paper":"/paper/2511.00810"},"observation_digest":"sha256:0ca09c6b70d0dbc35ff9aa778f14a2b14ce6024d8991b6b3d501d0e454d44953","observation_id":"abf08a80-530f-4f86-9830-16c0557a9ab9","resolution":{"observed_at":"2026-08-04T00:30:24.763113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-04T00:30:24.934146Z","title":"Mobile-agent: Autonomous multi-modal mobile device agent with visual perception.arXiv preprint arXiv:2401.16158, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.00810","last_updated":"2026-06-30T10:43:39Z","snapshot_observed_at":"2026-08-04T00:30:22.339802Z","submitted_at":"2025-11-02T05:34:21Z","title":"GUI-AIMA: Aligning Intrinsic Multimodal Attention with a Context Anchor for GUI Grounding","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T00:30:24.934146Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2511.00810"},"observation_digest":"sha256:4a51f8c879df7af326502d4e8dd19097915d8e2e0837b13efb157fc21364f12a","observation_id":"84c6474e-f102-42f1-9cd7-b00ee6f97686","resolution":{"observed_at":"2026-08-04T00:30:24.934146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23218","last_updated":"2024-10-30T17:10:19Z","snapshot_observed_at":"2026-08-05T06:30:40.974506Z","submitted_at":"2024-10-30T17:10:19Z","title":"OS-ATLAS: A Foundation Action Model for Generalist GUI Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23218","snapshot_observed_at":"2026-08-04T00:30:25.003122Z","title":"Os-atlas: A foundation action model for gener- alist gui agents.arXiv preprint arXiv:2410.23218,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.00810","last_updated":"2026-06-30T10:43:39Z","snapshot_observed_at":"2026-08-04T00:30:22.339802Z","submitted_at":"2025-11-02T05:34:21Z","title":"GUI-AIMA: Aligning Intrinsic Multimodal Attention with a Context Anchor for GUI Grounding","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T00:30:25.003122Z"},"links":{"cited_paper":"/paper/2410.23218","citing_paper":"/paper/2511.00810"},"observation_digest":"sha256:7f8ebf0ac5642aa468baac23a1c965d85b34b110c2c258af65facd0c0ed30d45","observation_id":"a88d6600-0a8e-4b79-bbb5-dfd5dfde4b35","resolution":{"observed_at":"2026-08-04T00:30:25.003122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:30:25.173013Z","title":"Scaling computer-use grounding via user interface decomposition and synthesis.arXiv preprint arXiv:2505.13227, 2025b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.00810","last_updated":"2026-06-30T10:43:39Z","snapshot_observed_at":"2026-08-04T00:30:22.339802Z","submitted_at":"2025-11-02T05:34:21Z","title":"GUI-AIMA: Aligning Intrinsic Multimodal Attention with a Context Anchor for GUI Grounding","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T00:30:25.173013Z"},"links":{"citing_paper":"/paper/2511.00810"},"observation_digest":"sha256:bfb17678129b04a36ddee377aa834eeed80b828fa491f6ad1d22ec4f91742b89","observation_id":"f5892f10-c9c4-4b96-bf55-80ce1735b92d","resolution":{"observed_at":"2026-08-04T00:30:25.173013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05791","last_updated":"2025-10-03T23:50:19Z","snapshot_observed_at":"2026-07-30T10:31:35.758747Z","submitted_at":"2025-07-08T08:52:18Z","title":"GTA1: GUI Test-time Scaling Agent","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05791","snapshot_observed_at":"2026-08-04T00:30:25.286424Z","title":"Yuhao Yang, Yue Wang, Dongxu Li, Ziyang Luo, Bei Chen, Chao Huang, and Junnan Li","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.00810","last_updated":"2026-06-30T10:43:39Z","snapshot_observed_at":"2026-08-04T00:30:22.339802Z","submitted_at":"2025-11-02T05:34:21Z","title":"GUI-AIMA: Aligning Intrinsic Multimodal Attention with a Context Anchor for GUI Grounding","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T00:30:25.286424Z"},"links":{"cited_paper":"/paper/2507.05791","citing_paper":"/paper/2511.00810"},"observation_digest":"sha256:8fb8b1a43b4f432f1445a9052452387f022b484c8ac6c4947dc531c090386a5a","observation_id":"b851987c-5a10-40ab-85e2-bc1f1bce42a2","resolution":{"observed_at":"2026-08-04T00:30:25.286424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15144","last_updated":"2025-09-01T05:38:34Z","snapshot_observed_at":"2026-07-06T22:15:55.690108Z","submitted_at":"2025-08-21T00:39:12Z","title":"Mobile-Agent-v3: Fundamental Agents for GUI Automation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.15144","snapshot_observed_at":"2026-08-04T00:30:25.438320Z","title":"Mobile-agent-v3: Foundamental agents for gui automation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.00810","last_updated":"2026-06-30T10:43:39Z","snapshot_observed_at":"2026-08-04T00:30:22.339802Z","submitted_at":"2025-11-02T05:34:21Z","title":"GUI-AIMA: Aligning Intrinsic Multimodal Attention with a Context Anchor for GUI Grounding","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T00:30:25.438320Z"},"links":{"cited_paper":"/paper/2508.15144","citing_paper":"/paper/2511.00810"},"observation_digest":"sha256:35dde4f252f435189e8c66a672723e7a6973b9afffcd6aef74cdfc7a964e6075","observation_id":"89eacc2e-d49f-4c54-a7c7-71a20fce3f37","resolution":{"observed_at":"2026-08-04T00:30:25.438320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16161","last_updated":"2026-04-21T00:55:33Z","snapshot_observed_at":"2026-08-05T08:36:45.319221Z","submitted_at":"2025-02-22T09:32:01Z","title":"OmniParser V2: Structured-Points-of-Thought for Unified Visual Text Parsing and Its Generality to Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16161","snapshot_observed_at":"2026-08-04T00:30:25.554263Z","title":"15 Xinbin Yuan, Jian Zhang, Kaixin Li, Zhuoxuan Cai, Lujian Yao, Jie Chen, Enguang Wang, Qibin Hou, Jinwei Chen, Peng-Tao Jiang, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.00810","last_updated":"2026-06-30T10:43:39Z","snapshot_observed_at":"2026-08-04T00:30:22.339802Z","submitted_at":"2025-11-02T05:34:21Z","title":"GUI-AIMA: Aligning Intrinsic Multimodal Attention with a Context Anchor for GUI Grounding","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T00:30:25.554263Z"},"links":{"cited_paper":"/paper/2502.16161","citing_paper":"/paper/2511.00810"},"observation_digest":"sha256:0ef3b50e2adcd3abf62af5f9192c5bf31b63d5d33097c2aff60dae80e5487eb4","observation_id":"1082df2f-537e-4cea-aac1-077ec8bce7d1","resolution":{"observed_at":"2026-08-04T00:30:25.554263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07939","last_updated":"2024-05-23T05:18:58Z","snapshot_observed_at":"2026-08-01T11:47:21.821212Z","submitted_at":"2024-02-08T15:40:35Z","title":"UFO: A UI-Focused Agent for Windows OS Interaction","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07939","snapshot_observed_at":"2026-08-04T00:30:25.679125Z","title":"Ufo: A ui-focused agent for windows os interaction.arXiv preprint arXiv:2402.07939,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.00810","last_updated":"2026-06-30T10:43:39Z","snapshot_observed_at":"2026-08-04T00:30:22.339802Z","submitted_at":"2025-11-02T05:34:21Z","title":"GUI-AIMA: Aligning Intrinsic Multimodal Attention with a Context Anchor for GUI Grounding","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T00:30:25.679125Z"},"links":{"cited_paper":"/paper/2402.07939","citing_paper":"/paper/2511.00810"},"observation_digest":"sha256:e37a3f2b5254f38b04330364426db17028dd019b74db8bd8402a8b56068b74cc","observation_id":"15ac2636-7501-4b68-9aee-81bae9f4d19e","resolution":{"observed_at":"2026-08-04T00:30:25.679125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:30:25.804623Z","title":"Appagent: Multimodal agents as smartphone users","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.00810","last_updated":"2026-06-30T10:43:39Z","snapshot_observed_at":"2026-08-04T00:30:22.339802Z","submitted_at":"2025-11-02T05:34:21Z","title":"GUI-AIMA: Aligning Intrinsic Multimodal Attention with a Context Anchor for GUI Grounding","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T00:30:25.804623Z"},"links":{"citing_paper":"/paper/2511.00810"},"observation_digest":"sha256:7e0cd228a4b8e2b8c54acbc271d1b6698f58c5e807118cc0436d402228a917a6","observation_id":"49fb783d-6a20-40e6-9382-abb78a06a4e4","resolution":{"observed_at":"2026-08-04T00:30:25.804623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01614","last_updated":"2024-03-12T23:14:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-03T08:33:09Z","title":"GPT-4V(ision) is a Generalist Web Agent, if Grounded","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01614","snapshot_observed_at":"2026-08-04T00:30:25.933515Z","title":"Gpt-4v (ision) is a generalist web agent, if grounded.arXiv preprint arXiv:2401.01614,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.00810","last_updated":"2026-06-30T10:43:39Z","snapshot_observed_at":"2026-08-04T00:30:22.339802Z","submitted_at":"2025-11-02T05:34:21Z","title":"GUI-AIMA: Aligning Intrinsic Multimodal Attention with a Context Anchor for GUI Grounding","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T00:30:25.933515Z"},"links":{"cited_paper":"/paper/2401.01614","citing_paper":"/paper/2511.00810"},"observation_digest":"sha256:8860b3ba85da647a67b9aba5b797855c755ada65a3b7cc75e28b8efd6cb31405","observation_id":"deebc45c-d2ae-48f4-bdf4-c09549858777","resolution":{"observed_at":"2026-08-04T00:30:25.933515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15810","last_updated":"2025-05-22T11:15:23Z","snapshot_observed_at":"2026-07-06T21:28:01.596548Z","submitted_at":"2025-05-21T17:59:09Z","title":"GUI-G1: Understanding R1-Zero-Like Training for Visual Grounding in GUI Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15810","snapshot_observed_at":"2026-08-04T00:30:26.090264Z","title":"Gui-g1: Understand- ing r1-zero-like training for visual grounding in gui agents.arXiv preprint arXiv:2505.15810,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.00810","last_updated":"2026-06-30T10:43:39Z","snapshot_observed_at":"2026-08-04T00:30:22.339802Z","submitted_at":"2025-11-02T05:34:21Z","title":"GUI-AIMA: Aligning Intrinsic Multimodal Attention with a Context Anchor for GUI Grounding","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T00:30:26.090264Z"},"links":{"cited_paper":"/paper/2505.15810","citing_paper":"/paper/2511.00810"},"observation_digest":"sha256:71e4a0c84373e9749c4e5f82703fb764276f05e634043935c34ce2312f07510d","observation_id":"0eb3ef86-65d2-4543-99cc-91c9732d39b1","resolution":{"observed_at":"2026-08-04T00:30:26.090264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:30:26.196169Z","title":"Embedding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.00810","last_updated":"2026-06-30T10:43:39Z","snapshot_observed_at":"2026-08-04T00:30:22.339802Z","submitted_at":"2025-11-02T05:34:21Z","title":"GUI-AIMA: Aligning Intrinsic Multimodal Attention with a Context Anchor for GUI Grounding","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T00:30:26.196169Z"},"links":{"citing_paper":"/paper/2511.00810"},"observation_digest":"sha256:8a14c141f488c787991bf196b43731612134c0e8c5304a683ac7efcd300175a8","observation_id":"185d94af-22eb-4742-88fa-e626f9f0a1f4","resolution":{"observed_at":"2026-08-04T00:30:26.196169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.09418","last_updated":"2019-06-07T14:00:58Z","snapshot_observed_at":"2026-08-01T19:51:24.042109Z","submitted_at":"2019-05-23T01:13:24Z","title":"Analyzing Multi-Head Self-Attention: Specialized Heads Do the Heavy Lifting, the Rest Can Be Pruned","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.09418","snapshot_observed_at":"2026-08-04T00:30:24.831905Z","title":"Analyzing multi-head self-attention: Specialized heads do the heavy lifting, the rest can be pruned","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2511.00810","last_updated":"2026-06-30T10:43:39Z","snapshot_observed_at":"2026-08-04T00:30:22.339802Z","submitted_at":"2025-11-02T05:34:21Z","title":"GUI-AIMA: Aligning Intrinsic Multimodal Attention with a Context Anchor for GUI Grounding","version":4},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-04T00:30:24.831905Z"},"links":{"cited_paper":"/paper/1905.09418","citing_paper":"/paper/2511.00810"},"observation_digest":"sha256:ce3b1c96efab089d82d49246a4240bad8894c772b21b0c4010eba56bcad9929a","observation_id":"fff5cb83-329d-4f33-bff5-9a11c6eaba45","resolution":{"observed_at":"2026-08-04T00:30:24.831905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-04T00:30:23.665333Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capa- bilities.arXiv preprint arXiv:2507.06261,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.00810","last_updated":"2026-06-30T10:43:39Z","snapshot_observed_at":"2026-08-04T00:30:22.339802Z","submitted_at":"2025-11-02T05:34:21Z","title":"GUI-AIMA: Aligning Intrinsic Multimodal Attention with a Context Anchor for GUI Grounding","version":4},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-04T00:30:23.665333Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2511.00810"},"observation_digest":"sha256:db559316cf27d1130a6994acbebc81dac233cdcbf81ebef712c5e38fe645f62f","observation_id":"64bb1954-a65f-4d53-bb5c-ccb54adf5d7e","resolution":{"observed_at":"2026-08-04T00:30:23.665333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.11965","last_updated":"2025-06-01T15:37:01Z","snapshot_observed_at":"2026-08-02T01:57:08.990171Z","submitted_at":"2024-12-16T16:45:33Z","title":"Inferring Functionality of Attention Heads from their Parameters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.11965","snapshot_observed_at":"2026-08-04T00:30:23.736838Z","title":"Inferring functionality of attention heads from their parameters.arXiv preprint arXiv:2412.11965,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.00810","last_updated":"2026-06-30T10:43:39Z","snapshot_observed_at":"2026-08-04T00:30:22.339802Z","submitted_at":"2025-11-02T05:34:21Z","title":"GUI-AIMA: Aligning Intrinsic Multimodal Attention with a Context Anchor for GUI Grounding","version":4},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T00:30:23.736838Z"},"links":{"cited_paper":"/paper/2412.11965","citing_paper":"/paper/2511.00810"},"observation_digest":"sha256:577ca88cb3c407de37aeb9f803165406db91f15e6fbb75ea734ffbd8f93b4944","observation_id":"94d3d990-f9e7-487f-900f-0a0747732e6a","resolution":{"observed_at":"2026-08-04T00:30:23.736838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11317","last_updated":"2025-05-30T07:30:07Z","snapshot_observed_at":"2026-08-03T01:36:55.704876Z","submitted_at":"2024-06-17T08:30:55Z","title":"GUICourse: From General Vision Language Models to Versatile GUI Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11317","snapshot_observed_at":"2026-08-04T00:30:23.490027Z","title":"Guicourse: From general vision language models to versatile gui agents.arXiv preprint arXiv:2406.11317, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.00810","last_updated":"2026-06-30T10:43:39Z","snapshot_observed_at":"2026-08-04T00:30:22.339802Z","submitted_at":"2025-11-02T05:34:21Z","title":"GUI-AIMA: Aligning Intrinsic Multimodal Attention with a Context Anchor for GUI Grounding","version":4},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T00:30:23.490027Z"},"links":{"cited_paper":"/paper/2406.11317","citing_paper":"/paper/2511.00810"},"observation_digest":"sha256:4c240474bc7222ec999b5a21f5cf6cffbd77892bf4cdd4ef30785c205fe90941","observation_id":"0499cf22-1ab0-42e7-acbe-a8bf0d715f14","resolution":{"observed_at":"2026-08-04T00:30:23.490027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17490","last_updated":"2025-05-29T02:43:50Z","snapshot_observed_at":"2026-07-06T18:51:28.182977Z","submitted_at":"2024-07-03T17:59:58Z","title":"AMEX: Android Multi-annotation Expo Dataset for Mobile GUI Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17490","snapshot_observed_at":"2026-08-04T00:30:23.389647Z","title":"Amex: Android multi-annotation expo dataset for mobile gui agents.arXiv preprint arXiv:2407.17490,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.00810","last_updated":"2026-06-30T10:43:39Z","snapshot_observed_at":"2026-08-04T00:30:22.339802Z","submitted_at":"2025-11-02T05:34:21Z","title":"GUI-AIMA: Aligning Intrinsic Multimodal Attention with a Context Anchor for GUI Grounding","version":4},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T00:30:23.389647Z"},"links":{"cited_paper":"/paper/2407.17490","citing_paper":"/paper/2511.00810"},"observation_digest":"sha256:08fcc2fb729e1a34e8516aba1ebdde2ff44ae991fc4d7af95bca378bb3f0f267","observation_id":"e2007cee-e0a0-4394-aef7-f7a0f268f474","resolution":{"observed_at":"2026-08-04T00:30:23.389647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2511.00810","last_updated":"2026-06-30T10:43:39Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-04T00:30:22.339802Z","submitted_at":"2025-11-02T05:34:21Z","title":"GUI-AIMA: Aligning Intrinsic Multimodal Attention with a Context Anchor for GUI Grounding"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 1 inbound Pith citation observation for arXiv:2511.00810."}