{"as_of":"2026-08-07T11:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dc2e511766ea05d0cd06db124093fb7a63d646d71e8333191f8603fe0553bf96","coverage":[{"denominator":13,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-17T00:19:27.965902Z","state":"measured"},{"denominator":86,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":86,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":73,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":73,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:42:32.924240Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":13,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":"2401.16158","doi":"10.48550/arxiv.2401.16158","metadata_source":"pith","pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","venue":"cs.CL","work_id":"c8f4a2c0-2743-4264-acca-86fbf64ed3ba","year":2024},"citing_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-16T02:56:41.658658Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2306.13549"},"observation_digest":"sha256:507bbcc7442d4981226d70e520a0cbf453d6e45c5ff0f3060d03c058257d16ba","observation_id":"1c41c23a-d92d-4ab8-a120-cac3f0e60582","resolution":{"observed_at":"2026-05-17T00:19:28.048419Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":"2401.16158","doi":"10.48550/arxiv.2401.16158","metadata_source":"pith","pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","venue":"cs.CL","work_id":"c8f4a2c0-2743-4264-acca-86fbf64ed3ba","year":2024},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:7cebcc1d5ff610257b1d34f19a30379a4847a0925a08ff517c2a981dfe2af342","observation_id":"7d4aba06-231e-4667-bfdf-ddc9ca440267","resolution":{"observed_at":"2026-05-17T00:19:28.048419Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":"2401.16158","doi":"10.48550/arxiv.2401.16158","metadata_source":"pith","pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","venue":"cs.CL","work_id":"c8f4a2c0-2743-4264-acca-86fbf64ed3ba","year":2024},"citing_paper":{"arxiv_id":"2411.18279","last_updated":"2025-05-06T15:08:00Z","snapshot_observed_at":"2026-07-06T19:57:55.925634Z","submitted_at":"2024-11-27T12:13:39Z","title":"Large Language Model-Brained GUI Agents: A Survey","version":12},"reference_index":161,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:27.472508Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2411.18279"},"observation_digest":"sha256:e90515ce51980cda743c4080c5187a5b99b9b0e77707846243bae8078c048f60","observation_id":"5c0696ba-0ff7-4b92-8cc3-581b37ecd5fe","resolution":{"observed_at":"2026-05-19T11:08:27.689984Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":"2401.16158","doi":"10.48550/arxiv.2401.16158","metadata_source":"pith","pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","venue":"cs.CL","work_id":"c8f4a2c0-2743-4264-acca-86fbf64ed3ba","year":2024},"citing_paper":{"arxiv_id":"2501.16150","last_updated":"2026-03-27T07:41:10Z","snapshot_observed_at":"2026-08-02T22:37:46.736145Z","submitted_at":"2025-01-27T15:44:02Z","title":"A Comprehensive Survey of Agents for Computer Use: Foundations, Challenges, and Future Directions","version":3},"reference_index":160,"source":"pdf_text","source_observed_at":"2026-05-23T04:59:36.994758Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2501.16150"},"observation_digest":"sha256:68c15e75e479841519ede322fba32962f6adfe99ec714f49060b14b99f06fd1f","observation_id":"4db408ad-55f8-4e4b-8bd0-8511a594a28c","resolution":{"observed_at":"2026-05-23T05:02:35.054153Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":"2401.16158","doi":"10.48550/arxiv.2401.16158","metadata_source":"pith","pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","venue":"cs.CL","work_id":"c8f4a2c0-2743-4264-acca-86fbf64ed3ba","year":2024},"citing_paper":{"arxiv_id":"2503.14075","last_updated":"2026-04-10T01:08:12Z","snapshot_observed_at":"2026-07-06T20:54:36.522651Z","submitted_at":"2025-03-18T09:52:45Z","title":"Growing a Multi-head Twig via Distillation and Reinforcement Learning to Accelerate Large Vision-Language Models","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-22T23:58:57.819555Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2503.14075"},"observation_digest":"sha256:48d0b578bc3440367c432f4f9f06218d0c8294b98bca09a34e73f685e2d0fadf","observation_id":"5631c964-a8b3-4c14-b463-a11c4f16069a","resolution":{"observed_at":"2026-05-23T00:02:17.790289Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":"2401.16158","doi":"10.48550/arxiv.2401.16158","metadata_source":"pith","pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","venue":"cs.CL","work_id":"c8f4a2c0-2743-4264-acca-86fbf64ed3ba","year":2024},"citing_paper":{"arxiv_id":"2505.03364","last_updated":"2026-04-10T15:34:51Z","snapshot_observed_at":"2026-08-02T05:32:24.859906Z","submitted_at":"2025-05-06T09:37:51Z","title":"DroidRetriever: A Transparent and Steerable Automation System for Collaborative Mobile Information Seeking","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-22T17:03:27.724888Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2505.03364"},"observation_digest":"sha256:3363ab3b89ccac3a92806e40dd74557a03261ce6c9a25f90922bcb8a52c072d2","observation_id":"c58ce49b-32af-4047-a0e3-6da1241d37c7","resolution":{"observed_at":"2026-05-22T17:05:00.430089Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-07T11:42:32.924240Z","title":"Mobile-agent: Autonomous multi-modal mobile device agent with visual perception,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01616","last_updated":"2025-06-02T12:56:27Z","snapshot_observed_at":"2026-08-07T11:34:56.231886Z","submitted_at":"2025-06-02T12:56:27Z","title":"MLA-Trust: Benchmarking Trustworthiness of Multimodal LLM Agents in GUI Environments","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:42:32.924240Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2506.01616"},"observation_digest":"sha256:fd85ce59a09cbfff35b33b04256b63f33514cc2a6827b6cedec92f8eb5e786af","observation_id":"f6c743ab-99ed-49e8-ba22-12b1b4c53dbf","resolution":{"observed_at":"2026-08-07T11:42:32.924240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-07T05:25:59.323535Z","title":"Mobile-agent: Autonomous multi-modal mobile device agent with visual perception","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08012","last_updated":"2025-06-09T17:59:57Z","snapshot_observed_at":"2026-08-07T05:17:50.455180Z","submitted_at":"2025-06-09T17:59:57Z","title":"GUI-Reflection: Empowering Multimodal GUI Models with Self-Reflection Behavior","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:59.323535Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2506.08012"},"observation_digest":"sha256:74f7ed0ddc62a1673a182b7413106be1424e6dcfac4b3e7774cba097af79de98","observation_id":"f117333c-5809-45c1-abb6-953775bc1836","resolution":{"observed_at":"2026-08-07T05:25:59.323535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-07T05:04:03.960768Z","title":"Mobile-agent: Autonomous multi-modal mobile device agent with visual perception","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08972","last_updated":"2025-06-10T16:45:29Z","snapshot_observed_at":"2026-08-07T04:55:30.835214Z","submitted_at":"2025-06-10T16:45:29Z","title":"Atomic-to-Compositional Generalization for Mobile Agents with A New Benchmark and Scheduling System","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:04:03.960768Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2506.08972"},"observation_digest":"sha256:fc8d4a73c5f7061de30a2f112f8d19cb2482d78ded18c5d7d7d8b39afe9243f1","observation_id":"4bfccc72-5761-4723-b966-e18f30e0e118","resolution":{"observed_at":"2026-08-07T05:04:03.960768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-07T04:35:39.220141Z","title":"Mobile-agent: Autonomous multi-modal mobile device agent with visual perception","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10387","last_updated":"2025-06-12T06:21:19Z","snapshot_observed_at":"2026-08-07T04:25:27.475461Z","submitted_at":"2025-06-12T06:21:19Z","title":"Mirage-1: Augmenting and Updating GUI Agent with Hierarchical Multimodal Skills","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T04:35:39.220141Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2506.10387"},"observation_digest":"sha256:5212ba871d271d4ee41ca72fad9e9015030905eae9111d7bafb4b4c618af8bfa","observation_id":"70151fe8-aec0-4c69-9510-0a5bc0664328","resolution":{"observed_at":"2026-08-07T04:35:39.220141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-07T00:41:18.507084Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13205","last_updated":"2025-09-05T14:19:03Z","snapshot_observed_at":"2026-08-07T00:34:38.756010Z","submitted_at":"2025-06-16T08:09:32Z","title":"Poison Once, Control Anywhere: Clean-Text Visual Backdoors in VLM-based Mobile Agents","version":6},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T00:41:18.507084Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2506.13205"},"observation_digest":"sha256:af47ac91f157e9f9c6cea54c3475aa3ac236853dbc6020c1fbf0a14f6d23080b","observation_id":"2d2c4f0d-959e-4331-a295-bbc88e9a4af5","resolution":{"observed_at":"2026-08-07T00:41:18.507084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-06T23:28:06.913748Z","title":"Mobile-agent: Autonomous multi-modal mo- bile device agent with visual perception","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.18158","last_updated":"2025-06-22T20:17:46Z","snapshot_observed_at":"2026-08-06T23:20:53.871883Z","submitted_at":"2025-06-22T20:17:46Z","title":"Chain-of-Memory: Enhancing GUI Agents for Cross-Application Navigation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:06.913748Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2506.18158"},"observation_digest":"sha256:345bc23b8ff01e95690de4af5df7a7684e161c556ffd7644cda58b3ad2ee42f8","observation_id":"78655fa3-c978-4664-9bb3-ab5d8c86b4a9","resolution":{"observed_at":"2026-08-06T23:28:06.913748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-06T16:14:32.475224Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14088","last_updated":"2025-07-18T17:13:21Z","snapshot_observed_at":"2026-08-06T15:59:16.082325Z","submitted_at":"2025-07-18T17:13:21Z","title":"DPMT: Dual Process Multi-scale Theory of Mind Framework for Real-time Human-AI Collaboration","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T16:14:32.475224Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2507.14088"},"observation_digest":"sha256:92d65ec56f29b05943edbea3b03f36e6d3646a041ba3cc74bfb8a31e13ed0822","observation_id":"536928f8-91b1-4550-a6f9-b780b3e9b841","resolution":{"observed_at":"2026-08-06T16:14:32.475224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-06T15:29:14.284181Z","title":"Mobile-agent: Autonomous multi-modal mobile device agent with visual perception, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15846","last_updated":"2025-07-28T16:54:13Z","snapshot_observed_at":"2026-08-07T08:12:57.119379Z","submitted_at":"2025-07-21T17:53:42Z","title":"GUI-G$^2$: Gaussian Reward Modeling for GUI Grounding","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T15:29:14.284181Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2507.15846"},"observation_digest":"sha256:06b587a954f1105e7b9221322d7c7369e124a07ccf2c0823ed997756fb94bbf3","observation_id":"0ceb45ec-ccfd-4012-afa0-18dc18fce2a2","resolution":{"observed_at":"2026-08-06T15:29:14.284181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-06T13:05:40.153028Z","title":"Mobile-agent: Autonomous multi-modal mobile device agent with visual perception, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21206","last_updated":"2025-07-28T17:58:12Z","snapshot_observed_at":"2026-08-07T09:13:21.958176Z","submitted_at":"2025-07-28T17:58:12Z","title":"Agentic Web: Weaving the Next Web with AI Agents","version":1},"reference_index":220,"source":"arxiv_source","source_observed_at":"2026-08-06T13:05:40.153028Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2507.21206"},"observation_digest":"sha256:1335d3dc3208a0bd24e4f4efbc350f8340c618c2216135a021d62953305330c1","observation_id":"4a6cd0e4-ebae-4d9d-af43-8ab4ce52e135","resolution":{"observed_at":"2026-08-06T13:05:40.153028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-06T01:01:08.541228Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.04025","last_updated":"2025-08-06T02:38:02Z","snapshot_observed_at":"2026-08-06T01:01:02.645300Z","submitted_at":"2025-08-06T02:38:02Z","title":"Uncertainty-Aware GUI Agent: Adaptive Perception through Component Recommendation and Human-in-the-Loop Refinement","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T01:01:08.541228Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2508.04025"},"observation_digest":"sha256:b1d1106f1186d413517937231e210a3867be5bedc48c46f2d12e7092c260a092","observation_id":"07f2e5e2-607d-4601-8c7c-146a625d575e","resolution":{"observed_at":"2026-08-06T01:01:08.541228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-05T21:16:59.903780Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.09061","last_updated":"2025-08-12T16:25:27Z","snapshot_observed_at":"2026-08-05T22:54:33.146642Z","submitted_at":"2025-08-12T16:25:27Z","title":"VLM-3D:End-to-End Vision-Language Models for Open-World 3D Perception","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T21:16:59.903780Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2508.09061"},"observation_digest":"sha256:5f8d44e425ac1e8448c1fd27e0b79d0eb7e8d49ca02b1f1be069160e52f8cc8b","observation_id":"3b89a457-da30-46f4-94b9-83cadad811f7","resolution":{"observed_at":"2026-08-05T21:16:59.903780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-05T21:22:37.876143Z","title":"Mobile-agent: Autonomous multi-modal mobile device agent with visual perception","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.09237","last_updated":"2025-08-12T12:11:43Z","snapshot_observed_at":"2026-08-07T11:30:49.570543Z","submitted_at":"2025-08-12T12:11:43Z","title":"Blockchain Network Analysis using Quantum Inspired Graph Neural Networks & Ensemble Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T21:22:37.876143Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2508.09237"},"observation_digest":"sha256:4e27cdc6794800c7fefca5ca081e6e866f9e7091c5e0ae41c222bd5357eea332","observation_id":"ad84417d-9913-41a0-be97-b0666d3bda06","resolution":{"observed_at":"2026-08-05T21:22:37.876143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-05T20:29:09.489417Z","title":"Wang et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10955","last_updated":"2025-08-14T07:25:45Z","snapshot_observed_at":"2026-08-06T06:18:15.087722Z","submitted_at":"2025-08-14T07:25:45Z","title":"Empowering Multimodal LLMs with External Tools: A Comprehensive Survey","version":1},"reference_index":266,"source":"arxiv_source","source_observed_at":"2026-08-05T20:29:09.489417Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2508.10955"},"observation_digest":"sha256:6f0685bf490479f616104693f6958be592bc911ccd57bd7627eb4671f6d71fed","observation_id":"d1f88e07-71b6-4755-bb20-dae9dc0f522d","resolution":{"observed_at":"2026-08-05T20:29:09.489417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-05T17:45:20.656231Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.16688","last_updated":"2025-08-21T18:39:35Z","snapshot_observed_at":"2026-08-05T17:45:17.114121Z","submitted_at":"2025-08-21T18:39:35Z","title":"Cybernaut: Towards Reliable Web Automation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:20.656231Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2508.16688"},"observation_digest":"sha256:5fb6f127ac79b657974b5de2e6c5f052372041284e2ef12fe5a702fc214dc9c8","observation_id":"cd8ca3fc-ebf4-461a-ac30-8453003197e1","resolution":{"observed_at":"2026-08-05T17:45:20.656231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-05T12:49:38.454668Z","title":"Mobile-agent: Autonomous multi-modal mobile device agent with visual perception","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01199","last_updated":"2025-09-01T07:34:39Z","snapshot_observed_at":"2026-08-05T12:49:36.040066Z","submitted_at":"2025-09-01T07:34:39Z","title":"IndusGCC: A Data Benchmark and Evaluation Framework for GUI-Based General Computer Control in Industrial Automation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T12:49:38.454668Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2509.01199"},"observation_digest":"sha256:f3dbf70954ef0dfe07ca1c3d50408fd181ebedead5b996719898f1976daeb949","observation_id":"f217333d-366b-48a1-88ae-e18f99ec0bff","resolution":{"observed_at":"2026-08-05T12:49:38.454668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-04T07:06:38.110838Z","title":"Mobile-agent: Autonomous multi-modal mobile device agent with visual per- ception.arXiv preprint arXiv:2401.16158, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.27140","last_updated":"2026-07-07T02:18:26Z","snapshot_observed_at":"2026-08-06T02:11:06.061181Z","submitted_at":"2025-10-31T03:35:59Z","title":"Measuring the Security of Mobile LLM Agents under Adversarial Prompts from Untrusted Third-Party Channels","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-04T07:06:38.110838Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2510.27140"},"observation_digest":"sha256:bfeab4e2f7314d923d305922d623bf985a87eadee223a5dba5172662f13672af","observation_id":"893ea7e0-223a-4eb8-88ae-7e2c013efb31","resolution":{"observed_at":"2026-08-04T07:06:38.110838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-04T00:30:24.934146Z","title":"Mobile-agent: Autonomous multi-modal mobile device agent with visual perception.arXiv preprint arXiv:2401.16158, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.00810","last_updated":"2026-06-30T10:43:39Z","snapshot_observed_at":"2026-08-06T18:38:19.524231Z","submitted_at":"2025-11-02T05:34:21Z","title":"GUI-AIMA: Aligning Intrinsic Multimodal Attention with a Context Anchor for GUI Grounding","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T00:30:24.934146Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2511.00810"},"observation_digest":"sha256:0d9f7633aee57eff26a1e58c2cd61d7f2811ffbe88d07ea436f52aef73331c40","observation_id":"84c6474e-f102-42f1-9cd7-b00ee6f97686","resolution":{"observed_at":"2026-08-04T00:30:24.934146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":"2401.16158","doi":"10.48550/arxiv.2401.16158","metadata_source":"pith","pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","venue":"cs.CL","work_id":"c8f4a2c0-2743-4264-acca-86fbf64ed3ba","year":2024},"citing_paper":{"arxiv_id":"2511.03293","last_updated":"2025-11-07T07:54:50Z","snapshot_observed_at":"2026-07-06T22:34:58.108904Z","submitted_at":"2025-11-05T08:44:19Z","title":"UMDAM: A Unified Data Layout and DRAM Address Mapping for Heterogenous NPU-PIM","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-21T20:31:24.680337Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2511.03293"},"observation_digest":"sha256:2c3fd65eca5a83f7590583fa2736ae62443b8d744204972b58b2e5fe705a02b6","observation_id":"f39d4e76-7818-4801-b1f4-4a01bff336a8","resolution":{"observed_at":"2026-05-21T20:34:20.892221Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":"2401.16158","doi":"10.48550/arxiv.2401.16158","metadata_source":"pith","pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","venue":"cs.CL","work_id":"c8f4a2c0-2743-4264-acca-86fbf64ed3ba","year":2024},"citing_paper":{"arxiv_id":"2512.10371","last_updated":"2026-05-08T09:40:02Z","snapshot_observed_at":"2026-07-06T22:38:40.044448Z","submitted_at":"2025-12-11T07:37:38Z","title":"AgentProg: Empowering Long-Horizon GUI Agents with Program-Guided Context Management","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-16T23:42:25.086602Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2512.10371"},"observation_digest":"sha256:4a2932326ef52456b0f7a31a6ec912b25cba2ddc4e8784051d6f339a25c21b91","observation_id":"c233dcda-2429-4805-9142-d092f3a0e0c6","resolution":{"observed_at":"2026-05-17T00:19:28.048419Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-02T23:43:05.402748Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.12834","last_updated":"2026-07-14T08:38:14Z","snapshot_observed_at":"2026-08-06T04:10:00.111788Z","submitted_at":"2026-02-13T11:40:02Z","title":"FuncDroid: Towards Inter-Functional Flows for Comprehensive Mobile App GUI Testing","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T23:43:05.402748Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2602.12834"},"observation_digest":"sha256:76952ef4f16010d54d46a8126cbc8f7e68f7e77a9c65ea4f39a74e2ef25d7f78","observation_id":"96ae1b42-36f5-4bb3-879f-eb59278028ce","resolution":{"observed_at":"2026-08-02T23:43:05.402748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":"2401.16158","doi":"10.48550/arxiv.2401.16158","metadata_source":"pith","pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","venue":"cs.CL","work_id":"c8f4a2c0-2743-4264-acca-86fbf64ed3ba","year":2024},"citing_paper":{"arxiv_id":"2602.22942","last_updated":"2026-04-11T07:11:11Z","snapshot_observed_at":"2026-08-03T04:02:26.271081Z","submitted_at":"2026-02-26T12:34:57Z","title":"ClawMobile: Rethinking Smartphone-Native Agentic Systems","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-15T19:20:36.580925Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2602.22942"},"observation_digest":"sha256:b09bb22d0848d72e659b5de17b7030db84e8db088d82e9af3de70d7fba835716","observation_id":"6ec18f91-b771-4a27-b84c-c959bf15ee1f","resolution":{"observed_at":"2026-05-17T00:19:28.048419Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":"2401.16158","doi":"10.48550/arxiv.2401.16158","metadata_source":"pith","pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","venue":"cs.CL","work_id":"c8f4a2c0-2743-4264-acca-86fbf64ed3ba","year":2024},"citing_paper":{"arxiv_id":"2603.26041","last_updated":"2026-04-24T02:25:38Z","snapshot_observed_at":"2026-07-06T22:50:41.736941Z","submitted_at":"2026-03-27T03:21:19Z","title":"Rethinking Token Pruning for Historical Screenshots in GUI Visual Agents: Semantic, Spatial, and Temporal Perspectives","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-14T23:59:49.017251Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2603.26041"},"observation_digest":"sha256:2355a4d02bfd8a8006e8a2677224465d006d5093e2fab897288e2f550542966b","observation_id":"da33ea12-6a60-47b3-8520-8ccbe382b2cd","resolution":{"observed_at":"2026-05-17T00:19:28.048419Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":"2401.16158","doi":"10.48550/arxiv.2401.16158","metadata_source":"pith","pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","venue":"cs.CL","work_id":"c8f4a2c0-2743-4264-acca-86fbf64ed3ba","year":2024},"citing_paper":{"arxiv_id":"2604.03486","last_updated":"2026-04-08T04:29:20Z","snapshot_observed_at":"2026-07-06T22:52:39.423471Z","submitted_at":"2026-04-03T22:17:10Z","title":"VisionClaw: Always-On AI Agents through Smart Glasses","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-13T18:12:34.183092Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2604.03486"},"observation_digest":"sha256:19f26577fb962afc02541ce411e72ac5dc1ff9564c421926b972326bb2339629","observation_id":"ee37efc9-37ee-40ec-8436-b9d16cf0f95f","resolution":{"observed_at":"2026-05-17T00:19:28.048419Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-07-13T09:40:35.631188Z","title":"Mobile-agent: Autonomous multi-modal mobile device agent with visual perception.arXiv preprint arXiv:2401.16158, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.04834","last_updated":"2026-06-30T15:42:53Z","snapshot_observed_at":"2026-07-13T09:40:35.215938Z","submitted_at":"2026-04-06T16:35:57Z","title":"E-VLA: Event-Augmented Vision-Language-Action Model for Dark and Blurred Scenes","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-13T09:40:35.631188Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2604.04834"},"observation_digest":"sha256:63ce0ccaa2a1ae361f690d7c21fd11fe5fc1835386b97fe483b42cbb75bcd033","observation_id":"6ee5fb3b-9457-4d71-9df0-3ac142f70ff8","resolution":{"observed_at":"2026-07-13T09:40:35.631188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":"2401.16158","doi":"10.48550/arxiv.2401.16158","metadata_source":"pith","pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","venue":"cs.CL","work_id":"c8f4a2c0-2743-4264-acca-86fbf64ed3ba","year":2024},"citing_paper":{"arxiv_id":"2604.04838","last_updated":"2026-04-07T10:14:44Z","snapshot_observed_at":"2026-07-06T22:53:41.734429Z","submitted_at":"2026-04-06T16:41:19Z","title":"Less Detail, Better Answers: Degradation-Driven Prompting for VQA","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T20:17:01.867903Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2604.04838"},"observation_digest":"sha256:fd36fb9458cccc18cf28bd2791914d30bd2f0bd8213d15e360407c65707099de","observation_id":"7e90b45a-e8b3-4e31-bc22-8b55edd1fdf2","resolution":{"observed_at":"2026-05-17T00:19:28.048419Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":"2401.16158","doi":"10.48550/arxiv.2401.16158","metadata_source":"pith","pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","venue":"cs.CL","work_id":"c8f4a2c0-2743-4264-acca-86fbf64ed3ba","year":2024},"citing_paper":{"arxiv_id":"2604.09083","last_updated":"2026-04-10T08:09:56Z","snapshot_observed_at":"2026-08-02T04:52:54.413834Z","submitted_at":"2026-04-10T08:09:56Z","title":"EdgeFlow: Fast Cold Starts for LLMs on Mobile Devices","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-10T17:05:11.242273Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2604.09083"},"observation_digest":"sha256:3d12fda053d8e4539f53a0ee7dffe13077deb91b5d1f718af2140c2265330b20","observation_id":"0677d89b-3085-49c8-a6c1-2dfe3f318d7e","resolution":{"observed_at":"2026-05-17T00:19:28.048419Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":"2401.16158","doi":"10.48550/arxiv.2401.16158","metadata_source":"pith","pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","venue":"cs.CL","work_id":"c8f4a2c0-2743-4264-acca-86fbf64ed3ba","year":2024},"citing_paper":{"arxiv_id":"2604.09574","last_updated":"2026-02-24T04:29:42Z","snapshot_observed_at":"2026-08-05T05:08:09.074150Z","submitted_at":"2026-02-24T04:29:42Z","title":"Turing Test on Screen: A Benchmark for Mobile GUI Agent Humanization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T20:35:17.075890Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2604.09574"},"observation_digest":"sha256:ced24e1dfbf77b5cb91e039eaeb49ea96e0c615c8ca0b23fafa685e970f54c9b","observation_id":"105422fd-a65f-48c5-94ae-e84eca2395db","resolution":{"observed_at":"2026-05-17T00:19:28.048419Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":"2401.16158","doi":"10.48550/arxiv.2401.16158","metadata_source":"pith","pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","venue":"cs.CL","work_id":"c8f4a2c0-2743-4264-acca-86fbf64ed3ba","year":2024},"citing_paper":{"arxiv_id":"2604.14872","last_updated":"2026-04-16T11:02:19Z","snapshot_observed_at":"2026-07-06T23:02:31.717911Z","submitted_at":"2026-04-16T11:02:19Z","title":"SkillDroid: Compile Once, Reuse Forever","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T10:57:33.997266Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2604.14872"},"observation_digest":"sha256:1d6b68ea579dfa6f3521543ee08441054f4504826fc23c15786e4c0a99a2439d","observation_id":"b12f5b50-8765-49a4-9a8d-ce9c8e3af6e2","resolution":{"observed_at":"2026-05-17T00:19:28.048419Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":"2401.16158","doi":"10.48550/arxiv.2401.16158","metadata_source":"pith","pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","venue":"cs.CL","work_id":"c8f4a2c0-2743-4264-acca-86fbf64ed3ba","year":2024},"citing_paper":{"arxiv_id":"2604.17817","last_updated":"2026-04-20T05:15:14Z","snapshot_observed_at":"2026-07-06T23:04:50.935335Z","submitted_at":"2026-04-20T05:15:14Z","title":"Do LLMs Need to See Everything? A Benchmark and Study of Failures in LLM-driven Smartphone Automation using Screentext vs. Screenshots","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-10T04:42:21.843629Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2604.17817"},"observation_digest":"sha256:3faf6c84d22531512663893137408af71166f269a8ebb1cc501ff3fe25e34cef","observation_id":"f679806f-23fc-410d-9c71-233798099784","resolution":{"observed_at":"2026-05-17T00:19:28.048419Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":"2401.16158","doi":"10.48550/arxiv.2401.16158","metadata_source":"pith","pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","venue":"cs.CL","work_id":"c8f4a2c0-2743-4264-acca-86fbf64ed3ba","year":2024},"citing_paper":{"arxiv_id":"2604.18231","last_updated":"2026-05-06T14:26:07Z","snapshot_observed_at":"2026-07-06T23:05:08.728446Z","submitted_at":"2026-04-20T13:13:31Z","title":"AgenTEE: Confidential LLM Agent Execution on Edge Devices","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-10T04:46:53.351566Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2604.18231"},"observation_digest":"sha256:08ceca546b9e949464658a71a852104797743ac15b2fd756febcd9c7b5be5b91","observation_id":"5d667334-3e0a-455a-98ed-d9c2b3dbed99","resolution":{"observed_at":"2026-05-17T00:19:28.048419Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":"2401.16158","doi":"10.48550/arxiv.2401.16158","metadata_source":"pith","pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","venue":"cs.CL","work_id":"c8f4a2c0-2743-4264-acca-86fbf64ed3ba","year":2024},"citing_paper":{"arxiv_id":"2604.21375","last_updated":"2026-04-24T17:01:08Z","snapshot_observed_at":"2026-08-02T05:47:52.335425Z","submitted_at":"2026-04-23T07:42:37Z","title":"VLAA-GUI: Knowing When to Stop, Recover, and Search, A Modular Framework for GUI Automation","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-09T22:24:45.045405Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2604.21375"},"observation_digest":"sha256:8c375e61b12f9fe09b0e384d7b232d3a4403b2bff41d747c3204d2983e31c34a","observation_id":"2a7d102a-a558-423a-a9bb-db15cac52b0f","resolution":{"observed_at":"2026-05-17T00:19:28.048419Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":"2401.16158","doi":"10.48550/arxiv.2401.16158","metadata_source":"pith","pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","venue":"cs.CL","work_id":"c8f4a2c0-2743-4264-acca-86fbf64ed3ba","year":2024},"citing_paper":{"arxiv_id":"2604.26148","last_updated":"2026-04-28T22:15:06Z","snapshot_observed_at":"2026-08-02T09:05:58.745157Z","submitted_at":"2026-04-28T22:15:06Z","title":"Beyond Screenshots: Evaluating VLMs' Understanding of UI Animations","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-07T15:04:11.161618Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2604.26148"},"observation_digest":"sha256:2659a96eea084ab92d050c877ba396139545437a21a3b23bef392c9337c73b23","observation_id":"a65dc370-c638-46eb-acad-99f3b1a63aa1","resolution":{"observed_at":"2026-05-17T00:19:28.048419Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":"2401.16158","doi":"10.48550/arxiv.2401.16158","metadata_source":"pith","pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","venue":"cs.CL","work_id":"c8f4a2c0-2743-4264-acca-86fbf64ed3ba","year":2024},"citing_paper":{"arxiv_id":"2605.05765","last_updated":"2026-05-21T06:55:40Z","snapshot_observed_at":"2026-08-07T03:54:21.317685Z","submitted_at":"2026-05-07T06:58:34Z","title":"X-OmniClaw Technical Report: A Unified Mobile Agent for Multimodal Understanding and Interaction","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-08T14:53:52.019677Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2605.05765"},"observation_digest":"sha256:f38a6047fec3cb33eb3e40aa63b4b6559248c832edc07c073947f3d6e9f6402f","observation_id":"2735c3aa-902b-4295-8f0e-29dec02f394a","resolution":{"observed_at":"2026-05-17T00:19:28.048419Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":"2401.16158","doi":"10.48550/arxiv.2401.16158","metadata_source":"pith","pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","venue":"cs.CL","work_id":"c8f4a2c0-2743-4264-acca-86fbf64ed3ba","year":2024},"citing_paper":{"arxiv_id":"2605.05765","last_updated":"2026-05-21T06:55:40Z","snapshot_observed_at":"2026-08-07T03:54:21.317685Z","submitted_at":"2026-05-07T06:58:34Z","title":"X-OmniClaw Technical Report: A Unified Mobile Agent for Multimodal Understanding and Interaction","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-22T09:50:00.415616Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2605.05765"},"observation_digest":"sha256:970d98d7f15fcb068d5debdf0ff7e0c1e30546b8418eef8db6179e3807df1e48","observation_id":"84363691-0492-4e4f-bf2a-a5928362c017","resolution":{"observed_at":"2026-05-22T09:51:21.728174Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":"2401.16158","doi":"10.48550/arxiv.2401.16158","metadata_source":"pith","pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","venue":"cs.CL","work_id":"c8f4a2c0-2743-4264-acca-86fbf64ed3ba","year":2024},"citing_paper":{"arxiv_id":"2605.07110","last_updated":"2026-05-08T01:38:46Z","snapshot_observed_at":"2026-07-06T23:19:30.387067Z","submitted_at":"2026-05-08T01:38:46Z","title":"Securing Computer-Use Agents: A Unified Architecture-Lifecycle Framework for Deployment-Grounded Reliability","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-11T01:15:19.239355Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2605.07110"},"observation_digest":"sha256:9d73c0e7606c5e5c65a0218c7de77974412cf6398ed4623bec8ad3cc4f1bbd5b","observation_id":"9a7a06c4-3c97-4265-bda6-3ff10330323b","resolution":{"observed_at":"2026-05-17T00:19:28.048419Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":"2401.16158","doi":"10.48550/arxiv.2401.16158","metadata_source":"pith","pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","venue":"cs.CL","work_id":"c8f4a2c0-2743-4264-acca-86fbf64ed3ba","year":2024},"citing_paper":{"arxiv_id":"2605.09443","last_updated":"2026-05-10T09:40:43Z","snapshot_observed_at":"2026-07-06T23:21:30.897592Z","submitted_at":"2026-05-10T09:40:43Z","title":"Through the Lens of Character: Resolving Modality-Role Interference in Multimodal Role-Playing Agent","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-12T04:49:56.954433Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2605.09443"},"observation_digest":"sha256:4bca92ef38a604cc08e98b01c200eed7890c96f83424e2f03e3896bdaf2d1093","observation_id":"1d9a405b-0a0e-4cb9-8ad0-d84a8c355a75","resolution":{"observed_at":"2026-05-17T00:19:28.048419Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":"2401.16158","doi":"10.48550/arxiv.2401.16158","metadata_source":"pith","pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","venue":"cs.CL","work_id":"c8f4a2c0-2743-4264-acca-86fbf64ed3ba","year":2024},"citing_paper":{"arxiv_id":"2605.10347","last_updated":"2026-05-22T05:43:30Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:49:31Z","title":"How Mobile World Model Guides GUI Agents?","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-12T04:28:34.562344Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2605.10347"},"observation_digest":"sha256:9592279f71c7493bd395b49d2ed7166fd600fede59a5ac2fb480d03fff726a96","observation_id":"55b40fe5-2e67-49d1-b882-a5e6646d083e","resolution":{"observed_at":"2026-05-17T00:19:28.048419Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":"2401.16158","doi":"10.48550/arxiv.2401.16158","metadata_source":"pith","pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","venue":"cs.CL","work_id":"c8f4a2c0-2743-4264-acca-86fbf64ed3ba","year":2024},"citing_paper":{"arxiv_id":"2605.10347","last_updated":"2026-05-22T05:43:30Z","snapshot_observed_at":"2026-07-06T23:22:18.704329Z","submitted_at":"2026-05-11T10:49:31Z","title":"How Mobile World Model Guides GUI Agents?","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-25T06:00:34.560405Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2605.10347"},"observation_digest":"sha256:24f7e5f30a8b214d1cc6e09102ea08c2710e07843b7eae657f6d388d49159631","observation_id":"87a69956-4b7e-4552-802f-b40bb986a1ed","resolution":{"observed_at":"2026-05-25T06:05:26.674190Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":"2401.16158","doi":"10.48550/arxiv.2401.16158","metadata_source":"pith","pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","venue":"cs.CL","work_id":"c8f4a2c0-2743-4264-acca-86fbf64ed3ba","year":2024},"citing_paper":{"arxiv_id":"2605.15224","last_updated":"2026-05-13T08:50:05Z","snapshot_observed_at":"2026-08-02T16:16:00.555280Z","submitted_at":"2026-05-13T08:50:05Z","title":"ICRL: Learning to Internalize Self-Critique with Reinforcement Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-19T17:58:05.817581Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2605.15224"},"observation_digest":"sha256:1aed9a50a29a08e4eb692869186fbdf8ad0139c51411843f179bd8655f7a3e52","observation_id":"5dc51e9b-9f2a-4485-b483-35f1c702aeb5","resolution":{"observed_at":"2026-05-19T18:02:42.392144Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":"2401.16158","doi":"10.48550/arxiv.2401.16158","metadata_source":"pith","pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","venue":"cs.CL","work_id":"c8f4a2c0-2743-4264-acca-86fbf64ed3ba","year":2024},"citing_paper":{"arxiv_id":"2605.15542","last_updated":"2026-05-15T02:27:41Z","snapshot_observed_at":"2026-08-01T22:59:27.797060Z","submitted_at":"2026-05-15T02:27:41Z","title":"DRS-GUI: Dynamic Region Search for Training-Free GUI Grounding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-19T14:24:48.938948Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2605.15542"},"observation_digest":"sha256:ac63428c7f168ab83d952492c99c32b62cd1e291f6239417813b3313bb80f82e","observation_id":"1e259459-eee6-44b0-a925-f0362b1379ea","resolution":{"observed_at":"2026-05-19T14:27:24.206105Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":"2401.16158","doi":"10.48550/arxiv.2401.16158","metadata_source":"pith","pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","venue":"cs.CL","work_id":"c8f4a2c0-2743-4264-acca-86fbf64ed3ba","year":2024},"citing_paper":{"arxiv_id":"2605.16402","last_updated":"2026-05-13T02:48:52Z","snapshot_observed_at":"2026-07-06T23:27:34.514541Z","submitted_at":"2026-05-13T02:48:52Z","title":"WinDeskGround: A Benchmark for Robust GUI Grounding in Complex Multi-Window Desktop Environments","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-20T22:17:22.560632Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2605.16402"},"observation_digest":"sha256:30cc6499df75f6209d5b8961740a0835e24eee3a5c00bab5713d10bbce074b32","observation_id":"7af95b5a-20bc-4492-a695-fc763352d39d","resolution":{"observed_at":"2026-05-20T22:19:07.610874Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":"2401.16158","doi":"10.48550/arxiv.2401.16158","metadata_source":"pith","pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","venue":"cs.CL","work_id":"c8f4a2c0-2743-4264-acca-86fbf64ed3ba","year":2024},"citing_paper":{"arxiv_id":"2605.16883","last_updated":"2026-05-16T08:51:57Z","snapshot_observed_at":"2026-08-03T03:43:27.806285Z","submitted_at":"2026-05-16T08:51:57Z","title":"SE-GA: Memory-Augmented Self-Evolution for GUI Agents","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-19T20:38:37.264654Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2605.16883"},"observation_digest":"sha256:05fb6bb460fc6ff8424838791227b5fa81825a79dd4cbb7441d387d2b8bc62ac","observation_id":"e95c925f-b3d7-4dd7-89b0-c58bae2563bc","resolution":{"observed_at":"2026-05-19T20:42:46.393092Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":"2401.16158","doi":"10.48550/arxiv.2401.16158","metadata_source":"pith","pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","venue":"cs.CL","work_id":"c8f4a2c0-2743-4264-acca-86fbf64ed3ba","year":2024},"citing_paper":{"arxiv_id":"2605.18535","last_updated":"2026-05-18T15:18:29Z","snapshot_observed_at":"2026-07-06T23:29:24.494326Z","submitted_at":"2026-05-18T15:18:29Z","title":"Beyond Scaling: Agents Are Heading to the Edge","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-20T11:51:14.999341Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2605.18535"},"observation_digest":"sha256:59cd8f3bcd59272df36adcf7d40db3deaa82a8451b4291ff243072d05b774496","observation_id":"87b36c38-fb93-4eea-98d4-0c66f8e98e3d","resolution":{"observed_at":"2026-05-20T11:53:14.928467Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":"2401.16158","doi":"10.48550/arxiv.2401.16158","metadata_source":"pith","pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","venue":"cs.CL","work_id":"c8f4a2c0-2743-4264-acca-86fbf64ed3ba","year":2024},"citing_paper":{"arxiv_id":"2605.19260","last_updated":"2026-05-19T02:13:29Z","snapshot_observed_at":"2026-07-06T23:30:02.207108Z","submitted_at":"2026-05-19T02:13:29Z","title":"AQuaUI: Visual Token Reduction for GUI Agents with Adaptive Quadtrees","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-20T06:20:33.874919Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2605.19260"},"observation_digest":"sha256:04c6f4fb1ec7fa34a243b4b6c03ddc9cabca9a5fc1a3c048de94354219067ee5","observation_id":"3e9552e7-66d6-4a29-9e07-0d4e98c4faff","resolution":{"observed_at":"2026-05-20T06:23:05.518192Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":"2401.16158","doi":"10.48550/arxiv.2401.16158","metadata_source":"pith","pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","venue":"cs.CL","work_id":"c8f4a2c0-2743-4264-acca-86fbf64ed3ba","year":2024},"citing_paper":{"arxiv_id":"2606.02951","last_updated":"2026-06-01T23:07:44Z","snapshot_observed_at":"2026-08-03T11:01:01.154372Z","submitted_at":"2026-06-01T23:07:44Z","title":"SCOPE: Real-Time Natural Language Camera Agent at the Edge","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T13:52:28.991189Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2606.02951"},"observation_digest":"sha256:4f82eb9d6baf8c1403694948e377cad7acb8fb9f8e254d1527fa4a0b97a4ed82","observation_id":"7ed47fcd-fe98-4e01-a099-8539d00638e0","resolution":{"observed_at":"2026-06-28T14:32:18.539138Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":"2401.16158","doi":"10.48550/arxiv.2401.16158","metadata_source":"pith","pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","venue":"cs.CL","work_id":"c8f4a2c0-2743-4264-acca-86fbf64ed3ba","year":2024},"citing_paper":{"arxiv_id":"2606.03236","last_updated":"2026-06-02T06:54:02Z","snapshot_observed_at":"2026-08-02T10:23:26.425296Z","submitted_at":"2026-06-02T06:54:02Z","title":"Perceive Before Reasoning: A Pre-Reasoning Perception Framework for Efficient and Reliable Proactive Mobile Agents","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-06-28T10:05:32.165534Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2606.03236"},"observation_digest":"sha256:6b3b495e7b3cbc3cb9ca295b74522b0375b42b05445fbe2556e87a097f2d5d4d","observation_id":"6815e590-f6ad-48c4-b9b6-3a8b45d7ed12","resolution":{"observed_at":"2026-07-02T03:26:28.891778Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":"2401.16158","doi":"10.48550/arxiv.2401.16158","metadata_source":"pith","pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","venue":"cs.CL","work_id":"c8f4a2c0-2743-4264-acca-86fbf64ed3ba","year":2024},"citing_paper":{"arxiv_id":"2606.04627","last_updated":"2026-06-06T08:34:56Z","snapshot_observed_at":"2026-07-06T23:44:42.700120Z","submitted_at":"2026-06-03T09:01:24Z","title":"MIRAGE: Mobile Agents with Implicit Reasoning and Generative World Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T06:21:57.229717Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2606.04627"},"observation_digest":"sha256:94e959dbd3bdb8fd9a968cad47ac98eab2d164734445d5db9c5d0a375bf97e46","observation_id":"14251431-9f45-49a2-9e70-924553be491b","resolution":{"observed_at":"2026-07-02T08:06:48.318407Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":"2401.16158","doi":"10.48550/arxiv.2401.16158","metadata_source":"pith","pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","venue":"cs.CL","work_id":"c8f4a2c0-2743-4264-acca-86fbf64ed3ba","year":2024},"citing_paper":{"arxiv_id":"2606.04701","last_updated":"2026-06-03T10:25:46Z","snapshot_observed_at":"2026-07-06T23:44:47.848374Z","submitted_at":"2026-06-03T10:25:46Z","title":"Benchmarking Living-Screen-Native GUI Agents on Short-Video Platforms","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-28T07:19:40.069221Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2606.04701"},"observation_digest":"sha256:2298f4a1f7ddf3b30242bfacf5d3f7b7a7830a1abd19719aafd9d08956fed526","observation_id":"13242446-c093-49f9-850e-d19d53fe9cac","resolution":{"observed_at":"2026-07-02T06:36:44.126268Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-07-12T20:25:22.219346Z","title":"Mobile- agent: Autonomous multi-modal mobile device agent with visual perception, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.05171","last_updated":"2026-04-15T17:02:09Z","snapshot_observed_at":"2026-07-12T20:25:21.797198Z","submitted_at":"2026-04-15T17:02:09Z","title":"AppAgent-Claw: CLI Is All You Need for GUI Automation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-12T20:25:22.219346Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2606.05171"},"observation_digest":"sha256:2f54e45d71a28456f65f61efe79ff30abce913cde22e83c5f297cf2cadc29590","observation_id":"81d0a661-9d2c-43df-bcbc-ea802a84ca9b","resolution":{"observed_at":"2026-07-12T20:25:22.219346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":"2401.16158","doi":"10.48550/arxiv.2401.16158","metadata_source":"pith","pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","venue":"cs.CL","work_id":"c8f4a2c0-2743-4264-acca-86fbf64ed3ba","year":2024},"citing_paper":{"arxiv_id":"2606.09669","last_updated":"2026-06-08T15:51:51Z","snapshot_observed_at":"2026-08-02T20:17:41.727375Z","submitted_at":"2026-06-08T15:51:51Z","title":"SpatialWorld: Benchmarking Interactive Spatial Reasoning of Multimodal Agents in Real-World Tasks","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-27T16:35:14.099586Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2606.09669"},"observation_digest":"sha256:01e658d149b6f95e5be99604a9ec340767ad9f27d66a0bf69487e56fcdd3f103","observation_id":"435b9a5a-a0f0-486c-b535-5ecca914db45","resolution":{"observed_at":"2026-07-03T01:27:30.628006Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":"2401.16158","doi":"10.48550/arxiv.2401.16158","metadata_source":"pith","pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","venue":"cs.CL","work_id":"c8f4a2c0-2743-4264-acca-86fbf64ed3ba","year":2024},"citing_paper":{"arxiv_id":"2606.10522","last_updated":"2026-07-06T06:23:24Z","snapshot_observed_at":"2026-08-06T02:01:24.162802Z","submitted_at":"2026-06-09T07:52:10Z","title":"GUI-AC: Enhancing Continual Learning in GUI Agents","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-27T13:56:09.049753Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2606.10522"},"observation_digest":"sha256:574e43fc8d81d3ec6adb0bbd4fbed0d1337a39652635a99ae04b2dfbba3076a4","observation_id":"dcea54bb-00ee-46b4-b8b9-23d8c68cf039","resolution":{"observed_at":"2026-07-03T04:27:36.614466Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-07-12T14:27:05.589465Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception.arXiv preprint arXiv:2401.16158, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.10522","last_updated":"2026-07-06T06:23:24Z","snapshot_observed_at":"2026-08-06T02:01:24.162802Z","submitted_at":"2026-06-09T07:52:10Z","title":"GUI-AC: Enhancing Continual Learning in GUI Agents","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-12T14:27:05.589465Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2606.10522"},"observation_digest":"sha256:2b0319df41719d16fd5bc2252309363a74bfce855c350ded5a643ae613bb51bf","observation_id":"0e2faaa1-5a42-458e-8653-5ca0cc6d9823","resolution":{"observed_at":"2026-07-12T14:27:05.589465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":"2401.16158","doi":"10.48550/arxiv.2401.16158","metadata_source":"pith","pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","venue":"cs.CL","work_id":"c8f4a2c0-2743-4264-acca-86fbf64ed3ba","year":2024},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:f22b72d5e38eb633e56f15efa1aa3bc5a32bcd1fabbf544b9cc89a1ebe62f1fd","observation_id":"3079e832-34b4-4472-b8aa-f3743e308d3c","resolution":{"observed_at":"2026-07-03T10:48:03.180078Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":"2401.16158","doi":"10.48550/arxiv.2401.16158","metadata_source":"pith","pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","venue":"cs.CL","work_id":"c8f4a2c0-2743-4264-acca-86fbf64ed3ba","year":2024},"citing_paper":{"arxiv_id":"2606.12666","last_updated":"2026-06-16T03:15:00Z","snapshot_observed_at":"2026-07-30T01:01:38.589980Z","submitted_at":"2026-06-10T20:48:39Z","title":"CAPED: Context-Aware Privacy Exposure Defense for Mobile GUI Agents","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T09:00:10.153170Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2606.12666"},"observation_digest":"sha256:9d35072a981911397c6b717ad469edf06baf99220aef38849e699516e2117936","observation_id":"2b096cd2-9528-4d3c-9197-13aca52d97ad","resolution":{"observed_at":"2026-07-03T12:28:07.419714Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":"2401.16158","doi":"10.48550/arxiv.2401.16158","metadata_source":"pith","pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","venue":"cs.CL","work_id":"c8f4a2c0-2743-4264-acca-86fbf64ed3ba","year":2024},"citing_paper":{"arxiv_id":"2606.17929","last_updated":"2026-06-16T13:40:21Z","snapshot_observed_at":"2026-08-05T10:34:10.739663Z","submitted_at":"2026-06-16T13:40:21Z","title":"PreAct: Computer-Using Agents that Get Faster on Repeated Tasks","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-27T01:06:26.643487Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2606.17929"},"observation_digest":"sha256:ff3bf1a8e1bbd86daa39153d384052cbaaf74513693aceb2f66c26869fc17855","observation_id":"b4f62c91-f46f-43ff-92f0-66bb39e68c5b","resolution":{"observed_at":"2026-07-03T20:48:56.535243Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":"2401.16158","doi":"10.48550/arxiv.2401.16158","metadata_source":"pith","pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","venue":"cs.CL","work_id":"c8f4a2c0-2743-4264-acca-86fbf64ed3ba","year":2024},"citing_paper":{"arxiv_id":"2606.23049","last_updated":"2026-06-24T02:20:35Z","snapshot_observed_at":"2026-07-06T23:57:53.101659Z","submitted_at":"2026-06-22T08:57:54Z","title":"PhoneBuddy: Training Open Models for Agentic Phone Use","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-26T08:15:49.428124Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2606.23049"},"observation_digest":"sha256:0672068a7730b0e1884863b909a9d8666509ddf0b65dac5d4719a65f2f98108b","observation_id":"d019e385-d419-4e17-852d-2e3486e41e30","resolution":{"observed_at":"2026-07-04T10:59:46.529434Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":"2401.16158","doi":"10.48550/arxiv.2401.16158","metadata_source":"pith","pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","venue":"cs.CL","work_id":"c8f4a2c0-2743-4264-acca-86fbf64ed3ba","year":2024},"citing_paper":{"arxiv_id":"2606.24525","last_updated":"2026-06-23T12:57:02Z","snapshot_observed_at":"2026-07-06T23:59:03.724013Z","submitted_at":"2026-06-23T12:57:02Z","title":"VisCritic: Visual State Comparison as Process Reward for GUI Agents","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-26T00:51:37.888398Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2606.24525"},"observation_digest":"sha256:92ea73d7bac8a80f4153359103e0c3daf6debfb4b7b4d42af3b9196d5aaf36dd","observation_id":"18e48f09-ee35-4dda-bc3d-e9252180aabc","resolution":{"observed_at":"2026-07-04T16:09:57.365600Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":"2401.16158","doi":"10.48550/arxiv.2401.16158","metadata_source":"pith","pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","venue":"cs.CL","work_id":"c8f4a2c0-2743-4264-acca-86fbf64ed3ba","year":2024},"citing_paper":{"arxiv_id":"2606.25705","last_updated":"2026-06-24T11:18:01Z","snapshot_observed_at":"2026-08-06T10:26:35.331022Z","submitted_at":"2026-06-24T11:18:01Z","title":"GUI agent: Guided Exploration of User-Sensitive Screens","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-25T20:34:05.239277Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2606.25705"},"observation_digest":"sha256:bae644440c17163633666a0eb55c412d129c20f8f3835f6fefe96c043ba40c4c","observation_id":"42bfef86-ec5f-4880-ab71-ef83a0226599","resolution":{"observed_at":"2026-07-04T20:10:08.743859Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":"2401.16158","doi":"10.48550/arxiv.2401.16158","metadata_source":"pith","pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","venue":"cs.CL","work_id":"c8f4a2c0-2743-4264-acca-86fbf64ed3ba","year":2024},"citing_paper":{"arxiv_id":"2606.31410","last_updated":"2026-07-01T03:59:21Z","snapshot_observed_at":"2026-07-07T00:05:07.912609Z","submitted_at":"2026-06-30T09:36:35Z","title":"Xiaomi-GUI-0 Technical Report","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-01T06:07:48.137351Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2606.31410"},"observation_digest":"sha256:b0f979b07ba2272b4a8c06005ddf1130c9777075a34030f2044390bd0c49e07a","observation_id":"979446c6-c92f-42fd-b2d8-4ce6f4c920ac","resolution":{"observed_at":"2026-07-01T09:55:40.266227Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":"2401.16158","doi":"10.48550/arxiv.2401.16158","metadata_source":"pith","pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","venue":"cs.CL","work_id":"c8f4a2c0-2743-4264-acca-86fbf64ed3ba","year":2024},"citing_paper":{"arxiv_id":"2606.31410","last_updated":"2026-07-01T03:59:21Z","snapshot_observed_at":"2026-07-07T00:05:07.912609Z","submitted_at":"2026-06-30T09:36:35Z","title":"Xiaomi-GUI-0 Technical Report","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-02T19:37:49.661596Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2606.31410"},"observation_digest":"sha256:63cc3c97b71f188645c404d08c9989fad9210b66153e9d4598bee000033ef2b8","observation_id":"4aca7c90-a786-48ff-b25f-650d54f2dc05","resolution":{"observed_at":"2026-07-02T19:47:19.028792Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":"2401.16158","doi":"10.48550/arxiv.2401.16158","metadata_source":"pith","pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","venue":"cs.CL","work_id":"c8f4a2c0-2743-4264-acca-86fbf64ed3ba","year":2024},"citing_paper":{"arxiv_id":"2606.31612","last_updated":"2026-07-02T06:42:39Z","snapshot_observed_at":"2026-08-02T11:25:34.061644Z","submitted_at":"2026-06-30T13:01:19Z","title":"What Memory Do GUI Agents Really Need? From Passive Records to Active Task-Driving States","version":1},"reference_index":109,"source":"arxiv_source","source_observed_at":"2026-07-01T05:26:53.441833Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2606.31612"},"observation_digest":"sha256:90cddf7d22a65adef0892cb6692df4c5dc96de6f657544a030ff4527326a5a80","observation_id":"2943cc48-dc51-4984-a00d-2aef1d33a3f0","resolution":{"observed_at":"2026-07-01T10:35:41.229703Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":"2401.16158","doi":"10.48550/arxiv.2401.16158","metadata_source":"pith","pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","venue":"cs.CL","work_id":"c8f4a2c0-2743-4264-acca-86fbf64ed3ba","year":2024},"citing_paper":{"arxiv_id":"2606.31612","last_updated":"2026-07-02T06:42:39Z","snapshot_observed_at":"2026-08-02T11:25:34.061644Z","submitted_at":"2026-06-30T13:01:19Z","title":"What Memory Do GUI Agents Really Need? From Passive Records to Active Task-Driving States","version":2},"reference_index":109,"source":"arxiv_source","source_observed_at":"2026-07-03T22:03:26.625209Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2606.31612"},"observation_digest":"sha256:6be51b6d8b37263a6099c76b4bf8b55b01eb250b7fc09cdb91b4afeff88d7408","observation_id":"ec55ea18-d81d-4030-a47f-012344342d90","resolution":{"observed_at":"2026-07-03T22:08:58.664846Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-02T01:50:32.969373Z","title":"UI-TARS-2 technical report: Advancing GUI agent with multi-turn reinforcement learning, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14548","last_updated":"2026-07-16T04:12:42Z","snapshot_observed_at":"2026-08-05T04:44:49.809120Z","submitted_at":"2026-07-16T04:12:42Z","title":"HyMobileAgent: Data-Environment Co-Scaling for Efficient GUI Agents","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T01:50:32.969373Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2607.14548"},"observation_digest":"sha256:ac743af09bf34605a41b37054abb2b95d5aac08a0b3ca2491477a73d4a3197b0","observation_id":"737393b5-e325-44b8-bce4-13031f226903","resolution":{"observed_at":"2026-08-02T01:50:32.969373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-01T16:35:16.725999Z","title":"Mobile-agent: Autonomous multi-modal mobile device agent with visual perception,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17951","last_updated":"2026-07-20T13:52:24Z","snapshot_observed_at":"2026-08-06T03:03:53.912929Z","submitted_at":"2026-07-20T13:52:24Z","title":"RT-SHCUA: Real-Time Self-Hosted Computer-Use Agent for UAV Control","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-01T16:35:16.725999Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2607.17951"},"observation_digest":"sha256:c4ce7314e1ad48e9118017f73dc932cc17f471931acc834e90cda35d53767999","observation_id":"0fcbfbfd-5493-46fa-862f-9892dde40148","resolution":{"observed_at":"2026-08-01T16:35:16.725999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-07-31T14:04:46.279676Z","title":"arXiv preprint arXiv:2401.16158 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28227","last_updated":"2026-07-30T13:58:41Z","snapshot_observed_at":"2026-08-04T06:59:54.896655Z","submitted_at":"2026-07-30T13:58:41Z","title":"Qwen-UI-Agent Technical Report: Toward Next-Generation Real-World Centric Foundation GUI Agents","version":1},"reference_index":166,"source":"arxiv_source","source_observed_at":"2026-07-31T14:04:46.279676Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2607.28227"},"observation_digest":"sha256:21d575f0382e46f5fe2e1ba6ad49ec4de6f02d10976df81a71a5f6d80385a933","observation_id":"ec95727f-7010-43a1-8e73-51ddebd2699a","resolution":{"observed_at":"2026-07-31T14:04:46.279676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-03T00:53:50.481883Z","title":"arXiv preprint arXiv:2401.16158 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28645","last_updated":"2026-05-29T05:48:19Z","snapshot_observed_at":"2026-08-05T23:11:22.264645Z","submitted_at":"2026-05-29T05:48:19Z","title":"Looks Right, Works Right: A Project-Level Benchmark for Multi-Screen Mobile App Generation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-03T00:53:50.481883Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2607.28645"},"observation_digest":"sha256:2a9acfa93b8f520dbc3796ec6e56728ec589dfeb0bf9feeaf7b55d999ad5e0ec","observation_id":"a86e3d66-3dc1-408a-9513-d7e851e16f53","resolution":{"observed_at":"2026-08-03T00:53:50.481883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-03T11:50:48.258279Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.29199","last_updated":"2026-07-31T09:18:55Z","snapshot_observed_at":"2026-08-06T16:41:38.516023Z","submitted_at":"2026-07-31T09:18:55Z","title":"Alignment Is Local: A Paired Diagnostic for GUI Agents under User-Side Persuasion","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T11:50:48.258279Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2607.29199"},"observation_digest":"sha256:c41f2e156d8f6818b0d131b7c9cb565ec54ea5b779887a1f80367d39bc8f0e8a","observation_id":"a898618e-ccb8-4740-a25c-09a3e691e557","resolution":{"observed_at":"2026-08-03T11:50:48.258279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2401.16158/citation-record","integrity":"/paper/2401.16158/integrity","json":"/paper/2401.16158/citation-record.json","paper":"/paper/2401.16158"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.00986","last_updated":"2023-09-02T16:50:30Z","snapshot_observed_at":"2026-08-03T17:29:13.756570Z","submitted_at":"2023-09-02T16:50:30Z","title":"ModelScope-Agent: Building Your Customizable Agent System with Open-source Large Language Models","version":1},"cited_work":{"arxiv_id":"2309.00986","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.00986","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Modelscope-agent: Building your customizable agent system with open-source large language models","venue":null,"work_id":"2327fb2d-530b-44f6-972c-1ea9cb6b8c3d","year":null},"citing_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-17T00:19:27.965902Z"},"links":{"cited_paper":"/paper/2309.00986","citing_paper":"/paper/2401.16158"},"observation_digest":"sha256:6f77239f68d7189a71d581ddb84300dce60cbc3958eaa9e61da7104a84703737","observation_id":"c3ec6a90-3617-4416-b2b4-28555437dc30","resolution":{"observed_at":"2026-05-17T00:19:27.982450Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17796","last_updated":"2023-12-18T15:09:20Z","snapshot_observed_at":"2026-07-06T16:39:16.652626Z","submitted_at":"2023-10-26T21:57:21Z","title":"ControlLLM: Augment Language Models with Tools by Searching on Graphs","version":3},"cited_work":{"arxiv_id":"2310.17796","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.17796","snapshot_observed_at":"2026-07-03T10:48:03.070368Z","title":"Controlllm: Augment language models with tools by searching on graphs","venue":null,"work_id":"5a9fd1ba-c4e9-4185-ad1e-5e587998b78a","year":2023},"citing_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-17T00:19:27.965902Z"},"links":{"cited_paper":"/paper/2310.17796","citing_paper":"/paper/2401.16158"},"observation_digest":"sha256:afd94035a117b14df22f48dd322f38208d2bc8532c04696bf4badf036e4e6f54","observation_id":"4551d6f1-484e-4765-93ef-421d89265ce4","resolution":{"observed_at":"2026-05-17T00:19:27.987617Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":"2303.04671","doi":"10.48550/arxiv.2303.04671","metadata_source":"pith","pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","venue":"cs.CV","work_id":"b06ebfb8-5543-4f2c-af49-c05c4e63fc45","year":2023},"citing_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-17T00:19:27.965902Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2401.16158"},"observation_digest":"sha256:814d3a656e9f2addbb30c2ec115df9e930bd7cff8d1cd87994f0472bc1623918","observation_id":"cb41746b-bf36-4cc3-98f8-808cc13902aa","resolution":{"observed_at":"2026-05-17T00:19:27.991850Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18752","last_updated":"2023-05-30T05:27:21Z","snapshot_observed_at":"2026-08-06T18:37:20.517203Z","submitted_at":"2023-05-30T05:27:21Z","title":"GPT4Tools: Teaching Large Language Model to Use Tools via Self-instruction","version":1},"cited_work":{"arxiv_id":"2305.18752","doi":"10.48550/arxiv.2305.18752","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.18752","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gpt4tools: Teaching large language model to use tools via self-instruction","venue":"arXiv (Cornell University)","work_id":"260a71e5-f66b-4679-a4f4-2d3778841d09","year":2025},"citing_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-17T00:19:27.965902Z"},"links":{"cited_paper":"/paper/2305.18752","citing_paper":"/paper/2401.16158"},"observation_digest":"sha256:353a292b04879bfcc5935b3665c5cd10e94cdc6c9983e6094eb3c23dcd44fecb","observation_id":"ae6ec38b-8fb3-4a98-a6e2-5d7f5006e8a8","resolution":{"observed_at":"2026-05-17T00:19:27.996686Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11381","last_updated":"2023-03-20T18:31:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-20T18:31:47Z","title":"MM-REACT: Prompting ChatGPT for Multimodal Reasoning and Action","version":1},"cited_work":{"arxiv_id":"2303.11381","doi":"10.48550/arxiv.2303.11381","metadata_source":"pith","pith_arxiv_id":"2303.11381","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MM-REACT: Prompting ChatGPT for Multimodal Reasoning and Action","venue":"cs.CV","work_id":"6dc43db8-227d-438e-8658-0c8acecba08a","year":2023},"citing_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-17T00:19:27.965902Z"},"links":{"cited_paper":"/paper/2303.11381","citing_paper":"/paper/2401.16158"},"observation_digest":"sha256:b7c93067246f57e72e4096ed03fa768ff47eb1ae4638849c395f3313ce5f0996","observation_id":"15909591-c97c-47da-a11f-4893841197c3","resolution":{"observed_at":"2026-05-17T00:19:28.000908Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02224","last_updated":"2023-06-04T01:07:20Z","snapshot_observed_at":"2026-08-03T03:58:33.818386Z","submitted_at":"2023-06-04T01:07:20Z","title":"Auto-GPT for Online Decision Making: Benchmarks and Additional Opinions","version":1},"cited_work":{"arxiv_id":"2306.02224","doi":"10.48550/arxiv.2306.02224","metadata_source":"arxiv_reference","pith_arxiv_id":"2306.02224","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Auto-gpt for online decision making: Benchmarks and additional opinions","venue":"arXiv (Cornell University)","work_id":"4ab2fe20-0594-4eb2-8558-02d1dbfceb19","year":2025},"citing_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-17T00:19:27.965902Z"},"links":{"cited_paper":"/paper/2306.02224","citing_paper":"/paper/2401.16158"},"observation_digest":"sha256:713a35f6265ee8e0fca6caa0d7918c3a333b29b987ab3bd30fbd74884881b7ed","observation_id":"614d9264-04d0-4bb6-bcd6-39ed055b273a","resolution":{"observed_at":"2026-05-17T00:19:28.005343Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-12T03:19:36.403026+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T03:19:36.403026+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":"2304.14178","doi":"10.48550/arxiv.2304.14178","metadata_source":"pith","pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","venue":"cs.CL","work_id":"74a7deb6-48be-4132-9d35-882cc5870ebd","year":2023},"citing_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-17T00:19:27.965902Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2401.16158"},"observation_digest":"sha256:7ff238b710ceeafb2b7a813652be6344b557d348a0f4ab54da94bc1cc62fa806","observation_id":"29f21e54-a2f2-4286-9570-f57881e28d40","resolution":{"observed_at":"2026-05-17T00:19:28.009730Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":"2310.03744","doi":"10.48550/arxiv.2310.03744","metadata_source":"pith","pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improved Baselines with Visual Instruction Tuning","venue":"cs.CV","work_id":"5baeaa33-5986-44a3-85a4-fcabd6fc1e8d","year":2023},"citing_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-17T00:19:27.965902Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2401.16158"},"observation_digest":"sha256:8ee2d41702f801551a014a1b316dbe7f7a829885189551cb83c87cf8e0bb9200","observation_id":"e94ebfd3-da23-4b49-a675-fa78cc70900e","resolution":{"observed_at":"2026-05-17T00:19:28.015193Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-08-06T04:08:15.266897Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"cited_work":{"arxiv_id":"2311.04257","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.04257","snapshot_observed_at":"2026-07-04T06:39:37.569021Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","venue":"cs.CL","work_id":"9200bc1e-ad8a-49b6-8f93-1bdac4689a9f","year":2023},"citing_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-17T00:19:27.965902Z"},"links":{"cited_paper":"/paper/2311.04257","citing_paper":"/paper/2401.16158"},"observation_digest":"sha256:ef5190d21e409140af206176c3fc4c79b4d7429f4063f5ed40a73a95fdd88d8c","observation_id":"74aa7ba5-e508-4027-8609-6a373889c352","resolution":{"observed_at":"2026-05-18T03:18:51.946750Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07533","last_updated":"2024-05-16T21:21:30Z","snapshot_observed_at":"2026-07-06T17:00:37.507046Z","submitted_at":"2023-12-12T18:58:18Z","title":"VILA: On Pre-training for Visual Language Models","version":4},"cited_work":{"arxiv_id":"2312.07533","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.07533","snapshot_observed_at":"2026-07-04T12:09:48.871684Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":"6cd946f1-89e0-4dc6-9718-bf5a7e8519fa","year":2024},"citing_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-17T00:19:27.965902Z"},"links":{"cited_paper":"/paper/2312.07533","citing_paper":"/paper/2401.16158"},"observation_digest":"sha256:24b03dfed871cd8870206f7d317287e73620af4be984f07a5598dbb299dfed22","observation_id":"75b31be1-6db3-41b0-bb1b-15da1e94e251","resolution":{"observed_at":"2026-05-17T00:19:28.026823Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01614","last_updated":"2024-03-12T23:14:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-03T08:33:09Z","title":"GPT-4V(ision) is a Generalist Web Agent, if Grounded","version":2},"cited_work":{"arxiv_id":"2401.01614","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.01614","snapshot_observed_at":"2026-07-08T16:15:06.143411Z","title":"GPT-4V(ision) is a Generalist Web Agent, if Grounded","venue":"cs.IR","work_id":"d3503fef-7f64-4dcc-8aca-1f16e997034f","year":2024},"citing_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-17T00:19:27.965902Z"},"links":{"cited_paper":"/paper/2401.01614","citing_paper":"/paper/2401.16158"},"observation_digest":"sha256:e8e6a6a76345390fea6a5b9bd1f091112ac0a1ac24cd0b26fd5c14a7c45d0f76","observation_id":"c2daecfc-1d24-4026-93b1-3131c8310ecc","resolution":{"observed_at":"2026-05-17T00:19:28.032867Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13771","last_updated":"2026-07-05T07:51:04Z","snapshot_observed_at":"2026-08-04T19:11:48.797552Z","submitted_at":"2023-12-21T11:52:45Z","title":"AppAgent: Multimodal Agents as Smartphone Users","version":3},"cited_work":{"arxiv_id":"2312.13771","doi":"10.48550/arxiv.2312.13771","metadata_source":"pith","pith_arxiv_id":"2312.13771","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AppAgent: Multimodal Agents as Smartphone Users","venue":"cs.CV","work_id":"c3239910-590f-4891-bf7e-c462ffee2e9d","year":2023},"citing_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-17T00:19:27.965902Z"},"links":{"cited_paper":"/paper/2312.13771","citing_paper":"/paper/2401.16158"},"observation_digest":"sha256:9f1e7c233fa2ac2ccffcaab906d3b31fc4fb75e3417945dd97eea19f5db85807","observation_id":"17fbae21-1e4b-40f7-abdb-94bc74534986","resolution":{"observed_at":"2026-05-17T10:16:44.196372Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":"2303.05499","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-07-10T23:17:45.410080Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","venue":"cs.CV","work_id":"3757dc8f-79d5-4beb-a03b-eb4c9a33427d","year":2023},"citing_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-17T00:19:27.965902Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2401.16158"},"observation_digest":"sha256:3a8fa869f8cb56326f1526fd25877d320d8f505112b2af0cc925c1c133198aa9","observation_id":"5da45b0a-14ec-496c-a5fd-5ba88ef75e19","resolution":{"observed_at":"2026-05-17T00:19:28.046409Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception"},"reference_resolution":{"displayed":13,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":13,"verified_fuzzy":0},"total_outbound_references":13},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 13 of 13 outbound references and 73 inbound Pith citation observations for arXiv:2401.16158."}