{"as_of":"2026-08-08T08:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:94b4f50be0114a8cf44502954c0c34ada52588bdb70ba75e77016ee4290fc5d4","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":46,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T06:01:31.626071Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":6,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-07-06T17:01:40.744034Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":"2312.08914","doi":"10.48550/arxiv.2312.08914","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cogagent: A visual language model for gui agents","venue":"arXiv (Cornell University)","work_id":"11c41075-0a02-4367-b0f1-4a89b4f4d008","year":2024},"citing_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-16T02:56:41.658658Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2306.13549"},"observation_digest":"sha256:4c25e972a22815004535dbfc3ae2c536ea0f79a52e0aee755e957eb53da990a9","observation_id":"3214e3ab-a280-41cf-8dbd-7e197a925c31","resolution":{"observed_at":"2026-05-16T02:56:42.446292Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-07-06T17:01:40.744034Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":"2312.08914","doi":"10.48550/arxiv.2312.08914","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cogagent: A visual language model for gui agents","venue":"arXiv (Cornell University)","work_id":"11c41075-0a02-4367-b0f1-4a89b4f4d008","year":2024},"citing_paper":{"arxiv_id":"2401.10935","last_updated":"2024-02-23T04:36:51Z","snapshot_observed_at":"2026-08-08T03:28:12.161766Z","submitted_at":"2024-01-17T08:10:35Z","title":"SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-05-17T10:09:46.447508Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2401.10935"},"observation_digest":"sha256:e6c9a0107b8ee22416b3d6d20d51c44d316bdbf09617e33937a9e4f027cc1849","observation_id":"e6675e01-5d8a-410e-83a4-978dd5e5611e","resolution":{"observed_at":"2026-05-17T10:09:46.540356Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-07-06T17:01:40.744034Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":"2312.08914","doi":"10.48550/arxiv.2312.08914","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cogagent: A visual language model for gui agents","venue":"arXiv (Cornell University)","work_id":"11c41075-0a02-4367-b0f1-4a89b4f4d008","year":2024},"citing_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:32.406859Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2404.07972"},"observation_digest":"sha256:932af175f846dfdb717929b0dd29e3276d86e4f160a3d54fcc71aed3e6c46ca0","observation_id":"639bd103-164a-48a4-bd0d-82cbf0daa853","resolution":{"observed_at":"2026-05-13T01:19:32.465423Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-07-06T17:01:40.744034Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":"2312.08914","doi":"10.48550/arxiv.2312.08914","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cogagent: A visual language model for gui agents","venue":"arXiv (Cornell University)","work_id":"11c41075-0a02-4367-b0f1-4a89b4f4d008","year":2024},"citing_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-12T20:58:58.849040Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2404.16821"},"observation_digest":"sha256:74442d3e6c88f98ad09843e7119bdedf0e6b6a187833df5a93c579141a95e875","observation_id":"61661f24-5128-4028-9f4a-cab87d879e8f","resolution":{"observed_at":"2026-05-12T20:58:58.990645Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-07-06T17:01:40.744034Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":"2312.08914","doi":"10.48550/arxiv.2312.08914","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cogagent: A visual language model for gui agents","venue":"arXiv (Cornell University)","work_id":"11c41075-0a02-4367-b0f1-4a89b4f4d008","year":2024},"citing_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-15T20:21:57.873354Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2404.16994"},"observation_digest":"sha256:a004d9f9bc17c5ac42ebe09b5ccdff6bbb06a89f69a4061fe9575abe5b629a57","observation_id":"033a0815-e370-4512-8311-f765331f23a1","resolution":{"observed_at":"2026-05-15T20:21:57.935228Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-07-06T17:01:40.744034Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":"2312.08914","doi":"10.48550/arxiv.2312.08914","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cogagent: A visual language model for gui agents","venue":"arXiv (Cornell University)","work_id":"11c41075-0a02-4367-b0f1-4a89b4f4d008","year":2024},"citing_paper":{"arxiv_id":"2405.14573","last_updated":"2025-04-06T20:37:50Z","snapshot_observed_at":"2026-08-07T08:11:20.950548Z","submitted_at":"2024-05-23T13:48:54Z","title":"AndroidWorld: A Dynamic Benchmarking Environment for Autonomous Agents","version":5},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-13T12:06:13.697487Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2405.14573"},"observation_digest":"sha256:ab6738b1be798f581db6ffccb274dcf9bd32d03c8be230198d4ebfb492da6d86","observation_id":"daff75fb-8129-47db-9e38-ec8905cb7402","resolution":{"observed_at":"2026-05-13T12:06:13.777835Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-07-06T17:01:40.744034Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":"2312.08914","doi":"10.48550/arxiv.2312.08914","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cogagent: A visual language model for gui agents","venue":"arXiv (Cornell University)","work_id":"11c41075-0a02-4367-b0f1-4a89b4f4d008","year":2024},"citing_paper":{"arxiv_id":"2406.08035","last_updated":"2025-08-09T10:54:59Z","snapshot_observed_at":"2026-08-05T10:34:24.268925Z","submitted_at":"2024-06-12T09:36:52Z","title":"LVBench: An Extreme Long Video Understanding Benchmark","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-19T11:55:30.048525Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2406.08035"},"observation_digest":"sha256:e74e5cd5a3ee9dc5a54c0d2f23ac540b9bf24f87159b312e042ca469254d7af4","observation_id":"d20010ca-3451-405e-8a1e-55c27a43e0da","resolution":{"observed_at":"2026-05-19T11:55:30.172445Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-07-06T17:01:40.744034Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":"2312.08914","doi":"10.48550/arxiv.2312.08914","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cogagent: A visual language model for gui agents","venue":"arXiv (Cornell University)","work_id":"11c41075-0a02-4367-b0f1-4a89b4f4d008","year":2024},"citing_paper":{"arxiv_id":"2407.03320","last_updated":"2024-07-03T17:59:21Z","snapshot_observed_at":"2026-08-04T22:09:42.241578Z","submitted_at":"2024-07-03T17:59:21Z","title":"InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-17T10:46:28.447347Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2407.03320"},"observation_digest":"sha256:72f14cbe128cefa50c937e1965a7e432e4f59c85ba5b065c9b5f214868890303","observation_id":"18d3795f-aba7-4893-9d39-29fece85d28a","resolution":{"observed_at":"2026-05-17T10:46:28.769978Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-07-06T17:01:40.744034Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":"2312.08914","doi":"10.48550/arxiv.2312.08914","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cogagent: A visual language model for gui agents","venue":"arXiv (Cornell University)","work_id":"11c41075-0a02-4367-b0f1-4a89b4f4d008","year":2024},"citing_paper":{"arxiv_id":"2411.18279","last_updated":"2025-05-06T15:08:00Z","snapshot_observed_at":"2026-07-06T19:57:55.925634Z","submitted_at":"2024-11-27T12:13:39Z","title":"Large Language Model-Brained GUI Agents: A Survey","version":12},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:27.472508Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2411.18279"},"observation_digest":"sha256:998531a526173838fd1c2b25be438e2b2bcd539bef811dd0e7527c743e4a96bb","observation_id":"e4f5fead-4c87-4d63-bbed-2c9ec1fb625f","resolution":{"observed_at":"2026-05-19T11:08:27.968638Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-07-06T17:01:40.744034Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-08T06:01:31.626071Z","title":"org/CorpusID:229363676","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08226","last_updated":"2025-02-14T06:23:57Z","snapshot_observed_at":"2026-08-08T05:53:49.808163Z","submitted_at":"2025-02-12T09:12:30Z","title":"TRISHUL: Towards Region Identification and Screen Hierarchy Understanding for Large VLM based GUI Agents","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T06:01:31.626071Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2502.08226"},"observation_digest":"sha256:1d7117d3dfcf42debb2e721c61ce487398cd0503a02436e1ca9076fe000d2935","observation_id":"485324ff-eeda-4a5d-8817-79a990391ed7","resolution":{"observed_at":"2026-08-08T06:01:31.626071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-07-06T17:01:40.744034Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-07T20:57:48.425527Z","title":"Dmitry Kalashnikov, Alex Irpan, Peter Pastor, Julian Ibarz, Alexander Herzog, Eric Jang, Deirdre Quillen, Ethan Holly, Mrinal Kalakrishnan, Vincent Vanhoucke, and Sergey Levine","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.15760","last_updated":"2025-02-13T18:55:14Z","snapshot_observed_at":"2026-08-07T22:34:53.289352Z","submitted_at":"2025-02-13T18:55:14Z","title":"Digi-Q: Learning Q-Value Functions for Training Device-Control Agents","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T20:57:48.425527Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2502.15760"},"observation_digest":"sha256:5ba24586a7dabfbe2e7b3772eb123cc5e11231562cf8289d45718d9551cc4cd6","observation_id":"ae727bc1-7c64-44bf-b741-9d442477c5da","resolution":{"observed_at":"2026-08-07T20:57:48.425527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-07-06T17:01:40.744034Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-07T14:18:04.556039Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19554","last_updated":"2025-05-26T06:17:21Z","snapshot_observed_at":"2026-08-07T22:12:25.513471Z","submitted_at":"2025-05-26T06:17:21Z","title":"Aggregated Structural Representation with Large Language Models for Human-Centric Layout Generation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T14:18:04.556039Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2505.19554"},"observation_digest":"sha256:c4e08a79dcf5cd9f340c6c25b6d4f69706f6a4a4afc57f5e0ff26d861361abe8","observation_id":"53784e52-3283-4c3c-ae0f-0bb1fb454dde","resolution":{"observed_at":"2026-08-07T14:18:04.556039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-07-06T17:01:40.744034Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-07T11:16:43.994161Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03007","last_updated":"2025-06-03T15:45:41Z","snapshot_observed_at":"2026-08-07T20:35:00.476895Z","submitted_at":"2025-06-03T15:45:41Z","title":"DFBench: Benchmarking Deepfake Image Detection Capability of Large Multimodal Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:43.994161Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2506.03007"},"observation_digest":"sha256:c8f672055afa9cd5640e4ebf07cc6475558fcbaeda1d808a633279b9069f7555","observation_id":"ffb37659-bcbc-4cef-8a15-a406b0667597","resolution":{"observed_at":"2026-08-07T11:16:43.994161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-07-06T17:01:40.744034Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-07T00:41:13.264774Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12879","last_updated":"2025-06-15T15:09:37Z","snapshot_observed_at":"2026-08-07T00:35:01.991132Z","submitted_at":"2025-06-15T15:09:37Z","title":"Exploring the Potential of Metacognitive Support Agents for Human-AI Co-Creation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T00:41:13.264774Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2506.12879"},"observation_digest":"sha256:775abf26e3dcbb5bb6e4c5feb55198212fcf9c124213eed5c30cc0b4aa9a1c83","observation_id":"c4fb6c79-0874-4ebd-817a-ace03b950ed7","resolution":{"observed_at":"2026-08-07T00:41:13.264774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-07-06T17:01:40.744034Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-06T21:44:51.212777Z","title":"Cogagent: A visual language model for gui agents","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23491","last_updated":"2025-07-18T06:03:26Z","snapshot_observed_at":"2026-08-06T21:38:43.261031Z","submitted_at":"2025-06-30T03:33:02Z","title":"ZonUI-3B: A Lightweight Vision-Language Model for Cross-Resolution GUI Grounding","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:44:51.212777Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2506.23491"},"observation_digest":"sha256:2a3913aa1aae98bb85ea9d922e290a82535f15a7e4d702154a01da083a447229","observation_id":"cc4f8ab6-75d4-4a7d-bf8b-aa198f685dbe","resolution":{"observed_at":"2026-08-06T21:44:51.212777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-07-06T17:01:40.744034Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":"2312.08914","doi":"10.48550/arxiv.2312.08914","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cogagent: A visual language model for gui agents","venue":"arXiv (Cornell University)","work_id":"11c41075-0a02-4367-b0f1-4a89b4f4d008","year":2024},"citing_paper":{"arxiv_id":"2507.04227","last_updated":"2026-04-14T14:47:25Z","snapshot_observed_at":"2026-08-01T14:12:08.736574Z","submitted_at":"2025-07-06T03:31:36Z","title":"Mobile GUI Agents under Real-world Threats: Are We There Yet?","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-19T06:57:25.257775Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2507.04227"},"observation_digest":"sha256:8955c3c83b5371cf7e1cd86f31633f64cdf3906e0ccb858aa1812a3f354b3408","observation_id":"500ea2d7-0380-4833-8837-d97ded882cd3","resolution":{"observed_at":"2026-05-19T07:02:07.944025Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-07-06T17:01:40.744034Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-06T15:29:11.323765Z","title":"Cogagent: A visual language model for gui agents, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15846","last_updated":"2025-07-28T16:54:13Z","snapshot_observed_at":"2026-08-07T08:12:57.119379Z","submitted_at":"2025-07-21T17:53:42Z","title":"GUI-G$^2$: Gaussian Reward Modeling for GUI Grounding","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T15:29:11.323765Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2507.15846"},"observation_digest":"sha256:4683ebe7824aec3d65af6f03a031cc9468390caa501e8e9488f671c9cb961ec3","observation_id":"d0f6657d-6789-4ca2-a6f7-4dcdb6d7b6c8","resolution":{"observed_at":"2026-08-06T15:29:11.323765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-07-06T17:01:40.744034Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-06T15:08:35.405743Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16704","last_updated":"2025-07-22T15:38:12Z","snapshot_observed_at":"2026-08-07T17:17:14.473662Z","submitted_at":"2025-07-22T15:38:12Z","title":"Screen2AX: Vision-Based Approach for Automatic macOS Accessibility Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:08:35.405743Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2507.16704"},"observation_digest":"sha256:ab6d1839ea55ec533904014667c1ed9a14c338a42aa78ce12bf539668d280b59","observation_id":"c8769967-487a-4cb0-973a-086bfb325e7f","resolution":{"observed_at":"2026-08-06T15:08:35.405743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-07-06T17:01:40.744034Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-06T01:01:07.165776Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.04025","last_updated":"2025-08-06T02:38:02Z","snapshot_observed_at":"2026-08-07T12:39:39.663911Z","submitted_at":"2025-08-06T02:38:02Z","title":"Uncertainty-Aware GUI Agent: Adaptive Perception through Component Recommendation and Human-in-the-Loop Refinement","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T01:01:07.165776Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2508.04025"},"observation_digest":"sha256:78a5ad0dde0eb7ce02ba55d17161f958f1fbe942bf7d71fec408a3d144cd903a","observation_id":"b9019cd6-d586-44bf-9fd8-a4568a2e5b9c","resolution":{"observed_at":"2026-08-06T01:01:07.165776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-07-06T17:01:40.744034Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-05T23:55:48.651764Z","title":"Cogagent: A visual language model for GUI agents","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.04700","last_updated":"2025-08-12T15:11:53Z","snapshot_observed_at":"2026-08-07T09:56:01.664660Z","submitted_at":"2025-08-06T17:58:46Z","title":"SEAgent: Self-Evolving Computer Use Agent with Autonomous Learning from Experience","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T23:55:48.651764Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2508.04700"},"observation_digest":"sha256:dc12627f81688ee8921b4cf5af3b5be56a161c764cc16b707b03bbcb53210832","observation_id":"174dd392-0872-481e-9294-fc014b238dca","resolution":{"observed_at":"2026-08-05T23:55:48.651764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-07-06T17:01:40.744034Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-05T17:45:20.465838Z","title":"CogAgent: A Visual Language Model for GUI Agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.16688","last_updated":"2025-08-21T18:39:35Z","snapshot_observed_at":"2026-08-05T17:45:17.114121Z","submitted_at":"2025-08-21T18:39:35Z","title":"Cybernaut: Towards Reliable Web Automation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:20.465838Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2508.16688"},"observation_digest":"sha256:6270a79cf53e96b5f8cb0ba05f95a0426423acadd88805aca8a8e793bd3fe3a9","observation_id":"0aeabdef-01b3-41ce-91ab-3bbc1577c9e6","resolution":{"observed_at":"2026-08-05T17:45:20.465838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-07-06T17:01:40.744034Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-05T15:19:50.628996Z","title":"Cogagent: A visual language model for GUI agents","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20096","last_updated":"2025-08-27T17:59:50Z","snapshot_observed_at":"2026-08-05T15:19:32.265779Z","submitted_at":"2025-08-27T17:59:50Z","title":"CODA: Coordinating the Cerebrum and Cerebellum for a Dual-Brain Computer Use Agent with Decoupled Reinforcement Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:50.628996Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2508.20096"},"observation_digest":"sha256:b32d2f677c9506ca51200a770ef8b7ceb7c26701fd8fed8c7963330c9300ff0c","observation_id":"0f880a2d-6315-4c62-ae82-8b20b54c5721","resolution":{"observed_at":"2026-08-05T15:19:50.628996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-07-06T17:01:40.744034Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-05T13:34:59.368315Z","title":"arXiv:2312.08914 [cs.CV] https://arxiv.org/abs/2312.08914","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.00531","last_updated":"2025-08-30T15:24:47Z","snapshot_observed_at":"2026-08-07T16:52:46.214045Z","submitted_at":"2025-08-30T15:24:47Z","title":"MobiAgent: A Systematic Framework for Customizable Mobile Agents","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T13:34:59.368315Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2509.00531"},"observation_digest":"sha256:80a72c7cf24cdeb7f71bab8520892e923290be509bf32339b71697798b1ca96f","observation_id":"56f30723-c351-4607-9e16-bbe77c31f994","resolution":{"observed_at":"2026-08-05T13:34:59.368315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-07-06T17:01:40.744034Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-04T09:03:38.142743Z","title":"Cogagent: A visual language model for gui agents.arXiv preprint arXiv:2312.08914,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.17790","last_updated":"2026-05-26T11:29:37Z","snapshot_observed_at":"2026-08-04T09:03:36.135394Z","submitted_at":"2025-10-20T17:48:26Z","title":"UltraCUA: A Foundation Model for Computer Use Agents with Hybrid Action","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T09:03:38.142743Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2510.17790"},"observation_digest":"sha256:9e1af35440e47e27452d249fc4de8372ddebbe624a4d877f092f94dc284c2aa2","observation_id":"54e9756b-4558-43e2-8a15-858c219cc315","resolution":{"observed_at":"2026-08-04T09:03:38.142743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-07-06T17:01:40.744034Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-03T23:06:04.882108Z","title":"Cogagent: A visual language model for gui agents","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-07T05:40:52.575532Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:04.882108Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:fa968a2e99d2cc166b4ebae6f2345c864ab6130dc6f26a2a2459dfbb788d9adc","observation_id":"3be052ac-8eed-4fad-9a52-bf977b2ebc20","resolution":{"observed_at":"2026-08-03T23:06:04.882108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-07-06T17:01:40.744034Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-02T20:51:41.781289Z","title":"Cogagent: A visual language model for gui agents, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.22190","last_updated":"2026-05-25T21:32:44Z","snapshot_observed_at":"2026-08-02T20:51:33.578240Z","submitted_at":"2026-02-25T18:34:57Z","title":"GUI-Libra: Training Native GUI Agents to Reason and Act with Action-aware Supervision and Partially Verifiable RL","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-02T20:51:41.781289Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2602.22190"},"observation_digest":"sha256:c054ea145093c6392704012332fe31f8b7c68f9c8039fc8e8fd6cb63a4686ceb","observation_id":"0ed4a0e8-0cda-4841-95b3-4d180ee4915f","resolution":{"observed_at":"2026-08-02T20:51:41.781289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-07-06T17:01:40.744034Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-07-13T15:29:31.834566Z","title":"arXiv preprint arXiv:2312.08914 (2024) 4","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.29943","last_updated":"2026-07-10T15:58:11Z","snapshot_observed_at":"2026-08-07T09:23:25.859554Z","submitted_at":"2026-03-31T16:16:17Z","title":"Diagnosing Long-Video Quantitative Reasoning in Multimodal LLMs via Enumeration and Counting","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-13T15:29:31.834566Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2603.29943"},"observation_digest":"sha256:718aba5a3e49204b813b685c6ca6bdf4c1b4567171f8ba1e7646e42c9112df92","observation_id":"db48a1f3-5977-4056-9f33-511c1ac79750","resolution":{"observed_at":"2026-07-13T15:29:31.834566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-07-06T17:01:40.744034Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":"2312.08914","doi":"10.48550/arxiv.2312.08914","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cogagent: A visual language model for gui agents","venue":"arXiv (Cornell University)","work_id":"11c41075-0a02-4367-b0f1-4a89b4f4d008","year":2024},"citing_paper":{"arxiv_id":"2604.08516","last_updated":"2026-04-09T17:54:02Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:54:02Z","title":"MolmoWeb: Open Visual Web Agent and Open Data for the Open Web","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T18:00:34.401698Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2604.08516"},"observation_digest":"sha256:45819ba7d4daeaa881170e988635dcb9a22ea5eee6c27f2be1cdaade10cc3326","observation_id":"dd3a4c5c-dccb-4200-8e20-0c5f3b88b3e8","resolution":{"observed_at":"2026-05-11T05:40:58.721350Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-07-06T17:01:40.744034Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":"2312.08914","doi":"10.48550/arxiv.2312.08914","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cogagent: A visual language model for gui agents","venue":"arXiv (Cornell University)","work_id":"11c41075-0a02-4367-b0f1-4a89b4f4d008","year":2024},"citing_paper":{"arxiv_id":"2604.14113","last_updated":"2026-04-15T17:32:28Z","snapshot_observed_at":"2026-07-06T23:02:00.082783Z","submitted_at":"2026-04-15T17:32:28Z","title":"UI-Zoomer: Uncertainty-Driven Adaptive Zoom-In for GUI Grounding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T14:06:55.472857Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2604.14113"},"observation_digest":"sha256:3fec86f438da0524b14dd97a55ec3885b4b1c0f0c80b5094b16f7b94935d6811","observation_id":"b3b6f78c-33cd-47bf-890b-39f1bd64ead3","resolution":{"observed_at":"2026-05-10T14:10:28.874668Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-07-06T17:01:40.744034Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":"2312.08914","doi":"10.48550/arxiv.2312.08914","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cogagent: A visual language model for gui agents","venue":"arXiv (Cornell University)","work_id":"11c41075-0a02-4367-b0f1-4a89b4f4d008","year":2024},"citing_paper":{"arxiv_id":"2604.26622","last_updated":"2026-04-29T12:49:30Z","snapshot_observed_at":"2026-07-06T23:12:15.279847Z","submitted_at":"2026-04-29T12:49:30Z","title":"OCR-Memory: Optical Context Retrieval for Long-Horizon Agent Memory","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-07T10:45:48.976501Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2604.26622"},"observation_digest":"sha256:5462feba60faff243eab71c12f450a8dd0a68fb9234eb300a4bd2bd373d4d093","observation_id":"8a73181f-a9c7-45ae-99e5-6d60903a08d1","resolution":{"observed_at":"2026-05-12T09:31:25.492638Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-07-06T17:01:40.744034Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":"2312.08914","doi":"10.48550/arxiv.2312.08914","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cogagent: A visual language model for gui agents","venue":"arXiv (Cornell University)","work_id":"11c41075-0a02-4367-b0f1-4a89b4f4d008","year":2024},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-14T19:05:36.511150Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:93d33b0645d410e07c6662d41cdd65cda3759226eba58c083bcf81ac81f3580c","observation_id":"85007b8e-8431-49fe-82af-c599ef7c4e98","resolution":{"observed_at":"2026-05-14T19:07:51.413266Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-07-06T17:01:40.744034Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":"2312.08914","doi":"10.48550/arxiv.2312.08914","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cogagent: A visual language model for gui agents","venue":"arXiv (Cornell University)","work_id":"11c41075-0a02-4367-b0f1-4a89b4f4d008","year":2024},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-15T05:59:44.669877Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:b9d35dc49b5a192a591f14c086d8e738527e94569a912caebe6cb3fa01702980","observation_id":"27da449a-793a-4628-95e2-045219275cd9","resolution":{"observed_at":"2026-05-15T05:59:48.175276Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-07-06T17:01:40.744034Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":"2312.08914","doi":"10.48550/arxiv.2312.08914","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cogagent: A visual language model for gui agents","venue":"arXiv (Cornell University)","work_id":"11c41075-0a02-4367-b0f1-4a89b4f4d008","year":2024},"citing_paper":{"arxiv_id":"2605.13527","last_updated":"2026-06-01T11:38:10Z","snapshot_observed_at":"2026-07-06T23:25:07.022065Z","submitted_at":"2026-05-13T13:40:31Z","title":"MMSkills: Towards Multimodal Skills for General Visual Agents","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T21:31:20.079403Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2605.13527"},"observation_digest":"sha256:400fe1336f3aaf5139567d7a6ea7cb242be0c10d3bc0ed5cba121e7d88d6aff6","observation_id":"94636b68-cf0c-4e6c-ae31-eed6da1a0af7","resolution":{"observed_at":"2026-06-30T21:35:04.557252Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-07-06T17:01:40.744034Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":"2312.08914","doi":"10.48550/arxiv.2312.08914","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cogagent: A visual language model for gui agents","venue":"arXiv (Cornell University)","work_id":"11c41075-0a02-4367-b0f1-4a89b4f4d008","year":2024},"citing_paper":{"arxiv_id":"2605.25160","last_updated":"2026-06-18T02:24:07Z","snapshot_observed_at":"2026-08-03T08:02:05.766526Z","submitted_at":"2026-05-24T16:33:14Z","title":"ScaleWoB: Guiding GUI Agents with Coding Agents via Large-Scale Environmental Synthesis","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-30T10:57:59.013811Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2605.25160"},"observation_digest":"sha256:ff63b592a940a13287aa188be7fd57b0b968153ffcde57e6addd75b8298a08cb","observation_id":"7c800237-0192-4771-8bc4-b9d0d66db98d","resolution":{"observed_at":"2026-06-30T11:04:37.662147Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-07-06T17:01:40.744034Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":"2312.08914","doi":"10.48550/arxiv.2312.08914","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cogagent: A visual language model for gui agents","venue":"arXiv (Cornell University)","work_id":"11c41075-0a02-4367-b0f1-4a89b4f4d008","year":2024},"citing_paper":{"arxiv_id":"2605.25343","last_updated":"2026-05-25T01:57:43Z","snapshot_observed_at":"2026-07-06T23:35:16.647496Z","submitted_at":"2026-05-25T01:57:43Z","title":"Toward Native Multimodal Modeling: A Roadmap","version":1},"reference_index":168,"source":"pdf_text","source_observed_at":"2026-06-29T22:58:38.610609Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2605.25343"},"observation_digest":"sha256:900c524cc3908467dab0d00269f3148aa38501c88bc64acb8865f72ff4cfd7b9","observation_id":"d44059e2-596b-4f0b-b5e0-6fb567de06a8","resolution":{"observed_at":"2026-06-29T23:04:02.060945Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-07-06T17:01:40.744034Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":"2312.08914","doi":"10.48550/arxiv.2312.08914","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cogagent: A visual language model for gui agents","venue":"arXiv (Cornell University)","work_id":"11c41075-0a02-4367-b0f1-4a89b4f4d008","year":2024},"citing_paper":{"arxiv_id":"2605.29400","last_updated":"2026-05-28T05:49:36Z","snapshot_observed_at":"2026-08-06T18:01:03.220098Z","submitted_at":"2026-05-28T05:49:36Z","title":"Architecture-Sensitive Supervised Fine-Tuning for Screen-Conditioned Action Prediction: A PiSAR Benchmark","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T07:38:35.829605Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2605.29400"},"observation_digest":"sha256:b5f6922392a1a396c7857e38541b3e10fd5edec1c77e7d6472aaba47e9fa1343","observation_id":"546643e6-e15f-424f-94c6-5f61d0749a71","resolution":{"observed_at":"2026-06-29T07:43:13.153036Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-07-06T17:01:40.744034Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":"2312.08914","doi":"10.48550/arxiv.2312.08914","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cogagent: A visual language model for gui agents","venue":"arXiv (Cornell University)","work_id":"11c41075-0a02-4367-b0f1-4a89b4f4d008","year":2024},"citing_paper":{"arxiv_id":"2605.30884","last_updated":"2026-05-29T06:17:53Z","snapshot_observed_at":"2026-07-06T23:40:07.833692Z","submitted_at":"2026-05-29T06:17:53Z","title":"GUI-C$^2$: Coarse-to-Fine GUI Grounding via Difficulty-Aware Reinforcement Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-28T22:52:04.755523Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2605.30884"},"observation_digest":"sha256:d04b3a9883db7500566724809d6ec5394c488feb47f4aba95f9dec4ab23d191b","observation_id":"65db81a9-6606-4ac4-a108-bae0d9e901bf","resolution":{"observed_at":"2026-06-28T22:52:44.696258Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-07-06T17:01:40.744034Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":"2312.08914","doi":"10.48550/arxiv.2312.08914","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cogagent: A visual language model for gui agents","venue":"arXiv (Cornell University)","work_id":"11c41075-0a02-4367-b0f1-4a89b4f4d008","year":2024},"citing_paper":{"arxiv_id":"2606.17030","last_updated":"2026-06-17T13:54:57Z","snapshot_observed_at":"2026-08-01T21:48:31.832288Z","submitted_at":"2026-06-15T17:52:31Z","title":"Qwen-RobotWorld Technical Report: Unifying Embodied World Modeling through Language-Conditioned Video Generation","version":3},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-06-27T04:19:26.332718Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2606.17030"},"observation_digest":"sha256:7228d156f49be206eb3fc9f7a2cd2b24dfc6d258f3bdf14ef422f1400e2c0012","observation_id":"749f98ca-d7b8-49b0-9933-53d2beb899bc","resolution":{"observed_at":"2026-07-03T17:18:44.013381Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-07-06T17:01:40.744034Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":"2312.08914","doi":"10.48550/arxiv.2312.08914","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cogagent: A visual language model for gui agents","venue":"arXiv (Cornell University)","work_id":"11c41075-0a02-4367-b0f1-4a89b4f4d008","year":2024},"citing_paper":{"arxiv_id":"2606.17321","last_updated":"2026-06-15T22:04:11Z","snapshot_observed_at":"2026-07-06T23:52:57.359941Z","submitted_at":"2026-06-15T22:04:11Z","title":"ProCUA-SFT Technical Report","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T03:18:04.149281Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2606.17321"},"observation_digest":"sha256:b26a9811252561decbd06f2e7a73280bc068b9e51e06dec103079828272f0680","observation_id":"84ef5e59-b519-46dd-bf4d-9381a206014c","resolution":{"observed_at":"2026-07-03T18:08:46.718222Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-07-06T17:01:40.744034Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":"2312.08914","doi":"10.48550/arxiv.2312.08914","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cogagent: A visual language model for gui agents","venue":"arXiv (Cornell University)","work_id":"11c41075-0a02-4367-b0f1-4a89b4f4d008","year":2024},"citing_paper":{"arxiv_id":"2606.20717","last_updated":"2026-06-16T15:31:33Z","snapshot_observed_at":"2026-08-03T03:41:11.931921Z","submitted_at":"2026-06-16T15:31:33Z","title":"MIRAGE: Stealthy Visual Prompt Injection for Vulnerability Detection in Web Agents","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-27T00:54:00.944706Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2606.20717"},"observation_digest":"sha256:c91922c4a2134787387abd4a52fe701994945103ce4a2829387d7961cbeec828","observation_id":"bd8d87a1-6bcc-4cfd-84ef-01068cbd907e","resolution":{"observed_at":"2026-07-03T21:08:58.345016Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-07-06T17:01:40.744034Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":"2312.08914","doi":"10.48550/arxiv.2312.08914","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cogagent: A visual language model for gui agents","venue":"arXiv (Cornell University)","work_id":"11c41075-0a02-4367-b0f1-4a89b4f4d008","year":2024},"citing_paper":{"arxiv_id":"2606.29445","last_updated":"2026-06-28T15:11:19Z","snapshot_observed_at":"2026-08-02T18:05:44.581086Z","submitted_at":"2026-06-28T15:11:19Z","title":"Bridging VideoQA and Video-Guided Agentic Tasks via Generalized Keyframe Extraction","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T07:48:01.719339Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2606.29445"},"observation_digest":"sha256:8f9298dc919e8ebddd0168e2ee5e829fd791281c5701b264a7c3b18ceb6172d1","observation_id":"fe492bcf-aa7d-4260-9aad-21ab9317c5e1","resolution":{"observed_at":"2026-06-30T07:54:22.413201Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-07-06T17:01:40.744034Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":"2312.08914","doi":"10.48550/arxiv.2312.08914","metadata_source":"arxiv_reference","pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cogagent: A visual language model for gui agents","venue":"arXiv (Cornell University)","work_id":"11c41075-0a02-4367-b0f1-4a89b4f4d008","year":2024},"citing_paper":{"arxiv_id":"2606.29537","last_updated":"2026-07-13T10:30:17Z","snapshot_observed_at":"2026-07-17T23:18:06.822637Z","submitted_at":"2026-06-28T17:59:17Z","title":"OSWorld 2.0: Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-30T07:10:38.909339Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2606.29537"},"observation_digest":"sha256:9b905c29974ff10203f2637ead687290e6c9e7f6e360f1a74605080390036622","observation_id":"959a6d74-e4cc-420b-8379-73eb220a464b","resolution":{"observed_at":"2026-06-30T07:14:21.193108Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-07-06T17:01:40.744034Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-07-15T10:24:53.345620Z","title":"CogAgent: A visual language model for GUI agents, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.29537","last_updated":"2026-07-13T10:30:17Z","snapshot_observed_at":"2026-07-17T23:18:06.822637Z","submitted_at":"2026-06-28T17:59:17Z","title":"OSWorld 2.0: Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-15T10:24:53.345620Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2606.29537"},"observation_digest":"sha256:12b041e3f7d6e7b1de01ed15330176379a07c303efc6734b90c1d642ac04c754","observation_id":"a12d611d-2687-48b6-b2bc-a2aa74e42147","resolution":{"observed_at":"2026-07-15T10:24:53.345620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-07-06T17:01:40.744034Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-07-14T03:31:19.309532Z","title":"arXiv:2312.08914 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11738","last_updated":"2026-07-13T16:00:03Z","snapshot_observed_at":"2026-08-06T12:36:13.363835Z","submitted_at":"2026-07-13T16:00:03Z","title":"Qwen-Audio-VAE Technical Report","version":1},"reference_index":110,"source":"arxiv_source","source_observed_at":"2026-07-14T03:31:19.309532Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2607.11738"},"observation_digest":"sha256:10147ce9d854909f7f7ebdde4080467e781e7fac477b05da13c20912870badf6","observation_id":"ab5b6383-dd99-419b-b36e-d40de6cb68c1","resolution":{"observed_at":"2026-07-14T03:31:19.309532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-07-06T17:01:40.744034Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-07-31T10:42:21.217308Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28341","last_updated":"2026-07-30T15:07:00Z","snapshot_observed_at":"2026-08-04T02:02:27.774896Z","submitted_at":"2026-07-30T15:07:00Z","title":"Capturing Token Tendencies for Training-Free Token Pruning in Multimodal Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-31T10:42:21.217308Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2607.28341"},"observation_digest":"sha256:e41a2e75b87ea4171a60f81ea5a996f0b6d249a5a27cbf4440bd7b7ae08fa7ec","observation_id":"3e873257-3ded-4458-b51d-c2dc656c60c2","resolution":{"observed_at":"2026-07-31T10:42:21.217308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-07-06T17:01:40.744034Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-07T21:40:39.900263Z","title":"arXiv:2312.08914","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05891","last_updated":"2026-08-06T11:15:41Z","snapshot_observed_at":"2026-08-08T08:17:24.975436Z","submitted_at":"2026-08-06T11:15:41Z","title":"AppDeltaWorld: Transition-Grounded Delta Code World Model for Mobile GUI Agents","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T21:40:39.900263Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2608.05891"},"observation_digest":"sha256:103d64dd09f575e50a4174968f20819b12b970ee8267b5d86493e0c9b887ab84","observation_id":"19c92063-4d6b-49e1-96ae-3daa64838819","resolution":{"observed_at":"2026-08-07T21:40:39.900263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2312.08914/citation-record","integrity":"/paper/2312.08914/integrity","json":"/paper/2312.08914/citation-record.json","paper":"/paper/2312.08914"},"outbound":[],"paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T17:01:40.744034Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 46 inbound Pith citation observations for arXiv:2312.08914."}