{"as_of":"2026-08-05T11:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bce417c52a0d498b6d454a152b48921413e833c5ea38dbe69911013cd52d096d","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T23:06:05.164684Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T23:04:30.614443Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"cited_work":{"arxiv_id":"2511.07332","doi":"10.48550/arxiv.2511.07332","metadata_source":"pith","pith_arxiv_id":"2511.07332","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Grounding Computer Use Agents on Human Demonstrations","venue":"cs.LG","work_id":"9a131621-770b-4b5e-958c-93046b5aae28","year":2025},"citing_paper":{"arxiv_id":"2606.31270","last_updated":"2026-06-30T07:44:37Z","snapshot_observed_at":"2026-07-07T00:04:58.486133Z","submitted_at":"2026-06-30T07:44:37Z","title":"Learning from Failure: Inference-Time Self-Improvement for Computer-Use Agents","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-01T06:17:02.089012Z"},"links":{"cited_paper":"/paper/2511.07332","citing_paper":"/paper/2606.31270"},"observation_digest":"sha256:f00c7b4952ba0c1dc6bc2e66cd8c67f1dab845f181a8b562044c45e4766b762c","observation_id":"0ec72790-d788-4785-b7e1-45667519951c","resolution":{"observed_at":"2026-07-01T06:25:27.077201Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.07332","snapshot_observed_at":"2026-07-31T23:04:30.614443Z","title":"Grounding computer use agents on human demonstrations.arXiv preprint arXiv:2511.07332,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24112","last_updated":"2026-07-27T07:54:08Z","snapshot_observed_at":"2026-08-03T19:03:05.472935Z","submitted_at":"2026-07-27T07:54:08Z","title":"Scaling GUI Agents with Visual State Transitions","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-31T23:04:30.614443Z"},"links":{"cited_paper":"/paper/2511.07332","citing_paper":"/paper/2607.24112"},"observation_digest":"sha256:cec52e8bd1634cd658061c80eb9a3e0b0bfaea8bf275f7eb022a945518b67345","observation_id":"04b2f6fd-ea41-4d62-8fea-e1e615b64cad","resolution":{"observed_at":"2026-07-31T23:04:30.614443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2511.07332/citation-record","integrity":"/paper/2511.07332/integrity","json":"/paper/2511.07332/citation-record.json","paper":"/paper/2511.07332"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-07-06T17:34:07.737296Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-08-03T23:06:03.723162Z","title":"Back to basics: Revisiting reinforce style optimization for learning from human feedback in llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:03.723162Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:c45dfcfb8307831c429fb07518a4587cdc40fc94657b3f66306535ced943d83b","observation_id":"db5a663d-829b-4f40-b22a-24782d24299c","resolution":{"observed_at":"2026-08-03T23:06:03.723162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:06:03.759451Z","title":"Introducing computer use, a new claude 3.5 sonnet, and claude 3.5 haiku, October 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:03.759451Z"},"links":{"citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:4d7ca40e1262ef7b879f67a89fb1c72ef8db8e1f36c20c1bf0f7837c628948b2","observation_id":"f6f83e6d-f09c-4f7d-b5e1-01fea13b3fd8","resolution":{"observed_at":"2026-08-03T23:06:03.759451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:06:03.869268Z","title":"Introducing claude 4, May 2025 a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:03.869268Z"},"links":{"citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:05acaa776d68baca7a83d6e9c219553b83d6a9b033b74b01896f92da135d575c","observation_id":"1a890876-d950-40c1-8e62-1c79b5f0bce4","resolution":{"observed_at":"2026-08-03T23:06:03.869268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:06:03.927242Z","title":"Introducing claude sonnet 4.5, September 2025 b","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:03.927242Z"},"links":{"citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:8df6e5d043be1a495bef1e74ba33b19602a965da263374130e3b02b6f8bc2fca","observation_id":"4517e066-3db1-4a29-abfa-ed3d3a2cb897","resolution":{"observed_at":"2026-08-03T23:06:03.927242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:06:04.010505Z","title":"The claude 3 model family: Opus, sonnet, haiku","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:04.010505Z"},"links":{"citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:254c0636a3600fcf923ded6da2340b2a95aa887440bbcf6e875a04fe79616a4a","observation_id":"d88d38fe-c582-4889-92a4-239dd373f2dc","resolution":{"observed_at":"2026-08-03T23:06:04.010505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.13731","last_updated":"2021-08-10T08:55:21Z","snapshot_observed_at":"2026-08-05T01:53:50.218795Z","submitted_at":"2021-07-29T03:51:36Z","title":"UIBert: Learning Generic Multimodal Representations for UI Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.13731","snapshot_observed_at":"2026-08-03T23:06:04.092873Z","title":"Uibert: Learning generic multimodal representations for ui understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:04.092873Z"},"links":{"cited_paper":"/paper/2107.13731","citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:c8cf0f93bb851fd8492ec0ef5784bffe740a2d5358939065b469e04de1ab9b42","observation_id":"ee618a87-2480-41c5-9e2f-0d8e6d64ca0a","resolution":{"observed_at":"2026-08-03T23:06:04.092873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-03T23:06:04.189598Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:04.189598Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:e56519a7e20941a62f49700fe41ab5f5755ec05d73b684aef4fa860a12c5e10d","observation_id":"132eac72-4afd-49c9-849e-02e1508e1fb8","resolution":{"observed_at":"2026-08-03T23:06:04.189598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-03T23:06:04.271966Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:04.271966Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:3a0074119da2a9d7867116dd481cb207b88e5f1608a5c1498959f6a1e149fe06","observation_id":"fb6fef7d-4d64-4185-a415-fed91fdece0c","resolution":{"observed_at":"2026-08-03T23:06:04.271966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17490","last_updated":"2025-05-29T02:43:50Z","snapshot_observed_at":"2026-07-06T18:51:28.182977Z","submitted_at":"2024-07-03T17:59:58Z","title":"AMEX: Android Multi-annotation Expo Dataset for Mobile GUI Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17490","snapshot_observed_at":"2026-08-03T23:06:04.431774Z","title":"Amex: Android multi-annotation expo dataset for mobile gui agents, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:04.431774Z"},"links":{"cited_paper":"/paper/2407.17490","citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:34073ea3a88efbb89633b393f919f5b053d01937f0158a1352989aa2c3bd01ad","observation_id":"0af08ad0-7566-4f86-9c1d-f4c834d7ba6c","resolution":{"observed_at":"2026-08-03T23:06:04.431774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11317","last_updated":"2025-05-30T07:30:07Z","snapshot_observed_at":"2026-08-03T01:36:55.704876Z","submitted_at":"2024-06-17T08:30:55Z","title":"GUICourse: From General Vision Language Models to Versatile GUI Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11317","snapshot_observed_at":"2026-08-03T23:06:04.595637Z","title":"Guicourse: From general vision language models to versatile gui agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:04.595637Z"},"links":{"cited_paper":"/paper/2406.11317","citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:8c60eb50e0f2c0e6b3dca9a8e5dd0d2d9f5276548ee25254c58b2d2d7d5704e8","observation_id":"b1624e81-117c-4a57-a075-11c4bff191bd","resolution":{"observed_at":"2026-08-03T23:06:04.595637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-03T23:06:04.647028Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:04.647028Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:cc98f0f2b12cd40b780350b18551524cf881230c280514d8519d3b5d1dc1baed","observation_id":"3c539971-c60d-419d-9ee3-6b1807e9002f","resolution":{"observed_at":"2026-08-03T23:06:04.647028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10935","last_updated":"2024-02-23T04:36:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-17T08:10:35Z","title":"SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10935","snapshot_observed_at":"2026-08-03T23:06:04.772053Z","title":"Seeclick: Harnessing gui grounding for advanced visual gui agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:04.772053Z"},"links":{"cited_paper":"/paper/2401.10935","citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:a947718b30283d9f47beeea9b80a0f93d298617d5820e4ad515a53b29d456f3d","observation_id":"07e05dca-9399-4ebc-98dd-4353d91f9d77","resolution":{"observed_at":"2026-08-03T23:06:04.772053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05595","last_updated":"2025-07-08T02:14:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-08T02:14:10Z","title":"PaddleOCR 3.0 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05595","snapshot_observed_at":"2026-08-03T23:06:04.793443Z","title":"Paddleocr 3.0 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:04.793443Z"},"links":{"cited_paper":"/paper/2507.05595","citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:8055842684ee88e6fea51dd9d69b4991e83549db6881a24f261a3903063f5bc8","observation_id":"8c19df76-e218-4b39-92bd-e4179ff26e7a","resolution":{"observed_at":"2026-08-03T23:06:04.793443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:06:04.835184Z","title":"Rico: A mobile app dataset for building data-driven design applications","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:04.835184Z"},"links":{"citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:3e8f1890fa3b24e0b65ecd7a2ef2e22f70d7fac2a9bf06db02fda86afa95f4e8","observation_id":"80cb7af6-73d2-4308-bb1f-272446823607","resolution":{"observed_at":"2026-08-03T23:06:04.835184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.15210","last_updated":"2025-05-29T23:35:10Z","snapshot_observed_at":"2026-07-06T20:40:15.895471Z","submitted_at":"2025-02-21T04:53:11Z","title":"PairBench: Are Vision-Language Models Reliable at Comparing What They See?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.15210","snapshot_observed_at":"2026-08-03T23:06:04.855888Z","title":"Pairbench: Are vision-language models reliable at comparing what they see?, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:04.855888Z"},"links":{"cited_paper":"/paper/2502.15210","citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:9b2005502122ad913e88e6a3d5a3b747165dbb98a691bce5b77b6db840841ff0","observation_id":"7a6a37c1-697a-44e6-a321-fbc5b1846e61","resolution":{"observed_at":"2026-08-03T23:06:04.855888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-03T23:06:04.860471Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:04.860471Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:7a2759a78a64a589e8596afb1ccaca330b74eb271ab3e0fc676015b5be7ed9e0","observation_id":"64e65654-9c14-4ad2-9ca1-f2ce6c155e36","resolution":{"observed_at":"2026-08-03T23:06:04.860471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05243","last_updated":"2025-06-17T15:06:02Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T17:47:50Z","title":"Navigating the Digital World as Humans Do: Universal Visual Grounding for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05243","snapshot_observed_at":"2026-08-03T23:06:04.872520Z","title":"Navigating the digital world as humans do: Universal visual grounding for gui agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:04.872520Z"},"links":{"cited_paper":"/paper/2410.05243","citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:0d5de7ffc9c5d069d59473f6ca9ba616dc1e04feeb0317c1adfb41783eb6c6a3","observation_id":"a68ee014-a1ed-4347-9653-66f0c360157a","resolution":{"observed_at":"2026-08-03T23:06:04.872520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-03T23:06:04.877333Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:04.877333Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:a6d3466b3a944e0f002edc478b0f98561484e69322bd3e03b16ef0e9c74c3e8d","observation_id":"541baa7e-2523-43be-b12a-811fa3045d01","resolution":{"observed_at":"2026-08-03T23:06:04.877333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-07-06T17:01:40.744034Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-03T23:06:04.882108Z","title":"Cogagent: A visual language model for gui agents","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:04.882108Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:00fda70c95d9297d31e5fa47efb8d9678c57c739f0d131d92ffad248b2a7aed4","observation_id":"3be052ac-8eed-4fad-9a52-bf977b2ebc20","resolution":{"observed_at":"2026-08-03T23:06:04.882108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-08-03T23:06:04.886225Z","title":"Kimi-vl technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:04.886225Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:19074f2557b11c6ac8654a034029f0e786e6e827afd5f72ef0e4fcfbb5988f34","observation_id":"ebf26015-b100-4edf-b917-5bb22bcb914e","resolution":{"observed_at":"2026-08-03T23:06:04.886225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:06:04.890498Z","title":"Screenspot-pro: Gui grounding for professional high-resolution computer use, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:04.890498Z"},"links":{"citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:5f00502efc9dcfc1362d96b018c5e4e29776529aac5f1e023724105ff473301a","observation_id":"2692efef-be89-4840-95c6-d25f1c5877a0","resolution":{"observed_at":"2026-08-03T23:06:04.890498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.03776","last_updated":"2020-06-05T02:11:56Z","snapshot_observed_at":"2026-07-06T09:18:39.151686Z","submitted_at":"2020-05-07T21:41:40Z","title":"Mapping Natural Language Instructions to Mobile UI Action Sequences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.03776","snapshot_observed_at":"2026-08-03T23:06:04.894273Z","title":"Mapping natural language instructions to mobile ui action sequences","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:04.894273Z"},"links":{"cited_paper":"/paper/2005.03776","citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:467fe258c4ab3d1912b2f689250953889a024a2eadbcf580a6d5123b12643142","observation_id":"145bd27c-b809-44c4-8ae2-eed3d721b7fc","resolution":{"observed_at":"2026-08-03T23:06:04.894273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.04295","last_updated":"2020-10-08T22:56:03Z","snapshot_observed_at":"2026-07-06T10:02:48.167825Z","submitted_at":"2020-10-08T22:56:03Z","title":"Widget Captioning: Generating Natural Language Description for Mobile User Interface Elements","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.04295","snapshot_observed_at":"2026-08-03T23:06:04.899120Z","title":"Widget captioning: Generating natural language description for mobile user interface elements","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:04.899120Z"},"links":{"cited_paper":"/paper/2010.04295","citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:8207667f144fafb7e966124ea6cc6aebc21acf1593e196684e8a2fe09ca8bd0c","observation_id":"fc2bc87a-0c3b-4c8c-928e-c3c69892ab03","resolution":{"observed_at":"2026-08-03T23:06:04.899120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17465","last_updated":"2024-11-26T14:29:47Z","snapshot_observed_at":"2026-07-06T19:57:18.481261Z","submitted_at":"2024-11-26T14:29:47Z","title":"ShowUI: One Vision-Language-Action Model for GUI Visual Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17465","snapshot_observed_at":"2026-08-03T23:06:04.903445Z","title":"Showui: One vision-language-action model for gui visual agent, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:04.903445Z"},"links":{"cited_paper":"/paper/2411.17465","citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:199205c11720447d8d1e3191b23b434c700f687c766d6759f54b3b756724c38c","observation_id":"8a3e9fe5-f353-494a-8a6d-e3914f42405a","resolution":{"observed_at":"2026-08-03T23:06:04.903445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14239","last_updated":"2025-04-19T09:25:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-19T09:25:55Z","title":"InfiGUI-R1: Advancing Multimodal GUI Agents from Reactive Actors to Deliberative Reasoners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14239","snapshot_observed_at":"2026-08-03T23:06:05.022849Z","title":"Infigui-r1: Advancing multimodal gui agents from reactive actors to deliberative reasoners","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:05.022849Z"},"links":{"cited_paper":"/paper/2504.14239","citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:13875bd9d055574b6808d6b4dac315b5f4a6692a3df738b9d554e7bc92bb9823","observation_id":"41cf2645-2615-4ebf-9596-a599a9925136","resolution":{"observed_at":"2026-08-03T23:06:05.022849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:06:05.027595Z","title":"Infigui-g1: Advancing gui grounding with adaptive exploration policy optimization, 2025 b","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:05.027595Z"},"links":{"citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:2fb6e45c010d8d2f4b9bf3960dc73e60962db5858e3055d0bf0e7d19ced46f18","observation_id":"d4e603f6-a477-48cd-8a4b-42d5bb6f4cf0","resolution":{"observed_at":"2026-08-03T23:06:05.027595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21620","last_updated":"2025-05-24T08:46:08Z","snapshot_observed_at":"2026-08-01T20:06:59.931737Z","submitted_at":"2025-03-27T15:39:30Z","title":"UI-R1: Enhancing Efficient Action Prediction of GUI Agents by Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21620","snapshot_observed_at":"2026-08-03T23:06:05.031828Z","title":"Ui-r1: Enhancing efficient action prediction of gui agents by reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:05.031828Z"},"links":{"cited_paper":"/paper/2503.21620","citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:57e77f82560b9ddae714b5e3fd1ab6e13df0aae9b889468b14ed4fa19f3c6633","observation_id":"3903365b-e94f-48ea-8b1b-8fdcf5098803","resolution":{"observed_at":"2026-08-03T23:06:05.031828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10458","last_updated":"2025-10-01T04:55:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:45:54Z","title":"GUI-R1 : A Generalist R1-Style Vision-Language Action Model For GUI Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10458","snapshot_observed_at":"2026-08-03T23:06:05.036856Z","title":"Gui-r1: A generalist r1-style vision-language action model for gui agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:05.036856Z"},"links":{"cited_paper":"/paper/2504.10458","citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:09407b315daa17ece5f5d8330d1ba6ff48d428140197951b88e5376654cd1026","observation_id":"f56f0e0c-91d1-4670-8df5-b3bed901b4a7","resolution":{"observed_at":"2026-08-03T23:06:05.036856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:06:05.041552Z","title":"Pal, and Siva Reddy","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:05.041552Z"},"links":{"citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:623f6cbf25f0e96ebbf7b0b5f7e3a71ccfdbff945365c0a439845d6546051ae7","observation_id":"30082b38-2f76-44ba-b9f6-4e9faa5e01b8","resolution":{"observed_at":"2026-08-03T23:06:05.041552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16704","last_updated":"2025-07-22T15:38:12Z","snapshot_observed_at":"2026-07-06T22:01:07.517110Z","submitted_at":"2025-07-22T15:38:12Z","title":"Screen2AX: Vision-Based Approach for Automatic macOS Accessibility Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.16704","snapshot_observed_at":"2026-08-03T23:06:05.045839Z","title":"Screen2ax: Vision-based approach for automatic macos accessibility generation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:05.045839Z"},"links":{"cited_paper":"/paper/2507.16704","citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:d6ba1a249c5790492368c6166e60126593c0afbadb3157dcda74d4670568ed17","observation_id":"2f80533e-f05e-426c-b962-8a034b3f1312","resolution":{"observed_at":"2026-08-03T23:06:05.045839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15661","last_updated":"2025-05-06T17:43:11Z","snapshot_observed_at":"2026-07-06T20:55:42.402903Z","submitted_at":"2025-03-19T19:26:17Z","title":"UI-Vision: A Desktop-centric GUI Benchmark for Visual Perception and Interaction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15661","snapshot_observed_at":"2026-08-03T23:06:05.050263Z","title":"Rodriguez, Montek Kalsi, Rabiul Awal, Nicolas Chapados, M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:05.050263Z"},"links":{"cited_paper":"/paper/2503.15661","citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:6e23c98dc00b28b4f614a757b029d26772c257d95dfa8174c8768f8d5808406e","observation_id":"19cc78c7-807a-4275-a56d-bbaea56c9179","resolution":{"observed_at":"2026-08-03T23:06:05.050263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:06:05.054640Z","title":"Gpt-4 technical report, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:05.054640Z"},"links":{"citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:0bc09dc1d8c09eb640f372fa6ab944b0a49bf560afe8c6f57963013e60ffcd5b","observation_id":"a946bda3-a81d-48f8-b7b7-a23e294bfc93","resolution":{"observed_at":"2026-08-03T23:06:05.054640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:06:05.058756Z","title":"Hello gpt-4o, May 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:05.058756Z"},"links":{"citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:b05f582e56423fdd9d0e9dd29aab88e1b5597788bf66a0f59af891ad77791655","observation_id":"abaf55fa-aca8-440b-a07f-ec7cf4df51f9","resolution":{"observed_at":"2026-08-03T23:06:05.058756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:06:05.062690Z","title":"Introducing openai o3 and o4-mini, April 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:05.062690Z"},"links":{"citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:459ff9ff7b2a9bcf0c201fe0eb790c49b1897b41c13e32d1291ba8c2629577fe","observation_id":"9d0216bb-325a-45fc-8595-26832b4d0f08","resolution":{"observed_at":"2026-08-03T23:06:05.062690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:06:05.066497Z","title":"Computer-using agent, January 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:05.066497Z"},"links":{"citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:26a5729cd249e681009d7733165355f093b9c69ab1e5b9d9ac4c3da83fa3f61a","observation_id":"3cb7f3d3-942c-470f-92b2-0f1f51a12124","resolution":{"observed_at":"2026-08-03T23:06:05.066497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17557","last_updated":"2024-10-31T11:37:49Z","snapshot_observed_at":"2026-08-02T15:25:02.551919Z","submitted_at":"2024-06-25T13:50:56Z","title":"The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17557","snapshot_observed_at":"2026-08-03T23:06:05.070454Z","title":"The fineweb datasets: Decanting the web for the finest text data at scale, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:05.070454Z"},"links":{"cited_paper":"/paper/2406.17557","citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:1358aa44ea98f4d2147abccb023a84652e27ccc0e4950b1a82436b5c1ae275ef","observation_id":"0ad4ff3b-1f4e-47fa-a4e1-cc54372d4bf7","resolution":{"observed_at":"2026-08-03T23:06:05.070454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12326","last_updated":"2025-01-21T17:48:10Z","snapshot_observed_at":"2026-07-06T20:23:58.426780Z","submitted_at":"2025-01-21T17:48:10Z","title":"UI-TARS: Pioneering Automated GUI Interaction with Native Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12326","snapshot_observed_at":"2026-08-03T23:06:05.074681Z","title":"Ui-tars: Pioneering automated gui interaction with native agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:05.074681Z"},"links":{"cited_paper":"/paper/2501.12326","citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:8a07b96acd4ac925ef91853803dd0c1bcbc9ccb4e75a171c87cc1db9f512c8c6","observation_id":"1a55f357-d574-4b01-8254-feb21b05de15","resolution":{"observed_at":"2026-08-03T23:06:05.074681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:06:05.079123Z","title":"Seed1.5-vl technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:05.079123Z"},"links":{"citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:d3e35331b8630c28720f9225cc0ce92ab3ee6f5853884437e00d12daea69dc4c","observation_id":"f6c0b410-afb4-4c13-b8d2-ab2e4e955358","resolution":{"observed_at":"2026-08-03T23:06:05.079123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15846","last_updated":"2025-07-28T16:54:13Z","snapshot_observed_at":"2026-07-06T22:00:33.554745Z","submitted_at":"2025-07-21T17:53:42Z","title":"GUI-G$^2$: Gaussian Reward Modeling for GUI Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15846","snapshot_observed_at":"2026-08-03T23:06:05.083240Z","title":"Gui-g ^2 : Gaussian reward modeling for gui grounding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:05.083240Z"},"links":{"cited_paper":"/paper/2507.15846","citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:0d147cdfe32adcd5430eb8a3f734f9dcc755f5e51d7f39838e4f4799e7cae34d","observation_id":"4fe4186c-0dfd-4355-9368-bcb0d02d2150","resolution":{"observed_at":"2026-08-03T23:06:05.083240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:06:05.087509Z","title":"Charles, Zhilin Yang, and Tao Yu","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:05.087509Z"},"links":{"citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:20ced155317c2932de69c2b6b765a828a5e1964b2eb3919add2e2e4e2455864e","observation_id":"791cfe7f-1392-4c58-92dc-99985ed7c900","resolution":{"observed_at":"2026-08-03T23:06:05.087509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.19478","last_updated":"2025-07-25T17:59:26Z","snapshot_observed_at":"2026-07-06T22:02:56.216824Z","submitted_at":"2025-07-25T17:59:26Z","title":"MMBench-GUI: Hierarchical Multi-Platform Evaluation Framework for GUI Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.19478","snapshot_observed_at":"2026-08-03T23:06:05.091486Z","title":"Mmbench-gui: Hierarchical multi-platform evaluation framework for gui agents, 2025 b","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:05.091486Z"},"links":{"cited_paper":"/paper/2507.19478","citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:b582381333a9026a9e63fe33e228ca35d743bf5b6e2e402b3be5992c13d6f54a","observation_id":"c0785da3-2323-4630-8062-c38256276b9d","resolution":{"observed_at":"2026-08-03T23:06:05.091486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03143","last_updated":"2025-06-03T17:59:08Z","snapshot_observed_at":"2026-08-01T17:23:14.885858Z","submitted_at":"2025-06-03T17:59:08Z","title":"GUI-Actor: Coordinate-Free Visual Grounding for GUI Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03143","snapshot_observed_at":"2026-08-03T23:06:05.095782Z","title":"Gui-actor: Coordinate-free visual grounding for gui agents, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:05.095782Z"},"links":{"cited_paper":"/paper/2506.03143","citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:276a0c7f98e54457ed929de50c592d77f867c00852d622903b96cea1904280c1","observation_id":"cc67adb0-ad3d-45cf-9032-84a7d0066d70","resolution":{"observed_at":"2026-08-03T23:06:05.095782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23218","last_updated":"2024-10-30T17:10:19Z","snapshot_observed_at":"2026-08-05T06:30:40.974506Z","submitted_at":"2024-10-30T17:10:19Z","title":"OS-ATLAS: A Foundation Action Model for Generalist GUI Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23218","snapshot_observed_at":"2026-08-03T23:06:05.100005Z","title":"Os-atlas: A foundation action model for generalist gui agents, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:05.100005Z"},"links":{"cited_paper":"/paper/2410.23218","citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:9e0eb43fbc1bf32de19871b94a87199b8bac6ebdf25cf64adf57d6eaf0bb3cc4","observation_id":"9ad885b0-98c4-4a70-a2a0-ab4e74b19529","resolution":{"observed_at":"2026-08-03T23:06:05.100005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:06:05.104304Z","title":"Scaling computer-use grounding via user interface decomposition and synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:05.104304Z"},"links":{"citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:d9f7412821914b9d56413d4dbe4b4cd5f27ff88a2e81ea259501f7b132285ca6","observation_id":"c241e984-48ee-48d1-a161-aac21fd5e5aa","resolution":{"observed_at":"2026-08-03T23:06:05.104304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04454","last_updated":"2025-05-05T16:17:20Z","snapshot_observed_at":"2026-07-06T20:02:21.509050Z","submitted_at":"2024-12-05T18:58:26Z","title":"Aguvis: Unified Pure Vision Agents for Autonomous GUI Interaction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04454","snapshot_observed_at":"2026-08-03T23:06:05.108292Z","title":"Aguvis: Unified pure vision agents for autonomous gui interaction, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:05.108292Z"},"links":{"cited_paper":"/paper/2412.04454","citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:1885d01f46e5ac938d21cb29334d3c88cf76efc1734a924dc4d1f94dc68d81e2","observation_id":"252f6a0b-9823-4e5e-8632-07d32cdee3da","resolution":{"observed_at":"2026-08-03T23:06:05.108292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05791","last_updated":"2025-10-03T23:50:19Z","snapshot_observed_at":"2026-07-30T10:31:35.758747Z","submitted_at":"2025-07-08T08:52:18Z","title":"GTA1: GUI Test-time Scaling Agent","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05791","snapshot_observed_at":"2026-08-03T23:06:05.112420Z","title":"Gta1: Gui test-time scaling agent, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:05.112420Z"},"links":{"cited_paper":"/paper/2507.05791","citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:17eb1155831410b7d486f1305fb3e2189c66b451e837df1772f42377034094a5","observation_id":"904c39ff-6d7e-4fcf-9d71-04a9d42b3b3f","resolution":{"observed_at":"2026-08-03T23:06:05.112420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16256","last_updated":"2025-07-08T08:49:17Z","snapshot_observed_at":"2026-07-06T20:11:11.053567Z","submitted_at":"2024-12-20T07:16:57Z","title":"Aria-UI: Visual Grounding for GUI Instructions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16256","snapshot_observed_at":"2026-08-03T23:06:05.116719Z","title":"Aria-ui: Visual grounding for gui instructions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:05.116719Z"},"links":{"cited_paper":"/paper/2412.16256","citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:070a4e3145d9aa3710e859611da000ed639f37db5fc1dde3f754a14cbbdee3b8","observation_id":"2a0d68fa-d289-42b3-9585-00ff73872133","resolution":{"observed_at":"2026-08-03T23:06:05.116719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-03T23:06:05.120893Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:05.120893Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:fb833cc41d12c2c47f58fcf413c897979032cd1e3aced252764bb23f6b970069","observation_id":"39c88373-ecef-4384-98b7-96ae28f2ae29","resolution":{"observed_at":"2026-08-03T23:06:05.120893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05719","last_updated":"2024-04-08T17:55:44Z","snapshot_observed_at":"2026-07-06T17:57:19.117933Z","submitted_at":"2024-04-08T17:55:44Z","title":"Ferret-UI: Grounded Mobile UI Understanding with Multimodal LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05719","snapshot_observed_at":"2026-08-03T23:06:05.125194Z","title":"Ferret-ui: Grounded mobile ui understanding with multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:05.125194Z"},"links":{"cited_paper":"/paper/2404.05719","citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:4f41a805442c7000b54ab775c5531cba593c5e2bbd765ed8653b328b1f25cbf1","observation_id":"43c2731b-eb06-4e20-a0df-05925fa0582c","resolution":{"observed_at":"2026-08-03T23:06:05.125194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12370","last_updated":"2025-05-24T03:01:02Z","snapshot_observed_at":"2026-07-06T21:25:46.964896Z","submitted_at":"2025-05-18T11:22:04Z","title":"Enhancing Visual Grounding for GUI Agents via Self-Evolutionary Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12370","snapshot_observed_at":"2026-08-03T23:06:05.129224Z","title":"Enhancing visual grounding for gui agents via self-evolutionary reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:05.129224Z"},"links":{"cited_paper":"/paper/2505.12370","citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:e3a1f0e82fe253bdec36a3153fb53cfb9b65cc595f0f3e788b81f44214aaf21e","observation_id":"07994362-2fc5-4b60-b1d0-aa5f8acc1588","resolution":{"observed_at":"2026-08-03T23:06:05.129224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.23779","last_updated":"2025-07-31T17:59:09Z","snapshot_observed_at":"2026-08-02T07:44:26.612895Z","submitted_at":"2025-07-31T17:59:09Z","title":"Phi-Ground Tech Report: Advancing Perception in GUI Grounding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.23779","snapshot_observed_at":"2026-08-03T23:06:05.133513Z","title":"Phi-ground tech report: Advancing perception in gui grounding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:05.133513Z"},"links":{"cited_paper":"/paper/2507.23779","citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:b753747b34d31f49a1ccae1ec3e365d5877de7f4a530d2882398be4630917b06","observation_id":"83416878-8c17-4644-ada6-24ba4e533c2e","resolution":{"observed_at":"2026-08-03T23:06:05.133513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13372","last_updated":"2024-06-27T22:44:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-20T08:08:54Z","title":"LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13372","snapshot_observed_at":"2026-08-03T23:06:05.137899Z","title":"Llamafactory: Unified efficient fine-tuning of 100+ language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:05.137899Z"},"links":{"cited_paper":"/paper/2403.13372","citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:8c264877e5f17c822725c32d0608fd28752764a4f14d188c62848572a277590a","observation_id":"cd9c8c1f-38ca-4cd2-9a4a-137237691b3a","resolution":{"observed_at":"2026-08-03T23:06:05.137899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15810","last_updated":"2025-05-22T11:15:23Z","snapshot_observed_at":"2026-07-06T21:28:01.596548Z","submitted_at":"2025-05-21T17:59:09Z","title":"GUI-G1: Understanding R1-Zero-Like Training for Visual Grounding in GUI Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15810","snapshot_observed_at":"2026-08-03T23:06:05.142213Z","title":"Gui-g1: Understanding r1-zero-like training for visual grounding in gui agents, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:05.142213Z"},"links":{"cited_paper":"/paper/2505.15810","citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:adf8fba1ee8c9a31ae17067ed80658b9859eca33ae51195a349889d38d1a4394","observation_id":"c9a8f360-cb59-4cab-aaf8-d1ec47701775","resolution":{"observed_at":"2026-08-03T23:06:05.142213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-03T23:06:05.146662Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:05.146662Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:c7eccb1770961d0ad19a1a4b1e446501d2bedd0c24caeb946badc282270fcbc1","observation_id":"1fca5f60-7a81-410f-ac06-9d137edd8d6f","resolution":{"observed_at":"2026-08-03T23:06:05.146662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:06:05.150794Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:05.150794Z"},"links":{"citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:1d3bfda9d3fc36d5b89563402a659ab2779e9f24cad20bd999434eb2ba42e3a2","observation_id":"b09a5f94-b983-40bf-86fe-bd62549ecc16","resolution":{"observed_at":"2026-08-03T23:06:05.150794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:06:05.155526Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:05.155526Z"},"links":{"citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:e8062184e0764ba0bd6be9562d1d785a910e05b04b3b8dfa08f90b7dc44306bf","observation_id":"e22b0bbf-a435-436b-8203-d48599c18a41","resolution":{"observed_at":"2026-08-03T23:06:05.155526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:06:05.160524Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:05.160524Z"},"links":{"citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:44d36f3656464e914e72cea7523bf4bba548cf5d480a314335238abeada4e806","observation_id":"f5577c75-d9df-4344-8cf6-5626123e8a0d","resolution":{"observed_at":"2026-08-03T23:06:05.160524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T23:06:05.164684Z","title":"OK/Cancel","venue":null,"work_id":null,"year":1920},"citing_paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-03T23:06:05.164684Z"},"links":{"citing_paper":"/paper/2511.07332"},"observation_digest":"sha256:ff434504427cedace1d3bd102e98321e773adb1d5984bd5a00c758a74d2a8261","observation_id":"12afe2a4-83dc-459a-a2e0-5afe3c166f55","resolution":{"observed_at":"2026-08-03T23:06:05.164684Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2511.07332","last_updated":"2026-06-09T21:30:32Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-03T23:05:58.992115Z","submitted_at":"2025-11-10T17:35:21Z","title":"Grounding Computer Use Agents on Human Demonstrations"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":57,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 2 inbound Pith citation observations for arXiv:2511.07332."}