{"as_of":"2026-08-08T17:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4828c33bc51fcfda74d361cec333cd3febff6a76362939ecad2d9fe893b6be32","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:23:54.184865Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T05:41:45.971495Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-07T14:18:12.990027Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19095","snapshot_observed_at":"2026-08-03T05:41:45.971495Z","title":"findings-acl.1158/","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.01576","last_updated":"2026-05-23T02:41:44Z","snapshot_observed_at":"2026-08-03T05:41:42.857114Z","submitted_at":"2026-02-02T03:12:16Z","title":"Generative Visual Code Mobile World Models","version":2},"reference_index":1158,"source":"pdf_text","source_observed_at":"2026-08-03T05:41:45.971495Z"},"links":{"cited_paper":"/paper/2505.19095","citing_paper":"/paper/2602.01576"},"observation_digest":"sha256:de020430638516b83977fdab32487f06f44e7e9128ac3c1d78a318a7de9018c8","observation_id":"8b615e0f-a8f9-43db-ae7e-dc8bbecd39c8","resolution":{"observed_at":"2026-08-03T05:41:45.971495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.19095/citation-record","integrity":"/paper/2505.19095/integrity","json":"/paper/2505.19095/citation-record.json","paper":"/paper/2505.19095"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:50.136418Z","title":"Sparks of artificial general intelligence: Early experiments with gpt-4, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-07T14:18:12.990027Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:50.136418Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:f9af46abb439abacdaec0b913c76af10b3c2ab2163af491e184deb414682869a","observation_id":"a3292f4e-d09b-4932-ac08-d87145fcc796","resolution":{"observed_at":"2026-08-07T14:23:50.136418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:24:00.950414Z","title":"Large language model-brained gui agents: A survey, 2025","venue":null,"work_id":"7c6e3bd1-6541-4cbd-88d4-8041e74b9b3f","year":2025},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-07T14:18:12.990027Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:50.196977Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:0d28abfb04a404c03cc6140944ee2a553d0875ea48991dd56bcac32646836a7b","observation_id":"1841d92c-6bfd-4290-b630-bf9fea057644","resolution":{"observed_at":"2026-08-07T14:24:01.017196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03186","last_updated":"2024-07-02T17:23:13Z","snapshot_observed_at":"2026-08-01T15:59:13.226787Z","submitted_at":"2024-03-05T18:22:29Z","title":"Cradle: Empowering Foundation Agents Towards General Computer Control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03186","snapshot_observed_at":"2026-08-07T14:23:50.329553Z","title":"Karlsson, Bo An, Shuicheng Yan, and Zongqing Lu","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-07T14:18:12.990027Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:50.329553Z"},"links":{"cited_paper":"/paper/2403.03186","citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:d6da1e2b04b3bf47a543872fb0717383563c3b4f13c500b8232e96a8160d64f1","observation_id":"6a77df4c-1f84-49c8-9b50-0a4f2a18752e","resolution":{"observed_at":"2026-08-07T14:23:50.329553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07939","last_updated":"2024-05-23T05:18:58Z","snapshot_observed_at":"2026-08-01T11:47:21.821212Z","submitted_at":"2024-02-08T15:40:35Z","title":"UFO: A UI-Focused Agent for Windows OS Interaction","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07939","snapshot_observed_at":"2026-08-07T14:23:50.446874Z","title":"UFO: A UI-Focused Agent for Windows OS Interaction.arXiv preprint arXiv:2402.07939, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-07T14:18:12.990027Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:50.446874Z"},"links":{"cited_paper":"/paper/2402.07939","citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:2e99d520bde01ea710a3aa916564f71df6e9cc314daad986aa07180109172de1","observation_id":"5c695656-7c0b-46a4-9cd2-71e600cebf31","resolution":{"observed_at":"2026-08-07T14:23:50.446874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14603","last_updated":"2025-04-25T05:14:14Z","snapshot_observed_at":"2026-08-07T16:00:46.914904Z","submitted_at":"2025-04-20T13:04:43Z","title":"UFO2: The Desktop AgentOS","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14603","snapshot_observed_at":"2026-08-07T14:23:50.533706Z","title":"UFO2: The Desktop AgentOS.arXiv preprint arXiv:2504.14603, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-07T14:18:12.990027Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:50.533706Z"},"links":{"cited_paper":"/paper/2504.14603","citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:b60cf427847941cf9b7a205211e45fc182b96fef5f64c099a155fd114630f499","observation_id":"1180b532-608e-40c0-84ce-34287fb5ed8d","resolution":{"observed_at":"2026-08-07T14:23:50.533706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:24:00.782268Z","title":"Os-copilot: Towards generalist computer agents with self-improvement, 2024","venue":null,"work_id":"9a64d6ed-61cd-4dc4-8aeb-a3baf85d66eb","year":2024},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-07T14:18:12.990027Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:50.653068Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:ee2cea97ecad9e552a6cc0dc7e7c56c7c351ac067716b4ec82e3d0a06b922273","observation_id":"7e3b442b-7b62-4f51-b5d4-04109bb5290e","resolution":{"observed_at":"2026-08-07T14:24:00.863225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:24:00.646115Z","title":"Agent S: An Open Agentic Framework that Uses Computers Like a Human","venue":null,"work_id":"26e2c66a-67bb-4973-bc8f-9c9833950b53","year":2025},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-07T14:18:12.990027Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:50.798187Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:e611f7b315770e4a6d4260d02f8d6aaee8d0f55e1c487471c42672e461ebcca7","observation_id":"719eb583-a018-426e-b4fd-808772b9329d","resolution":{"observed_at":"2026-08-07T14:24:00.697254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:50.916548Z","title":"Agent s2: A compositional generalist-specialist framework for computer use agents, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-07T14:18:12.990027Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:50.916548Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:608cefb6973e3554bd21f3ef62199d798624a7fafcd387704f8ef1f16d4283f3","observation_id":"3aecce86-7dd7-452a-9d1c-b2f15167120b","resolution":{"observed_at":"2026-08-07T14:23:50.916548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:51.032073Z","title":"Cogagent: A visual language model for gui agents, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-07T14:18:12.990027Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:51.032073Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:d02994f067f27d6b7ca9ddc1c2c6a621cf96191966baad66bedde88f5692d76b","observation_id":"cd0ef37b-8122-4c27-bac6-cc395db8dfc7","resolution":{"observed_at":"2026-08-07T14:23:51.032073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:24:00.486772Z","title":"Rico: A mobile app dataset for building data-driven design applications","venue":null,"work_id":"e11d36d9-638d-4d18-8cc2-9fea615ef6d6","year":2017},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-07T14:18:12.990027Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:51.136114Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:baf77f3f1ba3860dd9d28e59d4bfe123b33a3bfd22da516532d533d6157c9758","observation_id":"48fa1991-cd94-40cf-a87c-51cee5b7bf73","resolution":{"observed_at":"2026-08-07T14:24:00.566044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:24:00.332845Z","title":null,"venue":null,"work_id":"d78210d1-fa41-415a-a8bf-3338cdb58a64","year":2021},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-07T14:18:12.990027Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:51.142987Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:3f83a80fb08578623958201db45f46b61b36c065afd54658200bbcfeb323955b","observation_id":"1b881989-0c6b-4acd-984d-a19925ff2f34","resolution":{"observed_at":"2026-08-07T14:24:00.398909Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:51.243633Z","title":"Mind2web: Towards a generalist agent for the web, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-07T14:18:12.990027Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:51.243633Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:6fd692a13e77782e013dc79ab08bfe04188a5ed930e32c90fbc996a43e77d766","observation_id":"6fa864d2-cb97-46a0-8ea2-36b9ad82eecf","resolution":{"observed_at":"2026-08-07T14:23:51.243633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:24:00.117211Z","title":"Mobilevlm: A vision-language model for better intra- and inter-ui understanding, 2024","venue":null,"work_id":"b8816e0b-6af3-48c7-9f0c-3e33c1ce6994","year":2024},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-07T14:18:12.990027Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:51.319588Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:ca969e23274ed1a53eef7f414118a2367f1d12d43a339c3819cc9a5cc7597d71","observation_id":"d925d938-98a7-4c27-9563-75995874c1dd","resolution":{"observed_at":"2026-08-07T14:24:00.221133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:59.931424Z","title":"Screenagent: A vision language model-driven computer control agent","venue":null,"work_id":"cbd9d057-60cb-42d1-8b72-b5cb3733c6cc","year":2024},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-07T14:18:12.990027Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:51.397691Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:d25f46c19bfc9754710651e89287d32152cc6c423380a5861822b6f4d2355d0d","observation_id":"45802f04-c31b-41af-b303-5f5aec6d7ad6","resolution":{"observed_at":"2026-08-07T14:24:00.030072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:59.795957Z","title":"Guicourse: From general vision language models to versatile gui agents, 2024","venue":null,"work_id":"f0616737-beaf-463f-8d60-889e4180c434","year":2024},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-07T14:18:12.990027Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:51.450062Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:a9a4c6bb7997ffee212f9aab785f13e5c347ce99b01ca0366e2e665af08ba6fc","observation_id":"bb6537af-054a-4da5-a473-c26b3676e54f","resolution":{"observed_at":"2026-08-07T14:23:59.839812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:51.520085Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-07T14:18:12.990027Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:51.520085Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:f70cb88d479b6d217f237d27c3b2adbd12d26ad25e27487e15097439fe013990","observation_id":"886679a2-9596-4cfd-a107-709612b1eeb9","resolution":{"observed_at":"2026-08-07T14:23:51.520085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:59.559611Z","title":"Exploration by random network distillation, 2018","venue":null,"work_id":"17ae6a39-452e-4cfb-bac0-d98502ccbb11","year":2018},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-07T14:18:12.990027Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:51.572170Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:3f62abfaac271168f7b67030502d89d473c3348f4fd7cbb4f4a933ab6a26033b","observation_id":"e31bcd74-d63b-4af6-abd7-bf2f386a552b","resolution":{"observed_at":"2026-08-07T14:23:59.702983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:59.287633Z","title":"Noveld: A simple yet effective exploration criterion","venue":null,"work_id":"e75e1972-a888-43d9-8a8f-e4a1c40b1e65","year":2021},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-07T14:18:12.990027Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:51.637693Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:11c7321821d70e60cf9aa8340d29ebc3865fdded9515524dc19ed8acc8518ff6","observation_id":"b1649282-0b2e-4782-9894-3caa7d3f2f54","resolution":{"observed_at":"2026-08-07T14:23:59.439194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:59.041109Z","title":"Diversity is all you need: Learning skills without a reward function, 2018","venue":null,"work_id":"989dd0b2-31f4-4c3d-8794-75dc4d204df2","year":2018},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-07T14:18:12.990027Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:51.709534Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:4bfd99df3ea6bc6c3de16e37931c22ea3bec7c6d2be676936ad606242f2ca24d","observation_id":"ed778763-8992-42f6-a376-fe4a98c01f69","resolution":{"observed_at":"2026-08-07T14:23:59.180697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:58.824667Z","title":"Dynamics- aware unsupervised discovery of skills, 2020","venue":null,"work_id":"756964fb-826a-4127-bc17-2cb5d0d43df4","year":2020},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-07T14:18:12.990027Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:51.792160Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:c563b399e82d288eab8bdd16eb70ed3559251abdb37658390f1b8fde6f386128","observation_id":"348e6354-4c97-465f-8459-04e07c87a687","resolution":{"observed_at":"2026-08-07T14:23:58.931445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:51.856964Z","title":"V oyager: An open-ended embodied agent with large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-07T14:18:12.990027Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:51.856964Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:e8029a2382a223c3f08d78382eeaf93ccc346e82737771ade2f47044a286ec20","observation_id":"1f1b9ca9-2968-48c8-815e-e07cfd6f13fc","resolution":{"observed_at":"2026-08-07T14:23:51.856964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:58.569193Z","title":"Tenenbaum, Tim Rocktäschel, and Edward Grefenstette","venue":null,"work_id":"3e1024e9-cb75-4e67-a7f9-c7e3f4bcdb1a","year":2021},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-07T14:18:12.990027Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:51.925314Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:b42e7efb63c3a300bbce24e188e2daa3796963b5321e9c15dac8ead90c7e01b3","observation_id":"d3ddebf6-0a95-449c-a878-6a69d9a06573","resolution":{"observed_at":"2026-08-07T14:23:58.697187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:58.331823Z","title":"Open-world reinforcement learning over long short-term imagination, 2025","venue":null,"work_id":"c65e69a1-9c4d-4af5-8785-9c29635449e4","year":2025},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-07T14:18:12.990027Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:51.995562Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:a81e7597e2ec894c483e0b377208c60b68bee15a617b1c64200896792557ab38","observation_id":"42fec0c1-8510-4a49-b151-716177ef56df","resolution":{"observed_at":"2026-08-07T14:23:58.434680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:58.108204Z","title":null,"venue":null,"work_id":"9e620e6b-fe01-4e93-b750-610b82a4704f","year":2024},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-07T14:18:12.990027Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:52.048337Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:c5f214f5362eebee041d163b6aaae0be122f064b0513bb4bbe64836d5db90497","observation_id":"49491ffc-7351-47d5-8892-51d8de8c3bae","resolution":{"observed_at":"2026-08-07T14:23:58.213090Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:52.112981Z","title":"Let’s verify step by step, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-07T14:18:12.990027Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:52.112981Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:ed8edf4d2ae5b7222f4bb9c63faffbd2d759d1a2f787c96187a1384db395597d","observation_id":"2bb7b0b7-315c-48c1-8316-171965c873eb","resolution":{"observed_at":"2026-08-07T14:23:52.112981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:57.730142Z","title":"Mutual reasoning makes smaller llms stronger problem-solvers, 2024","venue":null,"work_id":"4e0b9e27-f279-4fab-94a3-0b592d504ebd","year":2024},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-07T14:18:12.990027Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:52.194199Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:a2edd12675467c7af4ecf41f3717b7cc5bc7a760be51a96c2c529f9285d0dc10","observation_id":"bf34e17c-af05-4439-b861-23a6c1157da5","resolution":{"observed_at":"2026-08-07T14:23:57.879733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:57.465319Z","title":null,"venue":null,"work_id":"33e8f8f1-c4bb-4bc8-ba86-070e61601e8a","year":2025},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-07T14:18:12.990027Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:52.282678Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:eb5f0febef7cdbe6f6da5061b3139dc841485fa5846824b5b2f57db25ff2d439","observation_id":"75e9669b-d764-4dfb-9f92-bd04a518355e","resolution":{"observed_at":"2026-08-07T14:23:57.580006Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:57.222183Z","title":"Improving rl exploration for llm reasoning through retrospective replay, 2025","venue":null,"work_id":"0ed094e1-322d-4c1e-8966-5bb4883c7e81","year":2025},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-07T14:18:12.990027Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:52.361528Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:bd0b7c5e62044a2656f3fcd25f92e5b7526fb7365e13975f852d3f177ea3cb80","observation_id":"50337ece-f62a-480c-9e05-ee45f06b1f9f","resolution":{"observed_at":"2026-08-07T14:23:57.339753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:52.429742Z","title":"Ragen: Understanding self-evolution in llm agents via multi-turn reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-07T14:18:12.990027Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:52.429742Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:7c459bd6e1c4c9532c5cff7a154988b57a97f0966b1947880f18c24b7d550ad9","observation_id":"11e10259-1368-4963-8894-e494bb2886e9","resolution":{"observed_at":"2026-08-07T14:23:52.429742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:56.990151Z","title":"Showui: One vision-language-action model for gui visual agent, 2024","venue":null,"work_id":"01068ae6-687d-4534-a663-e30384a94af6","year":2024},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-07T14:18:12.990027Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:52.518291Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:09112d9aeff5e6b6b75098ca56a028cc4024c6e553c9cfb630e32b052db89577","observation_id":"3d6a367f-9159-4fd1-a787-d4c622a6410a","resolution":{"observed_at":"2026-08-07T14:23:57.071670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02006","last_updated":"2025-09-14T09:13:39Z","snapshot_observed_at":"2026-08-07T10:06:55.204010Z","submitted_at":"2024-11-04T11:50:58Z","title":"Foundations and Recent Trends in Multimodal Mobile Agents: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02006","snapshot_observed_at":"2026-08-07T14:23:52.565138Z","title":"Foundations and recent trends in multimodal mobile agents: A survey.arXiv preprint arXiv:2411.02006, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-07T14:18:12.990027Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:52.565138Z"},"links":{"cited_paper":"/paper/2411.02006","citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:4499c20cf1d4ce3bcd4cbaccd9238beadac53c03feef8d4cd984a7dbb2800098","observation_id":"cecc6fc2-b50f-4d92-a74d-9b6c27ccf459","resolution":{"observed_at":"2026-08-07T14:23:52.565138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:52.649898Z","title":"Mobile-agent: Autonomous multi-modal mobile device agent with visual perception, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-07T14:18:12.990027Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:52.649898Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:b551e851f2bdc176f19adc2e19aa2b27d8797dd893ca549567350bbf8a265eb5","observation_id":"4afb4400-b6a4-499d-aee7-52aa24ce6fb6","resolution":{"observed_at":"2026-08-07T14:23:52.649898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:56.818836Z","title":"Karlsson, Bo An, and Zongqing Lu","venue":null,"work_id":"b9818a9a-6c65-4feb-8708-06d8993a2f87","year":2024},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-07T14:18:12.990027Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:52.712806Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:adf514e095570cb867d859a6e76a89f78fb5cbf4351e0683b7b56becbfd50ebf","observation_id":"1dabb108-50d2-4c56-9727-06916e0d11a7","resolution":{"observed_at":"2026-08-07T14:23:56.896119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:52.805502Z","title":"Digirl: Training in-the-wild device-control agents with autonomous reinforcement learning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-07T14:18:12.990027Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:52.805502Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:1adefbec570ab69e5a04af0b6dd6548fa89f22d23fa81d34f9dbd4388b383cd1","observation_id":"603aca4e-1589-44d9-b2e3-cc95868b8c64","resolution":{"observed_at":"2026-08-07T14:23:52.805502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:52.879340Z","title":"Au- tonomous evaluation and refinement of digital agents, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-07T14:18:12.990027Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:52.879340Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:cd493cb081cb366e694e90101a64711ca2ef120673c99fc84016a822b7934353","observation_id":"7b25cece-4247-4994-9aff-d23e7f241afc","resolution":{"observed_at":"2026-08-07T14:23:52.879340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:56.680277Z","title":"Distrl: An asynchronous distributed reinforcement learning framework for on-device control agents, 2025","venue":null,"work_id":"bc460cad-4bbc-4c8f-ba1f-97e477fca19e","year":2025},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-07T14:18:12.990027Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:52.933677Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:c2008b92e2e7c587b4324dce9bf37d69d54dff6b49929ae89b0d0099ab45ac92","observation_id":"9ad340ca-1b8e-4042-98cc-5fde0cdcdf7c","resolution":{"observed_at":"2026-08-07T14:23:56.739056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:53.005703Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-07T14:18:12.990027Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:53.005703Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:74c53736c4097ad055bc8a3b2e2c7d8a0e2e53068cb284d4ff6b12e986610eb6","observation_id":"d425806b-2a29-469a-a0d3-1d1bfc839ac0","resolution":{"observed_at":"2026-08-07T14:23:53.005703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:53.064052Z","title":"Lee, and Sanjeev Arora","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-07T14:18:12.990027Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:53.064052Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:2376c58060428fff0808ec053f902983e6b7b579579e5fb007352f62f02f7262","observation_id":"fc3fc8ab-73cb-4653-847e-dd74aaca283d","resolution":{"observed_at":"2026-08-07T14:23:53.064052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:56.496694Z","title":"Mavor-Parker, Kimberly A","venue":null,"work_id":"1929d0d1-00e0-4bba-865c-cab3abd63e0e","year":2024},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-07T14:18:12.990027Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:53.173149Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:d96db1490a4f5aa157371cfda411843c29333cd279c086ceeeb918078a43673b","observation_id":"9b77a3f1-0941-45c4-8911-fe8a74a93566","resolution":{"observed_at":"2026-08-07T14:23:56.574673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:56.349978Z","title":"Space\") Key(","venue":null,"work_id":"becee88d-3077-48fe-bbf3-fe1857d09c5d","year":2023},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-07T14:18:12.990027Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:53.239568Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:f98b02f5751ea85353a8da0d39e28675a3dcca6516546ebdcfdabd2a4b9a2a25","observation_id":"7b0f6701-aea2-41c1-a5b0-fe99e6958354","resolution":{"observed_at":"2026-08-07T14:23:56.430888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:55.970650Z","title":null,"venue":null,"work_id":"f1613444-cd48-4e13-9d6f-94645d7b5eaf","year":null},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-07T14:18:12.990027Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:53.400607Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:b75627c528f99f2755284ad996597ef15da79b22ca2e59441126f9514b6934f0","observation_id":"b7539549-4679-4fa9-81f2-85e4947a2bdc","resolution":{"observed_at":"2026-08-07T14:23:56.085069Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:55.827973Z","title":null,"venue":null,"work_id":"5d6cd0bf-e88e-4e86-a70b-2a03744394d9","year":null},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-07T14:18:12.990027Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:53.495641Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:31d1c70efebcdd432dbcb5d29a1577db1f95759fade2ab1c3fa5f9780990afd3","observation_id":"56678f19-20c1-4a44-b7a7-65cf15b20809","resolution":{"observed_at":"2026-08-07T14:23:55.888651Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:55.643230Z","title":"In addition to manual filtering, we implemented an automated filtering process without human intervention, based on the following criteria:","venue":null,"work_id":"6ff3d862-66e7-4c66-9848-92f3ceffc444","year":null},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-07T14:18:12.990027Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:53.540034Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:ded0a6e3484a48f2baf3da64eca5a78d6760722b8eb49159a289e1ec7ec5455f","observation_id":"54fc38ff-24b8-4971-8a2e-031738810fe6","resolution":{"observed_at":"2026-08-07T14:23:55.736158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:56.187441Z","title":null,"venue":null,"work_id":"6ed9936d-6c18-48ef-9682-7e9008bc998c","year":null},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-07T14:18:12.990027Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:53.635922Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:9c43256d3ffb691ac8b9af24dd46da9059b5004e9e0e621714f4a6c2f1367cea","observation_id":"9f31d864-8f47-448f-8e2e-b3eaa504b84d","resolution":{"observed_at":"2026-08-07T14:23:56.285758Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:55.414960Z","title":null,"venue":null,"work_id":"a80860de-9cf6-488a-885c-1b9c2cd1eafd","year":null},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-07T14:18:12.990027Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:53.703424Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:08686a982719d4e68c81108df5fe02fc59b56d1297d8b9e70232fa509044a860","observation_id":"7880a239-c63d-4698-87b2-6399d3a43669","resolution":{"observed_at":"2026-08-07T14:23:55.528954Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:55.264556Z","title":null,"venue":null,"work_id":"8f72f9a1-caf0-49ae-a5d8-eedc32e0b716","year":null},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-07T14:18:12.990027Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:53.787016Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:cc12f3ace8a4a9b0db02c8fbde0274da94ab5bc76f00e54c401585681322af5e","observation_id":"85dc835d-dee0-4a12-8132-37246d8dd7aa","resolution":{"observed_at":"2026-08-07T14:23:55.314113Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:55.044376Z","title":"The automated filtering employs the following prompts: You are evaluating whether an intent string clearly specifies a computer operation instruction","venue":null,"work_id":"96196918-2330-4ad1-a7d1-cdccdf06fd8a","year":2024},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-07T14:18:12.990027Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:53.857027Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:3027d8a8183183c9f333961acd53590595f2056b5cd27b181838d711703b07eb","observation_id":"71039ee4-603c-4e2c-b877-ecf0ebb46b31","resolution":{"observed_at":"2026-08-07T14:23:55.150547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:54.875914Z","title":null,"venue":null,"work_id":"106d2aa2-1e86-41a2-95b6-f35a58a9898d","year":null},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-07T14:18:12.990027Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:53.943697Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:813dbf0b38847b6b6d1c1d82ff19821c07f70237e5d3d481af28e8138e6191b8","observation_id":"97d6c8ef-1dfb-4211-b256-ec3adef2473b","resolution":{"observed_at":"2026-08-07T14:23:54.967118Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:54.681257Z","title":null,"venue":null,"work_id":"db392b87-acf0-40b4-9a08-ee68af4e2fc8","year":null},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-07T14:18:12.990027Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:54.027798Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:066c84f067a40a08b31efb5cd3e682294d691d0fd2338a93ad4f1f0b1ff20ea5","observation_id":"651c6821-1e68-4932-960f-d508814caaf3","resolution":{"observed_at":"2026-08-07T14:23:54.775805Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:54.535736Z","title":null,"venue":null,"work_id":"4081de51-d985-4b9a-8660-1ebe3b84a1e9","year":null},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-07T14:18:12.990027Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:54.101767Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:3e9dabb320aa343f0c5cfe33bb0d6ffaef6cfb66f4df7a885f42a231e6c60afd","observation_id":"6235fa44-90d6-4100-aaf1-3b699d3129c7","resolution":{"observed_at":"2026-08-07T14:23:54.594976Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:54.381213Z","title":"{{intent}}","venue":null,"work_id":"0f969c27-c628-4567-bd58-96c4b50d656f","year":null},"citing_paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","snapshot_observed_at":"2026-08-07T14:18:12.990027Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:54.184865Z"},"links":{"citing_paper":"/paper/2505.19095"},"observation_digest":"sha256:3301db695b39aa4709fa5c5f6537ee0d845fa64eaa2f37790abc425ac0b5ed1a","observation_id":"1410146d-0864-4a4c-8255-46a12e44e094","resolution":{"observed_at":"2026-08-07T14:23:54.449870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.19095","last_updated":"2025-05-25T11:13:03Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T14:18:12.990027Z","submitted_at":"2025-05-25T11:13:03Z","title":"ScreenExplorer: Training a Vision-Language Model for Diverse Exploration in Open GUI World"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":27,"verified_exact":0,"verified_fuzzy":23},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 1 inbound Pith citation observation for arXiv:2505.19095."}