{"as_of":"2026-08-19T05:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2d358ef9804827df42a2cc7ebf2fb3c2b90dd60e3f6dda38acb4167cfc1c03ba","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T16:10:29.052921Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T18:05:09.289637Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-19T11:08:27.767412Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-19T00:00:21.277614Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"cited_work":{"arxiv_id":"2412.10342","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.10342","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Iris: Breaking gui complexity with adaptive focus and self-refining","venue":null,"work_id":"88ae369e-8744-4fa9-8647-2ba8ae2d0886","year":2024},"citing_paper":{"arxiv_id":"2411.18279","last_updated":"2025-05-06T15:08:00Z","snapshot_observed_at":"2026-08-17T10:40:45.253009Z","submitted_at":"2024-11-27T12:13:39Z","title":"Large Language Model-Brained GUI Agents: A Survey","version":12},"reference_index":214,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:27.472508Z"},"links":{"cited_paper":"/paper/2412.10342","citing_paper":"/paper/2411.18279"},"observation_digest":"sha256:76d602b554a0a2612a0136393a3536a7d19d54838cca81c7079d45b707403f13","observation_id":"f7565c5c-5909-4277-bacb-4540ca8286ba","resolution":{"observed_at":"2026-05-19T11:08:27.769205Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-19T00:00:21.277614Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10342","snapshot_observed_at":"2026-08-07T05:02:29.178376Z","title":"Iris: Breaking gui complexity with adaptive focus and self-refining","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08933","last_updated":"2025-06-10T15:59:38Z","snapshot_observed_at":"2026-08-17T17:45:42.396476Z","submitted_at":"2025-06-10T15:59:38Z","title":"What Limits Virtual Agent Application? OmniBench: A Scalable Multi-Dimensional Benchmark for Essential Virtual Agent Capabilities","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T05:02:29.178376Z"},"links":{"cited_paper":"/paper/2412.10342","citing_paper":"/paper/2506.08933"},"observation_digest":"sha256:1c72eda35da2d61e9277d60844a3c3fcd93c6444b517906b974e9af6d0e2602a","observation_id":"47c6f886-57fb-4877-b41b-63b287dd429e","resolution":{"observed_at":"2026-08-07T05:02:29.178376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-19T00:00:21.277614Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10342","snapshot_observed_at":"2026-08-07T04:35:36.675559Z","title":"Iris: Breaking gui complexity with adaptive focus and self-refining.arXiv preprint arXiv:2412.10342, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10387","last_updated":"2025-06-12T06:21:19Z","snapshot_observed_at":"2026-08-16T02:56:21.500616Z","submitted_at":"2025-06-12T06:21:19Z","title":"Mirage-1: Augmenting and Updating GUI Agent with Hierarchical Multimodal Skills","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T04:35:36.675559Z"},"links":{"cited_paper":"/paper/2412.10342","citing_paper":"/paper/2506.10387"},"observation_digest":"sha256:e9f8f72e1f27e24e19728840c585ec65005202294fe555eff8546f76f6dbc82e","observation_id":"77fc636a-8af5-4362-9d75-3febd07cdabc","resolution":{"observed_at":"2026-08-07T04:35:36.675559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-19T00:00:21.277614Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10342","snapshot_observed_at":"2026-08-15T18:05:09.289637Z","title":"Iris: Breaking gui complexity with adaptive focus and self-refining","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.19132","last_updated":"2025-07-25T10:14:53Z","snapshot_observed_at":"2026-08-16T13:46:06.537646Z","submitted_at":"2025-07-25T10:14:53Z","title":"OS-MAP: How Far Can Computer-Using Agents Go in Breadth and Depth?","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T18:05:09.289637Z"},"links":{"cited_paper":"/paper/2412.10342","citing_paper":"/paper/2507.19132"},"observation_digest":"sha256:e645af21d4f35972c342ab26fb647f6482d7e53913e9d018827562053d7d3fd2","observation_id":"3befbff8-0d15-4f3a-8a88-950c2955dd53","resolution":{"observed_at":"2026-08-15T18:05:09.289637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-19T00:00:21.277614Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10342","snapshot_observed_at":"2026-08-05T17:45:21.052024Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.16688","last_updated":"2025-08-21T18:39:35Z","snapshot_observed_at":"2026-08-16T21:30:29.751711Z","submitted_at":"2025-08-21T18:39:35Z","title":"Cybernaut: Towards Reliable Web Automation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T17:45:21.052024Z"},"links":{"cited_paper":"/paper/2412.10342","citing_paper":"/paper/2508.16688"},"observation_digest":"sha256:5472a4fbe533916d072a57565bf0eb8d954268e0622f65f30bbd8fb0bf0137ab","observation_id":"74b247d5-9142-405e-9f6f-6930299855d2","resolution":{"observed_at":"2026-08-05T17:45:21.052024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-19T00:00:21.277614Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10342","snapshot_observed_at":"2026-08-04T16:51:32.578220Z","title":"Iris: Breaking gui complexity with adap- tive focus and self-refining,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.11548","last_updated":"2026-06-10T01:13:27Z","snapshot_observed_at":"2026-08-16T14:03:41.431978Z","submitted_at":"2025-09-15T03:28:29Z","title":"How Auxiliary Reasoning Unleashes GUI Grounding in VLMs","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T16:51:32.578220Z"},"links":{"cited_paper":"/paper/2412.10342","citing_paper":"/paper/2509.11548"},"observation_digest":"sha256:d5605f893c0a71a0876b79125ebae8c89454bbb235f7d5a7a00bd42dd960766e","observation_id":"5c57e7fd-9a60-4885-8155-74ba7bfae981","resolution":{"observed_at":"2026-08-04T16:51:32.578220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.10342/citation-record","integrity":"/paper/2412.10342/integrity","json":"/paper/2412.10342/citation-record.json","paper":"/paper/2412.10342"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T16:10:28.867498Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-19T00:00:21.277614Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:28.867498Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:5c271240dd0794d55df29ddeea04afb3baa435957989a9ff6bc824b98965e581","observation_id":"462e3955-cf34-447e-927d-7ae20125979e","resolution":{"observed_at":"2026-08-11T16:10:28.867498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:10:29.621941Z","title":"The claude 3 model family: Opus, sonnet, haiku","venue":null,"work_id":"924597e7-a036-465f-b099-9fab7057e182","year":2024},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-19T00:00:21.277614Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:28.871745Z"},"links":{"citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:184876e5c9b33e5992111ed48048d9739c6b75ef3acba0f5e3786a661ed67be0","observation_id":"c4ad8e76-eebd-4533-aa3b-301bea25e978","resolution":{"observed_at":"2026-08-11T16:10:29.626618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-11T16:10:28.876033Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-19T00:00:21.277614Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:28.876033Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:5288a6d701ba1a97d67a0030d1d9ab48266b5f4d6b72d5e8250ae06062954576","observation_id":"e63e462a-5b70-42a4-99ee-39e041a9fc6b","resolution":{"observed_at":"2026-08-11T16:10:28.876033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:10:29.608374Z","title":"Fuyu-8b: A multimodal architecture for ai agents, 2023","venue":null,"work_id":"1a917767-db3d-4d48-afe2-c5355ed93f98","year":2023},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-19T00:00:21.277614Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:28.880833Z"},"links":{"citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:a58606c507c99c6392239bc40ea5ba6a689b1e70a6858423e9ecf3e915cb7ba8","observation_id":"597c723d-1b13-47e2-9d6d-a7426cb03235","resolution":{"observed_at":"2026-08-11T16:10:29.613252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-11T16:10:28.886036Z","title":"Paligemma: A versatile 3b vlm for trans- fer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-19T00:00:21.277614Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:28.886036Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:bc4b29d141d0238aa8cf7dc3ee878fba30e043e31be2a2faefaaf4b1f2980127","observation_id":"cbce299e-ea7c-4a85-94ba-5118a2da68df","resolution":{"observed_at":"2026-08-11T16:10:28.886036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:10:29.594917Z","title":"A computational approach to edge detection","venue":null,"work_id":"a08a7a5e-6049-40ff-982b-f86f2a399f59","year":1986},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-19T00:00:21.277614Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:28.891368Z"},"links":{"citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:48533290da5da196bbc876f51bc2443a05eb945884a26ae1bdede3dc1541930b","observation_id":"bd8dfdc6-b39b-41ec-9778-7ec9d835ba5e","resolution":{"observed_at":"2026-08-11T16:10:29.599787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-17T13:04:04.064087Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-11T16:10:28.895775Z","title":"Minigpt-v2: large language model as a unified interface for vision-language multi-task learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-19T00:00:21.277614Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:28.895775Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:07b4467810b94a3615c805df2e5d8302855368c855f66c7c6863cd72422a66af","observation_id":"28b90062-3e2e-427a-b6ec-1f8a01c43495","resolution":{"observed_at":"2026-08-11T16:10:28.895775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10935","last_updated":"2024-02-23T04:36:51Z","snapshot_observed_at":"2026-08-18T02:03:58.046358Z","submitted_at":"2024-01-17T08:10:35Z","title":"SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10935","snapshot_observed_at":"2026-08-11T16:10:28.900333Z","title":"Seeclick: Har- nessing gui grounding for advanced visual gui agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-19T00:00:21.277614Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:28.900333Z"},"links":{"cited_paper":"/paper/2401.10935","citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:9739ccbd5100b49411ed7916427e3806fa0199a589bd5d890c01215126fabd0d","observation_id":"8ff0e854-320f-4a49-b9da-92e317c5fbe5","resolution":{"observed_at":"2026-08-11T16:10:28.900333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:10:29.580534Z","title":"Rico: A mobile app dataset for building data- driven design applications","venue":null,"work_id":"6122bcdf-ccfc-4ad8-8028-41262b7e37b8","year":2017},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-19T00:00:21.277614Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:28.905456Z"},"links":{"citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:3ce5a3235bbcb4692e192c251e598d58647be139b25b5ac1d0e0dee6a93b8e65","observation_id":"f2e8ef3f-266a-4633-810c-aa30d6e6b477","resolution":{"observed_at":"2026-08-11T16:10:29.586082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:10:29.567588Z","title":"Mind2web: Towards a generalist agent for the web","venue":null,"work_id":"901fc999-50a1-40a2-b280-891eba14374b","year":2024},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-19T00:00:21.277614Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:28.910089Z"},"links":{"citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:a61a40089667d5281c457b2b57c7fe06893b2b1d097a144bac8747843a240b57","observation_id":"16f9c842-52c8-460f-980c-c3003bb7ad60","resolution":{"observed_at":"2026-08-11T16:10:29.571928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06512","last_updated":"2024-04-09T17:59:32Z","snapshot_observed_at":"2026-08-18T00:33:47.386234Z","submitted_at":"2024-04-09T17:59:32Z","title":"InternLM-XComposer2-4KHD: A Pioneering Large Vision-Language Model Handling Resolutions from 336 Pixels to 4K HD","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06512","snapshot_observed_at":"2026-08-11T16:10:28.919795Z","title":"Internlm-xcomposer2- 4khd: A pioneering large vision-language model handling resolutions from 336 pixels to 4k hd","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-19T00:00:21.277614Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:28.919795Z"},"links":{"cited_paper":"/paper/2404.06512","citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:a1634165f8085122c6edcee10d03c331c02fffa1ce60cdbd2fd8baf112010103","observation_id":"9161f461-1e60-4f8f-ad7d-c8fab868559b","resolution":{"observed_at":"2026-08-11T16:10:28.919795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:10:29.554307Z","title":"Vitron: A unified pixel-level vision llm for understanding, generating, segmenting, editing","venue":null,"work_id":"39cc476c-8c01-40e1-9ca1-0a88f7875d5a","year":2024},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-19T00:00:21.277614Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:28.924452Z"},"links":{"citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:ac546e3754aa41a18b367affdac71573776f51957b31340a70be24e869af74ea","observation_id":"1ecf13a7-a279-4d13-9cbc-f554050ecf88","resolution":{"observed_at":"2026-08-11T16:10:29.558706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:10:29.539646Z","title":"Enhancing video-language representations with structural spatio-temporal alignment","venue":null,"work_id":"e15f833f-cd0b-4be3-97b0-e3d6f3411776","year":2024},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-19T00:00:21.277614Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:28.929413Z"},"links":{"citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:c98dc780c55270b1821feadd45a41eb067f3861f9658a2e0661d2c5bce0ee8aa","observation_id":"773d8398-3400-446b-b473-f82fb8d2d359","resolution":{"observed_at":"2026-08-11T16:10:29.544854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10943","last_updated":"2024-11-17T02:44:56Z","snapshot_observed_at":"2026-08-16T10:37:51.980574Z","submitted_at":"2024-11-17T02:44:56Z","title":"Generalist Virtual Agents: A Survey on Autonomous Agents Across Digital Platforms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10943","snapshot_observed_at":"2026-08-11T16:10:28.934341Z","title":"Generalist virtual agents: A survey on autonomous agents across digital platforms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-19T00:00:21.277614Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:28.934341Z"},"links":{"cited_paper":"/paper/2411.10943","citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:4408a08946acf3f84f36293c2964a74170cd85e20cdd68c5e0db1c0e0118be95","observation_id":"fb87489d-35a0-4b1b-8583-082cafbd7f0b","resolution":{"observed_at":"2026-08-11T16:10:28.934341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:10:29.524149Z","title":"De-fine: De composing and re fin ing visual programs with auto-feedback","venue":null,"work_id":"b8e584d8-f79e-417c-9bb3-190acaf395f1","year":2024},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-19T00:00:21.277614Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:28.938874Z"},"links":{"citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:712d4398f892a2f85b0f94d0333b6780c75cc0108b3a950fbe54010076c2d85c","observation_id":"84e459e8-4348-4432-aee6-c3c6fbecdebe","resolution":{"observed_at":"2026-08-11T16:10:29.529117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05243","last_updated":"2025-06-17T15:06:02Z","snapshot_observed_at":"2026-08-17T12:05:03.684448Z","submitted_at":"2024-10-07T17:47:50Z","title":"Navigating the Digital World as Humans Do: Universal Visual Grounding for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05243","snapshot_observed_at":"2026-08-11T16:10:28.942871Z","title":"Navigating the digital world as humans do: Universal visual grounding for gui agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-19T00:00:21.277614Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:28.942871Z"},"links":{"cited_paper":"/paper/2410.05243","citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:ee4e03eff0e3c2514321dde62acf9209d83cdc05e90bac20b8ef22fd409f5d5d","observation_id":"6c3b1587-661a-4697-bd1d-429b24c7400d","resolution":{"observed_at":"2026-08-11T16:10:28.942871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-18T00:01:15.410179Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-11T16:10:28.947119Z","title":"Cogvlm2: Visual language mod- els for image and video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-19T00:00:21.277614Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:28.947119Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:fb27806cb2975694a30d4deba3aada9ae65b5fe9ee09f9cec53981d69ecabdd5","observation_id":"22c75973-7a83-4169-89d2-a9460907a033","resolution":{"observed_at":"2026-08-11T16:10:28.947119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:10:29.510838Z","title":"Cogagent: A visual language model for gui agents","venue":null,"work_id":"4a2459e0-22f0-4773-8bfc-5f991e2865da","year":2024},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-19T00:00:21.277614Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:28.951617Z"},"links":{"citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:675f9b9d9dafad092e47bd6089daaded1d189b3b28720c15e0cb6bf7b0edf36e","observation_id":"a3c0777f-3afa-4d7d-b4da-da34b226b0d3","resolution":{"observed_at":"2026-08-11T16:10:29.515180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-08-12T13:10:06.472493Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06395","snapshot_observed_at":"2026-08-11T16:10:28.955772Z","title":"Minicpm: Unveiling the potential of small language models with scalable training strategies","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-19T00:00:21.277614Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:28.955772Z"},"links":{"cited_paper":"/paper/2404.06395","citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:9cca0878fc043ed0e6bc4a53aac52b77ceb4da05537fb1dcde922af8fde7ca4a","observation_id":"1aa0533d-9155-4c66-a343-9d715d165d60","resolution":{"observed_at":"2026-08-11T16:10:28.955772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-17T19:26:44.032537Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-11T16:10:28.960093Z","title":"Adam: A method for stochastic opti- mization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-19T00:00:21.277614Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:28.960093Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:ab3629bce13a3c4417622fed171bd57ec8c408353aa9b4aa3d1b120634e238a1","observation_id":"d4cab38e-5f1c-4b08-9d62-1bf1787e5236","resolution":{"observed_at":"2026-08-11T16:10:28.960093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04152","last_updated":"2024-05-25T14:56:21Z","snapshot_observed_at":"2026-08-16T15:10:01.454046Z","submitted_at":"2023-08-08T09:32:43Z","title":"Fine-tuning Multimodal LLMs to Follow Zero-shot Demonstrative Instructions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.04152","snapshot_observed_at":"2026-08-11T16:10:28.964021Z","title":"Fine-tuning multimodal llms to follow zero-shot demonstrative instructions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-19T00:00:21.277614Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:28.964021Z"},"links":{"cited_paper":"/paper/2308.04152","citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:ef00dc00e20db127af259ffb3367d548c8c26c937c30f6dfb0bcf436299fc3b5","observation_id":"f944425b-8ed8-4f99-bccc-f632f40237ad","resolution":{"observed_at":"2026-08-11T16:10:28.964021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18967","last_updated":"2025-02-28T00:29:14Z","snapshot_observed_at":"2026-08-18T16:49:42.786864Z","submitted_at":"2024-10-24T17:58:31Z","title":"Ferret-UI 2: Mastering Universal User Interface Understanding Across Platforms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18967","snapshot_observed_at":"2026-08-11T16:10:28.968225Z","title":"Ferret-ui 2: Master- ing universal user interface understanding across platforms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-19T00:00:21.277614Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:28.968225Z"},"links":{"cited_paper":"/paper/2410.18967","citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:8aed8505c88af4a4799d65a755f3dffb427eab3bb8dc68582bbbc5cd14d2cb4d","observation_id":"129b2dc6-8eab-42b7-a7c6-cc38c7c21a3c","resolution":{"observed_at":"2026-08-11T16:10:28.968225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05935","last_updated":"2025-03-21T10:19:01Z","snapshot_observed_at":"2026-08-18T00:33:51.822601Z","submitted_at":"2024-02-08T18:59:48Z","title":"SPHINX-X: Scaling Data and Parameters for a Family of Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05935","snapshot_observed_at":"2026-08-11T16:10:28.973202Z","title":"Sphinx-x: Scaling data and parameters for a family of multi-modal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-19T00:00:21.277614Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:28.973202Z"},"links":{"cited_paper":"/paper/2402.05935","citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:f067a530ad58d21e36bf6329a9af1c506b26184b46747ec1b42daa6b71ce5ec9","observation_id":"289ae9cd-18e5-408e-a7a0-98ad1fee55ee","resolution":{"observed_at":"2026-08-11T16:10:28.973202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:10:29.496970Z","title":"Visual instruction tuning","venue":null,"work_id":"fa0fbf7d-b77d-4d55-b73b-9628328d3943","year":2024},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-19T00:00:21.277614Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:28.977592Z"},"links":{"citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:2f3283587205cd43527caab9967beb727a5112bb3fc0a86a5950df8a2d564905","observation_id":"15d50b90-e9ce-4b7e-a6f2-044a0d703951","resolution":{"observed_at":"2026-08-11T16:10:29.501267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05955","last_updated":"2024-04-09T02:29:39Z","snapshot_observed_at":"2026-08-17T00:01:45.419694Z","submitted_at":"2024-04-09T02:29:39Z","title":"VisualWebBench: How Far Have Multimodal LLMs Evolved in Web Page Understanding and Grounding?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05955","snapshot_observed_at":"2026-08-11T16:10:28.981478Z","title":"Visualwebbench: How far have multimodal llms evolved in web page under- standing and grounding? arXiv preprint arXiv:2404.05955,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-19T00:00:21.277614Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:28.981478Z"},"links":{"cited_paper":"/paper/2404.05955","citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:3969a3a7a17a5f02750ee69a0085affcd2e95f47b2621ecc60d6c81797395cb0","observation_id":"c24df63a-9a42-40c3-b1d7-218e41340dab","resolution":{"observed_at":"2026-08-11T16:10:28.981478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08451","last_updated":"2025-08-01T03:37:57Z","snapshot_observed_at":"2026-08-16T13:43:38.458825Z","submitted_at":"2024-06-12T17:44:26Z","title":"GUIOdyssey: A Comprehensive Dataset for Cross-App GUI Navigation on Mobile Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08451","snapshot_observed_at":"2026-08-11T16:10:28.985979Z","title":"Gui odyssey: A comprehensive dataset for cross-app gui navigation on mobile devices","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-19T00:00:21.277614Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:28.985979Z"},"links":{"cited_paper":"/paper/2406.08451","citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:cc8c7aec57c235b7634ac5caf1c71d0bd0f17d7bac9814b19464e01d543229c4","observation_id":"40a18b4c-7574-4144-be21-f9f3feecea53","resolution":{"observed_at":"2026-08-11T16:10:28.985979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:10:29.483457Z","title":"Androidinthewild: A large- scale dataset for android device control","venue":null,"work_id":"13b2d431-39ef-47be-ac80-fbbeac232b04","year":2024},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-19T00:00:21.277614Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:28.990556Z"},"links":{"citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:96f2effd49ce50a8ff305d458907bac5420c84f56d153e1aa3bcb224caabbbfc","observation_id":"380ec206-46c8-4459-818a-ea52b28e16a6","resolution":{"observed_at":"2026-08-11T16:10:29.487904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11029","last_updated":"2022-11-24T06:34:43Z","snapshot_observed_at":"2026-08-16T16:58:31.432274Z","submitted_at":"2022-05-23T04:05:37Z","title":"META-GUI: Towards Multi-modal Conversational Agents on Mobile GUI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.11029","snapshot_observed_at":"2026-08-11T16:10:28.994614Z","title":"Meta-gui: Towards multi-modal conversational agents on mobile gui","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-19T00:00:21.277614Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:28.994614Z"},"links":{"cited_paper":"/paper/2205.11029","citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:775cbecc5804f9099552ac1a5757e1244370cab70d06c44750e27aede410fd6f","observation_id":"267af3bb-898f-4b25-a1a4-f66b759c0e5b","resolution":{"observed_at":"2026-08-11T16:10:28.994614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-11T16:10:28.999032Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-19T00:00:21.277614Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:28.999032Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:b391f90b9187d035b0a2fe48ebe8bacb2929dcb564d9fa5a383b1e15769443da","observation_id":"ecc04415-d9a4-4a04-b8e2-a5d56b3acf59","resolution":{"observed_at":"2026-08-11T16:10:28.999032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-11T16:10:29.003225Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-19T00:00:21.277614Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:29.003225Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:bcc4c69abc04929d7ca1c0152ec1651b6b431724a20f86836fa3d326143b86c6","observation_id":"a81b2c2d-c420-4e5b-b61a-f9a6127e8a3b","resolution":{"observed_at":"2026-08-11T16:10:29.003225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-11T16:10:29.007597Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-19T00:00:21.277614Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:29.007597Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:4c40691d81427e590bf0e665532087fdd522bddd510aa0f305d27d48d24384d0","observation_id":"6adb5cd8-dc24-41e8-aa01-80ca931d4788","resolution":{"observed_at":"2026-08-11T16:10:29.007597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-16T13:42:20.592010Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-11T16:10:29.011807Z","title":"Mobile-agent: Autonomous multi-modal mobile device agent with visual perception","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-19T00:00:21.277614Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:29.011807Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:20ae3d515164ff6764e50bb8c3fcdbb65c8aa4bac93eb025abc870dca536b107","observation_id":"d45563af-ff1d-4516-9a54-3295ee6150cb","resolution":{"observed_at":"2026-08-11T16:10:29.011807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-11T16:10:29.016231Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-19T00:00:21.277614Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:29.016231Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:9cbf4b81b5a67fa5c944704ec638f46004985806e29ad6fed470595a1078db87","observation_id":"9a5de42d-6139-49b2-8e43-8918c866aafa","resolution":{"observed_at":"2026-08-11T16:10:29.016231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:10:29.467864Z","title":"Webui: A dataset for en- hancing visual ui understanding with web semantics","venue":null,"work_id":"3b7c0300-424b-4e7b-9642-d11769709c20","year":2023},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-19T00:00:21.277614Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:29.021156Z"},"links":{"citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:cb6ef99bbef4d22e2b0d87c1bc6b9ace78cdc35d6c096b940bb2c6dbe1baa0f7","observation_id":"ebddd9d9-b86a-4cc9-ac30-ded666f716c7","resolution":{"observed_at":"2026-08-11T16:10:29.474038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07456","last_updated":"2024-02-15T09:30:48Z","snapshot_observed_at":"2026-08-16T14:19:26.200721Z","submitted_at":"2024-02-12T07:29:22Z","title":"OS-Copilot: Towards Generalist Computer Agents with Self-Improvement","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07456","snapshot_observed_at":"2026-08-11T16:10:29.025490Z","title":"Os-copilot: Towards generalist computer agents with self-improvement","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-19T00:00:21.277614Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:29.025490Z"},"links":{"cited_paper":"/paper/2402.07456","citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:95a5ad018ecceea5d3cd215f196dcf25833acf659e94b3750096e1b496c7b416","observation_id":"b2baf02b-11ac-4e2e-a2ef-d21b6122ef8e","resolution":{"observed_at":"2026-08-11T16:10:29.025490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-16T14:08:50.290302Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-08-11T16:10:29.030128Z","title":"Llava-uhd: an lmm perceiving any aspect ratio and high-resolution images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-19T00:00:21.277614Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:29.030128Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:9976acffb714d25dd73be1a0124fff4d505d5d6e3d48b3144490094d95fe8e32","observation_id":"a0472031-8831-4bed-a82c-bec1764fb727","resolution":{"observed_at":"2026-08-11T16:10:29.030128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05719","last_updated":"2024-04-08T17:55:44Z","snapshot_observed_at":"2026-08-19T02:01:51.948777Z","submitted_at":"2024-04-08T17:55:44Z","title":"Ferret-UI: Grounded Mobile UI Understanding with Multimodal LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05719","snapshot_observed_at":"2026-08-11T16:10:29.034981Z","title":"Ferret-ui: Grounded mobile ui understanding with mul- timodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-19T00:00:21.277614Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:29.034981Z"},"links":{"cited_paper":"/paper/2404.05719","citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:95f9ba2394bb605165dfb260f4b4912edd761ca509908e6da1b140425ba2a469","observation_id":"c5859b87-0094-4be4-b9a5-d5c06f4380e6","resolution":{"observed_at":"2026-08-11T16:10:29.034981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07939","last_updated":"2024-05-23T05:18:58Z","snapshot_observed_at":"2026-08-18T14:41:50.057065Z","submitted_at":"2024-02-08T15:40:35Z","title":"UFO: A UI-Focused Agent for Windows OS Interaction","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07939","snapshot_observed_at":"2026-08-11T16:10:29.039295Z","title":"Ufo: A ui-focused agent for windows os inter- action","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-19T00:00:21.277614Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:29.039295Z"},"links":{"cited_paper":"/paper/2402.07939","citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:ab78debda3cafa2cbdd2014d5b5daa12bef208bcd465c4556f58755108f01cdd","observation_id":"80058f2c-f2a8-43f9-8ec5-975a8065a7b3","resolution":{"observed_at":"2026-08-11T16:10:29.039295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11436","last_updated":"2024-06-07T04:52:29Z","snapshot_observed_at":"2026-08-16T14:59:03.737515Z","submitted_at":"2023-09-20T16:12:32Z","title":"You Only Look at Screens: Multimodal Chain-of-Action Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11436","snapshot_observed_at":"2026-08-11T16:10:29.043380Z","title":"You only look at screens: Multimodal chain-of-action agents","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-19T00:00:21.277614Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:29.043380Z"},"links":{"cited_paper":"/paper/2309.11436","citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:7fc4ff495930c9b76c57e4b5a467be3237b80a72f2b00e17fa36a75ce48d2711","observation_id":"94f898c5-0801-4a50-83b5-d594cfead54d","resolution":{"observed_at":"2026-08-11T16:10:29.043380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17918","last_updated":"2025-02-14T08:13:39Z","snapshot_observed_at":"2026-08-18T09:23:21.297977Z","submitted_at":"2024-03-26T17:54:15Z","title":"AgentStudio: A Toolkit for Building General Virtual Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17918","snapshot_observed_at":"2026-08-11T16:10:29.048625Z","title":"Agentstudio: A toolkit for building general virtual agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-19T00:00:21.277614Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:29.048625Z"},"links":{"cited_paper":"/paper/2403.17918","citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:4be66ef1364f87f86cec10566af4c4120461396c0bb1241e61cd792cbcff7a64","observation_id":"7453521a-0ec9-4fb6-aeb3-7a19c1943f9f","resolution":{"observed_at":"2026-08-11T16:10:29.048625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13854","last_updated":"2024-04-16T15:13:18Z","snapshot_observed_at":"2026-08-14T11:14:55.351653Z","submitted_at":"2023-07-25T22:59:32Z","title":"WebArena: A Realistic Web Environment for Building Autonomous Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13854","snapshot_observed_at":"2026-08-11T16:10:29.052921Z","title":"Webarena: A realistic web en- vironment for building autonomous agents","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-19T00:00:21.277614Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:29.052921Z"},"links":{"cited_paper":"/paper/2307.13854","citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:ee880aef53f879d670466f3c6f967b5cb7dafa4b920c7dfa8426bcad9c451ea5","observation_id":"ff225322-4c23-4035-a16e-c71e1281f2f0","resolution":{"observed_at":"2026-08-11T16:10:29.052921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-19T00:00:21.277614Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":12},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 6 inbound Pith citation observations for arXiv:2412.10342."}