{"as_of":"2026-08-08T19:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ce74d23b1610d39a1bb6dcabb0aa1b84596e0dd189dbf49965c1d87d73c83ce4","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T06:01:31.686444Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-19T16:58:41.558250Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-19T17:02:40.806435Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.08226","last_updated":"2025-02-14T06:23:57Z","snapshot_observed_at":"2026-08-08T05:53:49.808163Z","submitted_at":"2025-02-12T09:12:30Z","title":"TRISHUL: Towards Region Identification and Screen Hierarchy Understanding for Large VLM based GUI Agents","version":2},"cited_work":{"arxiv_id":"2502.08226","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.08226","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Trishul: Towards region identification and screen hierarchy understanding for large vlm based gui agents","venue":null,"work_id":"f53ff714-17f4-4f54-b477-a712b8bb6fc9","year":2025},"citing_paper":{"arxiv_id":"2411.18279","last_updated":"2025-05-06T15:08:00Z","snapshot_observed_at":"2026-07-06T19:57:55.925634Z","submitted_at":"2024-11-27T12:13:39Z","title":"Large Language Model-Brained GUI Agents: A Survey","version":12},"reference_index":233,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:27.472508Z"},"links":{"cited_paper":"/paper/2502.08226","citing_paper":"/paper/2411.18279"},"observation_digest":"sha256:7cb6b8ffcc8fce68983df1e34488928fc18d9b4fa1dbb4009120cbaa6f326472","observation_id":"af0e6d96-7973-4683-ada0-878218b6a5b1","resolution":{"observed_at":"2026-05-19T11:08:27.809040Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08226","last_updated":"2025-02-14T06:23:57Z","snapshot_observed_at":"2026-08-08T05:53:49.808163Z","submitted_at":"2025-02-12T09:12:30Z","title":"TRISHUL: Towards Region Identification and Screen Hierarchy Understanding for Large VLM based GUI Agents","version":2},"cited_work":{"arxiv_id":"2502.08226","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.08226","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Trishul: Towards region identification and screen hierarchy understanding for large vlm based gui agents","venue":null,"work_id":"f53ff714-17f4-4f54-b477-a712b8bb6fc9","year":2025},"citing_paper":{"arxiv_id":"2604.27859","last_updated":"2026-05-15T06:25:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-30T13:43:25Z","title":"Rethinking Agentic Reinforcement Learning In Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-07T06:30:09.945371Z"},"links":{"cited_paper":"/paper/2502.08226","citing_paper":"/paper/2604.27859"},"observation_digest":"sha256:a03e29a082335fd26e0a16094ae43d849454e9dd7b7966a5e44e11752bd4c1b3","observation_id":"0c74fc69-c773-49a8-86c1-997295ade976","resolution":{"observed_at":"2026-05-12T10:21:29.858362Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08226","last_updated":"2025-02-14T06:23:57Z","snapshot_observed_at":"2026-08-08T05:53:49.808163Z","submitted_at":"2025-02-12T09:12:30Z","title":"TRISHUL: Towards Region Identification and Screen Hierarchy Understanding for Large VLM based GUI Agents","version":2},"cited_work":{"arxiv_id":"2502.08226","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.08226","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Trishul: Towards region identification and screen hierarchy understanding for large vlm based gui agents","venue":null,"work_id":"f53ff714-17f4-4f54-b477-a712b8bb6fc9","year":2025},"citing_paper":{"arxiv_id":"2604.27859","last_updated":"2026-05-15T06:25:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-30T13:43:25Z","title":"Rethinking Agentic Reinforcement Learning In Large Language Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-08T03:12:19.414358Z"},"links":{"cited_paper":"/paper/2502.08226","citing_paper":"/paper/2604.27859"},"observation_digest":"sha256:5f653fb22799b4d09188c3db2478b7a6c89a5897fdf001c1b5b43e060d6ef8cb","observation_id":"0c874bfc-beb0-4b99-9d2c-90638588f7c4","resolution":{"observed_at":"2026-05-11T22:11:16.795571Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08226","last_updated":"2025-02-14T06:23:57Z","snapshot_observed_at":"2026-08-08T05:53:49.808163Z","submitted_at":"2025-02-12T09:12:30Z","title":"TRISHUL: Towards Region Identification and Screen Hierarchy Understanding for Large VLM based GUI Agents","version":2},"cited_work":{"arxiv_id":"2502.08226","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.08226","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Trishul: Towards region identification and screen hierarchy understanding for large vlm based gui agents","venue":null,"work_id":"f53ff714-17f4-4f54-b477-a712b8bb6fc9","year":2025},"citing_paper":{"arxiv_id":"2604.27859","last_updated":"2026-05-15T06:25:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-30T13:43:25Z","title":"Rethinking Agentic Reinforcement Learning In Large Language Models","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-19T16:58:41.558250Z"},"links":{"cited_paper":"/paper/2502.08226","citing_paper":"/paper/2604.27859"},"observation_digest":"sha256:721c393fdde32c8a08c1cda7213a5e14260471e59f982d37f28027a041d63120","observation_id":"9769caff-490f-4cd5-bfd4-b5aa646a308c","resolution":{"observed_at":"2026-05-19T17:02:40.807951Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.08226/citation-record","integrity":"/paper/2502.08226/integrity","json":"/paper/2502.08226/citation-record.json","paper":"/paper/2502.08226"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2306.06070","last_updated":"2023-12-09T05:57:46Z","snapshot_observed_at":"2026-07-06T15:40:50.807376Z","submitted_at":"2023-06-09T17:44:31Z","title":"Mind2Web: Towards a Generalist Agent for the Web","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.06070","snapshot_observed_at":"2026-08-08T06:01:31.596406Z","title":"org/CorpusID:267069082","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08226","last_updated":"2025-02-14T06:23:57Z","snapshot_observed_at":"2026-08-08T05:53:49.808163Z","submitted_at":"2025-02-12T09:12:30Z","title":"TRISHUL: Towards Region Identification and Screen Hierarchy Understanding for Large VLM based GUI Agents","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T06:01:31.596406Z"},"links":{"cited_paper":"/paper/2306.06070","citing_paper":"/paper/2502.08226"},"observation_digest":"sha256:1b88f66eacfae468bdee2d06b4d7ad3b74c9221c4c30ffc4be5c0dd8d0d5416c","observation_id":"46535077-e95d-410e-a0f9-fc1dc698b1d6","resolution":{"observed_at":"2026-08-08T06:01:31.596406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.09195","last_updated":"2018-12-21T15:32:59Z","snapshot_observed_at":"2026-07-06T07:22:53.686203Z","submitted_at":"2018-12-21T15:32:59Z","title":"Learning to Navigate the Web","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.09195","snapshot_observed_at":"2026-08-08T06:01:31.606292Z","title":"org/CorpusID:258823350","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08226","last_updated":"2025-02-14T06:23:57Z","snapshot_observed_at":"2026-08-08T05:53:49.808163Z","submitted_at":"2025-02-12T09:12:30Z","title":"TRISHUL: Towards Region Identification and Screen Hierarchy Understanding for Large VLM based GUI Agents","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T06:01:31.606292Z"},"links":{"cited_paper":"/paper/1812.09195","citing_paper":"/paper/2502.08226"},"observation_digest":"sha256:8af9088bfbeff91ec86c5d6393515cf32d366700c7d03090f282fe7c11e07c53","observation_id":"427cb6e4-e7c3-4a7a-9b8f-fbfc0bb6bf44","resolution":{"observed_at":"2026-08-08T06:01:31.606292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T06:01:32.042868Z","title":"org/CorpusID:260126067","venue":null,"work_id":"f13028f0-32f6-42ed-9477-09aa68c6f00c","year":null},"citing_paper":{"arxiv_id":"2502.08226","last_updated":"2025-02-14T06:23:57Z","snapshot_observed_at":"2026-08-08T05:53:49.808163Z","submitted_at":"2025-02-12T09:12:30Z","title":"TRISHUL: Towards Region Identification and Screen Hierarchy Understanding for Large VLM based GUI Agents","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T06:01:31.616461Z"},"links":{"citing_paper":"/paper/2502.08226"},"observation_digest":"sha256:08267fe83c10c531b809b73c99e4f4e09c6d312cf7ba2cfe0d6e1c5705dde178","observation_id":"719ad1e0-4b88-435a-aab2-018a574602af","resolution":{"observed_at":"2026-08-08T06:01:32.047735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T06:01:32.027555Z","title":"org/CorpusID:267211622","venue":null,"work_id":"5d3a3510-022c-43cb-a12f-77e347991f7d","year":null},"citing_paper":{"arxiv_id":"2502.08226","last_updated":"2025-02-14T06:23:57Z","snapshot_observed_at":"2026-08-08T05:53:49.808163Z","submitted_at":"2025-02-12T09:12:30Z","title":"TRISHUL: Towards Region Identification and Screen Hierarchy Understanding for Large VLM based GUI Agents","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T06:01:31.621088Z"},"links":{"citing_paper":"/paper/2502.08226"},"observation_digest":"sha256:d96707c4bb1dbb12f22f5ca0e05dce55a0c908b071c0124bf06c4cb7fb9b56e3","observation_id":"11128c8b-98fe-4cb7-af99-0ad72fec4cc2","resolution":{"observed_at":"2026-08-08T06:01:32.032281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-07-06T17:01:40.744034Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-08T06:01:31.626071Z","title":"org/CorpusID:229363676","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08226","last_updated":"2025-02-14T06:23:57Z","snapshot_observed_at":"2026-08-08T05:53:49.808163Z","submitted_at":"2025-02-12T09:12:30Z","title":"TRISHUL: Towards Region Identification and Screen Hierarchy Understanding for Large VLM based GUI Agents","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T06:01:31.626071Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2502.08226"},"observation_digest":"sha256:1d7117d3dfcf42debb2e721c61ce487398cd0503a02436e1ca9076fe000d2935","observation_id":"485324ff-eeda-4a5d-8817-79a990391ed7","resolution":{"observed_at":"2026-08-08T06:01:31.626071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T06:01:32.012358Z","title":"org/CorpusID:273102270","venue":null,"work_id":"9ca61055-9e6f-4681-9f78-d7bbc35edb44","year":2023},"citing_paper":{"arxiv_id":"2502.08226","last_updated":"2025-02-14T06:23:57Z","snapshot_observed_at":"2026-08-08T05:53:49.808163Z","submitted_at":"2025-02-12T09:12:30Z","title":"TRISHUL: Towards Region Identification and Screen Hierarchy Understanding for Large VLM based GUI Agents","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T06:01:31.630598Z"},"links":{"citing_paper":"/paper/2502.08226"},"observation_digest":"sha256:4e978d72654b0631c4e3bfa5023c6a539ae59d15e1987d47a9cc9f9e49f4e74c","observation_id":"cf7163f1-3fa0-4da6-a79c-240066fcf8ff","resolution":{"observed_at":"2026-08-08T06:01:32.017105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05955","last_updated":"2024-04-09T02:29:39Z","snapshot_observed_at":"2026-07-06T17:57:31.912970Z","submitted_at":"2024-04-09T02:29:39Z","title":"VisualWebBench: How Far Have Multimodal LLMs Evolved in Web Page Understanding and Grounding?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05955","snapshot_observed_at":"2026-08-08T06:01:31.639813Z","title":"org/CorpusID:3530344","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08226","last_updated":"2025-02-14T06:23:57Z","snapshot_observed_at":"2026-08-08T05:53:49.808163Z","submitted_at":"2025-02-12T09:12:30Z","title":"TRISHUL: Towards Region Identification and Screen Hierarchy Understanding for Large VLM based GUI Agents","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T06:01:31.639813Z"},"links":{"cited_paper":"/paper/2404.05955","citing_paper":"/paper/2502.08226"},"observation_digest":"sha256:b30784654ac71be1a11323502e12f17519eb1fa986e72e0812195d01c0bc6259","observation_id":"094a4728-86ac-42c7-a5dd-af30dd98fdb7","resolution":{"observed_at":"2026-08-08T06:01:31.639813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00203","last_updated":"2024-08-01T00:00:43Z","snapshot_observed_at":"2026-07-06T18:55:19.894571Z","submitted_at":"2024-08-01T00:00:43Z","title":"OmniParser for Pure Vision Based GUI Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00203","snapshot_observed_at":"2026-08-08T06:01:31.644304Z","title":"org/CorpusID:269009925","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08226","last_updated":"2025-02-14T06:23:57Z","snapshot_observed_at":"2026-08-08T05:53:49.808163Z","submitted_at":"2025-02-12T09:12:30Z","title":"TRISHUL: Towards Region Identification and Screen Hierarchy Understanding for Large VLM based GUI Agents","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T06:01:31.644304Z"},"links":{"cited_paper":"/paper/2408.00203","citing_paper":"/paper/2502.08226"},"observation_digest":"sha256:57f8bb276749db08ac073f1e20f7a104810c1c9dced2a0cd47bac41ddef445b9","observation_id":"5c4c82f0-5eb2-4f9d-a34d-ad8b37b7edce","resolution":{"observed_at":"2026-08-08T06:01:31.644304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T06:01:31.997354Z","title":"org/CorpusID:258841249","venue":null,"work_id":"b06429c6-8e80-418d-a289-99b3354f0917","year":null},"citing_paper":{"arxiv_id":"2502.08226","last_updated":"2025-02-14T06:23:57Z","snapshot_observed_at":"2026-08-08T05:53:49.808163Z","submitted_at":"2025-02-12T09:12:30Z","title":"TRISHUL: Towards Region Identification and Screen Hierarchy Understanding for Large VLM based GUI Agents","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T06:01:31.649648Z"},"links":{"citing_paper":"/paper/2502.08226"},"observation_digest":"sha256:227df2df91e098f2ba7791a0825c4810a6a68394c05a13ad5a91300503df52d3","observation_id":"6bb7f1a7-4ab7-4667-90b6-3ee73436af7a","resolution":{"observed_at":"2026-08-08T06:01:32.002121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-08-08T06:01:31.654033Z","title":"org/CorpusID:236957064","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08226","last_updated":"2025-02-14T06:23:57Z","snapshot_observed_at":"2026-08-08T05:53:49.808163Z","submitted_at":"2025-02-12T09:12:30Z","title":"TRISHUL: Towards Region Identification and Screen Hierarchy Understanding for Large VLM based GUI Agents","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T06:01:31.654033Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2502.08226"},"observation_digest":"sha256:8e6acd0d70bd584a9913bbe9ffcf0108d2524291d25db4306832ffbc29b2bbf9","observation_id":"c0346160-977e-4cd0-978f-3ca7ff3eabe2","resolution":{"observed_at":"2026-08-08T06:01:31.654033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-07T10:10:50.201348Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-08T06:01:31.658565Z","title":"org/CorpusID:237571719","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08226","last_updated":"2025-02-14T06:23:57Z","snapshot_observed_at":"2026-08-08T05:53:49.808163Z","submitted_at":"2025-02-12T09:12:30Z","title":"TRISHUL: Towards Region Identification and Screen Hierarchy Understanding for Large VLM based GUI Agents","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T06:01:31.658565Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2502.08226"},"observation_digest":"sha256:160045c0fb25829eb3387cf10019f3ac9e46010b56ca92651947de30cc3d41ea","observation_id":"f75cad35-a202-4970-a373-c4b62f4779f3","resolution":{"observed_at":"2026-08-08T06:01:31.658565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07562","last_updated":"2023-11-13T18:53:37Z","snapshot_observed_at":"2026-07-06T16:46:57.403995Z","submitted_at":"2023-11-13T18:53:37Z","title":"GPT-4V in Wonderland: Large Multimodal Models for Zero-Shot Smartphone GUI Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07562","snapshot_observed_at":"2026-08-08T06:01:31.663090Z","title":"org/CorpusID:269042918","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08226","last_updated":"2025-02-14T06:23:57Z","snapshot_observed_at":"2026-08-08T05:53:49.808163Z","submitted_at":"2025-02-12T09:12:30Z","title":"TRISHUL: Towards Region Identification and Screen Hierarchy Understanding for Large VLM based GUI Agents","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T06:01:31.663090Z"},"links":{"cited_paper":"/paper/2311.07562","citing_paper":"/paper/2502.08226"},"observation_digest":"sha256:273e77ca732f5ab5c9eacdc5439a6eb5ce4c7dfe64bbf9bbfaac936be44fe215","observation_id":"01fe3106-66a8-4a9a-86bd-b0d11aee631e","resolution":{"observed_at":"2026-08-08T06:01:31.663090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11441","last_updated":"2023-11-06T07:39:49Z","snapshot_observed_at":"2026-08-04T03:29:49.409446Z","submitted_at":"2023-10-17T17:51:31Z","title":"Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11441","snapshot_observed_at":"2026-08-08T06:01:31.667790Z","title":"org/CorpusID:265149992","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08226","last_updated":"2025-02-14T06:23:57Z","snapshot_observed_at":"2026-08-08T05:53:49.808163Z","submitted_at":"2025-02-12T09:12:30Z","title":"TRISHUL: Towards Region Identification and Screen Hierarchy Understanding for Large VLM based GUI Agents","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T06:01:31.667790Z"},"links":{"cited_paper":"/paper/2310.11441","citing_paper":"/paper/2502.08226"},"observation_digest":"sha256:c495d2effb05155bb6a128297e6e2399bb2d9932e4f159bd8fab08e665353d77","observation_id":"aa9efc92-4a2a-4683-ae9b-dae43566a04e","resolution":{"observed_at":"2026-08-08T06:01:31.667790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13771","last_updated":"2026-07-05T07:51:04Z","snapshot_observed_at":"2026-08-04T19:11:48.797552Z","submitted_at":"2023-12-21T11:52:45Z","title":"AppAgent: Multimodal Agents as Smartphone Users","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13771","snapshot_observed_at":"2026-08-08T06:01:31.676622Z","title":"org/CorpusID:269005503","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08226","last_updated":"2025-02-14T06:23:57Z","snapshot_observed_at":"2026-08-08T05:53:49.808163Z","submitted_at":"2025-02-12T09:12:30Z","title":"TRISHUL: Towards Region Identification and Screen Hierarchy Understanding for Large VLM based GUI Agents","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T06:01:31.676622Z"},"links":{"cited_paper":"/paper/2312.13771","citing_paper":"/paper/2502.08226"},"observation_digest":"sha256:5e85072c0b71e459c2a6eb38c778ced54b584e71eb9ac01c4729d70b8d643d4c","observation_id":"e9f968f2-3cde-4033-a7bf-7c5dc11aa0af","resolution":{"observed_at":"2026-08-08T06:01:31.676622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09675","last_updated":"2020-02-24T18:59:28Z","snapshot_observed_at":"2026-07-29T15:42:51.774083Z","submitted_at":"2019-04-21T23:08:53Z","title":"BERTScore: Evaluating Text Generation with BERT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09675","snapshot_observed_at":"2026-08-08T06:01:31.681206Z","title":"org/CorpusID:266435868","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2502.08226","last_updated":"2025-02-14T06:23:57Z","snapshot_observed_at":"2026-08-08T05:53:49.808163Z","submitted_at":"2025-02-12T09:12:30Z","title":"TRISHUL: Towards Region Identification and Screen Hierarchy Understanding for Large VLM based GUI Agents","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T06:01:31.681206Z"},"links":{"cited_paper":"/paper/1904.09675","citing_paper":"/paper/2502.08226"},"observation_digest":"sha256:3f580f095d366364bb5f16cbe24820dce481feaa02bb35011460041b1c7fe229","observation_id":"d5330d4b-a207-43b6-b7a3-b925575f0dd5","resolution":{"observed_at":"2026-08-08T06:01:31.681206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01614","last_updated":"2024-03-12T23:14:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-03T08:33:09Z","title":"GPT-4V(ision) is a Generalist Web Agent, if Grounded","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01614","snapshot_observed_at":"2026-08-08T06:01:31.686444Z","title":"@\", \"#\",","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08226","last_updated":"2025-02-14T06:23:57Z","snapshot_observed_at":"2026-08-08T05:53:49.808163Z","submitted_at":"2025-02-12T09:12:30Z","title":"TRISHUL: Towards Region Identification and Screen Hierarchy Understanding for Large VLM based GUI Agents","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T06:01:31.686444Z"},"links":{"cited_paper":"/paper/2401.01614","citing_paper":"/paper/2502.08226"},"observation_digest":"sha256:fb92c95b5638379ce09ff8f5e9f5c7fd49e8a75f5480154b4612c6ec82b1d721","observation_id":"ef1c7581-0d05-49dd-8657-8151136a04be","resolution":{"observed_at":"2026-08-08T06:01:31.686444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02643","last_updated":"2023-04-05T17:59:46Z","snapshot_observed_at":"2026-08-08T05:14:59.435033Z","submitted_at":"2023-04-05T17:59:46Z","title":"Segment Anything","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02643","snapshot_observed_at":"2026-08-08T06:01:31.635032Z","title":"org/CorpusID:192633","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08226","last_updated":"2025-02-14T06:23:57Z","snapshot_observed_at":"2026-08-08T05:53:49.808163Z","submitted_at":"2025-02-12T09:12:30Z","title":"TRISHUL: Towards Region Identification and Screen Hierarchy Understanding for Large VLM based GUI Agents","version":2},"reference_index":2008,"source":"pdf_text","source_observed_at":"2026-08-08T06:01:31.635032Z"},"links":{"cited_paper":"/paper/2304.02643","citing_paper":"/paper/2502.08226"},"observation_digest":"sha256:7fb8fcef2d1debe96a89de07229a557a12ae7d4c4d781e82fbc22a65f760b155","observation_id":"af771705-efb5-4777-9299-8f876ae147b1","resolution":{"observed_at":"2026-08-08T06:01:31.635032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.12856","last_updated":"2024-02-25T16:17:43Z","snapshot_observed_at":"2026-07-06T15:57:53.178833Z","submitted_at":"2023-07-24T14:56:30Z","title":"A Real-World WebAgent with Planning, Long Context Understanding, and Program Synthesis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.12856","snapshot_observed_at":"2026-08-08T06:01:31.611688Z","title":"org/CorpusID:56657805","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08226","last_updated":"2025-02-14T06:23:57Z","snapshot_observed_at":"2026-08-08T05:53:49.808163Z","submitted_at":"2025-02-12T09:12:30Z","title":"TRISHUL: Towards Region Identification and Screen Hierarchy Understanding for Large VLM based GUI Agents","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-08T06:01:31.611688Z"},"links":{"cited_paper":"/paper/2307.12856","citing_paper":"/paper/2502.08226"},"observation_digest":"sha256:f6c5abcbc192ece4c6d546fa4c4dc703b1615dcde555685ecfbc4cdad2b90464","observation_id":"4202dee2-31ba-49c7-ad4b-7b254cddc4de","resolution":{"observed_at":"2026-08-08T06:01:31.611688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T06:01:32.058988Z","title":"org/CorpusID:218971783","venue":null,"work_id":"bf1f748e-947e-4bbb-8727-a4c52cb4e420","year":2020},"citing_paper":{"arxiv_id":"2502.08226","last_updated":"2025-02-14T06:23:57Z","snapshot_observed_at":"2026-08-08T05:53:49.808163Z","submitted_at":"2025-02-12T09:12:30Z","title":"TRISHUL: Towards Region Identification and Screen Hierarchy Understanding for Large VLM based GUI Agents","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-08T06:01:31.591836Z"},"links":{"citing_paper":"/paper/2502.08226"},"observation_digest":"sha256:dcec682acd0c3edff16fa8c2b35db5868e55755ae0cae7e8076e8c57ff4505ad","observation_id":"98dd4547-f206-478c-9629-64696f6a6200","resolution":{"observed_at":"2026-08-08T06:01:32.063652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11896","last_updated":"2024-06-14T17:49:55Z","snapshot_observed_at":"2026-08-05T15:40:55.400927Z","submitted_at":"2024-06-14T17:49:55Z","title":"DigiRL: Training In-The-Wild Device-Control Agents with Autonomous Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11896","snapshot_observed_at":"2026-08-08T06:01:31.581813Z","title":"org/CorpusID:236493482","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08226","last_updated":"2025-02-14T06:23:57Z","snapshot_observed_at":"2026-08-08T05:53:49.808163Z","submitted_at":"2025-02-12T09:12:30Z","title":"TRISHUL: Towards Region Identification and Screen Hierarchy Understanding for Large VLM based GUI Agents","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-08T06:01:31.581813Z"},"links":{"cited_paper":"/paper/2406.11896","citing_paper":"/paper/2502.08226"},"observation_digest":"sha256:998a61320c12105c5265d4482448234d5e4e0f77a68444dbe65477808e085043","observation_id":"1e4b7b4c-0a65-427d-8e12-9cf119621f80","resolution":{"observed_at":"2026-08-08T06:01:31.581813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T06:01:31.981386Z","title":"org/CorpusID:250264533","venue":null,"work_id":"2e13eab6-0e3a-4b1b-b902-d38bd1f07387","year":null},"citing_paper":{"arxiv_id":"2502.08226","last_updated":"2025-02-14T06:23:57Z","snapshot_observed_at":"2026-08-08T05:53:49.808163Z","submitted_at":"2025-02-12T09:12:30Z","title":"TRISHUL: Towards Region Identification and Screen Hierarchy Understanding for Large VLM based GUI Agents","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-08T06:01:31.672281Z"},"links":{"citing_paper":"/paper/2502.08226"},"observation_digest":"sha256:997fce88ed08512ba7a568de312304e460b77111bd15c69c9c162ed853439046","observation_id":"45863639-f58e-4012-ac03-715860e055d1","resolution":{"observed_at":"2026-08-08T06:01:31.986571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19263","last_updated":"2024-10-25T18:16:21Z","snapshot_observed_at":"2026-07-06T18:38:00.379225Z","submitted_at":"2024-06-27T15:34:16Z","title":"Read Anywhere Pointed: Layout-aware GUI Screen Reading with Tree-of-Lens Grounding","version":2},"cited_work":{"arxiv_id":"2406.19263","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.19263","snapshot_observed_at":"2026-08-08T06:01:31.916847Z","title":"Read Anywhere Pointed: Layout-aware GUI Screen Reading with Tree-of-Lens Grounding","venue":"cs.CL","work_id":"f43cea23-a75a-4fb5-b0a7-a7a894325448","year":2024},"citing_paper":{"arxiv_id":"2502.08226","last_updated":"2025-02-14T06:23:57Z","snapshot_observed_at":"2026-08-08T05:53:49.808163Z","submitted_at":"2025-02-12T09:12:30Z","title":"TRISHUL: Towards Region Identification and Screen Hierarchy Understanding for Large VLM based GUI Agents","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-08T06:01:31.601410Z"},"links":{"cited_paper":"/paper/2406.19263","citing_paper":"/paper/2502.08226"},"observation_digest":"sha256:18eb2769ad4855c4daeefc1c354842ddc757f75c8f8cb18c11cd3bc0b3f1f892","observation_id":"0e529500-dc0f-4b61-96ad-87288b2f6ad2","resolution":{"observed_at":"2026-08-08T06:01:31.923914Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-08T06:01:31.587294Z","title":"org/CorpusID:270562229","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2502.08226","last_updated":"2025-02-14T06:23:57Z","snapshot_observed_at":"2026-08-08T05:53:49.808163Z","submitted_at":"2025-02-12T09:12:30Z","title":"TRISHUL: Towards Region Identification and Screen Hierarchy Understanding for Large VLM based GUI Agents","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-08T06:01:31.587294Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2502.08226"},"observation_digest":"sha256:d9a53f4fd4073552080c87f2626da96d5af408183f256f0d06e63d50a4e004e6","observation_id":"89245070-267b-4638-aef9-4731d7ccf824","resolution":{"observed_at":"2026-08-08T06:01:31.587294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.08226","last_updated":"2025-02-14T06:23:57Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T05:53:49.808163Z","submitted_at":"2025-02-12T09:12:30Z","title":"TRISHUL: Towards Region Identification and Screen Hierarchy Understanding for Large VLM based GUI Agents"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":16,"verified_exact":0,"verified_fuzzy":6},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 4 inbound Pith citation observations for arXiv:2502.08226."}