{"as_of":"2026-08-10T21:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:24f3edf9aa9618e970414a715c6a94c37ee836eb95bed67d84f90cb028b9e802","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T08:47:00.222759Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.04334/citation-record","integrity":"/paper/2607.04334/integrity","json":"/paper/2607.04334/citation-record.json","paper":"/paper/2607.04334"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2401.10935","last_updated":"2024-02-23T04:36:51Z","snapshot_observed_at":"2026-08-08T03:28:12.161766Z","submitted_at":"2024-01-17T08:10:35Z","title":"SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10935","snapshot_observed_at":"2026-08-02T08:46:58.841614Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04334","last_updated":"2026-07-18T16:56:38Z","snapshot_observed_at":"2026-08-02T08:46:57.997006Z","submitted_at":"2026-07-05T14:33:29Z","title":"Do GUI Agents Believe Their Eyes? Diagnosing State-Belief Reliance on Pixels versus Structure","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T08:46:58.841614Z"},"links":{"cited_paper":"/paper/2401.10935","citing_paper":"/paper/2607.04334"},"observation_digest":"sha256:6eb99f1703300b068e82248888bc0dd92af60220db80fee059b72b65f122613d","observation_id":"15d12ab7-d2d9-4368-b527-25ca6bcd0269","resolution":{"observed_at":"2026-08-02T08:46:58.841614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13919","last_updated":"2024-06-06T18:37:34Z","snapshot_observed_at":"2026-08-09T21:47:22.232349Z","submitted_at":"2024-01-25T03:33:18Z","title":"WebVoyager: Building an End-to-End Web Agent with Large Multimodal Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13919","snapshot_observed_at":"2026-08-02T08:46:59.178429Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04334","last_updated":"2026-07-18T16:56:38Z","snapshot_observed_at":"2026-08-02T08:46:57.997006Z","submitted_at":"2026-07-05T14:33:29Z","title":"Do GUI Agents Believe Their Eyes? Diagnosing State-Belief Reliance on Pixels versus Structure","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T08:46:59.178429Z"},"links":{"cited_paper":"/paper/2401.13919","citing_paper":"/paper/2607.04334"},"observation_digest":"sha256:59924bf2f6836c90414005fbdfe74478cb296b4f56cb4bb5372f9c696645d4e8","observation_id":"72b21fe9-7339-4c3e-a3ef-5b1aeeeee905","resolution":{"observed_at":"2026-08-02T08:46:59.178429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13649","last_updated":"2024-06-06T02:01:09Z","snapshot_observed_at":"2026-08-05T16:01:54.847394Z","submitted_at":"2024-01-24T18:35:21Z","title":"VisualWebArena: Evaluating Multimodal Agents on Realistic Visual Web Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13649","snapshot_observed_at":"2026-08-02T08:46:59.230300Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04334","last_updated":"2026-07-18T16:56:38Z","snapshot_observed_at":"2026-08-02T08:46:57.997006Z","submitted_at":"2026-07-05T14:33:29Z","title":"Do GUI Agents Believe Their Eyes? Diagnosing State-Belief Reliance on Pixels versus Structure","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T08:46:59.230300Z"},"links":{"cited_paper":"/paper/2401.13649","citing_paper":"/paper/2607.04334"},"observation_digest":"sha256:957b41ab79a1c8f8f0c3a586a218b6460c1b1f5c1e7fc6d7e96d747c9db31d5a","observation_id":"5298c8ae-7e9b-4f57-9269-5cf9826aef89","resolution":{"observed_at":"2026-08-02T08:46:59.230300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:46:59.290377Z","title":"arXiv preprint arXiv:2506.14866","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04334","last_updated":"2026-07-18T16:56:38Z","snapshot_observed_at":"2026-08-02T08:46:57.997006Z","submitted_at":"2026-07-05T14:33:29Z","title":"Do GUI Agents Believe Their Eyes? Diagnosing State-Belief Reliance on Pixels versus Structure","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T08:46:59.290377Z"},"links":{"citing_paper":"/paper/2607.04334"},"observation_digest":"sha256:7aaabe638303c019deef62653207e57aaba2821e6b270433ff18ffaf5a561f43","observation_id":"951c97af-1154-4603-8870-393df154e43d","resolution":{"observed_at":"2026-08-02T08:46:59.290377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07981","last_updated":"2025-04-04T14:25:17Z","snapshot_observed_at":"2026-08-07T16:08:52.673312Z","submitted_at":"2025-04-04T14:25:17Z","title":"ScreenSpot-Pro: GUI Grounding for Professional High-Resolution Computer Use","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07981","snapshot_observed_at":"2026-08-02T08:46:59.376649Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04334","last_updated":"2026-07-18T16:56:38Z","snapshot_observed_at":"2026-08-02T08:46:57.997006Z","submitted_at":"2026-07-05T14:33:29Z","title":"Do GUI Agents Believe Their Eyes? Diagnosing State-Belief Reliance on Pixels versus Structure","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T08:46:59.376649Z"},"links":{"cited_paper":"/paper/2504.07981","citing_paper":"/paper/2607.04334"},"observation_digest":"sha256:cd43e3a1f8f31169c1bd0a32108b721513ee9dc50cf162aa6e3cf1cf602941e2","observation_id":"2764b688-9b77-44b9-998c-1f4d46165ba5","resolution":{"observed_at":"2026-08-02T08:46:59.376649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17465","last_updated":"2024-11-26T14:29:47Z","snapshot_observed_at":"2026-08-10T11:30:41.419025Z","submitted_at":"2024-11-26T14:29:47Z","title":"ShowUI: One Vision-Language-Action Model for GUI Visual Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17465","snapshot_observed_at":"2026-08-02T08:46:59.431501Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04334","last_updated":"2026-07-18T16:56:38Z","snapshot_observed_at":"2026-08-02T08:46:57.997006Z","submitted_at":"2026-07-05T14:33:29Z","title":"Do GUI Agents Believe Their Eyes? Diagnosing State-Belief Reliance on Pixels versus Structure","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T08:46:59.431501Z"},"links":{"cited_paper":"/paper/2411.17465","citing_paper":"/paper/2607.04334"},"observation_digest":"sha256:37d60080b45fefcccdaccf957860c3a78d2c200ce466a808ce15aa6f0abfb732","observation_id":"6ee9538c-55f7-44f6-a56c-cf5914914214","resolution":{"observed_at":"2026-08-02T08:46:59.431501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:46:59.525844Z","title":"Lu, Y.; Yang, J.; Shen, Y.; and Awadallah, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04334","last_updated":"2026-07-18T16:56:38Z","snapshot_observed_at":"2026-08-02T08:46:57.997006Z","submitted_at":"2026-07-05T14:33:29Z","title":"Do GUI Agents Believe Their Eyes? Diagnosing State-Belief Reliance on Pixels versus Structure","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T08:46:59.525844Z"},"links":{"citing_paper":"/paper/2607.04334"},"observation_digest":"sha256:b1dd84ea5dda73147f9020566eddef84779e281a3f69f41c7a2d6f85c5206744","observation_id":"5453de06-1f7f-4108-9b85-0fc9491ad060","resolution":{"observed_at":"2026-08-02T08:46:59.525844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00203","last_updated":"2024-08-01T00:00:43Z","snapshot_observed_at":"2026-08-10T14:01:04.459878Z","submitted_at":"2024-08-01T00:00:43Z","title":"OmniParser for Pure Vision Based GUI Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00203","snapshot_observed_at":"2026-08-02T08:46:59.575883Z","title":"Lu, Y.; Zhao, M.; Ju, T.; Yan, Z.; Ma, X.; Guo, Y.; Ding, D.; Liu, G.; and Zhang, Z","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04334","last_updated":"2026-07-18T16:56:38Z","snapshot_observed_at":"2026-08-02T08:46:57.997006Z","submitted_at":"2026-07-05T14:33:29Z","title":"Do GUI Agents Believe Their Eyes? Diagnosing State-Belief Reliance on Pixels versus Structure","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T08:46:59.575883Z"},"links":{"cited_paper":"/paper/2408.00203","citing_paper":"/paper/2607.04334"},"observation_digest":"sha256:9c2a97f82d2817441b9d99026bb4ba464dcc61432d85f9b3e2f93918229e7a60","observation_id":"36d7466f-4b58-4f7c-b509-160ddb2445fc","resolution":{"observed_at":"2026-08-02T08:46:59.575883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14289","last_updated":"2026-06-05T10:24:33Z","snapshot_observed_at":"2026-08-07T15:34:54.479489Z","submitted_at":"2025-05-20T12:41:05Z","title":"EVA: Evolving Semantic Adversaries for Red-Teaming GUI Agents Against Environmental Injection Attacks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14289","snapshot_observed_at":"2026-08-02T08:46:59.620484Z","title":"Muryn, V.; Sumyk, M.; Hirna, M.; Garkot, S.; and Sham- rai, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04334","last_updated":"2026-07-18T16:56:38Z","snapshot_observed_at":"2026-08-02T08:46:57.997006Z","submitted_at":"2026-07-05T14:33:29Z","title":"Do GUI Agents Believe Their Eyes? Diagnosing State-Belief Reliance on Pixels versus Structure","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T08:46:59.620484Z"},"links":{"cited_paper":"/paper/2505.14289","citing_paper":"/paper/2607.04334"},"observation_digest":"sha256:54ee36f0346ea6a99b44f29f660dc65e4e2405b2a4e3d71aeff6d867954c16a9","observation_id":"fcc245f2-2e48-40df-8466-d0decfa321f5","resolution":{"observed_at":"2026-08-02T08:46:59.620484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16704","last_updated":"2025-07-22T15:38:12Z","snapshot_observed_at":"2026-08-09T17:12:55.581380Z","submitted_at":"2025-07-22T15:38:12Z","title":"Screen2AX: Vision-Based Approach for Automatic macOS Accessibility Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.16704","snapshot_observed_at":"2026-08-02T08:46:59.664562Z","title":"Park, J.; and Shim, H","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04334","last_updated":"2026-07-18T16:56:38Z","snapshot_observed_at":"2026-08-02T08:46:57.997006Z","submitted_at":"2026-07-05T14:33:29Z","title":"Do GUI Agents Believe Their Eyes? Diagnosing State-Belief Reliance on Pixels versus Structure","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T08:46:59.664562Z"},"links":{"cited_paper":"/paper/2507.16704","citing_paper":"/paper/2607.04334"},"observation_digest":"sha256:aa3b45fc4617599fe478a9040a6e4890433ad410a0c1a9c866997a6751454f3d","observation_id":"bbf4ed8f-733b-46d6-9969-5d601899d01e","resolution":{"observed_at":"2026-08-02T08:46:59.664562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.21061","last_updated":"2026-05-20T11:45:32Z","snapshot_observed_at":"2026-08-03T03:46:14.228234Z","submitted_at":"2026-05-20T11:45:32Z","title":"Grounding Driving VLA via Inverse Kinematics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.21061","snapshot_observed_at":"2026-08-02T08:46:59.721136Z","title":"Qin, Y.; et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04334","last_updated":"2026-07-18T16:56:38Z","snapshot_observed_at":"2026-08-02T08:46:57.997006Z","submitted_at":"2026-07-05T14:33:29Z","title":"Do GUI Agents Believe Their Eyes? Diagnosing State-Belief Reliance on Pixels versus Structure","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T08:46:59.721136Z"},"links":{"cited_paper":"/paper/2605.21061","citing_paper":"/paper/2607.04334"},"observation_digest":"sha256:acf10967c520ac40ac098b0d5d1dcc078aeaff069055bc52ccedcea0e8cd256a","observation_id":"996e118c-88ca-4ee1-9da6-2fda21019d87","resolution":{"observed_at":"2026-08-02T08:46:59.721136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12326","last_updated":"2025-01-21T17:48:10Z","snapshot_observed_at":"2026-07-06T20:23:58.426780Z","submitted_at":"2025-01-21T17:48:10Z","title":"UI-TARS: Pioneering Automated GUI Interaction with Native Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12326","snapshot_observed_at":"2026-08-02T08:46:59.778832Z","title":"Rahman, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04334","last_updated":"2026-07-18T16:56:38Z","snapshot_observed_at":"2026-08-02T08:46:57.997006Z","submitted_at":"2026-07-05T14:33:29Z","title":"Do GUI Agents Believe Their Eyes? Diagnosing State-Belief Reliance on Pixels versus Structure","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T08:46:59.778832Z"},"links":{"cited_paper":"/paper/2501.12326","citing_paper":"/paper/2607.04334"},"observation_digest":"sha256:524a4a09426d3a7c8f9b00611ee40066d2253f74b9998497ca2a5fc3547ee6ec","observation_id":"fedaa37c-b4e5-407b-92c3-dde930a09257","resolution":{"observed_at":"2026-08-02T08:46:59.778832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:46:59.884489Z","title":"Rawles, C.; et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04334","last_updated":"2026-07-18T16:56:38Z","snapshot_observed_at":"2026-08-02T08:46:57.997006Z","submitted_at":"2026-07-05T14:33:29Z","title":"Do GUI Agents Believe Their Eyes? Diagnosing State-Belief Reliance on Pixels versus Structure","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T08:46:59.884489Z"},"links":{"citing_paper":"/paper/2607.04334"},"observation_digest":"sha256:2d98a3f2e1098193e7256ea9debc64201ad73888345e4c4f8a7abf57d4db6d79","observation_id":"7ba51528-3455-426f-af8b-605bca05dc8a","resolution":{"observed_at":"2026-08-02T08:46:59.884489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14573","last_updated":"2025-04-06T20:37:50Z","snapshot_observed_at":"2026-08-07T08:11:20.950548Z","submitted_at":"2024-05-23T13:48:54Z","title":"AndroidWorld: A Dynamic Benchmarking Environment for Autonomous Agents","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14573","snapshot_observed_at":"2026-08-02T08:46:59.942292Z","title":"Schiepanski, T","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04334","last_updated":"2026-07-18T16:56:38Z","snapshot_observed_at":"2026-08-02T08:46:57.997006Z","submitted_at":"2026-07-05T14:33:29Z","title":"Do GUI Agents Believe Their Eyes? Diagnosing State-Belief Reliance on Pixels versus Structure","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T08:46:59.942292Z"},"links":{"cited_paper":"/paper/2405.14573","citing_paper":"/paper/2607.04334"},"observation_digest":"sha256:9a6fdbcb9437c3bf70289a908d66ea431f045d65737f64bd7da09119fbf29218","observation_id":"17508232-d0e0-4ba5-83df-ee9000dae65a","resolution":{"observed_at":"2026-08-02T08:46:59.942292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:46:59.975207Z","title":"arXiv preprint arXiv:2508.04412","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04334","last_updated":"2026-07-18T16:56:38Z","snapshot_observed_at":"2026-08-02T08:46:57.997006Z","submitted_at":"2026-07-05T14:33:29Z","title":"Do GUI Agents Believe Their Eyes? Diagnosing State-Belief Reliance on Pixels versus Structure","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T08:46:59.975207Z"},"links":{"citing_paper":"/paper/2607.04334"},"observation_digest":"sha256:a9b4912ef77b765776c9e2a9d822da802d725482649a7f0f6be0fe50328753eb","observation_id":"e727ae0c-600b-4cf3-89ba-cc896f1a1ae7","resolution":{"observed_at":"2026-08-02T08:46:59.975207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:46:59.995637Z","title":"Wu,Q.;Cheng,K.;Yang,R.;Zhang,C.;Yang,J.;Jiang,H.; Mu, J.; Peng, B.; Qiao, B.; Zheng, L.; et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04334","last_updated":"2026-07-18T16:56:38Z","snapshot_observed_at":"2026-08-02T08:46:57.997006Z","submitted_at":"2026-07-05T14:33:29Z","title":"Do GUI Agents Believe Their Eyes? Diagnosing State-Belief Reliance on Pixels versus Structure","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T08:46:59.995637Z"},"links":{"citing_paper":"/paper/2607.04334"},"observation_digest":"sha256:1bda6962ca120c7f9392b9a6e6fbdb312155253fbd7575b396def7ceab91e212","observation_id":"391a9e9e-7619-465e-90e6-0926a541c8b4","resolution":{"observed_at":"2026-08-02T08:46:59.995637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-09T01:39:11.956106Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-02T08:47:00.045453Z","title":"InNeurIPS","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04334","last_updated":"2026-07-18T16:56:38Z","snapshot_observed_at":"2026-08-02T08:46:57.997006Z","submitted_at":"2026-07-05T14:33:29Z","title":"Do GUI Agents Believe Their Eyes? Diagnosing State-Belief Reliance on Pixels versus Structure","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T08:47:00.045453Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2607.04334"},"observation_digest":"sha256:f82b3f08f42919ee462beac6d9c0fc3e5bd1c712ca556339a3a22b1748e8e2a8","observation_id":"cb09fa53-9950-4b24-980c-143511f6dbf7","resolution":{"observed_at":"2026-08-02T08:47:00.045453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04454","last_updated":"2025-05-05T16:17:20Z","snapshot_observed_at":"2026-07-06T20:02:21.509050Z","submitted_at":"2024-12-05T18:58:26Z","title":"Aguvis: Unified Pure Vision Agents for Autonomous GUI Interaction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04454","snapshot_observed_at":"2026-08-02T08:47:00.078234Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04334","last_updated":"2026-07-18T16:56:38Z","snapshot_observed_at":"2026-08-02T08:46:57.997006Z","submitted_at":"2026-07-05T14:33:29Z","title":"Do GUI Agents Believe Their Eyes? Diagnosing State-Belief Reliance on Pixels versus Structure","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T08:47:00.078234Z"},"links":{"cited_paper":"/paper/2412.04454","citing_paper":"/paper/2607.04334"},"observation_digest":"sha256:93a0f4d93134967886860acde792db92afdf6890de83ce5cb2fda85e1c5540e9","observation_id":"8d6d3349-a716-4847-ba23-f604a29b0dae","resolution":{"observed_at":"2026-08-02T08:47:00.078234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12370","last_updated":"2025-05-24T03:01:02Z","snapshot_observed_at":"2026-08-07T15:43:40.367697Z","submitted_at":"2025-05-18T11:22:04Z","title":"Enhancing Visual Grounding for GUI Agents via Self-Evolutionary Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12370","snapshot_observed_at":"2026-08-02T08:47:00.112259Z","title":"Zhang, G.; Zheng, H.; and Yang, H","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04334","last_updated":"2026-07-18T16:56:38Z","snapshot_observed_at":"2026-08-02T08:46:57.997006Z","submitted_at":"2026-07-05T14:33:29Z","title":"Do GUI Agents Believe Their Eyes? Diagnosing State-Belief Reliance on Pixels versus Structure","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T08:47:00.112259Z"},"links":{"cited_paper":"/paper/2505.12370","citing_paper":"/paper/2607.04334"},"observation_digest":"sha256:af7f690cfebd3c17e4f2eb690345abab07cda8213fd6e883e74acf90c4fbfb43","observation_id":"375d6bab-54a4-47b5-a37b-efe43ed52d82","resolution":{"observed_at":"2026-08-02T08:47:00.112259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.19192","last_updated":"2026-05-20T21:49:08Z","snapshot_observed_at":"2026-08-03T06:06:31.296336Z","submitted_at":"2026-05-18T23:40:43Z","title":"Hallucination as Exploit: Evidence-Carrying Multimodal Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.19192","snapshot_observed_at":"2026-08-02T08:47:00.150429Z","title":"Zheng, B.; Gou, B.; Kil, J.; Sun, H.; and Su, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04334","last_updated":"2026-07-18T16:56:38Z","snapshot_observed_at":"2026-08-02T08:46:57.997006Z","submitted_at":"2026-07-05T14:33:29Z","title":"Do GUI Agents Believe Their Eyes? Diagnosing State-Belief Reliance on Pixels versus Structure","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T08:47:00.150429Z"},"links":{"cited_paper":"/paper/2605.19192","citing_paper":"/paper/2607.04334"},"observation_digest":"sha256:31e88ef7a3325cdda6329955fbfc2c39561af12599b9a9e5cf746a56a125f7c0","observation_id":"2028c1b9-7883-4914-b5a4-9d0cea7808d9","resolution":{"observed_at":"2026-08-02T08:47:00.150429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01614","last_updated":"2024-03-12T23:14:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-03T08:33:09Z","title":"GPT-4V(ision) is a Generalist Web Agent, if Grounded","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01614","snapshot_observed_at":"2026-08-02T08:47:00.184606Z","title":"abs.det","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04334","last_updated":"2026-07-18T16:56:38Z","snapshot_observed_at":"2026-08-02T08:46:57.997006Z","submitted_at":"2026-07-05T14:33:29Z","title":"Do GUI Agents Believe Their Eyes? Diagnosing State-Belief Reliance on Pixels versus Structure","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T08:47:00.184606Z"},"links":{"cited_paper":"/paper/2401.01614","citing_paper":"/paper/2607.04334"},"observation_digest":"sha256:5bf2727e26de3e13e6f7e1b22a0748e2dc6d555835e8f813a0f3f99252537227","observation_id":"b6e18209-2cbc-4092-8fb5-4d8e829d4cc5","resolution":{"observed_at":"2026-08-02T08:47:00.184606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:47:00.222759Z","title":"err” is the text-swap / stale-node action error, “SF","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04334","last_updated":"2026-07-18T16:56:38Z","snapshot_observed_at":"2026-08-02T08:46:57.997006Z","submitted_at":"2026-07-05T14:33:29Z","title":"Do GUI Agents Believe Their Eyes? Diagnosing State-Belief Reliance on Pixels versus Structure","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T08:47:00.222759Z"},"links":{"citing_paper":"/paper/2607.04334"},"observation_digest":"sha256:c777aa38037e5a13b14e934c5e93a6d15401818b0fe90778868bfd557614aa0e","observation_id":"26251104-136d-484b-bb95-87c45c01aabf","resolution":{"observed_at":"2026-08-02T08:47:00.222759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.08802","last_updated":"2018-02-24T05:32:47Z","snapshot_observed_at":"2026-07-06T06:25:09.401059Z","submitted_at":"2018-02-24T05:32:47Z","title":"Reinforcement Learning on Web Interfaces Using Workflow-Guided Exploration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.08802","snapshot_observed_at":"2026-08-02T08:46:59.478572Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04334","last_updated":"2026-07-18T16:56:38Z","snapshot_observed_at":"2026-08-02T08:46:57.997006Z","submitted_at":"2026-07-05T14:33:29Z","title":"Do GUI Agents Believe Their Eyes? Diagnosing State-Belief Reliance on Pixels versus Structure","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-02T08:46:59.478572Z"},"links":{"cited_paper":"/paper/1802.08802","citing_paper":"/paper/2607.04334"},"observation_digest":"sha256:ac385a876b84c9b8cc1e6fc024f094f75a526f5fa297d61c4a99aaafb128558c","observation_id":"1962c545-3095-46c3-9240-8e6c34aa1f8b","resolution":{"observed_at":"2026-08-02T08:46:59.478572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.06070","last_updated":"2023-12-09T05:57:46Z","snapshot_observed_at":"2026-07-06T15:40:50.807376Z","submitted_at":"2023-06-09T17:44:31Z","title":"Mind2Web: Towards a Generalist Agent for the Web","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.06070","snapshot_observed_at":"2026-08-02T08:46:59.023831Z","title":"InNeurIPS","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04334","last_updated":"2026-07-18T16:56:38Z","snapshot_observed_at":"2026-08-02T08:46:57.997006Z","submitted_at":"2026-07-05T14:33:29Z","title":"Do GUI Agents Believe Their Eyes? Diagnosing State-Belief Reliance on Pixels versus Structure","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-02T08:46:59.023831Z"},"links":{"cited_paper":"/paper/2306.06070","citing_paper":"/paper/2607.04334"},"observation_digest":"sha256:af53f1b1f486fd845aba738c96b38c8041fce00e17e20b090877709dde360273","observation_id":"1e79545e-a2c6-4745-8949-f44f76221267","resolution":{"observed_at":"2026-08-02T08:46:59.023831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10819","last_updated":"2025-03-24T11:46:14Z","snapshot_observed_at":"2026-07-06T18:31:40.910349Z","submitted_at":"2024-06-16T06:56:53Z","title":"GUI-World: A Video Benchmark and Dataset for Multimodal GUI-oriented Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10819","snapshot_observed_at":"2026-08-02T08:46:58.780844Z","title":"Cheng, K.; et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04334","last_updated":"2026-07-18T16:56:38Z","snapshot_observed_at":"2026-08-02T08:46:57.997006Z","submitted_at":"2026-07-05T14:33:29Z","title":"Do GUI Agents Believe Their Eyes? Diagnosing State-Belief Reliance on Pixels versus Structure","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T08:46:58.780844Z"},"links":{"cited_paper":"/paper/2406.10819","citing_paper":"/paper/2607.04334"},"observation_digest":"sha256:0c366bbb47a73f19796946e67c43b00c7e563c583abec5251a5dc2d42fc8135b","observation_id":"7d88eb89-7126-4b75-a01e-8914a9c9e72b","resolution":{"observed_at":"2026-08-02T08:46:58.780844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T08:46:58.718693Z","title":"Chen, D.; et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04334","last_updated":"2026-07-18T16:56:38Z","snapshot_observed_at":"2026-08-02T08:46:57.997006Z","submitted_at":"2026-07-05T14:33:29Z","title":"Do GUI Agents Believe Their Eyes? Diagnosing State-Belief Reliance on Pixels versus Structure","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T08:46:58.718693Z"},"links":{"citing_paper":"/paper/2607.04334"},"observation_digest":"sha256:6f99f9c79616ee4951de46de4e67b3c09ccd836f3dc66baff9ea2a41f634b01c","observation_id":"2d9f4ea4-8334-4b5c-b423-04957040df4c","resolution":{"observed_at":"2026-08-02T08:46:58.718693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.15128","last_updated":"2026-05-14T17:37:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-14T17:37:52Z","title":"MemEye: A Visual-Centric Evaluation Framework for Multimodal Agent Memory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.15128","snapshot_observed_at":"2026-08-02T08:46:59.069624Z","title":"He, H.; Yao, W.; Ma, K.; Yu, W.; Dai, Y.; Zhang, H.; Lan, Z.; and Yu, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04334","last_updated":"2026-07-18T16:56:38Z","snapshot_observed_at":"2026-08-02T08:46:57.997006Z","submitted_at":"2026-07-05T14:33:29Z","title":"Do GUI Agents Believe Their Eyes? Diagnosing State-Belief Reliance on Pixels versus Structure","version":2},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-02T08:46:59.069624Z"},"links":{"cited_paper":"/paper/2605.15128","citing_paper":"/paper/2607.04334"},"observation_digest":"sha256:e8a93d1aa8bd01ae71cc580935479550b66ec9ee3107d391123709bdfb7c6ffa","observation_id":"4eec5a4e-4779-45c9-b3cf-367bed3ba159","resolution":{"observed_at":"2026-08-02T08:46:59.069624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.04334","last_updated":"2026-07-18T16:56:38Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-02T08:46:57.997006Z","submitted_at":"2026-07-05T14:33:29Z","title":"Do GUI Agents Believe Their Eyes? Diagnosing State-Belief Reliance on Pixels versus Structure"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:2607.04334."}