{"as_of":"2026-08-12T09:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5c677965e1f565a61b71a88e57409481c56361d1340d9d9a9ce6238a707d598f","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T15:38:09.367743Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-19T11:08:27.472508Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-19T11:08:27.773962Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.10840","last_updated":"2024-12-14T14:30:05Z","snapshot_observed_at":"2026-08-11T15:31:55.689554Z","submitted_at":"2024-12-14T14:30:05Z","title":"Attention-driven GUI Grounding: Leveraging Pretrained Multimodal Large Language Models without Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2412.10840","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.10840","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attention- driven gui grounding: Leveraging pretrained multimodal large language models without fine-tuning","venue":null,"work_id":"05093fcc-1634-4179-a362-aa81a028c038","year":2024},"citing_paper":{"arxiv_id":"2411.18279","last_updated":"2025-05-06T15:08:00Z","snapshot_observed_at":"2026-07-06T19:57:55.925634Z","submitted_at":"2024-11-27T12:13:39Z","title":"Large Language Model-Brained GUI Agents: A Survey","version":12},"reference_index":216,"source":"pdf_text","source_observed_at":"2026-05-19T11:08:27.472508Z"},"links":{"cited_paper":"/paper/2412.10840","citing_paper":"/paper/2411.18279"},"observation_digest":"sha256:b92bc602d3024cd40b5889858936297104ae9dfba813b65ca90fcbcc29b7a96c","observation_id":"389aaa17-af3a-47dd-a822-c935abd24dc0","resolution":{"observed_at":"2026-05-19T11:08:27.775558Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.10840/citation-record","integrity":"/paper/2412.10840/integrity","json":"/paper/2412.10840/citation-record.json","paper":"/paper/2412.10840"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:38:09.937237Z","title":null,"venue":null,"work_id":"e3ab8924-88d2-4f85-9eb9-667312bba494","year":2024},"citing_paper":{"arxiv_id":"2412.10840","last_updated":"2024-12-14T14:30:05Z","snapshot_observed_at":"2026-08-11T15:31:55.689554Z","submitted_at":"2024-12-14T14:30:05Z","title":"Attention-driven GUI Grounding: Leveraging Pretrained Multimodal Large Language Models without Fine-Tuning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T15:38:09.180381Z"},"links":{"citing_paper":"/paper/2412.10840"},"observation_digest":"sha256:1070773e0694be930ab77c9dd2fce2ea50002cf1d06d31f52f17c2a07586cc06","observation_id":"d2fb6641-a1f2-4151-9814-6decf45c19e7","resolution":{"observed_at":"2026-08-11T15:38:09.941800Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-11T15:38:09.187380Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10840","last_updated":"2024-12-14T14:30:05Z","snapshot_observed_at":"2026-08-11T15:31:55.689554Z","submitted_at":"2024-12-14T14:30:05Z","title":"Attention-driven GUI Grounding: Leveraging Pretrained Multimodal Large Language Models without Fine-Tuning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T15:38:09.187380Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2412.10840"},"observation_digest":"sha256:757ba22cc91bb1ebb4f0a67786e6117fffc0dd041612871cebe4e54e83feb457","observation_id":"8d589e4d-f355-444a-857e-017b8961dca2","resolution":{"observed_at":"2026-08-11T15:38:09.187380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-06T12:38:03.720232Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-11T15:38:09.194044Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10840","last_updated":"2024-12-14T14:30:05Z","snapshot_observed_at":"2026-08-11T15:31:55.689554Z","submitted_at":"2024-12-14T14:30:05Z","title":"Attention-driven GUI Grounding: Leveraging Pretrained Multimodal Large Language Models without Fine-Tuning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T15:38:09.194044Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2412.10840"},"observation_digest":"sha256:390d296b88c348f94c9c1deb740337849aca250f23efa8cfcadb1219169adb83","observation_id":"6e68d410-381b-432e-bb3a-b05faf70a060","resolution":{"observed_at":"2026-08-11T15:38:09.194044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11317","last_updated":"2025-05-30T07:30:07Z","snapshot_observed_at":"2026-08-03T01:36:55.704876Z","submitted_at":"2024-06-17T08:30:55Z","title":"GUICourse: From General Vision Language Models to Versatile GUI Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11317","snapshot_observed_at":"2026-08-11T15:38:09.199600Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10840","last_updated":"2024-12-14T14:30:05Z","snapshot_observed_at":"2026-08-11T15:31:55.689554Z","submitted_at":"2024-12-14T14:30:05Z","title":"Attention-driven GUI Grounding: Leveraging Pretrained Multimodal Large Language Models without Fine-Tuning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T15:38:09.199600Z"},"links":{"cited_paper":"/paper/2406.11317","citing_paper":"/paper/2412.10840"},"observation_digest":"sha256:922d59a6f47fbe17038096beea796aa4669b72d1d26ccb2906736fd70e53b797","observation_id":"7a4c49e1-d45c-4af0-b7f5-a36a784cf6ea","resolution":{"observed_at":"2026-08-11T15:38:09.199600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10935","last_updated":"2024-02-23T04:36:51Z","snapshot_observed_at":"2026-08-11T07:36:02.871665Z","submitted_at":"2024-01-17T08:10:35Z","title":"SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10935","snapshot_observed_at":"2026-08-11T15:38:09.204777Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10840","last_updated":"2024-12-14T14:30:05Z","snapshot_observed_at":"2026-08-11T15:31:55.689554Z","submitted_at":"2024-12-14T14:30:05Z","title":"Attention-driven GUI Grounding: Leveraging Pretrained Multimodal Large Language Models without Fine-Tuning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T15:38:09.204777Z"},"links":{"cited_paper":"/paper/2401.10935","citing_paper":"/paper/2412.10840"},"observation_digest":"sha256:bcad1a2314c6615e1b28dd0db2aedd64dd960ce7de28c614559a77eb474dd2b4","observation_id":"b0c37753-debe-4836-b087-de80a8bccf36","resolution":{"observed_at":"2026-08-11T15:38:09.204777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:38:09.922453Z","title":null,"venue":null,"work_id":"ba339e7f-85c5-4dc8-a309-5a4b162c3a8e","year":2024},"citing_paper":{"arxiv_id":"2412.10840","last_updated":"2024-12-14T14:30:05Z","snapshot_observed_at":"2026-08-11T15:31:55.689554Z","submitted_at":"2024-12-14T14:30:05Z","title":"Attention-driven GUI Grounding: Leveraging Pretrained Multimodal Large Language Models without Fine-Tuning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T15:38:09.210192Z"},"links":{"citing_paper":"/paper/2412.10840"},"observation_digest":"sha256:281c48f03061504b3242e41ebc99608b4bf2777f2829677439d92b2589d85a85","observation_id":"bab83b3f-e46b-49d0-8d44-304eb99b16cb","resolution":{"observed_at":"2026-08-11T15:38:09.927142Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19263","last_updated":"2024-10-25T18:16:21Z","snapshot_observed_at":"2026-08-09T22:10:01.192081Z","submitted_at":"2024-06-27T15:34:16Z","title":"Read Anywhere Pointed: Layout-aware GUI Screen Reading with Tree-of-Lens Grounding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19263","snapshot_observed_at":"2026-08-11T15:38:09.215802Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10840","last_updated":"2024-12-14T14:30:05Z","snapshot_observed_at":"2026-08-11T15:31:55.689554Z","submitted_at":"2024-12-14T14:30:05Z","title":"Attention-driven GUI Grounding: Leveraging Pretrained Multimodal Large Language Models without Fine-Tuning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T15:38:09.215802Z"},"links":{"cited_paper":"/paper/2406.19263","citing_paper":"/paper/2412.10840"},"observation_digest":"sha256:463ea6a13b6816d3810b5d6826f182efa7015976f2d132e8609d7a11e21941fd","observation_id":"19466a30-d03d-4bd9-b65f-84aec5094156","resolution":{"observed_at":"2026-08-11T15:38:09.215802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:38:09.905555Z","title":null,"venue":null,"work_id":"3c044dcd-d049-461a-975e-e19f77e7410e","year":2024},"citing_paper":{"arxiv_id":"2412.10840","last_updated":"2024-12-14T14:30:05Z","snapshot_observed_at":"2026-08-11T15:31:55.689554Z","submitted_at":"2024-12-14T14:30:05Z","title":"Attention-driven GUI Grounding: Leveraging Pretrained Multimodal Large Language Models without Fine-Tuning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T15:38:09.221584Z"},"links":{"citing_paper":"/paper/2412.10840"},"observation_digest":"sha256:15f2d21a33775b6ef4be8c2f5b1bd76bfe2ff7146cceac6109083884af202827","observation_id":"b47c38f7-4a7c-4101-981f-85d4b65e43e7","resolution":{"observed_at":"2026-08-11T15:38:09.910905Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13919","last_updated":"2024-06-06T18:37:34Z","snapshot_observed_at":"2026-08-09T21:47:22.232349Z","submitted_at":"2024-01-25T03:33:18Z","title":"WebVoyager: Building an End-to-End Web Agent with Large Multimodal Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.13919","snapshot_observed_at":"2026-08-11T15:38:09.226286Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10840","last_updated":"2024-12-14T14:30:05Z","snapshot_observed_at":"2026-08-11T15:31:55.689554Z","submitted_at":"2024-12-14T14:30:05Z","title":"Attention-driven GUI Grounding: Leveraging Pretrained Multimodal Large Language Models without Fine-Tuning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T15:38:09.226286Z"},"links":{"cited_paper":"/paper/2401.13919","citing_paper":"/paper/2412.10840"},"observation_digest":"sha256:7dfb4032400ac702be2db58d80de8ee59001b7fa726b0f57978341fe2b2a2ab8","observation_id":"671e7e49-cdcf-4e7c-b1f1-0df4486ed79f","resolution":{"observed_at":"2026-08-11T15:38:09.226286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08914","last_updated":"2024-12-27T06:56:18Z","snapshot_observed_at":"2026-08-09T18:08:10.124923Z","submitted_at":"2023-12-14T13:20:57Z","title":"CogAgent: A Visual Language Model for GUI Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.08914","snapshot_observed_at":"2026-08-11T15:38:09.231300Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10840","last_updated":"2024-12-14T14:30:05Z","snapshot_observed_at":"2026-08-11T15:31:55.689554Z","submitted_at":"2024-12-14T14:30:05Z","title":"Attention-driven GUI Grounding: Leveraging Pretrained Multimodal Large Language Models without Fine-Tuning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T15:38:09.231300Z"},"links":{"cited_paper":"/paper/2312.08914","citing_paper":"/paper/2412.10840"},"observation_digest":"sha256:a8c18813384d043e86d40355f92a6edbe59ce46104c819bc2576387c686e0c65","observation_id":"1c4bb37b-564a-411c-aaef-10c9a3e84d39","resolution":{"observed_at":"2026-08-11T15:38:09.231300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17553","last_updated":"2024-07-21T23:16:13Z","snapshot_observed_at":"2026-07-06T17:36:16.016176Z","submitted_at":"2024-02-27T14:47:53Z","title":"OmniACT: A Dataset and Benchmark for Enabling Multimodal Generalist Autonomous Agents for Desktop and Web","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17553","snapshot_observed_at":"2026-08-11T15:38:09.236741Z","title":"P.; Russak, M.; Koh, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10840","last_updated":"2024-12-14T14:30:05Z","snapshot_observed_at":"2026-08-11T15:31:55.689554Z","submitted_at":"2024-12-14T14:30:05Z","title":"Attention-driven GUI Grounding: Leveraging Pretrained Multimodal Large Language Models without Fine-Tuning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T15:38:09.236741Z"},"links":{"cited_paper":"/paper/2402.17553","citing_paper":"/paper/2412.10840"},"observation_digest":"sha256:32ab34115133bcb24605f6b5d623ab7fc19c8e53601fa7e151ed486c92b8cfbc","observation_id":"46557417-933e-4753-8290-db01ddba6a50","resolution":{"observed_at":"2026-08-11T15:38:09.236741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:38:09.888981Z","title":"H.; Zheng, B.; Deng, X.; Su, Y.; and Chao, W.-L","venue":null,"work_id":"1f986457-b9cc-42dd-a1f8-130bada62a5e","year":2024},"citing_paper":{"arxiv_id":"2412.10840","last_updated":"2024-12-14T14:30:05Z","snapshot_observed_at":"2026-08-11T15:31:55.689554Z","submitted_at":"2024-12-14T14:30:05Z","title":"Attention-driven GUI Grounding: Leveraging Pretrained Multimodal Large Language Models without Fine-Tuning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T15:38:09.241809Z"},"links":{"citing_paper":"/paper/2412.10840"},"observation_digest":"sha256:d546c6bda80c396c2c26f4c0f9e6e8348f44b82c08d7c08211db6c965af7808a","observation_id":"9f4de35f-9bbb-4fce-8e71-6b714387a071","resolution":{"observed_at":"2026-08-11T15:38:09.893773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:38:09.873443Z","title":null,"venue":null,"work_id":"3a9a5048-fb71-48c7-8530-194ce7ce2497","year":2023},"citing_paper":{"arxiv_id":"2412.10840","last_updated":"2024-12-14T14:30:05Z","snapshot_observed_at":"2026-08-11T15:31:55.689554Z","submitted_at":"2024-12-14T14:30:05Z","title":"Attention-driven GUI Grounding: Leveraging Pretrained Multimodal Large Language Models without Fine-Tuning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T15:38:09.246955Z"},"links":{"citing_paper":"/paper/2412.10840"},"observation_digest":"sha256:64fe04399ccf5ea3dc4fefa0eab20c95654e1e6440585907f4e5d821b84a9bb6","observation_id":"7d576b52-1acb-471d-a394-c2f1b5e7cbc5","resolution":{"observed_at":"2026-08-11T15:38:09.878425Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:38:09.857012Z","title":"J.-J.; Mitchell, T.; and Myers, B","venue":null,"work_id":"add6aad5-c7f6-491a-bbe4-acbb5c6b41b6","year":2020},"citing_paper":{"arxiv_id":"2412.10840","last_updated":"2024-12-14T14:30:05Z","snapshot_observed_at":"2026-08-11T15:31:55.689554Z","submitted_at":"2024-12-14T14:30:05Z","title":"Attention-driven GUI Grounding: Leveraging Pretrained Multimodal Large Language Models without Fine-Tuning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T15:38:09.252245Z"},"links":{"citing_paper":"/paper/2412.10840"},"observation_digest":"sha256:a6cabb1f7c1e360042f573bc64fc6c60412b1d5fca5ec10806fe05b43eb37004","observation_id":"325726aa-3788-45eb-b388-0fab7463eed8","resolution":{"observed_at":"2026-08-11T15:38:09.862422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:38:09.841677Z","title":null,"venue":null,"work_id":"62ec5921-6a20-42c9-869b-aa643386dc32","year":2020},"citing_paper":{"arxiv_id":"2412.10840","last_updated":"2024-12-14T14:30:05Z","snapshot_observed_at":"2026-08-11T15:31:55.689554Z","submitted_at":"2024-12-14T14:30:05Z","title":"Attention-driven GUI Grounding: Leveraging Pretrained Multimodal Large Language Models without Fine-Tuning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T15:38:09.257429Z"},"links":{"citing_paper":"/paper/2412.10840"},"observation_digest":"sha256:577a09418019eb2f40c7d36f0c7bd0c870a7cf2aa10fffb976a2eacb34d6d7a7","observation_id":"80cd5fbf-6109-4123-bbf0-19010af9b68e","resolution":{"observed_at":"2026-08-11T15:38:09.846647Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:38:09.826207Z","title":null,"venue":null,"work_id":"c0a3a5f9-fb93-46ff-afa4-e0a29a906976","year":2024},"citing_paper":{"arxiv_id":"2412.10840","last_updated":"2024-12-14T14:30:05Z","snapshot_observed_at":"2026-08-11T15:31:55.689554Z","submitted_at":"2024-12-14T14:30:05Z","title":"Attention-driven GUI Grounding: Leveraging Pretrained Multimodal Large Language Models without Fine-Tuning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T15:38:09.263234Z"},"links":{"citing_paper":"/paper/2412.10840"},"observation_digest":"sha256:272fe9ae33221860c007cf0112aac2457ee0aee7307dfdc1aa289d922b066d53","observation_id":"1e4522ea-6091-48da-8bab-c15f4703a846","resolution":{"observed_at":"2026-08-11T15:38:09.831146Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:38:09.268870Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10840","last_updated":"2024-12-14T14:30:05Z","snapshot_observed_at":"2026-08-11T15:31:55.689554Z","submitted_at":"2024-12-14T14:30:05Z","title":"Attention-driven GUI Grounding: Leveraging Pretrained Multimodal Large Language Models without Fine-Tuning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T15:38:09.268870Z"},"links":{"citing_paper":"/paper/2412.10840"},"observation_digest":"sha256:71c1f9bffc7609d9d29ab8f8a4284e872d75451e7779bcd03b1aa87e1647160b","observation_id":"8ff745c3-d66f-4160-9ad0-1b8788f23a05","resolution":{"observed_at":"2026-08-11T15:38:09.268870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05955","last_updated":"2024-04-09T02:29:39Z","snapshot_observed_at":"2026-08-09T12:56:10.917138Z","submitted_at":"2024-04-09T02:29:39Z","title":"VisualWebBench: How Far Have Multimodal LLMs Evolved in Web Page Understanding and Grounding?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05955","snapshot_observed_at":"2026-08-11T15:38:09.273738Z","title":"Y.; Lam, W.; Neubig, G.; Li, Y.; and Yue, X","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10840","last_updated":"2024-12-14T14:30:05Z","snapshot_observed_at":"2026-08-11T15:31:55.689554Z","submitted_at":"2024-12-14T14:30:05Z","title":"Attention-driven GUI Grounding: Leveraging Pretrained Multimodal Large Language Models without Fine-Tuning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T15:38:09.273738Z"},"links":{"cited_paper":"/paper/2404.05955","citing_paper":"/paper/2412.10840"},"observation_digest":"sha256:2c2dfcdc53d0afbfde7edb10e8264ed03f30b8a30050d5fdbec0a3af057635dc","observation_id":"66533dcb-d213-4fb2-b63a-1e7b8fa93d16","resolution":{"observed_at":"2026-08-11T15:38:09.273738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-11T01:38:59.827005Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-11T15:38:09.279824Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10840","last_updated":"2024-12-14T14:30:05Z","snapshot_observed_at":"2026-08-11T15:31:55.689554Z","submitted_at":"2024-12-14T14:30:05Z","title":"Attention-driven GUI Grounding: Leveraging Pretrained Multimodal Large Language Models without Fine-Tuning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T15:38:09.279824Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2412.10840"},"observation_digest":"sha256:6d2903b649060a1bb1dd5145f7e26eee768df52500f27007a875899f204d18b3","observation_id":"a54594b6-7844-4211-9ff0-b1403db9f4c4","resolution":{"observed_at":"2026-08-11T15:38:09.279824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:38:09.800438Z","title":null,"venue":null,"work_id":"99be8109-9668-48ee-a236-9a5a33a4db0a","year":2024},"citing_paper":{"arxiv_id":"2412.10840","last_updated":"2024-12-14T14:30:05Z","snapshot_observed_at":"2026-08-11T15:31:55.689554Z","submitted_at":"2024-12-14T14:30:05Z","title":"Attention-driven GUI Grounding: Leveraging Pretrained Multimodal Large Language Models without Fine-Tuning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T15:38:09.284887Z"},"links":{"citing_paper":"/paper/2412.10840"},"observation_digest":"sha256:c4bb071fe3c11177055884a0a9320a176949693b8b1f0e0e030d3423690288ba","observation_id":"ef39dc5e-3abd-4498-99ad-5834fcfa612e","resolution":{"observed_at":"2026-08-11T15:38:09.805332Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04346","last_updated":"2024-12-06T07:43:34Z","snapshot_observed_at":"2026-07-06T18:41:48.855359Z","submitted_at":"2024-07-05T08:37:10Z","title":"MobileFlow: A Multimodal LLM For Mobile GUI Agent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04346","snapshot_observed_at":"2026-08-11T15:38:09.289700Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10840","last_updated":"2024-12-14T14:30:05Z","snapshot_observed_at":"2026-08-11T15:31:55.689554Z","submitted_at":"2024-12-14T14:30:05Z","title":"Attention-driven GUI Grounding: Leveraging Pretrained Multimodal Large Language Models without Fine-Tuning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T15:38:09.289700Z"},"links":{"cited_paper":"/paper/2407.04346","citing_paper":"/paper/2412.10840"},"observation_digest":"sha256:d4915252f21c0935e6b665467e174156180e7866cbfe9006c704f78a3dc580fc","observation_id":"cefd08b3-a486-4088-a248-fd43a289b032","resolution":{"observed_at":"2026-08-11T15:38:09.289700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:38:09.294858Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10840","last_updated":"2024-12-14T14:30:05Z","snapshot_observed_at":"2026-08-11T15:31:55.689554Z","submitted_at":"2024-12-14T14:30:05Z","title":"Attention-driven GUI Grounding: Leveraging Pretrained Multimodal Large Language Models without Fine-Tuning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T15:38:09.294858Z"},"links":{"citing_paper":"/paper/2412.10840"},"observation_digest":"sha256:f305110da0d96504c075c4f5fbf4f47ee8fd3172d3a8d2fa51cc8f529d24bec4","observation_id":"19cc0eb6-e08e-4e86-a1af-063276b49ad6","resolution":{"observed_at":"2026-08-11T15:38:09.294858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-11T15:38:09.299593Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10840","last_updated":"2024-12-14T14:30:05Z","snapshot_observed_at":"2026-08-11T15:31:55.689554Z","submitted_at":"2024-12-14T14:30:05Z","title":"Attention-driven GUI Grounding: Leveraging Pretrained Multimodal Large Language Models without Fine-Tuning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T15:38:09.299593Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2412.10840"},"observation_digest":"sha256:0ebcae5093924f288553ee27eb3df633ff42cd61d60dcfc8daf803cf109d72d0","observation_id":"5da58cc1-2bc8-448e-83f4-0338dcb8a2d9","resolution":{"observed_at":"2026-08-11T15:38:09.299593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:38:09.774412Z","title":null,"venue":null,"work_id":"246247d5-1e06-48f7-9a30-cb90871678c6","year":2023},"citing_paper":{"arxiv_id":"2412.10840","last_updated":"2024-12-14T14:30:05Z","snapshot_observed_at":"2026-08-11T15:31:55.689554Z","submitted_at":"2024-12-14T14:30:05Z","title":"Attention-driven GUI Grounding: Leveraging Pretrained Multimodal Large Language Models without Fine-Tuning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T15:38:09.304938Z"},"links":{"citing_paper":"/paper/2412.10840"},"observation_digest":"sha256:c6aa43eda49f505ea08a5432c565bab2b89939f24d0890999594b549300cf53a","observation_id":"c99ab3dd-7d00-4d12-a2a3-49896aaa80ec","resolution":{"observed_at":"2026-08-11T15:38:09.779042Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:38:09.758051Z","title":null,"venue":null,"work_id":"56dc27b1-efd3-49b0-9dca-0aa56137e1d2","year":2024},"citing_paper":{"arxiv_id":"2412.10840","last_updated":"2024-12-14T14:30:05Z","snapshot_observed_at":"2026-08-11T15:31:55.689554Z","submitted_at":"2024-12-14T14:30:05Z","title":"Attention-driven GUI Grounding: Leveraging Pretrained Multimodal Large Language Models without Fine-Tuning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T15:38:09.310195Z"},"links":{"citing_paper":"/paper/2412.10840"},"observation_digest":"sha256:e97c6dfe252c7ba6f182a963eea470c5ee381d86a843fe41b6468d3cf7d71385","observation_id":"33220915-e667-465f-8ad8-474c1c0b5380","resolution":{"observed_at":"2026-08-11T15:38:09.763859Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-11T07:29:21.471807Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-11T15:38:09.315695Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10840","last_updated":"2024-12-14T14:30:05Z","snapshot_observed_at":"2026-08-11T15:31:55.689554Z","submitted_at":"2024-12-14T14:30:05Z","title":"Attention-driven GUI Grounding: Leveraging Pretrained Multimodal Large Language Models without Fine-Tuning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T15:38:09.315695Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2412.10840"},"observation_digest":"sha256:5c677ad0e8348a87b6eab4bebf1a3b7cffee4f979b0f4f389ab7895b3877fe0f","observation_id":"4e78da62-d166-4fbb-98fc-56d284d05383","resolution":{"observed_at":"2026-08-11T15:38:09.315695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08184","last_updated":"2024-06-12T13:14:50Z","snapshot_observed_at":"2026-07-06T18:29:34.538901Z","submitted_at":"2024-06-12T13:14:50Z","title":"MobileAgentBench: An Efficient and User-Friendly Benchmark for Mobile LLM Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08184","snapshot_observed_at":"2026-08-11T15:38:09.322828Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10840","last_updated":"2024-12-14T14:30:05Z","snapshot_observed_at":"2026-08-11T15:31:55.689554Z","submitted_at":"2024-12-14T14:30:05Z","title":"Attention-driven GUI Grounding: Leveraging Pretrained Multimodal Large Language Models without Fine-Tuning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T15:38:09.322828Z"},"links":{"cited_paper":"/paper/2406.08184","citing_paper":"/paper/2412.10840"},"observation_digest":"sha256:75517776cad4dc6ce62c6cf9a7179b1b710de1dc46203a3468e35dd2c57d6d80","observation_id":"50f0f534-51d3-4361-9773-5f519f90758f","resolution":{"observed_at":"2026-08-11T15:38:09.322828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-11T15:38:09.327899Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10840","last_updated":"2024-12-14T14:30:05Z","snapshot_observed_at":"2026-08-11T15:31:55.689554Z","submitted_at":"2024-12-14T14:30:05Z","title":"Attention-driven GUI Grounding: Leveraging Pretrained Multimodal Large Language Models without Fine-Tuning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T15:38:09.327899Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2412.10840"},"observation_digest":"sha256:414b843d8a80454411a0c27a1df3fea3c4c0f8a41d899c7f19a2fc7a5fb09cef","observation_id":"877ec80c-6122-4bc2-ac7d-1dc5a236e381","resolution":{"observed_at":"2026-08-11T15:38:09.327899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07456","last_updated":"2024-02-15T09:30:48Z","snapshot_observed_at":"2026-08-11T22:45:09.394270Z","submitted_at":"2024-02-12T07:29:22Z","title":"OS-Copilot: Towards Generalist Computer Agents with Self-Improvement","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07456","snapshot_observed_at":"2026-08-11T15:38:09.332870Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10840","last_updated":"2024-12-14T14:30:05Z","snapshot_observed_at":"2026-08-11T15:31:55.689554Z","submitted_at":"2024-12-14T14:30:05Z","title":"Attention-driven GUI Grounding: Leveraging Pretrained Multimodal Large Language Models without Fine-Tuning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T15:38:09.332870Z"},"links":{"cited_paper":"/paper/2402.07456","citing_paper":"/paper/2412.10840"},"observation_digest":"sha256:bc54f8deea6fd4a62626eb620ce34b79dfc166201645854eb570e70bf9b02e48","observation_id":"5bc417ed-0584-4914-8c79-bd0e4b54967a","resolution":{"observed_at":"2026-08-11T15:38:09.332870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07972","last_updated":"2024-05-30T08:55:12Z","snapshot_observed_at":"2026-08-11T11:38:42.138003Z","submitted_at":"2024-04-11T17:56:05Z","title":"OSWorld: Benchmarking Multimodal Agents for Open-Ended Tasks in Real Computer Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07972","snapshot_observed_at":"2026-08-11T15:38:09.338376Z","title":"J.; Cheng, Z.; Shin, D.; Lei, F.; et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10840","last_updated":"2024-12-14T14:30:05Z","snapshot_observed_at":"2026-08-11T15:31:55.689554Z","submitted_at":"2024-12-14T14:30:05Z","title":"Attention-driven GUI Grounding: Leveraging Pretrained Multimodal Large Language Models without Fine-Tuning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T15:38:09.338376Z"},"links":{"cited_paper":"/paper/2404.07972","citing_paper":"/paper/2412.10840"},"observation_digest":"sha256:6a314eb363b672e9c5baec19acd7f809df3d49ebf965f7f6392439f287171edb","observation_id":"f24583d1-8fe3-4e4a-a157-18ab71995775","resolution":{"observed_at":"2026-08-11T15:38:09.338376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11441","last_updated":"2023-11-06T07:39:49Z","snapshot_observed_at":"2026-08-04T03:29:49.409446Z","submitted_at":"2023-10-17T17:51:31Z","title":"Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11441","snapshot_observed_at":"2026-08-11T15:38:09.343277Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10840","last_updated":"2024-12-14T14:30:05Z","snapshot_observed_at":"2026-08-11T15:31:55.689554Z","submitted_at":"2024-12-14T14:30:05Z","title":"Attention-driven GUI Grounding: Leveraging Pretrained Multimodal Large Language Models without Fine-Tuning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T15:38:09.343277Z"},"links":{"cited_paper":"/paper/2310.11441","citing_paper":"/paper/2412.10840"},"observation_digest":"sha256:ff80e234cfb32905cd6a5ba323ee98d42aad01e2c66c585ee629901df22f8c7a","observation_id":"ff5af437-adc0-4c0f-a333-e2d4959a1f46","resolution":{"observed_at":"2026-08-11T15:38:09.343277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-11T15:38:09.348135Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10840","last_updated":"2024-12-14T14:30:05Z","snapshot_observed_at":"2026-08-11T15:31:55.689554Z","submitted_at":"2024-12-14T14:30:05Z","title":"Attention-driven GUI Grounding: Leveraging Pretrained Multimodal Large Language Models without Fine-Tuning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T15:38:09.348135Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2412.10840"},"observation_digest":"sha256:4d46dea75563c99fb8ab610f9046f855b1e8d64a15efbf1a4020201bd21ccfcd","observation_id":"71ae2c90-139b-4331-bdb1-c62235a0a44c","resolution":{"observed_at":"2026-08-11T15:38:09.348135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05719","last_updated":"2024-04-08T17:55:44Z","snapshot_observed_at":"2026-07-06T17:57:19.117933Z","submitted_at":"2024-04-08T17:55:44Z","title":"Ferret-UI: Grounded Mobile UI Understanding with Multimodal LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05719","snapshot_observed_at":"2026-08-11T15:38:09.352732Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10840","last_updated":"2024-12-14T14:30:05Z","snapshot_observed_at":"2026-08-11T15:31:55.689554Z","submitted_at":"2024-12-14T14:30:05Z","title":"Attention-driven GUI Grounding: Leveraging Pretrained Multimodal Large Language Models without Fine-Tuning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T15:38:09.352732Z"},"links":{"cited_paper":"/paper/2404.05719","citing_paper":"/paper/2412.10840"},"observation_digest":"sha256:18bba578a1e7ecc2a72c5019f93ff682b0dd7929fefc14ddc0b6e2d68fc4e2bb","observation_id":"6271e389-7c5e-4eff-bb41-327ea28492b7","resolution":{"observed_at":"2026-08-11T15:38:09.352732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-11T15:38:09.357490Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10840","last_updated":"2024-12-14T14:30:05Z","snapshot_observed_at":"2026-08-11T15:31:55.689554Z","submitted_at":"2024-12-14T14:30:05Z","title":"Attention-driven GUI Grounding: Leveraging Pretrained Multimodal Large Language Models without Fine-Tuning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T15:38:09.357490Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2412.10840"},"observation_digest":"sha256:3dbaaacb845d4aecad750afbb01d79929f5350cb305788e3f6092f84117250bf","observation_id":"f5d676d2-4c45-4be3-86af-5206e5ee07b9","resolution":{"observed_at":"2026-08-11T15:38:09.357490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:38:09.362608Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10840","last_updated":"2024-12-14T14:30:05Z","snapshot_observed_at":"2026-08-11T15:31:55.689554Z","submitted_at":"2024-12-14T14:30:05Z","title":"Attention-driven GUI Grounding: Leveraging Pretrained Multimodal Large Language Models without Fine-Tuning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T15:38:09.362608Z"},"links":{"citing_paper":"/paper/2412.10840"},"observation_digest":"sha256:0edbb07ec7c5fa5c4c779be3c826cb0049fd80eaa152e15eb20b3d957e7b265c","observation_id":"df741db4-474f-4fa7-a644-5d9ec810bf1c","resolution":{"observed_at":"2026-08-11T15:38:09.362608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T15:38:09.367743Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10840","last_updated":"2024-12-14T14:30:05Z","snapshot_observed_at":"2026-08-11T15:31:55.689554Z","submitted_at":"2024-12-14T14:30:05Z","title":"Attention-driven GUI Grounding: Leveraging Pretrained Multimodal Large Language Models without Fine-Tuning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T15:38:09.367743Z"},"links":{"citing_paper":"/paper/2412.10840"},"observation_digest":"sha256:23ea6f4d9dabdf1608664a5185566faeaca0b00a69d120b494e03ca7b0e54d56","observation_id":"29e19b77-4c9a-42f5-8996-18d562f27639","resolution":{"observed_at":"2026-08-11T15:38:09.367743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.10840","last_updated":"2024-12-14T14:30:05Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T15:31:55.689554Z","submitted_at":"2024-12-14T14:30:05Z","title":"Attention-driven GUI Grounding: Leveraging Pretrained Multimodal Large Language Models without Fine-Tuning"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 1 inbound Pith citation observation for arXiv:2412.10840."}