{"as_of":"2026-08-05T06:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:716b1b3e8a70604ab0b1e34f2e1574c46a729629af903ca3b8ca598a87a00756","coverage":[{"denominator":104,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-09T23:05:05.251150Z","state":"measured"},{"denominator":102,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":102,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T02:01:51.292863Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-05-12T07:46:26.529865Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"cited_work":{"arxiv_id":"2604.21268","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.21268","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","venue":"cs.LG","work_id":"5bb08160-d561-4cd2-ab34-f7af2c359925","year":2026},"citing_paper":{"arxiv_id":"2605.00642","last_updated":"2026-05-10T03:40:15Z","snapshot_observed_at":"2026-08-02T17:34:14.464282Z","submitted_at":"2026-05-01T13:23:26Z","title":"Learn where to Click from Yourself: On-Policy Self-Distillation for GUI Grounding","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-09T19:36:42.309114Z"},"links":{"cited_paper":"/paper/2604.21268","citing_paper":"/paper/2605.00642"},"observation_digest":"sha256:2374df701ce1f7e4a594e43542c7e777376a869d4f5297756e89d586193596e5","observation_id":"2267700c-e2ec-4e0f-9d45-57938c6149d7","resolution":{"observed_at":"2026-05-11T15:36:07.980391Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"cited_work":{"arxiv_id":"2604.21268","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.21268","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","venue":"cs.LG","work_id":"5bb08160-d561-4cd2-ab34-f7af2c359925","year":2026},"citing_paper":{"arxiv_id":"2605.00642","last_updated":"2026-05-10T03:40:15Z","snapshot_observed_at":"2026-08-02T17:34:14.464282Z","submitted_at":"2026-05-01T13:23:26Z","title":"Learn where to Click from Yourself: On-Policy Self-Distillation for GUI Grounding","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-12T02:01:51.292863Z"},"links":{"cited_paper":"/paper/2604.21268","citing_paper":"/paper/2605.00642"},"observation_digest":"sha256:738d4370c958acb447543b390a2e1140cb7929c991be4d5da3141e1fd88d4a15","observation_id":"d14342f3-9597-4677-8435-d4e1fe3f32c0","resolution":{"observed_at":"2026-05-12T07:46:26.532834Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2604.21268/citation-record","integrity":"/paper/2604.21268/integrity","json":"/paper/2604.21268/citation-record.json","paper":"/paper/2604.21268"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.05731","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T07:04:21.841481Z","title":"Infigui-g1: Advancing gui grounding with adaptive exploration policy optimiza- tion.arXiv preprint arXiv:2508.05731","venue":null,"work_id":"c9e8e17f-87fb-4cef-8934-f78f8d265f16","year":2025},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:078b5fd3023c1e4e4c8f0a3dc42f4568fe029685e0135f57e7647f37e8938673","observation_id":"2a3a3a31-b6eb-453c-beef-171b43799504","resolution":{"observed_at":"2026-05-11T14:16:05.615777Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:350127100e10b2b963201d28de2f43c0f966d59df6801b931b97c6f68d185673","observation_id":"4357c2a4-690d-4791-8d24-639bc88b9b34","resolution":{"observed_at":"2026-05-11T14:16:05.673335Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.04295","last_updated":"2020-10-08T22:56:03Z","snapshot_observed_at":"2026-07-06T10:02:48.167825Z","submitted_at":"2020-10-08T22:56:03Z","title":"Widget Captioning: Generating Natural Language Description for Mobile User Interface Elements","version":1},"cited_work":{"arxiv_id":"2010.04295","doi":"10.48550/arxiv.2010.04295","metadata_source":"arxiv_reference","pith_arxiv_id":"2010.04295","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2020 , publisher =","venue":"arXiv (Cornell University)","work_id":"98ca0b6c-3a24-40f7-8366-93efa1a20154","year":2020},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2010.04295","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:b3fcad7f4501624e9ab116e558f85a4cb228b01982e77ec04995fab804b15250","observation_id":"5c492fac-1e76-429f-bba0-cb85869bba2b","resolution":{"observed_at":"2026-05-11T14:16:05.720930Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:18.410064+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:18.410064+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"European Conference on Computer Vision , pages=","venue":null,"work_id":"44442d69-bc46-4856-94b1-42e251615d50","year":2024},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:ebd06f924d07ee1c7775725b1dca6208cd3ad2c0172112f74a7b5823b4e7a870","observation_id":"6f68fbfb-b033-4132-97dc-c5d3d93be048","resolution":{"observed_at":"2026-05-23T13:38:01.493827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":"7f07210c-d6af-42d5-98f6-7e0bebf0ed88","year":null},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:f7f7ca49d041265e4fdac09bdccfab447d79dcb1a8ae3fb12e35bf921a332c4b","observation_id":"cc81447c-0821-43be-927c-b5a1410f7513","resolution":{"observed_at":"2026-05-23T13:38:01.527991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"NeurIPS 2024 Workshop on Open-World Agents , volume=","venue":null,"work_id":"db29e20d-b477-4f63-a7cb-e8cb68ae80f4","year":2024},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:27c4f3fb5476a75d24c0415c99fe6093c06a77c8c614efb82f41dc2af240200f","observation_id":"a3ce2d71-4ffa-4818-a399-8a9325e6bc3c","resolution":{"observed_at":"2026-05-23T13:38:01.456020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics , pages=","venue":null,"work_id":"0d049362-ab94-4386-b693-7295bb67d97d","year":null},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:1ed69d825eb70a132061791720f8f20ac4e0171e5cacda36eb7c6a5885c10ea2","observation_id":"ff892751-7f5f-408c-a827-255adf05eb83","resolution":{"observed_at":"2026-05-23T13:38:01.427476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23218","last_updated":"2024-10-30T17:10:19Z","snapshot_observed_at":"2026-08-05T06:30:40.974506Z","submitted_at":"2024-10-30T17:10:19Z","title":"OS-ATLAS: A Foundation Action Model for Generalist GUI Agents","version":1},"cited_work":{"arxiv_id":"2410.23218","doi":"10.48550/arxiv.2410.23218","metadata_source":"pith","pith_arxiv_id":"2410.23218","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OS-ATLAS: A Foundation Action Model for Generalist GUI Agents","venue":"cs.CL","work_id":"16e00be2-1641-403c-8835-c50a6628f483","year":2024},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2410.23218","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:c857cf6e679788904eb3176d5a22f71273e9c98c2514d1046707a4d946089f78","observation_id":"716fc42a-4e9c-4ed7-ab41-91a001435dc5","resolution":{"observed_at":"2026-05-13T09:29:27.958266Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:20.970634+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:20.970634+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.19478","last_updated":"2025-07-25T17:59:26Z","snapshot_observed_at":"2026-07-06T22:02:56.216824Z","submitted_at":"2025-07-25T17:59:26Z","title":"MMBench-GUI: Hierarchical Multi-Platform Evaluation Framework for GUI Agents","version":1},"cited_work":{"arxiv_id":"2507.19478","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.19478","snapshot_observed_at":"2026-06-30T07:04:21.802447Z","title":"Mmbench-gui: Hierarchical multi-platform evaluation framework for gui agents","venue":null,"work_id":"2c7aacbc-11c2-453e-9ce4-34c68821600e","year":2025},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2507.19478","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:9210e6ab3050fb2e9206129015652e37b1d45f9627cb241065ab61c9d9643c0f","observation_id":"f44c841e-20bb-46db-ad38-17d405b04571","resolution":{"observed_at":"2026-05-11T14:16:05.593705Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 33rd ACM International Conference on Multimedia , pages=","venue":null,"work_id":"adb67770-270c-4321-8a95-7a374476b6a3","year":null},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:4127a7bd4851427add16666cfbebcb26facf6b3b42ab8a43903d4bd4c2340244","observation_id":"67c60dc4-e1d3-4790-bc86-f1dfdcbd8259","resolution":{"observed_at":"2026-05-23T13:38:01.476748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15661","last_updated":"2025-05-06T17:43:11Z","snapshot_observed_at":"2026-07-06T20:55:42.402903Z","submitted_at":"2025-03-19T19:26:17Z","title":"UI-Vision: A Desktop-centric GUI Benchmark for Visual Perception and Interaction","version":2},"cited_work":{"arxiv_id":"2503.15661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.15661","snapshot_observed_at":"2026-07-04T19:50:10.493334Z","title":"Ui- vision: A desktop-centric gui benchmark for visual perception and interaction","venue":null,"work_id":"228ff8a2-536b-4900-8c1a-d2eb54a5ccf8","year":2025},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2503.15661","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:a8fb3328c6c68e04a263e7d3772ccb6978e9bdcc88c7544e596fb5a3eb4dc9b1","observation_id":"dddb2f6c-c819-4454-9fc3-713e578b7433","resolution":{"observed_at":"2026-05-11T14:16:05.642754Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11257","last_updated":"2025-07-30T13:57:49Z","snapshot_observed_at":"2026-07-06T21:09:50.780345Z","submitted_at":"2025-04-15T14:56:21Z","title":"UI-E2I-Synth: Advancing GUI Grounding with Large-Scale Instruction Synthesis","version":4},"cited_work":{"arxiv_id":"2504.11257","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.11257","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ui-e2i-synth: Advancing gui grounding with large-scale instruction synthesis","venue":null,"work_id":"cf7e48a8-8708-484e-9905-467eb9297769","year":2025},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2504.11257","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:7cc78b93d6334f079a6f1ead2de3084205df3b9e838eebe154caaae55a11bd0b","observation_id":"b629faeb-0e4e-4238-b56a-828763344f1a","resolution":{"observed_at":"2026-05-11T14:16:05.705933Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.13227","doi":"10.48550/arxiv.2505.13227","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Yao, S., Zhao, J., Yu, D., Du, N., Shafran, I., Narasimhan, K., and Cao, Y","venue":"ArXiv.org","work_id":"0114b464-4839-4413-bd56-d15e0adf532c","year":2025},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:4dc9c3947a3d5a060a70ee5fcb4261082d96e2ebd38cad7d0c86e6733b10a0dc","observation_id":"2fc78b02-4f2c-414c-80c1-d5eac74ece6b","resolution":{"observed_at":"2026-05-11T14:16:05.605695Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:21.397002+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:21.397002+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:83d2a6358f1ebda2cfe5a485d06192fb76fbbf2d42e27a88217941f03d32bf4a","observation_id":"584162e4-0c33-4a65-b47c-07f73b6d9e59","resolution":{"observed_at":"2026-05-11T14:16:05.661839Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-07-06T17:34:07.737296Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":"2402.14740","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-07-09T08:56:06.435604Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","venue":"cs.LG","work_id":"7bb8f9ec-1241-4472-a4fa-c636c6d79892","year":2024},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:277cc4e57b7a95d7ce7cf2b5aa71962fb042626f7467380031eedf66ed3cca61","observation_id":"b902e1d9-b4a7-460d-8e9a-72d518d2fcdf","resolution":{"observed_at":"2026-05-13T01:42:22.769824Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T17:56:26.189861Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"a3ec6fd7-275a-430c-823d-9166de28695a","year":null},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:9edd5c63b874f5328068c96dab707873b4223c8503a701b918dabefae8371470","observation_id":"4f6b35cf-4697-4970-b033-e73a9ed3e465","resolution":{"observed_at":"2026-05-23T13:38:01.394336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17161","last_updated":"2025-05-26T17:16:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-28T18:59:44Z","title":"SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training","version":2},"cited_work":{"arxiv_id":"2501.17161","doi":"10.48550/arxiv.2501.17161","metadata_source":"pith","pith_arxiv_id":"2501.17161","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SFT Memorizes, RL Generalizes: A Comparative Study of Foundation Model Post-training","venue":"cs.AI","work_id":"258dd934-025c-47f5-b4f6-5a0c1c338cc6","year":2025},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2501.17161","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:50a84e84fe1c10406a44ae977b0ddddb7e8bf2f1770202b083b58b89846a8e90","observation_id":"aef64e0b-69b7-4678-9709-623fdac39ec4","resolution":{"observed_at":"2026-05-12T21:31:30.352830Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:42.961784+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:42.961784+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.05802","last_updated":"2022-06-14T01:16:24Z","snapshot_observed_at":"2026-07-06T13:19:58.934755Z","submitted_at":"2022-06-12T17:40:53Z","title":"Self-critiquing models for assisting human evaluators","version":2},"cited_work":{"arxiv_id":"2206.05802","doi":"10.48550/arxiv.2206.05802","metadata_source":"pith","pith_arxiv_id":"2206.05802","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-critiquing models for assisting human evaluators","venue":"cs.CL","work_id":"3fcefdd1-22ab-4648-a683-cb1555e7a50e","year":2022},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2206.05802","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:6e7a28c11cd7c1349ef48f2b60cc9c2232fd748bf8b17322fe8ba07e690e1491","observation_id":"5d2ab6ab-b28d-4002-ac95-ca7de7469dbc","resolution":{"observed_at":"2026-05-16T20:25:41.981797Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"a3764967-f315-44d6-9461-3385473863bb","year":null},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:c816a65089e2147a1e02336357fa7f147ae6b667de22994b60d4e3e79bbacc3d","observation_id":"68342745-75ba-458f-be07-38b185f990ed","resolution":{"observed_at":"2026-05-23T13:38:01.441725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.01904","last_updated":"2024-02-04T12:15:18Z","snapshot_observed_at":"2026-07-06T15:12:07.431442Z","submitted_at":"2023-04-04T15:57:28Z","title":"REFINER: Reasoning Feedback on Intermediate Representations","version":2},"cited_work":{"arxiv_id":"2304.01904","doi":"10.48550/arxiv.2304.01904","metadata_source":"arxiv_reference","pith_arxiv_id":"2304.01904","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Refiner: Reasoning feedback on intermediate representations","venue":"arXiv (Cornell University)","work_id":"c05b1d6a-cac0-4c35-8f73-d4d2ba7ffc32","year":2023},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2304.01904","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:d16c3ec3559c56baa162d67cb8a9d6fd35c259af331651c2d260c440fe0a5be4","observation_id":"b1e15fc0-56ec-4a04-9e12-7452d6c454fd","resolution":{"observed_at":"2026-05-11T14:16:05.856887Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T07:03:26.855360Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"5dda28f0-c02b-4e75-afa2-b5c5b3aa994e","year":null},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:47741869627b34fcf1286b726a28bb83c942d1711febecfb7fa275c4ecf25b51","observation_id":"6dd96e2d-dcdc-427f-b58c-5fdacf57321e","resolution":{"observed_at":"2026-05-23T13:38:01.377123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T22:47:37.666062Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":"1265447d-0324-4d07-abba-34fa29d172da","year":null},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:eef0921d0c4643e3f19899199852bd4d4e8cde655ae5b60e730d6243c20d1fa5","observation_id":"7daa6804-2ca8-4758-9187-f78a8f138654","resolution":{"observed_at":"2026-05-23T13:38:01.437066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:ee5414bb22928169b4213b41dcd39301e748f955af6bb51b5c573c21b442f1c1","observation_id":"ac698ec7-2f60-4fe5-bcd7-7bfee93b7393","resolution":{"observed_at":"2026-05-12T18:12:27.664923Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18930","last_updated":"2025-04-01T18:36:08Z","snapshot_observed_at":"2026-08-05T02:45:38.008864Z","submitted_at":"2024-04-29T17:59:41Z","title":"Hallucination of Multimodal Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":"2404.18930","doi":"10.48550/arxiv.2404.18930","metadata_source":"pith","pith_arxiv_id":"2404.18930","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hallucination of Multimodal Large Language Models: A Survey","venue":"cs.CV","work_id":"1902954e-ed65-4b00-9956-5cc759b8ef40","year":2024},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2404.18930","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:bffd4af081c891b948b0fb95968cfe2965f6ffde8d41a8c6f00619556d4d66ca","observation_id":"56ac477c-9c1f-4dde-b2d3-f45ce7959082","resolution":{"observed_at":"2026-05-11T14:16:06.018251Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00053","last_updated":"2022-10-31T18:09:51Z","snapshot_observed_at":"2026-07-06T14:12:45.730577Z","submitted_at":"2022-10-31T18:09:51Z","title":"Generating Sequences by Learning to Self-Correct","version":1},"cited_work":{"arxiv_id":"2211.00053","doi":"10.48550/arxiv.2211.00053","metadata_source":"arxiv_reference","pith_arxiv_id":"2211.00053","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Generating sequences by learning to self-correct","venue":"arXiv (Cornell University)","work_id":"ccd1e168-905a-48c2-a387-c43d5c25f8bc","year":2022},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2211.00053","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:2c17227f64ddf961124f5e6e20201441ea1a1fb9c395712ee0516f4efe0401af","observation_id":"4ec7c14c-25f2-4f9b-898f-be71da5dc299","resolution":{"observed_at":"2026-05-11T14:16:06.221861Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.17140","last_updated":"2024-06-06T03:59:24Z","snapshot_observed_at":"2026-07-06T18:05:55.328415Z","submitted_at":"2024-04-26T03:41:28Z","title":"Small Language Models Need Strong Verifiers to Self-Correct Reasoning","version":2},"cited_work":{"arxiv_id":"2404.17140","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.17140","snapshot_observed_at":"2026-07-04T06:59:37.840996Z","title":"Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems? InECCV, 2024a","venue":null,"work_id":"2c0a1611-0b16-44ac-802f-f2bbb63d191a","year":2024},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2404.17140","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:50ab28f9e4c9a02c835d948dd74a099db4cb92e3ab78ab7a94b6e4b2bdf9fb4a","observation_id":"4cbf25de-1879-4333-900a-a72103915726","resolution":{"observed_at":"2026-05-11T14:16:05.883907Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14683","last_updated":"2024-06-16T18:43:50Z","snapshot_observed_at":"2026-07-06T17:34:03.539565Z","submitted_at":"2024-02-22T16:40:33Z","title":"Visual Hallucinations of Multi-modal Large Language Models","version":2},"cited_work":{"arxiv_id":"2402.14683","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.14683","snapshot_observed_at":"2026-07-02T02:56:29.276137Z","title":"Visual hallucinations of multi-modal large language models","venue":null,"work_id":"74ae9fd5-a689-4de2-957f-32423c3959ad","year":2024},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2402.14683","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:4dac6c3a3a9e48df039d06fa5e5359f2c7a7c565161f7babf52ee2fe390329b0","observation_id":"d8d4980c-0baf-499f-9a1f-34b238e14fa3","resolution":{"observed_at":"2026-05-11T14:16:05.974790Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12118","last_updated":"2025-02-18T18:54:12Z","snapshot_observed_at":"2026-08-03T17:17:48.809885Z","submitted_at":"2025-02-17T18:43:24Z","title":"Scaling Test-Time Compute Without Verification or RL is Suboptimal","version":2},"cited_work":{"arxiv_id":"2502.12118","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.12118","snapshot_observed_at":"2026-07-03T20:38:56.081466Z","title":"Scalingtest-timecomputewithout verification or rl is suboptimal","venue":null,"work_id":"f01d383c-eb52-4fe5-8e17-9f763cf82d39","year":2025},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2502.12118","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:d2dc111337b708d66dfb24c11c08c2fa48b13489269af07845ff1fc258f9e3ba","observation_id":"7eaa64f9-baa4-4f34-8c4d-6dd271c40469","resolution":{"observed_at":"2026-05-11T14:16:05.777615Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"78e2144b-fcc3-48a3-b867-6cd0da43d8fe","year":null},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:36c1a59f7447f9dbe1dd94297037d062dd14efd66a1e82e56505070ad2abc622","observation_id":"4c40767e-4b04-4ab6-8249-5cd72127f309","resolution":{"observed_at":"2026-05-23T13:38:01.472944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04642","last_updated":"2024-03-07T16:36:29Z","snapshot_observed_at":"2026-07-06T17:41:06.530605Z","submitted_at":"2024-03-07T16:36:29Z","title":"Teaching Large Language Models to Reason with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2403.04642","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04642","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Teaching large language models to reason with reinforcement learning","venue":null,"work_id":"ab9d8347-574c-4fbb-b8e1-44eeba9c66b9","year":2024},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2403.04642","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:c7c46d4bc61d69ce3bddcd8f0b541fbbb75331a709c38158ed9ee90f937851a4","observation_id":"6a38efa3-6279-45c4-b446-85466f863fef","resolution":{"observed_at":"2026-05-11T14:16:06.034886Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.18770","doi":"10.48550/arxiv.2502.18770","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reward shaping to mitigate reward hacking in rlhf","venue":"ArXiv.org","work_id":"ebf5fa0e-3997-4dcc-922f-354e98be03dc","year":2026},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:10067f15ad3c3b7ea935ec501a57a83be80df54643895ae0eca191a2c116e782","observation_id":"e0aa7ce6-4486-46d5-b0d7-cff2b43fe244","resolution":{"observed_at":"2026-05-11T14:16:06.337728Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-05T03:13:54.147007Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2503.01785","doi":"10.48550/arxiv.2503.01785","metadata_source":"pith","pith_arxiv_id":"2503.01785","snapshot_observed_at":"2026-07-11T03:17:51.789600Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","venue":"cs.CV","work_id":"872f09b5-998d-4a66-9a2f-f7ec2407cd62","year":2025},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2503.01785","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:5bba0f718813f0496715b51fcb2c8670de8bb44c46eb39f2b1ee89aedd1f4e55","observation_id":"3e1f7220-14d9-405c-9dff-4a9fb48b6998","resolution":{"observed_at":"2026-05-13T22:16:16.677111Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:7ec3672a29b4893cf1057ad4cc1d437e1afa161df2e32071d3bbaeac00ad7440","observation_id":"37f86781-fd2a-42ee-80d3-e295a6c3f67d","resolution":{"observed_at":"2026-05-11T14:16:06.058944Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:23:06.254602+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.08844","last_updated":"2023-07-11T18:29:12Z","snapshot_observed_at":"2026-07-06T15:27:25.253387Z","submitted_at":"2023-05-15T17:57:16Z","title":"RL4F: Generating Natural Language Feedback with Reinforcement Learning for Repairing Model Outputs","version":2},"cited_work":{"arxiv_id":"2305.08844","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.08844","snapshot_observed_at":"2026-07-02T20:57:23.916786Z","title":"u rek, E. Aky \\","venue":null,"work_id":"f3a3dfae-1c31-4afc-b8c6-8af914a8fd24","year":2023},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2305.08844","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:ef9665c2d94f81eed59cbd79e25bc4e9febc5977c77d153f17c2532742993891","observation_id":"d0eeae88-b57d-4f47-a746-03c3ec01fc2d","resolution":{"observed_at":"2026-05-11T14:16:06.088229Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12917","last_updated":"2024-10-04T17:28:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-19T17:16:21Z","title":"Training Language Models to Self-Correct via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2409.12917","doi":"10.48550/arxiv.2409.12917","metadata_source":"pith","pith_arxiv_id":"2409.12917","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training Language Models to Self-Correct via Reinforcement Learning","venue":"cs.LG","work_id":"3ac87f3c-6dc4-492a-bbfb-8cdc05a15706","year":2024},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2409.12917","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:e4c676de29ec8287777c4bc11b7dfaa0379b270d7b91068b500c0d5ca707146f","observation_id":"14c59791-71d7-4717-9d4f-27a98f971715","resolution":{"observed_at":"2026-05-17T12:04:11.157267Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:38.810784+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:38.810784+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01798","last_updated":"2024-03-14T04:27:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-03T04:56:12Z","title":"Large Language Models Cannot Self-Correct Reasoning Yet","version":2},"cited_work":{"arxiv_id":"2310.01798","doi":"10.48550/arxiv.2310.01798","metadata_source":"pith","pith_arxiv_id":"2310.01798","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Language Models Cannot Self-Correct Reasoning Yet","venue":"cs.CL","work_id":"f63b261b-ef16-40f5-993b-9d37b1a51b92","year":2023},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2310.01798","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:6826a207412b504239574ac7502b66d8b09ebd23bff7ea868aecc467d77b9ba6","observation_id":"7b1a7020-76bf-4840-83d3-8e143e70432b","resolution":{"observed_at":"2026-05-12T05:48:28.335998Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:38.048248+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:38.048248+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01478","last_updated":"2025-01-02T12:09:17Z","snapshot_observed_at":"2026-07-06T20:15:54.645357Z","submitted_at":"2025-01-02T12:09:17Z","title":"Enhancing Reasoning through Process Supervision with Monte Carlo Tree Search","version":1},"cited_work":{"arxiv_id":"2501.01478","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.01478","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Li, X., Yu, Z., and Xiong, C","venue":null,"work_id":"40b66ca2-1002-4eda-9594-78ac06a2e5c9","year":2025},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2501.01478","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:c71e7622154d6281e538d136b18ec3c58bb7493287ecc8114a3075b06647075a","observation_id":"1a44368c-2632-4ea3-9ac4-f0f4bd86b74e","resolution":{"observed_at":"2026-05-11T14:16:06.245387Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06592","last_updated":"2024-12-11T22:59:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-05T19:25:40Z","title":"Improve Mathematical Reasoning in Language Models by Automated Process Supervision","version":2},"cited_work":{"arxiv_id":"2406.06592","doi":"10.48550/arxiv.2406.06592","metadata_source":"pith","pith_arxiv_id":"2406.06592","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improve Mathematical Reasoning in Language Models by Automated Process Supervision","venue":"cs.CL","work_id":"9906447b-5bb3-4367-91f9-b9d556c9ee7f","year":2024},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2406.06592","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:1327651939f899176423f6369d58ab7ea5576568772d99a253f12aa39acaae81","observation_id":"577300cd-c929-4b66-81d0-3cbf872af551","resolution":{"observed_at":"2026-05-13T20:53:45.995574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04055","last_updated":"2025-06-05T13:25:43Z","snapshot_observed_at":"2026-07-06T19:28:18.775189Z","submitted_at":"2024-10-05T06:28:54Z","title":"Self-Correction is More than Refinement: A Learning Framework for Visual and Language Reasoning Tasks","version":3},"cited_work":{"arxiv_id":"2410.04055","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.04055","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2410.04055 , year=","venue":null,"work_id":"ccf06d12-6086-4cfc-b438-37547b263cd4","year":null},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2410.04055","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:7c1f524caad206ff1610c3d81d701af6c66fd83dc2e567dd0e8a85d4df09c394","observation_id":"b276f927-a26d-4e21-8b57-b2c9825d82a6","resolution":{"observed_at":"2026-05-11T14:16:05.921874Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":"2107.03374","doi":"10.48550/arxiv.2107.03374","metadata_source":"pith","pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating Large Language Models Trained on Code","venue":"cs.LG","work_id":"042493e9-b26f-4b4e-bbde-382072ca9b08","year":2021},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:adbb2ed731b4f5c9710d8e2d32e98b9f84c1bc54fee55c153ea7793f3ef793ac","observation_id":"472f0fc6-6ada-4b65-a117-014a7f1ec04d","resolution":{"observed_at":"2026-05-11T14:16:06.205569Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:23.404839+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05128","last_updated":"2023-10-05T09:12:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-11T10:43:43Z","title":"Teaching Large Language Models to Self-Debug","version":2},"cited_work":{"arxiv_id":"2304.05128","doi":"10.48550/arxiv.2304.05128","metadata_source":"pith","pith_arxiv_id":"2304.05128","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Teaching Large Language Models to Self-Debug","venue":"cs.CL","work_id":"cdfb2680-220c-44eb-9edd-867b75fb821d","year":2023},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2304.05128","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:921d292941a7452114ac5df3d236d257268db1ae94ad850d61e29d1d7d5b2799","observation_id":"70aad5af-2616-4080-ba16-eac2249101e2","resolution":{"observed_at":"2026-05-12T06:24:25.951261Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:0b794bbb5b9d49b0e997ae9f1cd4fe03fc1250d34f386b374d205aec0828898b","observation_id":"ad003060-9740-4924-b2e0-c6c609684d97","resolution":{"observed_at":"2026-05-11T14:16:06.236790Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02813","last_updated":"2025-05-22T08:22:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-04T15:31:26Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","version":3},"cited_work":{"arxiv_id":"2409.02813","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.02813","snapshot_observed_at":"2026-07-08T19:35:32.916072Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","venue":"cs.CL","work_id":"19883673-604e-4b58-b036-5a04ec11a6f9","year":2024},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2409.02813","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:f0955524e38edfa4e1d085aecfc694844e2a8174b25b25b78d089a5fa8e70f8c","observation_id":"49d74de4-fb79-42b7-916e-30ebb55cdc13","resolution":{"observed_at":"2026-05-14T00:51:48.633687Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T21:22:58.620946Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":"04484a78-8a2c-4240-b409-15982bc5709e","year":null},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:b376681517507426c8beab3f1e563948d4ed1398bf589cd081f9b07627f56984","observation_id":"2d254f1d-6e71-4efa-aca9-bd411a382d70","resolution":{"observed_at":"2026-05-23T13:38:01.400804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":"2310.02255","doi":"10.1109/cvpr52734.2025.01245","metadata_source":"pith","pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","venue":"cs.CV","work_id":"e22c3789-9e71-4242-b6ea-3e60e06e2b66","year":2023},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:f2ddbb04c143385818e292722efb0ae7f2c5e4ed6c5aecd2f6283c34f8e9025c","observation_id":"1c72e627-9d34-4527-a47e-981a29904801","resolution":{"observed_at":"2026-05-11T14:16:05.994147Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01284","last_updated":"2024-07-01T13:39:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-01T13:39:08Z","title":"We-Math: Does Your Large Multimodal Model Achieve Human-like Mathematical Reasoning?","version":1},"cited_work":{"arxiv_id":"2407.01284","doi":"10.48550/arxiv.2407.01284","metadata_source":"pith","pith_arxiv_id":"2407.01284","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"We-Math: Does Your Large Multimodal Model Achieve Human-like Mathematical Reasoning?","venue":"cs.AI","work_id":"36b1b11c-2612-4d1d-9a6e-7db18eca4a25","year":2024},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2407.01284","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:a9785d5126b8f2eb00bdc028b23e0349ccef50470ba88f068162635df0b483d5","observation_id":"55fb3d6f-75b2-4f4c-b7df-4a8b6683045d","resolution":{"observed_at":"2026-05-16T21:55:41.398838Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"European Conference on Computer Vision , pages=","venue":null,"work_id":"6ec8eb80-f249-4c46-88d7-72c196a2dac2","year":2024},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:3e0e4598aceef4a35ec3050edc28436a11398d39a0f9d6ff3f5cfba39fa847ab","observation_id":"813e9d71-136c-404c-b607-420efc08a2c9","resolution":{"observed_at":"2026-05-23T13:38:01.485448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T06:40:46.507907Z","title":"The Thirty-eight Conference on Neural Information Processing Systems Datasets and Benchmarks Track , year=","venue":null,"work_id":"ef29e2cc-a3bc-471e-9e10-04aa67c445ea","year":null},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:373dca71c37ca9b83477942422a48be5b40cbeee58e3b0554936215a54b79a7f","observation_id":"d31f2e60-ceb5-4e58-99f3-79ecb9e9a067","resolution":{"observed_at":"2026-05-23T13:38:01.410434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:06:50.946500Z","title":"2016 , eprint=","venue":null,"work_id":"3bba704f-b125-4cb9-aa04-bb46dc78a714","year":2016},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:2605343ad4f8345e00874bd75226f21415fbb2521f6d6b713acf29d8497237a6","observation_id":"032ab0ec-df90-4691-be2b-56d87b77903a","resolution":{"observed_at":"2026-05-23T13:38:01.388812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T07:46:57.604503Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"5a531bea-f0ed-4a69-b5d1-8b51e8974e5a","year":null},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:d9abd7a7bd0c9c4b402389bd433577fa13c7b4c685a8d99404bcd434d150d3c5","observation_id":"fee8aeda-866d-47d8-b0e1-b0cb77f343ca","resolution":{"observed_at":"2026-05-23T13:38:01.465117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":"2410.21276","doi":"10.1177/15248380231178756","metadata_source":"pith","pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4o System Card","venue":"cs.CL","work_id":"f37bf1c7-4964-4e56-9762-d20da8d9009f","year":2024},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:c24d5580c781e023987e069c06862ecf69a9357a4cfa038f30bad3154b71c8fc","observation_id":"34cca1c3-fff6-4cd6-97e2-2de45ac5a015","resolution":{"observed_at":"2026-05-11T14:16:05.913586Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":"2312.11805","doi":"10.1038/nrn2888","metadata_source":"pith","pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini: A Family of Highly Capable Multimodal Models","venue":"cs.CL","work_id":"83f7c85b-3f11-450f-ac0c-64d9745220b2","year":2023},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:29874db14175b701a47886907d60116e489ef7eb71be0abeafe2a3ed12134db6","observation_id":"171d1776-08f7-426d-84b2-7450b508cf60","resolution":{"observed_at":"2026-05-11T14:16:05.904403Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":"2412.16720","doi":"10.48550/arxiv.2412.16720","metadata_source":"pith","pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"OpenAI o1 System Card","venue":"cs.AI","work_id":"68d3c334-0fc9-49e3-b7b0-a69afae933e2","year":2024},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:81ee449205a3f73c66fc04c22af7a68c9b8b3e8cd4cee01778a2207a5fa08330","observation_id":"19d01cba-23e3-4b2f-ada8-2973129c42a6","resolution":{"observed_at":"2026-05-11T14:16:06.096111Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T00:21:40.582706Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":"7f2e84c9-b13e-4998-b0b6-f7fbdc5be7c7","year":null},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:c5deda50e2beb7bbd34a91f9dfc839435116dee90c714b96996ba97aac426039","observation_id":"ca696e8f-e02b-4ba4-a2b1-c5b67ed82249","resolution":{"observed_at":"2026-05-23T13:38:01.371085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10442","last_updated":"2025-04-07T09:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-15T18:59:27Z","title":"Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization","version":2},"cited_work":{"arxiv_id":"2411.10442","doi":"10.48550/arxiv.2411.10442","metadata_source":"pith","pith_arxiv_id":"2411.10442","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Enhancing the Reasoning Ability of Multimodal Large Language Models via Mixed Preference Optimization","venue":"cs.CL","work_id":"52f12dd6-1165-4717-9a1b-04ff19d82dfe","year":2024},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2411.10442","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:0da4396e0227c81fdc391a5ea134aa82ea226fb69be33d604e5eb9a7b362aa28","observation_id":"f98d2d85-3051-460c-8f1b-238fcac00dcb","resolution":{"observed_at":"2026-05-16T09:16:17.933281Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17352","last_updated":"2025-11-11T08:13:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-21T17:52:43Z","title":"OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles","version":3},"cited_work":{"arxiv_id":"2503.17352","doi":"10.48550/arxiv.2503.17352","metadata_source":"pith","pith_arxiv_id":"2503.17352","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles","venue":"cs.CV","work_id":"de4c64e1-82b1-4f70-8311-a3539e7bf400","year":2025},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2503.17352","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:e58ca39d16d7a73692958ff159dee9a4967f4754fb5c9129d958cffbda44efda","observation_id":"cc79d02a-8380-49f6-8a37-a7fdec8da79c","resolution":{"observed_at":"2026-05-19T06:59:03.519833Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-07-06T20:49:56.018809Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.07365","doi":"10.48550/arxiv.2503.07365","metadata_source":"pith","pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","venue":"cs.CV","work_id":"eda3a54e-ebd6-40bd-af17-b567ea4c5d62","year":2025},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:669675738962675e383a898834c2cb8a9448e94cb0745b37ded28fc4c3b1fac1","observation_id":"8a43710e-1551-4cf1-b9cc-5ae2f5c1851e","resolution":{"observed_at":"2026-05-11T14:16:05.947860Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":"2409.12191","doi":"10.48550/arxiv.2409.12191","metadata_source":"pith","pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","venue":"cs.CV","work_id":"8abcfe4f-e0fb-44b7-9123-448fac95f90a","year":2024},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:483be8bf02ad2d617b43bb9638e81d568840810c23cbf624c88174248db26106","observation_id":"8a437824-1167-418b-8f77-62326da0517c","resolution":{"observed_at":"2026-05-11T14:16:06.050121Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T02:19:33.884263+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-07-06T20:49:27.466064Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":"2503.06749","doi":"10.48550/arxiv.2503.06749","metadata_source":"pith","pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","venue":"cs.CV","work_id":"38998646-34ee-4605-b661-ab356f16d6e5","year":2025},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:3edd51edc8e53f3ab4c770add6c10ced85637fd0e7d94e15d4486b4af31085e5","observation_id":"24d73019-0739-4077-8c46-64dc78c7e866","resolution":{"observed_at":"2026-05-11T14:16:05.837144Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:d5038df5182e8f1f88712b17a2e79a0b8d8b9e7d3da729a3619ac2c18a20fb81","observation_id":"c8f3be58-bc35-47d5-bb88-b618a19a1f0e","resolution":{"observed_at":"2026-05-11T14:16:06.002603Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2505.07062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-08T16:15:06.198778Z","title":"Seed1.5-VL Technical Report","venue":"cs.CV","work_id":"0e8e025f-ca1e-49cc-aee2-33f3a0201f3c","year":2025},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:2c71bc78b2de8fcc76a59f0ab7c1b39fc882c08b3b564e5fb98a1cfc803ca62f","observation_id":"7deaca6e-06fe-4c94-bbc3-8133b4d2ba07","resolution":{"observed_at":"2026-05-11T14:16:05.940196Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8c24f37a-5cac-40ae-8868-83086d07c85b","year":null},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:1d9d531ea0ead495636ae3125b9e5123131ad02d3db40ff393de6644408a4230","observation_id":"5b2d3662-f211-4e9f-92bf-b163c363719d","resolution":{"observed_at":"2026-05-23T13:38:01.431805Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04454","last_updated":"2025-05-05T16:17:20Z","snapshot_observed_at":"2026-07-06T20:02:21.509050Z","submitted_at":"2024-12-05T18:58:26Z","title":"Aguvis: Unified Pure Vision Agents for Autonomous GUI Interaction","version":2},"cited_work":{"arxiv_id":"2412.04454","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.04454","snapshot_observed_at":"2026-07-04T10:39:44.899694Z","title":"Aguvis: Unified Pure Vision Agents for Autonomous GUI Interaction","venue":"cs.CL","work_id":"64030c49-afa6-4cf0-b64c-831d19d6674e","year":2024},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2412.04454","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:d8e8a0fb3787ea7585fdb0e794bf422c9d8c616097ab6dec59c21669a77f0470","observation_id":"39d52ee4-b5ac-4b60-a0a8-c1b0a0fddebc","resolution":{"observed_at":"2026-05-18T04:09:42.002663Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12326","last_updated":"2025-01-21T17:48:10Z","snapshot_observed_at":"2026-07-06T20:23:58.426780Z","submitted_at":"2025-01-21T17:48:10Z","title":"UI-TARS: Pioneering Automated GUI Interaction with Native Agents","version":1},"cited_work":{"arxiv_id":"2501.12326","doi":"10.48550/arxiv.2501.12326","metadata_source":"pith","pith_arxiv_id":"2501.12326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"UI-TARS: Pioneering Automated GUI Interaction with Native Agents","venue":"cs.AI","work_id":"0bbcf263-a46d-4525-a438-11fce3316568","year":2025},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2501.12326","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:ca1e1e6da9080257a2a7974ac65c9b8785f6f62c9f917621703f7605e824e0e7","observation_id":"a71e925a-0952-4f51-9ce2-0d460b78bf73","resolution":{"observed_at":"2026-05-11T14:16:05.932614Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:19.638951+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:19.638951+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05243","last_updated":"2025-06-17T15:06:02Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T17:47:50Z","title":"Navigating the Digital World as Humans Do: Universal Visual Grounding for GUI Agents","version":3},"cited_work":{"arxiv_id":"2410.05243","doi":"10.48550/arxiv.2410.05243","metadata_source":"pith","pith_arxiv_id":"2410.05243","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Navigating the Digital World as Humans Do: Universal Visual Grounding for GUI Agents","venue":"cs.AI","work_id":"9def1724-6fd2-4d5b-8339-4c1ee76e62f8","year":2024},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2410.05243","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:4544a0b6299051f576dbfd80735f12fabb004087c41d6b6a9273567b3bea5273","observation_id":"22b0e0f3-6160-4d1d-b871-7bdb871b4f4b","resolution":{"observed_at":"2026-05-16T21:09:01.446022Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15846","last_updated":"2025-07-28T16:54:13Z","snapshot_observed_at":"2026-07-06T22:00:33.554745Z","submitted_at":"2025-07-21T17:53:42Z","title":"GUI-G$^2$: Gaussian Reward Modeling for GUI Grounding","version":3},"cited_work":{"arxiv_id":"2507.15846","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.15846","snapshot_observed_at":"2026-07-03T04:27:36.550370Z","title":"Gui-g 2: Gaussian reward modeling for gui grounding.arXiv preprint arXiv:2507.15846","venue":null,"work_id":"65623939-e092-4407-b0b3-00013098ba6b","year":2025},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2507.15846","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:11ab19253f2a9bc961e5a3161797454fb03ae58a4eb92b0919d1ed25117c97ee","observation_id":"797937a4-da08-4583-9b4b-1e0a415cbbce","resolution":{"observed_at":"2026-05-11T14:16:05.748563Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.04039","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gui- spotlight: Adaptive iterative focus refinement for enhanced gui visual grounding","venue":null,"work_id":"f5881ad7-a360-4646-9184-2a08e87ac705","year":2025},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:e6e273994d784ae133b58ef2838098bdf7bd516c53ea7edc14f9af3884471965","observation_id":"b0938b0f-92fa-442c-b98e-d482ff708a8b","resolution":{"observed_at":"2026-05-11T14:16:06.295085Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.21552","last_updated":"2026-05-25T20:58:59Z","snapshot_observed_at":"2026-08-04T15:01:26.024743Z","submitted_at":"2025-09-25T20:38:01Z","title":"Learning GUI Grounding with Spatial Reasoning from Visual Feedback","version":2},"cited_work":{"arxiv_id":"2509.21552","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.21552","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learn- ing gui grounding with spatial reasoning from visual feed- back","venue":null,"work_id":"26a39ad7-f46b-4a0c-b2b2-c82e420aa731","year":2025},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2509.21552","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:7c8f06039d110a516f69d3cbb670223beee6e715d9f74e230733aa13f6b93507","observation_id":"582ffb78-4164-46cf-939e-a9656471d3bf","resolution":{"observed_at":"2026-05-27T02:04:30.009656Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"fba1fb3b-d11d-4a18-b6e4-ec4021043dea","year":null},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:5dd717976c0745cd49fdc09b11bfedcd3ec5703cbc9e925988fe840382a305d5","observation_id":"7012240d-1e24-42ec-8a06-68e5126b02d6","resolution":{"observed_at":"2026-05-23T13:38:01.450855Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18279","last_updated":"2025-05-06T15:08:00Z","snapshot_observed_at":"2026-07-06T19:57:55.925634Z","submitted_at":"2024-11-27T12:13:39Z","title":"Large Language Model-Brained GUI Agents: A Survey","version":12},"cited_work":{"arxiv_id":"2411.18279","doi":"10.48550/arxiv.2411.18279","metadata_source":"pith","pith_arxiv_id":"2411.18279","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Language Model-Brained GUI Agents: A Survey","venue":"cs.AI","work_id":"782b1dd3-0702-49e8-a23c-abe09cdc169a","year":2024},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2411.18279","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:c0659d915bfc747e9abd3227881fad3fa4b984db897cfeccb43f96e1bb99e5f7","observation_id":"2afdd88c-7b5e-4515-9b83-c601fe38be6b","resolution":{"observed_at":"2026-05-19T11:08:28.109115Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"cfafcc88-9058-4469-b624-c15c5d97494e","year":null},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:266a82dd88a776508119d5190d0dea3b7bce4dd54b37884d0771185e40f30900","observation_id":"a59ab394-5565-40ef-8559-5840fdf40233","resolution":{"observed_at":"2026-05-23T13:38:01.459956Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:47:55.730920Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":"b0092220-e738-45d3-97b1-bd1f0bd834c5","year":null},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:47bc785856b23dce176abca3c6421ef8c99065cc7d5f64988f0460e5fabf496d","observation_id":"8b2de776-435e-434a-a0e0-90514551321a","resolution":{"observed_at":"2026-05-23T13:38:01.519400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 , institution =","venue":null,"work_id":"7ea46051-fe40-493e-84b3-79ce3d4ae463","year":2025},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:845a2eb4317282b878d0c5ed6a1ec236401e42fa60ab915ac55728da32ec1e22","observation_id":"4568213a-5814-42d4-8504-c2ad419e2937","resolution":{"observed_at":"2026-05-23T13:38:01.507974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12937","last_updated":"2025-08-04T04:22:09Z","snapshot_observed_at":"2026-07-31T07:01:13.724738Z","submitted_at":"2025-03-17T08:51:44Z","title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","version":2},"cited_work":{"arxiv_id":"2503.12937","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.12937","snapshot_observed_at":"2026-07-10T05:16:48.080500Z","title":"R1-VL: Learning to Reason with Multimodal Large Language Models via Step-wise Group Relative Policy Optimization","venue":"cs.AI","work_id":"e1614961-16d2-43bc-908a-8c57da5b151c","year":2025},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2503.12937","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:754d2a0894808b51fe4e7835b4372fa38130cb3a89b5d064b22a8ccc75412eeb","observation_id":"d056907d-68ed-4960-87cf-e2a754ae69b6","resolution":{"observed_at":"2026-05-16T15:04:22.925544Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03143","last_updated":"2025-06-03T17:59:08Z","snapshot_observed_at":"2026-08-01T17:23:14.885858Z","submitted_at":"2025-06-03T17:59:08Z","title":"GUI-Actor: Coordinate-Free Visual Grounding for GUI Agents","version":1},"cited_work":{"arxiv_id":"2506.03143","doi":"10.48550/arxiv.2506.03143","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03143","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2506.03143 (2025)","venue":"ArXiv.org","work_id":"89d4aef6-1376-44bf-8327-9115705e719c","year":2025},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2506.03143","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:824345cdf0278fe68ca981c8d020f25ea6fabee5bf6b5641cc27c8e23c297327","observation_id":"cccfa714-d6ec-4908-bebe-8778f10a8a40","resolution":{"observed_at":"2026-05-11T14:16:06.195484Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume=","venue":null,"work_id":"e5716285-4177-42e1-8e1e-1c6cba60b82f","year":null},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:62beffd4f6a713343e411a7f4a25d0d664d40d04531409355ddabfbb19e58245","observation_id":"2135c4bd-061b-4033-af53-87a78223ade6","resolution":{"observed_at":"2026-05-23T13:38:01.446329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00684","last_updated":"2025-07-14T17:45:50Z","snapshot_observed_at":"2026-07-06T21:17:42.853055Z","submitted_at":"2025-05-01T17:45:59Z","title":"Visual Test-time Scaling for GUI Agent Grounding","version":2},"cited_work":{"arxiv_id":"2505.00684","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00684","snapshot_observed_at":"2026-07-02T02:56:29.279130Z","title":"Visual test-time scaling for gui agent grounding","venue":null,"work_id":"84f0f1da-5e56-4e86-8983-ff12e5b2e9a9","year":2025},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2505.00684","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:de72829a1088de73dc477b6741c83ec1c4037b777c9849fc1c4e96a4d208f106","observation_id":"e9fdcab8-9d22-4a77-8e41-34d24e041bc9","resolution":{"observed_at":"2026-05-11T14:16:06.024611Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13591","last_updated":"2025-09-11T16:37:00Z","snapshot_observed_at":"2026-07-06T19:53:21.444233Z","submitted_at":"2024-11-18T05:47:12Z","title":"Improved GUI Grounding via Iterative Narrowing","version":7},"cited_work":{"arxiv_id":"2411.13591","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.13591","snapshot_observed_at":"2026-07-02T02:56:29.291537Z","title":"Improved gui grounding via iterative narrowing","venue":null,"work_id":"b477469f-c4aa-433e-823a-388a03e3461c","year":2024},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2411.13591","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:0200e6f495b590f2d983673b3c4437e0d2ee62045de2970d9eaa53cf3d96bc67","observation_id":"77a6c011-4013-4ae9-b1a9-98e8492312d2","resolution":{"observed_at":"2026-05-11T14:16:05.964404Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":"7df3dacb-98b7-4dd1-afc7-1b86ce9eb876","year":2025},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:135b23999d3e16525ee9778025fd9b27733dfbaa3cd49d8799dc1479d884e2e2","observation_id":"3a79bd50-f463-46a8-99a0-a5eb7883e4ec","resolution":{"observed_at":"2026-05-23T13:38:01.515459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.02472","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T17:19:59.984011Z","title":"Guided self-evolving llms with minimal human supervision","venue":null,"work_id":"b3ab982e-f3fe-4249-88b3-341d8d0f3ff5","year":2025},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:bb4c19e3aa3ded279391411724e8181b147927b5a1e90ee3fe8b1b1e2322d393","observation_id":"0b5d5cc0-6cc2-458e-8961-995eacbb29b2","resolution":{"observed_at":"2026-05-11T14:16:05.825664Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.03412","last_updated":"2026-04-29T09:45:31Z","snapshot_observed_at":"2026-07-06T22:44:18.875334Z","submitted_at":"2026-02-03T11:41:02Z","title":"Verified Critical Step Optimization for LLM Agents","version":2},"cited_work":{"arxiv_id":"2602.03412","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.03412","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Verified Critical Step Optimization for LLM Agents","venue":"cs.CL","work_id":"89b2f568-2ae5-4b5d-9d8c-4edc35053d81","year":2026},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2602.03412","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:e852e099216d56efa444d0f554d0991014c2b95b7c8948def595ac959b113e89","observation_id":"46d50266-5fd1-4f12-b344-8de8a2ffad57","resolution":{"observed_at":"2026-05-11T14:16:06.322582Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.05615","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T04:27:36.593706Z","title":"Test-time reinforcement learning for gui grounding via region consistency","venue":null,"work_id":"b32be9a8-4b99-418c-b2d1-1f2a08a15037","year":2025},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:26792ab150f43b18bceac601775f6b555eb47cfb30d8a27145cfd580880af71e","observation_id":"0b10def3-3009-4411-b1a7-15aa20d5743f","resolution":{"observed_at":"2026-05-11T14:16:06.116348Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.00008","last_updated":"2025-09-05T17:21:02Z","snapshot_observed_at":"2026-07-06T21:49:56.788040Z","submitted_at":"2025-06-12T03:13:21Z","title":"DiMo-GUI: Advancing Test-time Scaling in GUI Grounding via Modality-Aware Visual Reasoning","version":2},"cited_work":{"arxiv_id":"2507.00008","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.00008","snapshot_observed_at":"2026-07-02T21:37:25.319373Z","title":"Dimo-gui: Advancing test-time scaling in gui grounding via modality- aware visual reasoning.arXiv preprint arXiv:2507.00008","venue":null,"work_id":"aeac6980-5888-409f-9d1e-f663a41ee21d","year":2025},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2507.00008","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:4c47c302f207287a407e857a86167f502bb836b1ed3135712c5f5139179d7e0e","observation_id":"2176429e-b6f6-4565-b816-f82147d0cd97","resolution":{"observed_at":"2026-05-11T14:16:06.162349Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05791","last_updated":"2025-10-03T23:50:19Z","snapshot_observed_at":"2026-07-30T10:31:35.758747Z","submitted_at":"2025-07-08T08:52:18Z","title":"GTA1: GUI Test-time Scaling Agent","version":5},"cited_work":{"arxiv_id":"2507.05791","doi":"10.48550/arxiv.2507.05791","metadata_source":"pith","pith_arxiv_id":"2507.05791","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GTA1: GUI Test-time Scaling Agent","venue":"cs.AI","work_id":"5345a78f-68f1-4e8c-b240-30b0bb230de3","year":2025},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2507.05791","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:60dd988ef92105d710a5a39c704b2198854d57aa50c3e4f1234286462c5e02c3","observation_id":"8e655cea-93a0-4b60-b1ff-426007ed123c","resolution":{"observed_at":"2026-05-17T13:55:00.131095Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":"340f178b-867f-4134-a7bf-450750366372","year":null},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:8036386efe1a80e409b11ae96f9b9844d17e10baf38c8a61b6649003d9dfe787","observation_id":"7d3d1610-fdc4-4607-92e2-cb46149336ac","resolution":{"observed_at":"2026-05-23T13:38:01.422286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21620","last_updated":"2025-05-24T08:46:08Z","snapshot_observed_at":"2026-08-01T20:06:59.931737Z","submitted_at":"2025-03-27T15:39:30Z","title":"UI-R1: Enhancing Efficient Action Prediction of GUI Agents by Reinforcement Learning","version":5},"cited_work":{"arxiv_id":"2503.21620","doi":"10.48550/arxiv.2503.21620","metadata_source":"pith","pith_arxiv_id":"2503.21620","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"UI-R1: Enhancing Efficient Action Prediction of GUI Agents by Reinforcement Learning","venue":"cs.AI","work_id":"4637c89b-db94-4e6f-8bf2-030bea2fdd6e","year":2025},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2503.21620","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:49d11973f1e79cee8d0a3c6c391b6b37ade9987d40ffb427c8a1632e3eafff7a","observation_id":"a1c5c2ad-218b-4c45-aedb-08ad9a1b0dcd","resolution":{"observed_at":"2026-05-16T11:02:41.429566Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":"4a1267d9-497c-4b48-83d5-da5598f2213a","year":null},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:3d8ebbac0fccfbf8f8e2fe4e6c4972d9f9f997098f6b77bd21de10dee9f0cc96","observation_id":"ffb27697-8606-4cfe-9b9d-e9c816aafe97","resolution":{"observed_at":"2026-05-23T13:38:01.497680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.04389","last_updated":"2025-08-06T12:35:24Z","snapshot_observed_at":"2026-07-06T22:08:45.542495Z","submitted_at":"2025-08-06T12:35:24Z","title":"GuirlVG: Incentivize GUI Visual Grounding via Empirical Exploration on Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2508.04389","doi":"10.48550/arxiv.2508.04389","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.04389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Guirlvg: Incentivize gui visual grounding via empirical exploration on reinforcement learning","venue":"arXiv (Cornell University)","work_id":"ba1bbdf7-5e60-4536-ab58-771408551cdc","year":2025},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2508.04389","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:448e2475fe90523d5dacba79cd514f570dedef8929772650491acfce85445c2a","observation_id":"11f80128-cdae-47c2-a031-602baf433146","resolution":{"observed_at":"2026-05-11T14:16:06.078429Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04575","last_updated":"2025-01-08T15:45:21Z","snapshot_observed_at":"2026-08-05T04:06:23.326388Z","submitted_at":"2025-01-08T15:45:21Z","title":"InfiGUIAgent: A Multimodal Generalist GUI Agent with Native Reasoning and Reflection","version":1},"cited_work":{"arxiv_id":"2501.04575","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.04575","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2501.04575 , year =","venue":null,"work_id":"158ad17f-ecff-470e-891b-d18558f04270","year":2025},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2501.04575","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:93174448eb4b961e2062ddce08e5055c75758ab96d609e45c7a50a32aede7d41","observation_id":"43a0619d-3183-48b1-8138-62881037df8d","resolution":{"observed_at":"2026-05-11T14:16:06.068755Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10615","last_updated":"2025-03-18T08:52:34Z","snapshot_observed_at":"2026-07-06T20:52:09.743730Z","submitted_at":"2025-03-13T17:56:05Z","title":"R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization","version":2},"cited_work":{"arxiv_id":"2503.10615","doi":"10.48550/arxiv.2503.10615","metadata_source":"pith","pith_arxiv_id":"2503.10615","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization","venue":"cs.CV","work_id":"bd2bf4d0-20bf-49b8-8dac-b54a8019be6c","year":2025},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2503.10615","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:892ebb51e7b322bb16778488a6a3f7062dd7e72cf868611a893d4fd5514700cb","observation_id":"059d0952-9b3b-45e8-89f8-9c3486fc06bd","resolution":{"observed_at":"2026-05-16T00:19:20.780377Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07934","last_updated":"2025-05-30T15:53:16Z","snapshot_observed_at":"2026-07-06T21:07:29.062389Z","submitted_at":"2025-04-10T17:49:05Z","title":"SoTA with Less: MCTS-Guided Sample Selection for Data-Efficient Visual Reasoning Self-Improvement","version":3},"cited_work":{"arxiv_id":"2504.07934","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.07934","snapshot_observed_at":"2026-07-04T16:29:57.248099Z","title":"Sota with less: Mcts-guided sample selection for data-efficient visual reasoning self-improvement","venue":null,"work_id":"3af2dc47-c7ba-4654-9a4e-89fdcbfa9bc0","year":2025},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2504.07934","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:ff97cab0aeaf28c5ce13ae1ad889820bdf66e3f2a169bc70c43bc6f223f703ae","observation_id":"f693a19e-16f1-44d6-b921-05860080a572","resolution":{"observed_at":"2026-05-11T14:16:06.142584Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume=","venue":null,"work_id":"4b41e4a6-490e-487e-9fe2-7870dd4510be","year":null},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:35d2d542a520369664cbba73f8535678fdc7e7c0a2ba8a7dcc33cd5886c13f45","observation_id":"8f8abcee-61b7-48a2-88d1-f0f1234ae15c","resolution":{"observed_at":"2026-05-23T13:38:01.511447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T15:16:18.918042Z","title":"Transactions of the Association for Computational Linguistics , volume=","venue":null,"work_id":"2c80363e-452a-42ba-8374-45905900d105","year":2024},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:524a34a462030d9ce96f38f60b877759077fcd1675cbe7ae51825cb7e32693c6","observation_id":"b36aac1d-103c-4aef-af20-f1f17b2d5e6b","resolution":{"observed_at":"2026-05-23T13:38:01.532104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T02:46:43.213655Z","title":"Communication, Simulation, and Intelligent Agents: Implications of Personal Intelligent Machines for Medical Education","venue":null,"work_id":"b277feb0-ac04-469b-b219-01bf57aa5d66","year":null},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:0ee38f8985e3fe52bca592b0f1b34a1765d9b00be220ab8bdfc7497de4281242","observation_id":"431eda5b-97df-49b2-a9ab-8cd43e42cb5a","resolution":{"observed_at":"2026-05-23T13:38:01.523979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T02:46:43.089024Z","title":"Classification Problem Solving","venue":null,"work_id":"5fc3ac2c-32b3-48e8-88ab-97323e52e90f","year":null},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:b2edfabba2ab2370d11750febf4c1ffc12465214f30b00c9665145c8620d13d2","observation_id":"df195eaa-bd3d-4b34-927f-dc8cec3aaa6f","resolution":{"observed_at":"2026-05-23T13:38:01.468882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T02:46:43.160595Z","title":"title =","venue":null,"work_id":"c2f7654c-8c84-460e-8108-6799a27c8f81","year":1980},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:2ee0f256174fe304d70f18072b3e56248ba5b9001750c7b721a360d1e58cd88c","observation_id":"d65b60da-efa5-4645-852d-05c8dc39aa70","resolution":{"observed_at":"2026-05-23T13:38:01.350782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T02:46:43.133884Z","title":"New Ways to Make Microcircuits Smaller---Duplicate Entry","venue":null,"work_id":"1b2e5887-3df9-43db-83e9-86f80ec79d40","year":null},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:29923b2fd22466d9de3880f8dde835d76e352bddc30e96a5ce8eaab89ec61179","observation_id":"c0379a31-3077-4481-b8ad-c2f416ad04ac","resolution":{"observed_at":"2026-05-23T13:38:01.383432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/s0020-7373(84)80003-6","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T02:46:42.889340Z","title":"Clancey and Glenn Rennels , abstract =","venue":"International Journal of Man-Machine Studies","work_id":"720602ef-8e14-4f51-ad29-e9f471bdac3c","year":1984},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:93e81c0cae248410a27220edcdd155aca0177501eda90017e0cd0e59e97d3f16","observation_id":"18be6b79-e6b2-4e50-860c-c167069acde4","resolution":{"observed_at":"2026-05-09T23:09:26.642162Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-17T20:50:55.421115+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-17T20:50:55.421115+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T02:46:43.194499Z","title":"and Rennels, Glenn R","venue":null,"work_id":"83e00d13-8466-4968-89fc-e44bee61e537","year":null},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:009ff44f70c8e3ee3e570ca2b731246d1c4bcdbc2c246ac7ca9bf4fdfa35a9d3","observation_id":"2e1e41f5-6929-43c8-9b15-30529074224f","resolution":{"observed_at":"2026-05-23T13:38:01.504481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T02:46:43.151405Z","title":"Poligon: A System for Parallel Problem Solving","venue":null,"work_id":"4c9adf14-6517-4f20-9bc6-0a72d20a80af","year":null},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:18242f5b4684cd7b471eed7f76602cdba2346b4122d633aaf0baa506271d2f71","observation_id":"fdd12947-f880-4133-94fe-53757945f65a","resolution":{"observed_at":"2026-05-23T13:38:01.481353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":58,"parse_uncertain":0,"unresolved":3,"verified_exact":9,"verified_fuzzy":30},"total_outbound_references":104},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 100 of 104 outbound references and 2 inbound Pith citation observations for arXiv:2604.21268."}