{"as_of":"2026-08-12T16:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1a6b92280b2195e5f9665ad0da1e1fb5ca9876331c78c86af5c045aa9eeacfe0","coverage":[{"denominator":72,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":72,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T15:46:50.587684Z","state":"measured"},{"denominator":74,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":74,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T00:45:32.126811Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.02031","snapshot_observed_at":"2026-07-31T23:58:28.610388Z","title":"arXiv preprint arXiv:2606.02031 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23263","last_updated":"2026-07-25T16:00:45Z","snapshot_observed_at":"2026-08-08T14:02:28.427889Z","submitted_at":"2026-07-25T16:00:45Z","title":"SeekJudge: A Practical Reward Framework for Reinforcement Learning in Computer-Use Agents","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-07-31T23:58:28.610388Z"},"links":{"cited_paper":"/paper/2606.02031","citing_paper":"/paper/2607.23263"},"observation_digest":"sha256:491730a4281335ebb992c3054ba1e53a44af6c2288bdc8b26aa107bb9e588384","observation_id":"11a59d82-1620-4a73-aa12-e8302c4c0355","resolution":{"observed_at":"2026-07-31T23:58:28.610388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.02031","snapshot_observed_at":"2026-08-04T00:45:32.126811Z","title":"arXiv:2606.02031","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00335","last_updated":"2026-07-31T22:57:16Z","snapshot_observed_at":"2026-08-07T05:13:02.097724Z","submitted_at":"2026-07-31T22:57:16Z","title":"RMSWeb: Reflection, Failure-Mode Mining, and Salvage-DS for Web Agent Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T00:45:32.126811Z"},"links":{"cited_paper":"/paper/2606.02031","citing_paper":"/paper/2608.00335"},"observation_digest":"sha256:f103c574cce75384fad97f4a4e01a7bf633b137e529078547a28db7ceb828aed","observation_id":"b0217b2c-d4d3-4b49-82a3-c2b19124985e","resolution":{"observed_at":"2026-08-04T00:45:32.126811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.02031/citation-record","integrity":"/paper/2606.02031/integrity","json":"/paper/2606.02031/citation-record.json","paper":"/paper/2606.02031"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:f62436b91cc571d7fb7a50d825a7d601bbe1f5e63681b532b5fc8674f850e87a","observation_id":"0ee32fac-a6fb-4f7d-ae52-b509651b9d76","resolution":{"observed_at":"2026-07-01T22:06:16.392441Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02865","last_updated":"2025-06-11T09:33:38Z","snapshot_observed_at":"2026-08-10T06:34:13.102785Z","submitted_at":"2025-06-03T13:29:03Z","title":"Surfer-H Meets Holo1: Cost-Efficient Web Agent Powered by Open Weights","version":2},"cited_work":{"arxiv_id":"2506.02865","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02865","snapshot_observed_at":"2026-07-01T22:06:16.459539Z","title":"Surfer-h meets holo1: Cost-efficient web agent powered by open weights","venue":null,"work_id":"bcb7e1a4-4870-4b27-a5b3-e3d6f587fa0b","year":2025},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"cited_paper":"/paper/2506.02865","citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:e199cc98d9aef2d69bfaaf48c9d00fe64cd628a81ef80afec592cdc578bd29b4","observation_id":"7f02ee38-cd25-4965-8ed5-5784fb0fc937","resolution":{"observed_at":"2026-07-01T22:06:16.461295Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.19663","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T05:27:39.595999Z","title":"Fara-7b: An efficient agentic model for computer use","venue":null,"work_id":"7c024272-b3cb-43d8-abea-064ed3da371a","year":2025},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:fc69d583688434d704ecbdc276c3ba828c8cac6312635f136e29dd785242343a","observation_id":"3f5eb26f-bd39-4b89-bd5e-8cf024ff023a","resolution":{"observed_at":"2026-07-01T22:06:16.428259Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.02439","last_updated":"2026-05-02T18:45:09Z","snapshot_observed_at":"2026-08-11T04:05:27.279416Z","submitted_at":"2026-01-05T09:35:11Z","title":"WebGym: Scaling Training Environments for Visual Web Agents with Realistic Tasks","version":6},"cited_work":{"arxiv_id":"2601.02439","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.02439","snapshot_observed_at":"2026-07-04T17:09:59.271081Z","title":"WebGym: Scaling Training Environments for Visual Web Agents with Realistic Tasks","venue":"cs.LG","work_id":"d7907f33-ed97-41c0-8581-52ef6663314c","year":2026},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"cited_paper":"/paper/2601.02439","citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:e621583e85a4e444b962f28855fc627934f4467ae8dfdc7b44877f5209bd2065","observation_id":"34702829-b451-433f-852d-0ae36c114e07","resolution":{"observed_at":"2026-07-01T22:06:16.434499Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:46:50.587684Z","title":"DigiRL: Training in-the-wild device-control agents with autonomous reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:a6cfc987dddb957ea678da444a181facd88ecc330e393b45e14e636b15d6d513","observation_id":"694b5164-defb-4340-bb0d-7e54549e8f21","resolution":{"observed_at":"2026-06-28T15:46:50.587684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-11T14:42:37.584016Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:369cb421004274f6694516c55e72b5d30ba550a77dc6528543aa8b20691bdcb9","observation_id":"c55bcdab-1331-4eda-9752-5468ffed1a99","resolution":{"observed_at":"2026-07-01T22:06:16.428388Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:46:50.587684Z","title":"Web agents with world models: Learning and leveraging environment dynamics in web navigation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:a4d13090886fc4054361bb6037848c80b26fa19dd8a0eb8f5ef765ea6821fa8f","observation_id":"2a4a2e64-87bf-4942-8f14-a23fbbc68db7","resolution":{"observed_at":"2026-06-28T15:46:50.587684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.12693","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T22:06:16.430434Z","title":"arXiv preprint arXiv:2510.12693 , year=","venue":null,"work_id":"e00da591-7344-4c6a-9294-ceb4dd8c9015","year":2025},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:408f9446e146cb35c2c27dde640c0c085ace0398a899b2d9530f1e29bd503965","observation_id":"e54dd26e-4112-426c-a1b9-798a51d52b86","resolution":{"observed_at":"2026-07-01T22:06:16.432168Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.23559","last_updated":"2026-06-29T04:46:30Z","snapshot_observed_at":"2026-07-13T20:13:28.192496Z","submitted_at":"2026-03-23T23:35:59Z","title":"CAPTCHA Solving for Native GUI Agents: Automated Reasoning-Action Data Generation and Self-Corrective Training","version":2},"cited_work":{"arxiv_id":"2603.23559","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.23559","snapshot_observed_at":"2026-07-01T22:06:16.433451Z","title":"CAPTCHA Solving for Native GUI Agents: Automated Reasoning-Action Data Generation and Self-Corrective Training","venue":"cs.CR","work_id":"2d2256ed-5add-4c74-bccc-e4e4383a9a34","year":2026},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"cited_paper":"/paper/2603.23559","citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:7e2c5e64d7872e8e5e1db0e3a31222ed77b4c1f53f9fb3bc1b2327c9eb691e12","observation_id":"087543f3-3c2a-4b47-b709-a579650171d3","resolution":{"observed_at":"2026-07-01T22:06:16.434850Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:46:50.587684Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:1435bf31b1602231fdbef8bd1a1e08d1d8421f66f6b5c57542a5b2f3c935475d","observation_id":"a41d36ae-09a0-4df7-8a3b-016c80e6aca7","resolution":{"observed_at":"2026-06-28T15:46:50.587684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:46:50.587684Z","title":"Seeclick: Harnessing gui grounding for advanced visual gui agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:4c22d8a2bc79010c1a9b8e11c4b49c58a0220a14c35a37d2f01d3f5500406b72","observation_id":"d254b99f-7e51-4a8b-90f2-e15b2dd88ad3","resolution":{"observed_at":"2026-06-28T15:46:50.587684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:46:50.587684Z","title":"Mind2web: Towards a generalist agent for the web.Advances in Neural Information Processing Systems, 36:28091–28114, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:3d6f674170fa043ec7a364d401e09d7b433161e5e41ddee6fcb5904f2ee0ac5e","observation_id":"a7cca339-63da-499a-bbba-4ae98d91ec8c","resolution":{"observed_at":"2026-06-28T15:46:50.587684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:46:50.587684Z","title":"Scaling laws for reward model overoptimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:f9a56422b1198b2eeba599ec4be8b9cad7adce64502bb9c9d9a2f615e5620f8b","observation_id":"b911a0f9-9836-4ff1-ae24-c93f367885bf","resolution":{"observed_at":"2026-06-28T15:46:50.587684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:46:50.587684Z","title":"Navigating the digital world as humans do: Universal visual grounding for gui agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:d7b48df1b8be28141b4663ca1224995484f252b6762014be69ba5bda1646429f","observation_id":"5e74c58f-b2d7-4521-bedb-9ceb6e623bc7","resolution":{"observed_at":"2026-06-28T15:46:50.587684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06559","last_updated":"2025-04-01T05:04:47Z","snapshot_observed_at":"2026-08-09T10:42:58.450567Z","submitted_at":"2024-11-10T18:50:51Z","title":"Is Your LLM Secretly a World Model of the Internet? Model-Based Planning for Web Agents","version":2},"cited_work":{"arxiv_id":"2411.06559","doi":"10.48550/arxiv.2411.06559","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.06559","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Is your llm secretly a world model of the internet? model-based planning for web agents","venue":"arXiv (Cornell University)","work_id":"30c2e3ae-88b7-41e6-986b-6f097fe53d5f","year":2024},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"cited_paper":"/paper/2411.06559","citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:34238becf1b03fa96cd057122525d605a696b69272e1fed3b962a48191aa1ea0","observation_id":"93b96fca-c486-4927-a8f5-2f21c814485a","resolution":{"observed_at":"2026-07-01T22:06:16.437544Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:46:50.587684Z","title":"Deepseek-r1 incentivizes reasoning in llms through reinforcement learning.Nature, 645(8081):633–638, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:084f5cbc392ce875a1b6714872ae66a102f27a5393b18a56f21cdeccf91e3101","observation_id":"df3c7960-c60d-48c0-af59-127219d61ad9","resolution":{"observed_at":"2026-06-28T15:46:50.587684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.08516","last_updated":"2026-04-09T17:54:02Z","snapshot_observed_at":"2026-07-06T22:57:35.435713Z","submitted_at":"2026-04-09T17:54:02Z","title":"MolmoWeb: Open Visual Web Agent and Open Data for the Open Web","version":1},"cited_work":{"arxiv_id":"2604.08516","doi":"10.48550/arxiv.2604.08516","metadata_source":"pith","pith_arxiv_id":"2604.08516","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"MolmoWeb: Open Visual Web Agent and Open Data for the Open Web","venue":"cs.CV","work_id":"8d13f969-a073-4a98-bbc5-fd8bf64dda61","year":2026},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"cited_paper":"/paper/2604.08516","citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:c6e958b064a9efb698566c3d1191d8aa614ce30911dd5878229e449da18b889a","observation_id":"f00ee4d4-aa91-423a-8866-6e5378792912","resolution":{"observed_at":"2026-07-01T22:06:16.442722Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:46:50.587684Z","title":"Webvoyager: Building an end-to-end web agent with large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:603e715d30ad90a7832a622df819843e8f141a4ccf742fb4816ff57c0dc52052","observation_id":"4c8c2e25-0f07-471a-b41a-568e3cb8d7e9","resolution":{"observed_at":"2026-06-28T15:46:50.587684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:46:50.587684Z","title":"Openwebvoyager: Building multimodal web agents via iterative real-world ex- ploration, feedback and optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:d18bb9036d67e4ee24ecda22aab5953a4a628d8c00aef5168e537314f7470a1d","observation_id":"22c49a81-ea69-43cf-8c15-5d79817fceae","resolution":{"observed_at":"2026-06-28T15:46:50.587684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.10962","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T10:58:02.924056Z","title":"Scalable data synthesis for computer use agents with step-level filtering,","venue":null,"work_id":"975f4e37-23bd-4647-9da5-7ee374ae2e8a","year":2025},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:df6fcb7423c857cd94f02532f1876db3f90675301ddbc4cdf1f08733cd8ff1a1","observation_id":"c7fe0526-818a-439f-9f56-0fc4732152e7","resolution":{"observed_at":"2026-07-01T22:06:16.443216Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:46:50.587684Z","title":"Glm-4.1 v-thinking: Towards versatile multimodal reasoning with scalable reinforcement learning.arXiv e-prints, pages arXiv–2507, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:59ee452e942cb33d291de12c38923dd19f0fe499e3a83f014d1da1276c71c50c","observation_id":"46d9c196-30b5-4289-b1dc-d5b5f0a6d50c","resolution":{"observed_at":"2026-06-28T15:46:50.587684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:46:50.587684Z","title":"Embodied web agents: Bridging physical-digital realms for integrated agent intelligence.Advances in Neural Information Processing Systems, 38, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:7d0ba8458d556b3adbf9e48e3b6437c81bdcbf351c4cf20381e9e6f3f96c130b","observation_id":"e1e13c10-827a-4c66-ba1f-01450b12a6df","resolution":{"observed_at":"2026-06-28T15:46:50.587684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.06052","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T10:17:57.832911Z","title":"Rethinking memory mechanisms of foundation agents in the second half","venue":null,"work_id":"639480bb-7fee-4f7e-ac4f-23006d622bd4","year":2026},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:bf7945840ee6b4f9356c43849a19600df2eac3f5dc2eac0cf5b09b8f5682d4bb","observation_id":"85403a82-da14-4642-8df6-f0a5815ed867","resolution":{"observed_at":"2026-07-01T22:06:16.463970Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-08-07T18:44:26.813869Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":"2503.06749","doi":"10.48550/arxiv.2503.06749","metadata_source":"pith","pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","venue":"cs.CV","work_id":"38998646-34ee-4605-b661-ab356f16d6e5","year":2025},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:b9507d63c756ee54928341876a33f7c82361aa45d860571b5afc90173ec75a38","observation_id":"62901e59-52a5-4b31-916a-8d4ba98fbe3f","resolution":{"observed_at":"2026-07-01T22:06:16.450977Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.15221","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T05:29:35.728165Z","title":"Scalecua: Scaling open-source computer use agents with cross-platform data","venue":null,"work_id":"d1cd3d65-758c-49ba-8985-67b492e0897a","year":2025},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:44a3a769ab996c1a126c965abb609ec0a24154531fe8ddebdde7b6aa20e08cdf","observation_id":"6aaa6ab2-3b78-4245-b8fc-559b8841929e","resolution":{"observed_at":"2026-07-01T22:06:16.471653Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:46:50.587684Z","title":"Visual-rft: Visual reinforcement fine-tuning","venue":null,"work_id":null,"year":2034},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:dfc5086c554df266efac974ec9d8053c375a7dd7af84f8da124525bcd721d510","observation_id":"501acd53-cba0-4fb0-be15-00a0630bcd25","resolution":{"observed_at":"2026-06-28T15:46:50.587684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.08942","doi":"10.48550/arxiv.2504.08942","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agentrewardbench: Evaluating automatic evaluations of web agent trajectories","venue":"ArXiv.org","work_id":"4672f8c4-b6e4-4226-91be-6e4cb99e2669","year":2025},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:fec76f9a1e41c2d6605918e1f56264d736bf4bef9f1941ea70b76b0d318c9eea","observation_id":"34605548-2744-40eb-8380-9f91743c5182","resolution":{"observed_at":"2026-07-01T22:06:16.479102Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:46:50.587684Z","title":"Ui-r1: Enhancing efficient action prediction of gui agents by reinforcement learning","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:6180a49bc264bf342a7c8123d135f7eb7a2377da7772f04a459ff303a6dc574f","observation_id":"57443a4a-4acc-4129-af17-4b13b2443f17","resolution":{"observed_at":"2026-06-28T15:46:50.587684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10458","last_updated":"2025-10-01T04:55:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:45:54Z","title":"GUI-R1 : A Generalist R1-Style Vision-Language Action Model For GUI Agents","version":4},"cited_work":{"arxiv_id":"2504.10458","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.10458","snapshot_observed_at":"2026-07-04T14:19:55.071333Z","title":"GUI-R1 : A Generalist R1-Style Vision-Language Action Model For GUI Agents","venue":"cs.CV","work_id":"5e82d316-7129-4f55-9c00-0d7fcbcea139","year":2025},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"cited_paper":"/paper/2504.10458","citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:456e4a1f581b76c5536f897c4a10d07fbff78399d69770bfb02f59a471d12e6d","observation_id":"05b64c83-ada2-48db-9b2d-7b1014d58eec","resolution":{"observed_at":"2026-07-01T22:06:16.452406Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02839","last_updated":"2025-06-03T13:08:17Z","snapshot_observed_at":"2026-08-11T09:56:50.892544Z","submitted_at":"2025-06-03T13:08:17Z","title":"DeepShop: A Benchmark for Deep Research Shopping Agents","version":1},"cited_work":{"arxiv_id":"2506.02839","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02839","snapshot_observed_at":"2026-07-03T15:48:35.852951Z","title":"Deepshop: A benchmark for deep research shopping agents","venue":null,"work_id":"fbbb47e3-1dac-4aaf-a4d0-ed74d7d9bc3a","year":2025},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"cited_paper":"/paper/2506.02839","citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:e4c84e5f54358693e53adc2a7871df8dfb8a9e8e688fce5f3f482e2962c86e4e","observation_id":"7383006c-253c-4889-a0b0-b6b62341d313","resolution":{"observed_at":"2026-07-01T22:06:16.457940Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:46:50.587684Z","title":"Inform: Mitigating reward hacking in rlhf via information-theoretic reward modeling.Advances in Neural Information Processing Systems, 37:134387–134429, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:0c6197c9449580119d64beec1346b16e79270f2c4f1617c523449c957cf6a2bb","observation_id":"1004efd3-c3e3-4718-b65d-039422044496","resolution":{"observed_at":"2026-06-28T15:46:50.587684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12373","last_updated":"2024-07-16T06:19:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-18T07:58:33Z","title":"WebCanvas: Benchmarking Web Agents in Online Environments","version":3},"cited_work":{"arxiv_id":"2406.12373","doi":"10.48550/arxiv.2406.12373","metadata_source":"pith","pith_arxiv_id":"2406.12373","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebCanvas: Benchmarking Web Agents in Online Environments","venue":"cs.CL","work_id":"b8949e88-00ed-4d70-b935-0761ce59b669","year":2024},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"cited_paper":"/paper/2406.12373","citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:0f919fac4722b4a5a4ed615d348ba4aa79e01a9d91e43bf7f53c8168758c8281","observation_id":"171f012a-c40f-4943-8958-199f6e341e8d","resolution":{"observed_at":"2026-07-01T22:06:16.436936Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.15040","last_updated":"2026-07-30T16:17:23Z","snapshot_observed_at":"2026-08-02T23:57:46.531676Z","submitted_at":"2026-05-14T16:35:12Z","title":"Orchard: An Open-Source Agentic Modeling Framework","version":3},"cited_work":{"arxiv_id":"2605.15040","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.15040","snapshot_observed_at":"2026-07-01T22:06:16.399587Z","title":"Orchard: An Open-Source Agentic Modeling Framework","venue":"cs.AI","work_id":"4b89a6c5-6b60-4c1b-820c-8bea40b0f8b1","year":2026},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"cited_paper":"/paper/2605.15040","citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:6f8068fd11cabc385ee06bf3c2e010acbbce87ac5bc7ea0214ec1913faf7e12e","observation_id":"223f4fdb-b8b4-4a80-b10a-9b68f958701c","resolution":{"observed_at":"2026-07-01T22:06:16.401012Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:46:50.587684Z","title":"Webrl: Training llm web agents via self-evolving online curriculum reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:c4087d36399096950ef1b313ac7faa640b725ff41c85cb89300bb353ce536b7f","observation_id":"7aedf6dd-e6a6-40da-a114-d2169af94b97","resolution":{"observed_at":"2026-06-28T15:46:50.587684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12326","last_updated":"2025-01-21T17:48:10Z","snapshot_observed_at":"2026-07-06T20:23:58.426780Z","submitted_at":"2025-01-21T17:48:10Z","title":"UI-TARS: Pioneering Automated GUI Interaction with Native Agents","version":1},"cited_work":{"arxiv_id":"2501.12326","doi":"10.48550/arxiv.2501.12326","metadata_source":"pith","pith_arxiv_id":"2501.12326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"UI-TARS: Pioneering Automated GUI Interaction with Native Agents","venue":"cs.AI","work_id":"0bbcf263-a46d-4525-a438-11fce3316568","year":2025},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"cited_paper":"/paper/2501.12326","citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:9a1875ac61abfc02676f5a6915465f0e04155f05a244d65a82d3aec3f0a78e2f","observation_id":"91c4051b-f433-483e-8fe9-23c279cdabf8","resolution":{"observed_at":"2026-07-01T22:06:16.481774Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:19.638951+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:19.638951+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:0b5ec5bc1d4352851a975b47a853e9f73b6e5a16ab7f3677f234cf4262a50dd6","observation_id":"ead8682a-9df4-416b-abf4-ca0693d3d6e5","resolution":{"observed_at":"2026-07-01T22:06:16.455986Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-08-08T20:11:45.308315Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":"2504.07615","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-11T03:17:51.904109Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","venue":"cs.CV","work_id":"d36889cb-edb6-448f-9a50-36df8b1623e5","year":2025},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:a8678d7f5a88cec75af76cbed622bc89e75f455273619245af29d69d386ed9d4","observation_id":"ba77acba-516f-4347-93cd-c284777f47c7","resolution":{"observed_at":"2026-07-01T22:06:16.463237Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03267","last_updated":"2026-05-01T23:55:43Z","snapshot_observed_at":"2026-08-02T10:52:10.211700Z","submitted_at":"2025-12-19T07:05:38Z","title":"OpenAI GPT-5 System Card","version":2},"cited_work":{"arxiv_id":"2601.03267","doi":"10.48550/arxiv.2601.03267","metadata_source":"pith","pith_arxiv_id":"2601.03267","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"OpenAI GPT-5 System Card","venue":"cs.CL","work_id":"ca87689a-0d29-4476-b504-b65dbbb08af4","year":2025},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"cited_paper":"/paper/2601.03267","citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:21a477af89fcf8944f5e2f85fe422bb66c8aaf606a166483be2bce61b24a85d7","observation_id":"4cdf6d52-2b97-4470-91ac-6eef6690b316","resolution":{"observed_at":"2026-07-01T22:06:16.476391Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-10T00:38:24.809631+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T00:38:24.809631+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-08-09T09:48:45.884814Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":"2504.07491","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-07-08T06:34:41.884360Z","title":"Kimi-VL Technical Report","venue":"cs.CV","work_id":"c876520f-8a20-44f3-b92a-bf7d35bd430f","year":2025},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:0fea9dd28451d1cbde6f3508d3e3c3743873eb52fa21d97d146139b546d219c9","observation_id":"5afc4c37-dc9e-4fd3-a0d5-8f3c9e695a88","resolution":{"observed_at":"2026-07-01T22:06:16.474148Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06776","last_updated":"2025-05-22T17:59:11Z","snapshot_observed_at":"2026-08-08T15:07:58.758525Z","submitted_at":"2025-02-10T18:54:05Z","title":"InSTA: Towards Internet-Scale Training For Agents","version":2},"cited_work":{"arxiv_id":"2502.06776","doi":"10.48550/arxiv.2502.06776","metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06776","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"URL https://doi.org/10.48550/arXiv.2502.06776","venue":"ArXiv.org","work_id":"2baee46a-1f93-42d5-bfa2-562670f49c9e","year":2025},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"cited_paper":"/paper/2502.06776","citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:db3c07475f1d2e4d3176d8b7ed3957e19da99f4e3091fcf546bf155e780c8be9","observation_id":"262c0d22-9ae3-4eaf-a79f-acb7ffbdded2","resolution":{"observed_at":"2026-07-01T22:06:16.466449Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02544","last_updated":"2025-09-05T14:59:27Z","snapshot_observed_at":"2026-08-11T12:35:47.937091Z","submitted_at":"2025-09-02T17:44:45Z","title":"UI-TARS-2 Technical Report: Advancing GUI Agent with Multi-Turn Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2509.02544","doi":"10.1037/xlm0000535","metadata_source":"pith","pith_arxiv_id":"2509.02544","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"UI-TARS-2 Technical Report: Advancing GUI Agent with Multi-Turn Reinforcement Learning","venue":"cs.AI","work_id":"422846c6-e6e2-47c9-9065-85cc09c07cd6","year":2025},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"cited_paper":"/paper/2509.02544","citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:be8b4f7b163c3719599f013bbbb21312b2b272bd7440b46ba59a6aedf130cd46","observation_id":"a813d14d-4c60-4e1e-8b10-d9d48d09dc68","resolution":{"observed_at":"2026-07-01T22:06:16.448597Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:46:50.587684Z","title":"Vl-rethinker: Incentivizing self-reflection of vision-language models with reinforcement learning.Advances in Neural Information Processing Systems, 38:30865–30891, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:90fd2d0576fbc72812e22233db1ecc5f01fdfb795bd463ab2766db105d8f2c7b","observation_id":"f9bf9220-b665-486a-afa8-42907aa94c0f","resolution":{"observed_at":"2026-06-28T15:46:50.587684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:46:50.587684Z","title":"Vagen: Reinforcing world model reasoning for multi-turn vlm agents.Advances in Neural Information Processing Systems, 38:172871–172933, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:d33839f32f59523e7eb0576077df042537fe5e0248060fbe9b10876a573000ac","observation_id":"25022457-6040-4bca-9e95-16451e02d2c0","resolution":{"observed_at":"2026-06-28T15:46:50.587684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13318","last_updated":"2026-04-14T21:48:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-14T21:48:15Z","title":"WebXSkill: Skill Learning for Autonomous Web Agents","version":1},"cited_work":{"arxiv_id":"2604.13318","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.13318","snapshot_observed_at":"2026-07-04T16:59:57.816722Z","title":"WebXSkill: Skill Learning for Autonomous Web Agents","venue":"cs.AI","work_id":"9612e018-0d33-4355-95f1-25d48f37bd08","year":2026},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"cited_paper":"/paper/2604.13318","citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:356bdb311a9fad88758348e343ce6820dbab84738b34ebf11db216370f9304a0","observation_id":"0239183f-d0ff-41a0-b994-aab23e15d362","resolution":{"observed_at":"2026-07-01T22:06:16.472075Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20073","last_updated":"2025-05-26T17:19:30Z","snapshot_observed_at":"2026-08-10T06:52:44.809057Z","submitted_at":"2025-04-24T17:57:08Z","title":"RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2504.20073","doi":"10.18653/v1/2025.acl-long.887","metadata_source":"pith","pith_arxiv_id":"2504.20073","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning","venue":"cs.LG","work_id":"b96383ee-f8dc-471f-aba4-bc5ce9b0b632","year":2025},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"cited_paper":"/paper/2504.20073","citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:ecae5ac0fa0b13a12f8de173db43c987410e6243ef050368174134c8e11eab59","observation_id":"30281e7c-4687-4ea5-a483-c266c1f14a32","resolution":{"observed_at":"2026-07-01T22:06:16.416446Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:46:50.587684Z","title":"Webagent-r1: Training web agents via end-to-end multi-turn reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:ad012f02c625b58e57a2e2f57dec5d97119da30c655b09d635c28c29d1cbdfb9","observation_id":"e05f5330-39e5-4994-b363-a04c2f89e91b","resolution":{"observed_at":"2026-06-28T15:46:50.587684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03143","last_updated":"2025-06-03T17:59:08Z","snapshot_observed_at":"2026-08-12T00:20:29.515481Z","submitted_at":"2025-06-03T17:59:08Z","title":"GUI-Actor: Coordinate-Free Visual Grounding for GUI Agents","version":1},"cited_work":{"arxiv_id":"2506.03143","doi":"10.48550/arxiv.2506.03143","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03143","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2506.03143 (2025)","venue":"ArXiv.org","work_id":"89d4aef6-1376-44bf-8327-9115705e719c","year":2025},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"cited_paper":"/paper/2506.03143","citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:624f502e7fbc29da78ae4c555491c772f0b5f9e2455c2b904cdf8078e163389b","observation_id":"262006fb-c5ba-4f1d-ba15-bbf7ccc52454","resolution":{"observed_at":"2026-07-01T22:06:16.403821Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:46:50.587684Z","title":"Os-atlas: Foundation action model for generalist gui agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:e91c586723ed44951d7f15fa525384464144eda2a06fff6028de4fb0c4fbc831","observation_id":"7bdd7622-76bf-485a-b8ee-b50e7857d5a4","resolution":{"observed_at":"2026-06-28T15:46:50.587684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04454","last_updated":"2025-05-05T16:17:20Z","snapshot_observed_at":"2026-07-06T20:02:21.509050Z","submitted_at":"2024-12-05T18:58:26Z","title":"Aguvis: Unified Pure Vision Agents for Autonomous GUI Interaction","version":2},"cited_work":{"arxiv_id":"2412.04454","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.04454","snapshot_observed_at":"2026-07-04T10:39:44.899694Z","title":"Aguvis: Unified Pure Vision Agents for Autonomous GUI Interaction","venue":"cs.CL","work_id":"64030c49-afa6-4cf0-b64c-831d19d6674e","year":2024},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"cited_paper":"/paper/2412.04454","citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:f133591fc58c37c0a3e4d423ed31bada406e2db43332e80da922987f87156cc2","observation_id":"045f0561-ef05-4383-b820-5ea605ff435f","resolution":{"observed_at":"2026-07-01T22:06:16.440280Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:46:50.587684Z","title":"An illusion of progress? assessing the current state of web agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:92b5dcd647ed13a9e877a54f7d7875d7559f62cf58f3ece51ec10876ca84f833","observation_id":"395a6145-0ae6-41b8-92cf-52a7c1c11030","resolution":{"observed_at":"2026-06-28T15:46:50.587684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:46:50.587684Z","title":"Magma: A foundation model for multimodal ai agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:8af8066491272a88633da79f07ea4d5146ef1d029393ccdfced221c82ffbfcfd","observation_id":"5dbee843-c802-4ab4-9ade-b1966d29cae5","resolution":{"observed_at":"2026-06-28T15:46:50.587684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:46:50.587684Z","title":"Agentoccam: A simple yet strong baseline for llm-based web agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:1892efd15261e998539aa4087ab49e366fceb09c9d3f639d2cc23a79972f5c5d","observation_id":"5f343030-6a3f-4511-a06e-38f37c337a2d","resolution":{"observed_at":"2026-06-28T15:46:50.587684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":"2502.09560","doi":"10.48550/arxiv.2502.09560","metadata_source":"pith","pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","venue":"cs.AI","work_id":"b1e694c6-fe5b-477f-ab8f-801e0fb0412f","year":2025},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:aaf3b6410426582c15cbabd0f061701db18831dbcff47007121c701e5e1204a8","observation_id":"e4c219b1-1b7e-43f8-8449-93a2d4a6f311","resolution":{"observed_at":"2026-07-01T22:06:16.401189Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:46:50.587684Z","title":"Regularizing hidden states enables learning generalizable reward model for llms.Advances in Neural Information Processing Systems, 37:62279–62309, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:a4ae53ea596cd0940c0458386996984fc881d0c3493649cb211f765ccdea8adb","observation_id":"77bb24c1-5f61-48b7-9fd6-f36fbd2c4bce","resolution":{"observed_at":"2026-06-28T15:46:50.587684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:46:50.587684Z","title":"GUI-Libra: Training native GUI agents to reason and act with action-aware supervision and partially verifiable RL, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:168a4b39c414373826d052b76224b1a4e24014c153281199ada74cc5a663a09a","observation_id":"721830e8-399d-43cd-ac98-29ab900578a2","resolution":{"observed_at":"2026-06-28T15:46:50.587684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:46:50.587684Z","title":"ReAct: Synergizing reasoning and acting in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:44621182b6bc3e45e33465f10e030dfb624cb6edf241de792a5899b3d85aeb48","observation_id":"144a5e71-d1b0-4778-a7f3-9e7c715f3039","resolution":{"observed_at":"2026-06-28T15:46:50.587684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.21961","doi":"10.48550/arxiv.2601.21961","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"How do visual attributes influence web agents? a comprehensive evaluation of user interface design factors.arXiv preprint arXiv:2601.21961, 2026","venue":"Open MIND","work_id":"fcf12ff9-5736-4ed3-99e8-087cb9dca78a","year":2026},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:056e86aa3496173093717fc934f803b34c48c0842d478ac089bfcad7da8a28ae","observation_id":"1999d737-fa6e-4c4e-8131-db2c737aa7ec","resolution":{"observed_at":"2026-07-01T22:06:16.466075Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":"2503.14476","doi":"10.48550/arxiv.2503.14476","metadata_source":"pith","pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","venue":"cs.LG","work_id":"64019d00-0b11-4bbd-b173-b46c8fad0157","year":2025},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:1cf3bb59bad3b9d1dccd1352114b98e6664c781a5b9eab7e4a31e100bc76551b","observation_id":"c9a3d777-1c56-423e-9faa-d8a393413545","resolution":{"observed_at":"2026-07-01T22:06:16.406885Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:20.547492+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:46:50.587684Z","title":"Fine-tuning large vision-language models as decision-making agents via reinforcement learning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:aa0edb1f5717409117e4e3cc4135355bc892ab4f39c646b29e403a39112f1f24","observation_id":"86abf6e1-d644-4487-bc7a-d7d169ca0424","resolution":{"observed_at":"2026-06-28T15:46:50.587684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:46:50.587684Z","title":"Beat: Visual backdoor attacks on vlm-based embodied agents via contrastive trigger learning, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:e18dedb642ca2393a6881fa37db4377672280c8619513ab29cf1a8429bc46224","observation_id":"4f68a811-a732-41e8-bbe1-f60d883382ad","resolution":{"observed_at":"2026-06-28T15:46:50.587684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:46:50.587684Z","title":"AgentRL: Scaling agentic reinforcement learning with a multi-turn, multi-task framework, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:c0835b67c081819048b86354eb56a56e789b6dd5453e1ecf24fe6d45e6f1c540","observation_id":"41386195-9587-4283-87d4-fa3bd473a13d","resolution":{"observed_at":"2026-06-28T15:46:50.587684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:46:50.587684Z","title":"LlamaFactory: Unified efficient fine-tuning of 100+ language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:d14825f5fd8c8daf6f449a7d2873e76080ebe9941e068fcf27a08370f08ebca1","observation_id":"097481d2-63c9-4c0e-9c76-4b92003ea4a7","resolution":{"observed_at":"2026-06-28T15:46:50.587684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:46:50.587684Z","title":"Deepresearcher: Scaling deep research via reinforcement learning in real-world environments","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:1d1e534c5322b6437748f68dc68be737a08c9bf0531d6bd9be077447e4f23540","observation_id":"97d1fb3d-bc28-4b9f-bc4f-35339278784d","resolution":{"observed_at":"2026-06-28T15:46:50.587684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:46:50.587684Z","title":"Proposer-agent-evaluator (PAE): Autonomous skill discovery for foundation model internet agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:d1bcafc0ff7efd245f1cb73a5403082f2b4ef9ecb0d8c8f0db3431cc31f3081a","observation_id":"5597776e-93f1-49ca-8b20-550bdda05c6c","resolution":{"observed_at":"2026-06-28T15:46:50.587684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:46:50.587684Z","title":"Workforceagent-r1: Incentivizing reasoning capability in llm-based web agents via reinforcement learning","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:4fb6323065d815beb156800322f759d20b4fee32a8fab13269562378215baf59","observation_id":"2cfaf7ae-1f8c-4241-914a-80b01801d842","resolution":{"observed_at":"2026-06-28T15:46:50.587684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"blob/4490826","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T22:06:16.473246Z","title":"Alpine Ridge","venue":null,"work_id":"052865de-b39b-4b16-b677-1be1a423462c","year":null},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:cade33262618f751b2ed799b51abb3bc12044ef12351797c55111965cedb7a84","observation_id":"03c70b78-9ba4-4902-9a4d-679cdbe79ddf","resolution":{"observed_at":"2026-07-01T22:06:16.474728Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:46:50.587684Z","title":"name\": ...,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:ec813ff1dc836ecf47f4e66c02108b3971b5072c8f510443abf97b8c45ab1ad1","observation_id":"3ab2f7fc-a598-4a61-9fcd-00b76f1d7a0a","resolution":{"observed_at":"2026-06-28T15:46:50.587684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:46:50.587684Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:08e9a547efcf45f12ab898001b35425b4e3002fc40be64eaf4f93d63d2cd5604","observation_id":"ea5985b0-4562-4d13-8cf6-60e5c7c07c82","resolution":{"observed_at":"2026-06-28T15:46:50.587684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:46:50.587684Z","title":"Use it to understand what the agent tried to do, but do not treat it as ground truth if it conflicts with the screenshots","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:5b2407cfce28afa9b4ceb29defc84ee807032327911ccda69b5af09402e5c6aa","observation_id":"f39a3e6f-bd2f-4a7a-a9be-a410e08f89fc","resolution":{"observed_at":"2026-06-28T15:46:50.587684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:46:50.587684Z","title":"point 2d","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:d3fb46255ac19808b4e9886103c76d3c2a031a5e0b2c5fef4896ce8646c65cab","observation_id":"780bd1dd-e6ba-4857-932f-4a5bf3017257","resolution":{"observed_at":"2026-06-28T15:46:50.587684Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:46:50.587684Z","title":"SHOP MEN'S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:74318d426b9695b25c363318c2a990d53884dd869057627e8ee703bdc09bb5ca","observation_id":"89e4c9a6-38fa-49c0-865c-ac2224c9e55c","resolution":{"observed_at":"2026-06-28T15:46:50.587684Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:46:50.587684Z","title":"name\": \"hover","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:2ea4980207f66883b2ce7b8550d375a657e5f8c3854ae19f2f366070a6389e38","observation_id":"32b51fec-4d25-440b-981b-527bb85dd4c0","resolution":{"observed_at":"2026-06-28T15:46:50.587684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents"},"reference_resolution":{"displayed":72,"state_counts":{"malformed_identifier":2,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":37,"verified_exact":32,"verified_fuzzy":0},"total_outbound_references":72},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 72 of 72 outbound references and 2 inbound Pith citation observations for arXiv:2606.02031."}