{"as_of":"2026-08-08T03:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:19130ce6cc979d468977da4a66abc0348c32c669f38cb87c0360821dc5ac4d54","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:37:49.267563Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T19:26:37.281563Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T16:47:09.687885Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-08T03:09:00.063180Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"cited_work":{"arxiv_id":"2505.18121","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18121","snapshot_observed_at":"2026-07-02T16:47:09.687885Z","title":"Progrm: Build better gui agents with progress rewards","venue":null,"work_id":"0f11dc97-9f11-45ca-a4c9-3906c9c07a6d","year":2025},"citing_paper":{"arxiv_id":"2604.02345","last_updated":"2026-02-11T17:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-11T17:02:38Z","title":"UI-Oceanus: Scaling GUI Agents with Synthetic Environmental Dynamics","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-16T02:59:27.807789Z"},"links":{"cited_paper":"/paper/2505.18121","citing_paper":"/paper/2604.02345"},"observation_digest":"sha256:3b354f840b90f0d82a9943669a35a64f6ecb8943c66dd9bce007cf73714a8b19","observation_id":"32164952-9169-4ee7-af71-03c15a4fad7f","resolution":{"observed_at":"2026-05-16T03:00:31.666131Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-08T03:09:00.063180Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"cited_work":{"arxiv_id":"2505.18121","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18121","snapshot_observed_at":"2026-07-02T16:47:09.687885Z","title":"Progrm: Build better gui agents with progress rewards","venue":null,"work_id":"0f11dc97-9f11-45ca-a4c9-3906c9c07a6d","year":2025},"citing_paper":{"arxiv_id":"2604.27955","last_updated":"2026-04-30T14:51:49Z","snapshot_observed_at":"2026-07-06T23:13:20.516759Z","submitted_at":"2026-04-30T14:51:49Z","title":"GUI Agents with Reinforcement Learning: Toward Digital Inhabitants","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-07T05:48:00.486572Z"},"links":{"cited_paper":"/paper/2505.18121","citing_paper":"/paper/2604.27955"},"observation_digest":"sha256:d9f25f95990ea00209d8dd4a8fe249d29e66dc424ac8b559611982679c4fe621","observation_id":"81223177-eb8d-47d6-92ed-1976515667bf","resolution":{"observed_at":"2026-05-12T10:31:29.615649Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-08T03:09:00.063180Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"cited_work":{"arxiv_id":"2505.18121","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18121","snapshot_observed_at":"2026-07-02T16:47:09.687885Z","title":"Progrm: Build better gui agents with progress rewards","venue":null,"work_id":"0f11dc97-9f11-45ca-a4c9-3906c9c07a6d","year":2025},"citing_paper":{"arxiv_id":"2605.07110","last_updated":"2026-05-08T01:38:46Z","snapshot_observed_at":"2026-07-06T23:19:30.387067Z","submitted_at":"2026-05-08T01:38:46Z","title":"Securing Computer-Use Agents: A Unified Architecture-Lifecycle Framework for Deployment-Grounded Reliability","version":1},"reference_index":114,"source":"pdf_text","source_observed_at":"2026-05-11T01:15:19.239355Z"},"links":{"cited_paper":"/paper/2505.18121","citing_paper":"/paper/2605.07110"},"observation_digest":"sha256:964b7410d49902809d8b2194f377a8dcf388f9a35fdbdc72beb7bf421d4b302c","observation_id":"331eab4f-af11-4384-8355-7588e38095c9","resolution":{"observed_at":"2026-05-11T04:35:56.866360Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-08T03:09:00.063180Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"cited_work":{"arxiv_id":"2505.18121","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18121","snapshot_observed_at":"2026-07-02T16:47:09.687885Z","title":"Progrm: Build better gui agents with progress rewards","venue":null,"work_id":"0f11dc97-9f11-45ca-a4c9-3906c9c07a6d","year":2025},"citing_paper":{"arxiv_id":"2606.00564","last_updated":"2026-05-30T06:34:37Z","snapshot_observed_at":"2026-07-06T23:41:15.410587Z","submitted_at":"2026-05-30T06:34:37Z","title":"Decomposed On-Policy Distillation for Vision-Language Reasoning: Steering Gradients for Visual Grounding","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-06-28T19:26:37.281563Z"},"links":{"cited_paper":"/paper/2505.18121","citing_paper":"/paper/2606.00564"},"observation_digest":"sha256:c6a23738e71282ef3ed0583ebe7391b498a6d0c7d50832c16a54e597b9810524","observation_id":"106cf729-2ff8-4143-ace8-1a0164978cba","resolution":{"observed_at":"2026-06-28T19:32:35.010485Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-08T03:09:00.063180Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"cited_work":{"arxiv_id":"2505.18121","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18121","snapshot_observed_at":"2026-07-02T16:47:09.687885Z","title":"Progrm: Build better gui agents with progress rewards","venue":null,"work_id":"0f11dc97-9f11-45ca-a4c9-3906c9c07a6d","year":2025},"citing_paper":{"arxiv_id":"2606.07027","last_updated":"2026-06-05T08:17:28Z","snapshot_observed_at":"2026-08-01T08:01:00.499508Z","submitted_at":"2026-06-05T08:17:28Z","title":"StainFlow: Entity-Stain Tracking and Evidence Linking for Process Rewards in GUI Agents","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-27T22:24:41.353303Z"},"links":{"cited_paper":"/paper/2505.18121","citing_paper":"/paper/2606.07027"},"observation_digest":"sha256:3783df005add42bd69b4d0d5770a72e3f7cda7b96c51fe42ea9b4c66f27207ca","observation_id":"6c8feefd-d674-4c20-a654-fa417d286531","resolution":{"observed_at":"2026-07-02T16:47:09.689614Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.18121/citation-record","integrity":"/paper/2505.18121/integrity","json":"/paper/2505.18121/citation-record.json","paper":"/paper/2505.18121"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:51.878920Z","title":"Digi-q: Learning vlm q-value functions for training device-control agents","venue":null,"work_id":"a658979a-3353-48aa-9fac-3eb95b147e7f","year":null},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-08T03:09:00.063180Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:45.129305Z"},"links":{"citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:1ef5749ed48cd6f1d79aa6b622111f7abd868755cbed08c1c113fe4ca8a9f674","observation_id":"aec7cd57-76d8-4c11-a7ff-73119782bc71","resolution":{"observed_at":"2026-08-07T14:37:51.949072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:51.694147Z","title":"Digirl: Training in-the-wild device-control agents with autonomous re- inforcement learning","venue":null,"work_id":"7ea9065e-acd7-427c-bdf9-e62f511b2a0b","year":2024},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-08T03:09:00.063180Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:45.198300Z"},"links":{"citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:8406a34a727be7ac3a4ca4335a34be1eba78bba17b2040a464474b8d952c65b3","observation_id":"f7254977-e58d-4cd0-abab-2582825f887b","resolution":{"observed_at":"2026-08-07T14:37:51.762133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:51.495042Z","title":"Learning about progress from experts","venue":null,"work_id":"c5338dbe-6a41-4f3f-9388-36363c5e9675","year":2023},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-08T03:09:00.063180Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:45.251487Z"},"links":{"citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:4d3189716e8eb9e26d32dcb4449ca907ab48758129b613be248b69f36d36c9f9","observation_id":"a5895103-8609-41bb-847b-5452b5004258","resolution":{"observed_at":"2026-08-07T14:37:51.581616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T14:37:45.337260Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-08T03:09:00.063180Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:45.337260Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:a92a5eaf11da15af46128e8d42146f8bbd97e8b584deac7bc0ad5284ed9d52a3","observation_id":"879f22e9-00ab-40d8-9a23-badacf93344a","resolution":{"observed_at":"2026-08-07T14:37:45.337260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T14:37:45.419221Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-08T03:09:00.063180Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:45.419221Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:e95b57a654a9c5fdc4532a95ab8b3a7bdec94436681f4d80387e7229eec9339b","observation_id":"53605823-cbb5-4d82-80f2-6a76092eb65e","resolution":{"observed_at":"2026-08-07T14:37:45.419221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:51.290045Z","title":"Dungeons and data: A large-scale nethack dataset","venue":null,"work_id":"bb44dbd8-1f56-46c3-9e55-a34a49e22b98","year":2022},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-08T03:09:00.063180Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:45.508048Z"},"links":{"citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:9063736da491c1789c63570a81790cfe19514dbfc91926cd46c7071202248aa7","observation_id":"9bb8ec98-2eac-4dc7-8c12-73a5d9dd3a60","resolution":{"observed_at":"2026-08-07T14:37:51.400251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03262","last_updated":"2025-11-10T15:11:13Z","snapshot_observed_at":"2026-08-02T05:27:47.490711Z","submitted_at":"2025-01-04T02:08:06Z","title":"REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03262","snapshot_observed_at":"2026-08-07T14:37:45.597283Z","title":"Reinforce++: A simple and efficient approach for aligning large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-08T03:09:00.063180Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:45.597283Z"},"links":{"cited_paper":"/paper/2501.03262","citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:465f778fdff0cc0bb46a352d735c7f7fb9daa15270b0a6c2a20a0f49d78523e7","observation_id":"e7dc26f3-39d4-42cb-91c6-261d8a91c241","resolution":{"observed_at":"2026-08-07T14:37:45.597283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13145","last_updated":"2025-04-18T19:36:21Z","snapshot_observed_at":"2026-08-07T22:33:31.452435Z","submitted_at":"2025-04-17T17:53:54Z","title":"Exploring Expert Failures Improves LLM Agent Tuning","version":2},"cited_work":{"arxiv_id":"2504.13145","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.13145","snapshot_observed_at":"2026-08-07T14:37:49.973211Z","title":"Exploring Expert Failures Improves LLM Agent Tuning","venue":"cs.AI","work_id":"6fe2cedd-07b9-4e33-8452-69b2b355170c","year":2025},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-08T03:09:00.063180Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:45.644348Z"},"links":{"cited_paper":"/paper/2504.13145","citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:3369fd8f049f336ce5f3ec20552b9919c6084110fe39333d466c7161aca7e610","observation_id":"58e481f7-a907-4cbb-9051-e260b61b71d4","resolution":{"observed_at":"2026-08-07T14:37:50.068075Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:45.740939Z","title":"Making language models better reasoners with step-aware verifier","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-08T03:09:00.063180Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:45.740939Z"},"links":{"citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:72a08b36fff6b90a58675f83e6546f458659699afd4c53801d18c3b98c0b9093","observation_id":"a4ae53f1-e8c2-4bcc-ac12-def7e240e590","resolution":{"observed_at":"2026-08-07T14:37:45.740939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:45.786546Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-08T03:09:00.063180Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:45.786546Z"},"links":{"citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:fa133e1434173a3655a73a02c5de0406f1d04be0707d3b57f3335145150f53b2","observation_id":"8b426dbb-a6d4-449f-b9d5-68468ac898a7","resolution":{"observed_at":"2026-08-07T14:37:45.786546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21620","last_updated":"2025-05-24T08:46:08Z","snapshot_observed_at":"2026-08-01T20:06:59.931737Z","submitted_at":"2025-03-27T15:39:30Z","title":"UI-R1: Enhancing Efficient Action Prediction of GUI Agents by Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21620","snapshot_observed_at":"2026-08-07T14:37:45.862230Z","title":"UI-R1: enhancing action prediction of GUI agents by reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-08T03:09:00.063180Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:45.862230Z"},"links":{"cited_paper":"/paper/2503.21620","citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:d8beb554792c833d6a14532143c9a1a6dbd639bf50421cd1e77b714664493318","observation_id":"4a6e6515-a8a4-4cac-a2c8-9cca2eecd7b2","resolution":{"observed_at":"2026-08-07T14:37:45.862230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02907","last_updated":"2025-02-05T18:56:51Z","snapshot_observed_at":"2026-07-06T19:27:20.458797Z","submitted_at":"2024-10-03T18:56:51Z","title":"NNetNav: Unsupervised Learning of Browser Agents Through Environment Interaction in the Wild","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02907","snapshot_observed_at":"2026-08-07T14:37:45.943894Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-08T03:09:00.063180Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:45.943894Z"},"links":{"cited_paper":"/paper/2410.02907","citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:e28862e1a4fcc67407aafbd1af82ade39d30f5ac6507e81078e035438f9b4da1","observation_id":"50f6f860-4632-4c42-8826-d133a6404fdb","resolution":{"observed_at":"2026-08-07T14:37:45.943894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:51.114137Z","title":"Xu, Aman Madaan, Jiarui Liu, Robert Lo, Abishek Sridhar, Sudipta Sengupta, Dan Roth, Graham Neubig, and Shuyan Zhou","venue":null,"work_id":"7700eff7-f345-4def-b8ba-546211cddd23","year":2024},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-08T03:09:00.063180Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:46.013705Z"},"links":{"citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:288dbf41f27a846d2ee2765a6d37ffa5061994693fcdec129da7d906132dbbc9","observation_id":"47146464-9f0a-4fd5-8d7f-bafd72db849c","resolution":{"observed_at":"2026-08-07T14:37:51.202532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11357","last_updated":"2025-05-30T02:30:57Z","snapshot_observed_at":"2026-08-07T18:13:59.301597Z","submitted_at":"2025-02-17T02:13:48Z","title":"Explorer: Scaling Exploration-driven Web Trajectory Synthesis for Multimodal Web Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11357","snapshot_observed_at":"2026-08-07T14:37:46.119179Z","title":"Explorer: Scaling exploration-driven web trajectory synthesis for multimodal web agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-08T03:09:00.063180Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:46.119179Z"},"links":{"cited_paper":"/paper/2502.11357","citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:3b72767a4af3d95a097147816787fef5dd54223b122f431aa6681402e2b60f69","observation_id":"f3f932b9-fe28-43b6-9684-dfa389c944ac","resolution":{"observed_at":"2026-08-07T14:37:46.119179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06474","last_updated":"2024-10-07T14:19:37Z","snapshot_observed_at":"2026-08-03T07:29:21.763809Z","submitted_at":"2024-04-09T17:25:47Z","title":"Autonomous Evaluation and Refinement of Digital Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06474","snapshot_observed_at":"2026-08-07T14:37:46.228152Z","title":"Au- tonomous evaluation and refinement of digital agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-08T03:09:00.063180Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:46.228152Z"},"links":{"cited_paper":"/paper/2404.06474","citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:8b0d65c4100328d324fba423abe9ac5967ade489f20cafb12efe48517edb376d","observation_id":"b5b3b549-039f-4284-99eb-97810c3fe91c","resolution":{"observed_at":"2026-08-07T14:37:46.228152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02337","last_updated":"2025-01-27T11:56:15Z","snapshot_observed_at":"2026-07-06T19:45:00.034364Z","submitted_at":"2024-11-04T17:59:58Z","title":"WebRL: Training LLM Web Agents via Self-Evolving Online Curriculum Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02337","snapshot_observed_at":"2026-08-07T14:37:46.329762Z","title":"Webrl: Training LLM web agents via self-evolving online curriculum reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-08T03:09:00.063180Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:46.329762Z"},"links":{"cited_paper":"/paper/2411.02337","citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:c6ad2727c93ab7c3ba0a1184f91b994fccca1c28ca0d5079a6f74cb3874d2a6c","observation_id":"4efd62e6-4159-4d0d-b049-b694982913da","resolution":{"observed_at":"2026-08-07T14:37:46.329762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12326","last_updated":"2025-01-21T17:48:10Z","snapshot_observed_at":"2026-07-06T20:23:58.426780Z","submitted_at":"2025-01-21T17:48:10Z","title":"UI-TARS: Pioneering Automated GUI Interaction with Native Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12326","snapshot_observed_at":"2026-08-07T14:37:46.431629Z","title":"UI-TARS: pioneering automated GUI interaction with native agents.CoRR, abs/2501.12326, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-08T03:09:00.063180Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:46.431629Z"},"links":{"cited_paper":"/paper/2501.12326","citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:3a3455dd8d87515151c33caed8300b07a7c0d0cdf7a1714371840508d04604cb","observation_id":"8e89bd61-c05a-4608-9851-7de29189cb15","resolution":{"observed_at":"2026-08-07T14:37:46.431629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07572","last_updated":"2025-03-10T17:40:43Z","snapshot_observed_at":"2026-08-07T17:16:00.148793Z","submitted_at":"2025-03-10T17:40:43Z","title":"Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07572","snapshot_observed_at":"2026-08-07T14:37:46.502834Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-08T03:09:00.063180Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:46.502834Z"},"links":{"cited_paper":"/paper/2503.07572","citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:6dce20724086139ad3a70eb24a00724bd31f17c37e6a7b191756752ad1dcf92d","observation_id":"18d80b30-3761-4e5e-b55e-c5e36827d8ce","resolution":{"observed_at":"2026-08-07T14:37:46.502834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:50.910869Z","title":"Sentence-bert: Sentence embeddings using siamese bert- networks","venue":null,"work_id":"bdeedbfb-6199-4684-a3dd-49796641a25a","year":2019},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-08T03:09:00.063180Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:46.642165Z"},"links":{"citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:6ab18fff9dd4d72c0334e9f524a5710a7157454149f8ab7d03fe118565f4736f","observation_id":"d4bdfdd7-bfd0-451a-a2a5-ffbd21fb45d1","resolution":{"observed_at":"2026-08-07T14:37:51.001358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:50.720401Z","title":"Step: Stacked llm policies for web actions","venue":null,"work_id":"2239b7e1-de5f-4fad-94a8-e592ca212ada","year":null},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-08T03:09:00.063180Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:46.921764Z"},"links":{"citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:266fed066947dccbdcc68d6d484654c3c47f70d7cbf7e0aad55ee702fb19907c","observation_id":"c464d765-6783-4c58-ba4f-a10440cdcbe1","resolution":{"observed_at":"2026-08-07T14:37:50.788218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05592","last_updated":"2025-03-18T08:32:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-07T17:14:44Z","title":"R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05592","snapshot_observed_at":"2026-08-07T14:37:47.033881Z","title":"R1-searcher: Incentivizing the search capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-08T03:09:00.063180Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:47.033881Z"},"links":{"cited_paper":"/paper/2503.05592","citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:969d6329daec3d1ca5fd8530a857516aa8ba92f6a7dd888d7e6b93277ac1e6be","observation_id":"c9cf3a05-12da-493e-98f2-dce10c1ab90d","resolution":{"observed_at":"2026-08-07T14:37:47.033881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10893","last_updated":"2025-01-18T22:34:41Z","snapshot_observed_at":"2026-08-06T19:08:52.634844Z","submitted_at":"2025-01-18T22:34:41Z","title":"Learn-by-interact: A Data-Centric Framework for Self-Adaptive Agents in Realistic Environments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10893","snapshot_observed_at":"2026-08-07T14:37:47.108403Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-08T03:09:00.063180Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:47.108403Z"},"links":{"cited_paper":"/paper/2501.10893","citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:944a071f7ba42d95f306a438ece191287b0f731df34b2f721800297f0113b2c0","observation_id":"3eb32102-56d0-490f-a9e5-92e377d9949e","resolution":{"observed_at":"2026-08-07T14:37:47.108403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19723","last_updated":"2025-06-27T08:25:48Z","snapshot_observed_at":"2026-08-07T22:32:37.258577Z","submitted_at":"2024-12-27T16:21:58Z","title":"OS-Genesis: Automating GUI Agent Trajectory Construction via Reverse Task Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19723","snapshot_observed_at":"2026-08-07T14:37:47.185783Z","title":"Os-genesis: Automating GUI agent trajectory construction via reverse task synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-08T03:09:00.063180Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:47.185783Z"},"links":{"cited_paper":"/paper/2412.19723","citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:d7fb4d2ced708c8fe52ab87e2dd2c5cde2cf06f46b2df474c0afd62cf6770dc6","observation_id":"486f8fcf-9f3c-4375-be1f-f7656a1a18bf","resolution":{"observed_at":"2026-08-07T14:37:47.185783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16158","last_updated":"2024-04-18T06:53:38Z","snapshot_observed_at":"2026-08-05T03:22:24.562938Z","submitted_at":"2024-01-29T13:46:37Z","title":"Mobile-Agent: Autonomous Multi-Modal Mobile Device Agent with Visual Perception","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16158","snapshot_observed_at":"2026-08-07T14:37:47.238146Z","title":"Mobile-agent: Autonomous multi-modal mobile device agent with visual perception","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-08T03:09:00.063180Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:47.238146Z"},"links":{"cited_paper":"/paper/2401.16158","citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:8e5515a5bb18d2af700daadeed5f8aead4fa9e8e18cc55e40360ec0018813931","observation_id":"c6421f46-7dfa-4f7a-8464-a8c8d1c8b002","resolution":{"observed_at":"2026-08-07T14:37:47.238146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:47.380315Z","title":"Math-shepherd: Verify and reinforce llms step-by-step without human annotations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-08T03:09:00.063180Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:47.380315Z"},"links":{"citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:05e82c0e04eba70ed1d5ed43c021af8dccf33cb9e819e0a924b55f45709cce14","observation_id":"19a62709-4c66-4c0c-b607-d22e1aa6c55a","resolution":{"observed_at":"2026-08-07T14:37:47.380315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14803","last_updated":"2025-02-21T16:23:59Z","snapshot_observed_at":"2026-07-06T19:36:15.200874Z","submitted_at":"2024-10-18T18:19:56Z","title":"DistRL: An Asynchronous Distributed Reinforcement Learning Framework for On-Device Control Agents","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14803","snapshot_observed_at":"2026-08-07T14:37:47.485240Z","title":"Distrl: An asynchronous distributed reinforcement learning framework for on-device control agents.CoRR, abs/2410.14803, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-08T03:09:00.063180Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:47.485240Z"},"links":{"cited_paper":"/paper/2410.14803","citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:f9587a4f9751e91ca8407677f114a063f7ea0df7e0d196b42778f1f8d55c11d0","observation_id":"053bc850-e181-465d-8960-9813e0b5f08f","resolution":{"observed_at":"2026-08-07T14:37:47.485240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15821","last_updated":"2024-05-23T14:01:44Z","snapshot_observed_at":"2026-07-06T18:19:33.945119Z","submitted_at":"2024-05-23T14:01:44Z","title":"Reinforcing Language Agents via Policy Optimization with Action Decomposition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15821","snapshot_observed_at":"2026-08-07T14:37:47.590688Z","title":"Reinforcing language agents via policy optimization with action decomposition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-08T03:09:00.063180Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:47.590688Z"},"links":{"cited_paper":"/paper/2405.15821","citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:38ccb217bb49fcc5e420f850e7a6a534d0dbc55ba32e388b6373114438569bee","observation_id":"8029fb17-4eaa-44da-a0b9-37a8b23ba8c9","resolution":{"observed_at":"2026-08-07T14:37:47.590688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10458","last_updated":"2025-10-01T04:55:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:45:54Z","title":"GUI-R1 : A Generalist R1-Style Vision-Language Action Model For GUI Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10458","snapshot_observed_at":"2026-08-07T14:37:47.700415Z","title":"Gui-r1: A generalist r1-style vision-language action model for gui agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-08T03:09:00.063180Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:47.700415Z"},"links":{"cited_paper":"/paper/2504.10458","citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:8db1869118563e1f0466e00418c6e5991db0823e8b4b0a1e45e3e6c1eed4b3ba","observation_id":"a3e49663-2092-4537-8873-2260e3312495","resolution":{"observed_at":"2026-08-07T14:37:47.700415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14768","last_updated":"2025-02-20T17:49:26Z","snapshot_observed_at":"2026-08-04T12:32:53.090165Z","submitted_at":"2025-02-20T17:49:26Z","title":"Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14768","snapshot_observed_at":"2026-08-07T14:37:47.804784Z","title":"Logic-rl: Unleashing llm reasoning with rule-based reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-08T03:09:00.063180Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:47.804784Z"},"links":{"cited_paper":"/paper/2502.14768","citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:a865425b72eb34b1bab58fff5ab1eeb286fdc792d1419ab2babc54f48b3352f4","observation_id":"19c05f48-6249-4353-acce-6092cd98e096","resolution":{"observed_at":"2026-08-07T14:37:47.804784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04454","last_updated":"2025-05-05T16:17:20Z","snapshot_observed_at":"2026-07-06T20:02:21.509050Z","submitted_at":"2024-12-05T18:58:26Z","title":"Aguvis: Unified Pure Vision Agents for Autonomous GUI Interaction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04454","snapshot_observed_at":"2026-08-07T14:37:47.937341Z","title":"Aguvis: Unified pure vision agents for autonomous GUI interaction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-08T03:09:00.063180Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:47.937341Z"},"links":{"cited_paper":"/paper/2412.04454","citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:d9d560333861598804366d4f3890339afb67df67703a99699e0afd63da0a67b4","observation_id":"5a6a36ef-b5cf-4007-84c6-d943abba95e4","resolution":{"observed_at":"2026-08-07T14:37:47.937341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:50.641631Z","title":"Agenttrek: Agent trajectory synthesis via guiding replay with web tutorials","venue":null,"work_id":"53e85318-087c-4da1-a090-003183969369","year":2025},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-08T03:09:00.063180Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:48.039904Z"},"links":{"citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:a3612fdacf6778bfc296f56eab849394d90f96341510a3dcd65a12aa366763dc","observation_id":"835c7d55-3d95-4219-9486-da9488b80267","resolution":{"observed_at":"2026-08-07T14:37:50.672358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T14:37:48.119240Z","title":"Qwen2.5 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-08T03:09:00.063180Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:48.119240Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:3fb2c08e3da51bdb2ef08ea2b0f91d3caf405c67c3b9be28c02aae238c8a6534","observation_id":"3450faf6-7e13-4dc7-8f4e-c5518ff85d63","resolution":{"observed_at":"2026-08-07T14:37:48.119240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09724","last_updated":"2024-04-01T13:50:51Z","snapshot_observed_at":"2026-08-07T05:06:51.002209Z","submitted_at":"2023-11-16T09:56:28Z","title":"OVM, Outcome-supervised Value Models for Planning in Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09724","snapshot_observed_at":"2026-08-07T14:37:48.213972Z","title":"Outcome-supervised verifiers for planning in mathematical reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-08T03:09:00.063180Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:48.213972Z"},"links":{"cited_paper":"/paper/2311.09724","citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:efff264c4e1c4e387adce3be9e5a6336dc6a8ce8889d86f27a233cdd8e64f9d6","observation_id":"bd0674c3-a3c1-4f74-af92-f26678f2827c","resolution":{"observed_at":"2026-08-07T14:37:48.213972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01981","last_updated":"2024-12-02T21:20:02Z","snapshot_observed_at":"2026-08-06T03:48:05.506841Z","submitted_at":"2024-12-02T21:20:02Z","title":"Free Process Rewards without Process Labels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01981","snapshot_observed_at":"2026-08-07T14:37:48.320653Z","title":"Free process rewards without process labels","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-08T03:09:00.063180Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:48.320653Z"},"links":{"cited_paper":"/paper/2412.01981","citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:dd6cf1e0e8a427177688c4fee1cbd5aadb08e10310d29d3cd4d8df38b3439528","observation_id":"750b3d33-83c5-4606-8ed4-199bcbfa0d59","resolution":{"observed_at":"2026-08-07T14:37:48.320653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07939","last_updated":"2024-05-23T05:18:58Z","snapshot_observed_at":"2026-08-01T11:47:21.821212Z","submitted_at":"2024-02-08T15:40:35Z","title":"UFO: A UI-Focused Agent for Windows OS Interaction","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07939","snapshot_observed_at":"2026-08-07T14:37:48.529789Z","title":"UFO: A ui-focused agent for windows OS interaction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-08T03:09:00.063180Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:48.529789Z"},"links":{"cited_paper":"/paper/2402.07939","citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:fc1969bc61dd64951137dba551f352ad4dbd925d1f82aee4e111abc8d8a54a94","observation_id":"5dc867a9-8a39-4ef1-ae06-9424c5cdf5d8","resolution":{"observed_at":"2026-08-07T14:37:48.529789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:48.664282Z","title":"Appagent: Multimodal agents as smartphone users","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-08T03:09:00.063180Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:48.664282Z"},"links":{"citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:2e38f6e7328f242df38c6ed940e570339163feaf1bafd1ded5db4ac7ef953f50","observation_id":"8db64b3d-63b0-47ef-b6ef-d92909160a9a","resolution":{"observed_at":"2026-08-07T14:37:48.664282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:50.437074Z","title":"Large language models are semi-parametric reinforcement learning agents","venue":null,"work_id":"6b6991eb-b342-468a-aee9-88c2bb778024","year":2023},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-08T03:09:00.063180Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:48.771877Z"},"links":{"citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:ed171a3e5a145906eee15e78927f147bc481092a8b7bf9a3a68ae34bc5c6b032","observation_id":"d601e41c-ad3e-4be6-92fe-9e5ad8d03326","resolution":{"observed_at":"2026-08-07T14:37:50.549721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.08144","last_updated":"2024-06-13T11:51:37Z","snapshot_observed_at":"2026-07-06T15:26:58.583640Z","submitted_at":"2023-05-14T12:31:03Z","title":"Mobile-Env: Building Qualified Evaluation Benchmarks for LLM-GUI Interaction","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.08144","snapshot_observed_at":"2026-08-07T14:37:48.872226Z","title":"Mobile-env: Building qualified evaluation benchmarks for llm-gui interaction","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-08T03:09:00.063180Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:48.872226Z"},"links":{"cited_paper":"/paper/2305.08144","citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:3700de73bd00b58b4fa44b94e5669cbf83b4573caf69d0d3b4daaffde6743b12","observation_id":"32ad9c9e-7ec1-40c1-99e7-bdf899b9763d","resolution":{"observed_at":"2026-08-07T14:37:48.872226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07301","last_updated":"2025-06-05T16:34:24Z","snapshot_observed_at":"2026-08-03T11:11:25.359494Z","submitted_at":"2025-01-13T13:10:16Z","title":"The Lessons of Developing Process Reward Models in Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07301","snapshot_observed_at":"2026-08-07T14:37:48.959454Z","title":"The lessons of developing process reward models in mathematical reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-08T03:09:00.063180Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:48.959454Z"},"links":{"cited_paper":"/paper/2501.07301","citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:33babfbefade73851782dfeeca3b66d3cb063fdee5b76cf0824ad911ee211760","observation_id":"129c17e0-bb24-4cf3-ad7e-bbdcd6ef5525","resolution":{"observed_at":"2026-08-07T14:37:48.959454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:50.318538Z","title":"Gpt-4v(ision) is a generalist web agent, if grounded","venue":null,"work_id":"cc79f59c-378a-461b-8e86-0d241a5adcd6","year":2024},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-08T03:09:00.063180Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:49.041108Z"},"links":{"citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:c8594abf989c3f91826d13dedbd279303a7982769a54067a0a65388374f90d57","observation_id":"a0dee5fd-9a2b-44d8-a18e-b0cb28957dc1","resolution":{"observed_at":"2026-08-07T14:37:50.386446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18906","last_updated":"2025-02-26T07:52:02Z","snapshot_observed_at":"2026-08-07T17:47:52.710195Z","submitted_at":"2025-02-26T07:52:02Z","title":"VEM: Environment-Free Exploration for Training GUI Agent with Value Environment Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18906","snapshot_observed_at":"2026-08-07T14:37:49.160588Z","title":"VEM: environment-free exploration for training GUI agent with value environment model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-08T03:09:00.063180Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:49.160588Z"},"links":{"cited_paper":"/paper/2502.18906","citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:3ab78a3ad61f625bdb39489d5c15d6b52c3013586320e11c5d3a7e69aa36e90d","observation_id":"54802348-9e11-49bd-a93e-166b08e21376","resolution":{"observed_at":"2026-08-07T14:37:49.160588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13194","last_updated":"2024-12-17T18:59:50Z","snapshot_observed_at":"2026-08-03T11:34:22.888935Z","submitted_at":"2024-12-17T18:59:50Z","title":"Proposer-Agent-Evaluator(PAE): Autonomous Skill Discovery For Foundation Model Internet Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13194","snapshot_observed_at":"2026-08-07T14:37:49.207033Z","title":"Proposer-agent-evaluator(pae): Autonomous skill discovery for foundation model internet agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-08T03:09:00.063180Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:49.207033Z"},"links":{"cited_paper":"/paper/2412.13194","citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:f252d51d78e611dbc0be35f12a82bff59cf7e0289df42f24500ff1e8089f24df","observation_id":"901c9048-5ede-4c28-ae38-b51dac1b22fd","resolution":{"observed_at":"2026-08-07T14:37:49.207033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:50.171790Z","title":"prototype","venue":null,"work_id":"d7fb9cd4-e89a-422c-a7f6-5b68174df905","year":2025},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-08T03:09:00.063180Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:49.267563Z"},"links":{"citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:0498db65f9b9a4c46350b5f1e69ef36934d082e6f10c27fd95f31953495b5903","observation_id":"b897fa9b-2afd-4675-9485-e29701257712","resolution":{"observed_at":"2026-08-07T14:37:50.229956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:46.769331Z","title":"URL https://doi.org/10.18653/v1/D19-1410","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-08T03:09:00.063180Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:46.769331Z"},"links":{"citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:9a70339cc1bd485fa33c36e63363f2f9a5eb51231c21fc5f887921316b8fa0c5","observation_id":"853b27f3-2c39-475c-a86a-ae09ebfd1b8f","resolution":{"observed_at":"2026-08-07T14:37:46.769331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01981","last_updated":"2024-12-02T21:20:02Z","snapshot_observed_at":"2026-08-06T03:48:05.506841Z","submitted_at":"2024-12-02T21:20:02Z","title":"Free Process Rewards without Process Labels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01981","snapshot_observed_at":"2026-08-07T14:37:48.423228Z","title":"URL https://doi.org/10.48550/arXiv.2412","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","snapshot_observed_at":"2026-08-08T03:09:00.063180Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:48.423228Z"},"links":{"cited_paper":"/paper/2412.01981","citing_paper":"/paper/2505.18121"},"observation_digest":"sha256:6bb57da3b24164c948d3804632de74a7f6b69a76fb4131ffb0ff57cfa2b7f917","observation_id":"9d04d547-2c34-45ac-a980-11f7e7716d76","resolution":{"observed_at":"2026-08-07T14:37:48.423228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.18121","last_updated":"2025-05-23T17:23:11Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-08T03:09:00.063180Z","submitted_at":"2025-05-23T17:23:11Z","title":"ProgRM: Build Better GUI Agents with Progress Rewards"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":1,"verified_fuzzy":11},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 5 inbound Pith citation observations for arXiv:2505.18121."}