{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2026:LGLCRJJX7HPSVKTRPXCIR4X7PD","short_pith_number":"pith:LGLCRJJX","schema_version":"1.0","canonical_sha256":"599628a537f9df2aaa717dc488f2ff78fea466332cb21ca63d598c0837bb7fd2","source":{"kind":"arxiv","id":"2602.00575","version":2},"attestation_state":"computed","paper":{"title":"Agentic Reward Modeling: Verifying GUI Agent via Progressive Trajectory-Grounded Interaction","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.RO","authors_text":"Chaoqun Cui, Jing Huang, Liming Zheng, Qingchao Kong, Shijing Wang, Zhixiong Zeng","submitted_at":"2026-01-31T07:36:54Z","abstract_excerpt":"Reinforcement learning with verifiable rewards (RLVR) provides a promising pathway for continuously advancing GUI agents, yet existing reward modeling paradigms face complementary limitations. Rule-based methods suffer from poor scalability and cannot handle open-ended tasks. LLM-as-a-Judge methods enable scalable trajectory verification but remain passive and are constrained by partial state observability, since key evidence often resides in latent environment states beyond the trajectory. Recent active environment interaction methods mitigate observability issues but tend to over-rely on pro"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2602.00575","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.RO","submitted_at":"2026-01-31T07:36:54Z","cross_cats_sorted":[],"title_canon_sha256":"9e88c0b12f73dd491b74648a8fcfeb5eedd060435528a6d4fe04bd2d9e4970a3","abstract_canon_sha256":"c4238d5cb00b0df39b8781d4f5ac0647ff71e797e768a29804342ed57553279b"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-28T01:21:35.690994Z","signature_b64":"b1tBgf1/0OjBTwry7e3Q8CSAF7/tvFZD3cCfzyANg4fjTD8RIOXIc2ngVxP9l6QPRF89V+2BJj91sbHUL2xTBA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"599628a537f9df2aaa717dc488f2ff78fea466332cb21ca63d598c0837bb7fd2","last_reissued_at":"2026-07-28T01:21:35.690059Z","signature_status":"signed_v1","first_computed_at":"2026-07-28T01:21:35.690059Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Agentic Reward Modeling: Verifying GUI Agent via Progressive Trajectory-Grounded Interaction","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.RO","authors_text":"Chaoqun Cui, Jing Huang, Liming Zheng, Qingchao Kong, Shijing Wang, Zhixiong Zeng","submitted_at":"2026-01-31T07:36:54Z","abstract_excerpt":"Reinforcement learning with verifiable rewards (RLVR) provides a promising pathway for continuously advancing GUI agents, yet existing reward modeling paradigms face complementary limitations. Rule-based methods suffer from poor scalability and cannot handle open-ended tasks. LLM-as-a-Judge methods enable scalable trajectory verification but remain passive and are constrained by partial state observability, since key evidence often resides in latent environment states beyond the trajectory. Recent active environment interaction methods mitigate observability issues but tend to over-rely on pro"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2602.00575","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2602.00575/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2602.00575","created_at":"2026-07-28T01:21:35.690504+00:00"},{"alias_kind":"arxiv_version","alias_value":"2602.00575v2","created_at":"2026-07-28T01:21:35.690504+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2602.00575","created_at":"2026-07-28T01:21:35.690504+00:00"},{"alias_kind":"pith_short_12","alias_value":"LGLCRJJX7HPS","created_at":"2026-07-28T01:21:35.690504+00:00"},{"alias_kind":"pith_short_16","alias_value":"LGLCRJJX7HPSVKTR","created_at":"2026-07-28T01:21:35.690504+00:00"},{"alias_kind":"pith_short_8","alias_value":"LGLCRJJX","created_at":"2026-07-28T01:21:35.690504+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":3,"internal_anchor_count":3,"sample":[{"citing_arxiv_id":"2606.07027","citing_title":"StainFlow: Entity-Stain Tracking and Evidence Linking for Process Rewards in GUI Agents","ref_index":7,"is_internal_anchor":true},{"citing_arxiv_id":"2605.19769","citing_title":"OpenComputer: Verifiable Software Worlds for Computer-Use Agents","ref_index":5,"is_internal_anchor":true},{"citing_arxiv_id":"2604.27955","citing_title":"GUI Agents with Reinforcement Learning: Toward Digital Inhabitants","ref_index":15,"is_internal_anchor":true}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/LGLCRJJX7HPSVKTRPXCIR4X7PD","json":"https://pith.science/pith/LGLCRJJX7HPSVKTRPXCIR4X7PD.json","graph_json":"https://pith.science/api/pith-number/LGLCRJJX7HPSVKTRPXCIR4X7PD/graph.json","events_json":"https://pith.science/api/pith-number/LGLCRJJX7HPSVKTRPXCIR4X7PD/events.json","paper":"https://pith.science/paper/LGLCRJJX"},"agent_actions":{"view_html":"https://pith.science/pith/LGLCRJJX7HPSVKTRPXCIR4X7PD","download_json":"https://pith.science/pith/LGLCRJJX7HPSVKTRPXCIR4X7PD.json","view_paper":"https://pith.science/paper/LGLCRJJX","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2602.00575&json=true","fetch_graph":"https://pith.science/api/pith-number/LGLCRJJX7HPSVKTRPXCIR4X7PD/graph.json","fetch_events":"https://pith.science/api/pith-number/LGLCRJJX7HPSVKTRPXCIR4X7PD/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/LGLCRJJX7HPSVKTRPXCIR4X7PD/action/timestamp_anchor","attest_storage":"https://pith.science/pith/LGLCRJJX7HPSVKTRPXCIR4X7PD/action/storage_attestation","attest_author":"https://pith.science/pith/LGLCRJJX7HPSVKTRPXCIR4X7PD/action/author_attestation","sign_citation":"https://pith.science/pith/LGLCRJJX7HPSVKTRPXCIR4X7PD/action/citation_signature","submit_replication":"https://pith.science/pith/LGLCRJJX7HPSVKTRPXCIR4X7PD/action/replication_record"}},"created_at":"2026-07-28T01:21:35.690504+00:00","updated_at":"2026-07-28T01:21:35.690504+00:00"}