{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:W3SAI6NODA32CYQWFAISKK2QLK","short_pith_number":"pith:W3SAI6NO","schema_version":"1.0","canonical_sha256":"b6e40479ae1837a162162811252b505ab79d3050c8548595f55b899f77f96f10","source":{"kind":"arxiv","id":"2507.05720","version":1},"attestation_state":"computed","paper":{"title":"MobileGUI-RL: Advancing Mobile GUI Agent through Reinforcement Learning in Online Environment","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.CL"],"primary_cat":"cs.LG","authors_text":"Dong Yu, Haitao Mi, Hongming Zhang, Ninghao Liu, Wenhao Yu, Yonglin Wang, Yucheng Shi, Zaitang Li","submitted_at":"2025-07-08T07:07:53Z","abstract_excerpt":"Recently, there has been a surge of vision-based GUI agents designed to automate everyday mobile and web tasks. These agents interpret raw GUI screenshots and autonomously decide where to click, scroll, or type, which bypasses handcrafted rules and app-specific APIs. However, most existing methods trained GUI agent in the offline environment using pre-collected trajectories. This approach limits scalability, causes overfitting to specific UI templates, and leads to brittle policies when faced with unseen environment. We present MobileGUI-RL, a scalable framework that trains GUI agent in online"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2507.05720","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.LG","submitted_at":"2025-07-08T07:07:53Z","cross_cats_sorted":["cs.CL"],"title_canon_sha256":"614cfbf95e42fa0613fab676e2234d85363375ab28b951bfeda80bfd5c7aa2f1","abstract_canon_sha256":"01fc1525ac6cad6b187625c8897dfc573f201fb7ec896f8d9d2476c8af7cd724"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:33:35.224434Z","signature_b64":"xDsi2m80ZlvcA2x9GkP/J2T3QN0Arg/yryb4FxZPm3T+kFWDRKx5lsR4RJG1TWQVemQSm549IaEHSRRXorgFBQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"b6e40479ae1837a162162811252b505ab79d3050c8548595f55b899f77f96f10","last_reissued_at":"2026-07-05T11:33:35.223997Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:33:35.223997Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"MobileGUI-RL: Advancing Mobile GUI Agent through Reinforcement Learning in Online Environment","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.CL"],"primary_cat":"cs.LG","authors_text":"Dong Yu, Haitao Mi, Hongming Zhang, Ninghao Liu, Wenhao Yu, Yonglin Wang, Yucheng Shi, Zaitang Li","submitted_at":"2025-07-08T07:07:53Z","abstract_excerpt":"Recently, there has been a surge of vision-based GUI agents designed to automate everyday mobile and web tasks. These agents interpret raw GUI screenshots and autonomously decide where to click, scroll, or type, which bypasses handcrafted rules and app-specific APIs. However, most existing methods trained GUI agent in the offline environment using pre-collected trajectories. This approach limits scalability, causes overfitting to specific UI templates, and leads to brittle policies when faced with unseen environment. We present MobileGUI-RL, a scalable framework that trains GUI agent in online"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2507.05720","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2507.05720/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2507.05720","created_at":"2026-07-05T11:33:35.224052+00:00"},{"alias_kind":"arxiv_version","alias_value":"2507.05720v1","created_at":"2026-07-05T11:33:35.224052+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2507.05720","created_at":"2026-07-05T11:33:35.224052+00:00"},{"alias_kind":"pith_short_12","alias_value":"W3SAI6NODA32","created_at":"2026-07-05T11:33:35.224052+00:00"},{"alias_kind":"pith_short_16","alias_value":"W3SAI6NODA32CYQW","created_at":"2026-07-05T11:33:35.224052+00:00"},{"alias_kind":"pith_short_8","alias_value":"W3SAI6NO","created_at":"2026-07-05T11:33:35.224052+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":26,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.23049","citing_title":"PhoneBuddy: Training Open Models for Agentic Phone Use","ref_index":59,"is_internal_anchor":false},{"citing_arxiv_id":"2606.19930","citing_title":"MobileForge: Annotation-Free Adaptation for Mobile GUI Agents with Hierarchical Feedback-Guided Policy Optimization","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2606.31612","citing_title":"What Memory Do GUI Agents Really Need? From Passive Records to Active Task-Driving States","ref_index":110,"is_internal_anchor":false},{"citing_arxiv_id":"2606.13316","citing_title":"ReSum: Synergizing LLM Reasoning and Summarization with Reinforcement Learning","ref_index":55,"is_internal_anchor":false},{"citing_arxiv_id":"2606.31410","citing_title":"Xiaomi-GUI-0 Technical Report","ref_index":32,"is_internal_anchor":false},{"citing_arxiv_id":"2606.07027","citing_title":"StainFlow: Entity-Stain Tracking and Evidence Linking for Process Rewards in GUI Agents","ref_index":25,"is_internal_anchor":false},{"citing_arxiv_id":"2606.01249","citing_title":"Trust Region On-Policy Distillation","ref_index":50,"is_internal_anchor":false},{"citing_arxiv_id":"2606.31612","citing_title":"What Memory Do GUI Agents Really Need? From Passive Records to Active Task-Driving States","ref_index":110,"is_internal_anchor":false},{"citing_arxiv_id":"2606.31410","citing_title":"Xiaomi-GUI-0 Technical Report","ref_index":33,"is_internal_anchor":false},{"citing_arxiv_id":"2606.29705","citing_title":"GUICrafter: Weakly-Supervised GUI Agent Leveraging Massive Unannotated Screenshots","ref_index":38,"is_internal_anchor":false},{"citing_arxiv_id":"2605.29486","citing_title":"PhoneWorld: Scaling Phone-Use Agent Environments","ref_index":11,"is_internal_anchor":false},{"citing_arxiv_id":"2605.10347","citing_title":"How Mobile World Model Guides GUI Agents?","ref_index":46,"is_internal_anchor":false},{"citing_arxiv_id":"2605.20246","citing_title":"GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents","ref_index":21,"is_internal_anchor":false},{"citing_arxiv_id":"2605.20246","citing_title":"GROW: Aligning GRPO with State-Action Modeling for Open-World VLM Agents","ref_index":21,"is_internal_anchor":false},{"citing_arxiv_id":"2605.15963","citing_title":"PAGER: Bridging the Semantic-Execution Gap in Point-Precise Geometric GUI Control","ref_index":31,"is_internal_anchor":false},{"citing_arxiv_id":"2604.27859","citing_title":"Rethinking Agentic Reinforcement Learning In Large Language Models","ref_index":76,"is_internal_anchor":false},{"citing_arxiv_id":"2605.14311","citing_title":"Beyond Binary: Reframing GUI Critique as Continuous Semantic Alignment","ref_index":107,"is_internal_anchor":false},{"citing_arxiv_id":"2509.21982","citing_title":"RISK: A Framework for GUI Agents in E-commerce Risk Management","ref_index":18,"is_internal_anchor":false},{"citing_arxiv_id":"2605.14311","citing_title":"Beyond Binary: Reframing GUI Critique as Continuous Semantic Alignment","ref_index":107,"is_internal_anchor":false},{"citing_arxiv_id":"2509.02544","citing_title":"UI-TARS-2 Technical Report: Advancing GUI Agent with Multi-Turn Reinforcement Learning","ref_index":59,"is_internal_anchor":false},{"citing_arxiv_id":"2604.27955","citing_title":"GUI Agents with Reinforcement Learning: Toward Digital Inhabitants","ref_index":63,"is_internal_anchor":false},{"citing_arxiv_id":"2604.27859","citing_title":"Rethinking Agentic Reinforcement Learning In Large Language Models","ref_index":76,"is_internal_anchor":false},{"citing_arxiv_id":"2605.10347","citing_title":"How Mobile World Model Guides GUI Agents?","ref_index":46,"is_internal_anchor":false},{"citing_arxiv_id":"2604.27859","citing_title":"Rethinking Agentic Reinforcement Learning In Large Language Models","ref_index":76,"is_internal_anchor":false},{"citing_arxiv_id":"2604.24348","citing_title":"OS-SPEAR: A Toolkit for the Safety, Performance,Efficiency, and Robustness Analysis of OS Agents","ref_index":53,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/W3SAI6NODA32CYQWFAISKK2QLK","json":"https://pith.science/pith/W3SAI6NODA32CYQWFAISKK2QLK.json","graph_json":"https://pith.science/api/pith-number/W3SAI6NODA32CYQWFAISKK2QLK/graph.json","events_json":"https://pith.science/api/pith-number/W3SAI6NODA32CYQWFAISKK2QLK/events.json","paper":"https://pith.science/paper/W3SAI6NO"},"agent_actions":{"view_html":"https://pith.science/pith/W3SAI6NODA32CYQWFAISKK2QLK","download_json":"https://pith.science/pith/W3SAI6NODA32CYQWFAISKK2QLK.json","view_paper":"https://pith.science/paper/W3SAI6NO","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2507.05720&json=true","fetch_graph":"https://pith.science/api/pith-number/W3SAI6NODA32CYQWFAISKK2QLK/graph.json","fetch_events":"https://pith.science/api/pith-number/W3SAI6NODA32CYQWFAISKK2QLK/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/W3SAI6NODA32CYQWFAISKK2QLK/action/timestamp_anchor","attest_storage":"https://pith.science/pith/W3SAI6NODA32CYQWFAISKK2QLK/action/storage_attestation","attest_author":"https://pith.science/pith/W3SAI6NODA32CYQWFAISKK2QLK/action/author_attestation","sign_citation":"https://pith.science/pith/W3SAI6NODA32CYQWFAISKK2QLK/action/citation_signature","submit_replication":"https://pith.science/pith/W3SAI6NODA32CYQWFAISKK2QLK/action/replication_record"}},"created_at":"2026-07-05T11:33:35.224052+00:00","updated_at":"2026-07-05T11:33:35.224052+00:00"}