{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:N66HTWI5FARGLAC7PCC4SNHS5D","short_pith_number":"pith:N66HTWI5","schema_version":"1.0","canonical_sha256":"6fbc79d91d282265805f7885c934f2e8c1da8e61ade1a1401685ab7b33fec96f","source":{"kind":"arxiv","id":"2501.04575","version":1},"attestation_state":"computed","paper":{"title":"InfiGUIAgent: A Multimodal Generalist GUI Agent with Native Reasoning and Reflection","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.CL","cs.HC"],"primary_cat":"cs.AI","authors_text":"Congkai Xie, Fei Wu, Hongxia Yang, Pengxiang Li, Shengyu Zhang, Xiaotian Han, Xinchen Xu, Xueyu Hu, Yuhang Liu, Zishu Wei","submitted_at":"2025-01-08T15:45:21Z","abstract_excerpt":"Graphical User Interface (GUI) Agents, powered by multimodal large language models (MLLMs), have shown great potential for task automation on computing devices such as computers and mobile phones. However, existing agents face challenges in multi-step reasoning and reliance on textual annotations, limiting their effectiveness. We introduce \\textit{InfiGUIAgent}, an MLLM-based GUI Agent trained with a two-stage supervised fine-tuning pipeline. Stage 1 enhances fundamental skills such as GUI understanding and grounding, while Stage 2 integrates hierarchical reasoning and expectation-reflection r"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2501.04575","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.AI","submitted_at":"2025-01-08T15:45:21Z","cross_cats_sorted":["cs.CL","cs.HC"],"title_canon_sha256":"8fc259d270c011636a66d419af2f801bfc52a71260442d980e628c833d24659e","abstract_canon_sha256":"cebc726cf33ee457bd1684bc5228fb9e3af612dbfb4b6b1c01af3390fdd018f3"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:58:37.537026Z","signature_b64":"qFwccPjxepLbGYg966hfnuTN/0cqkU2rMv9QMLr/awbHaKPPKOxitggrwfRmvx0yNiB/PlIIB0t6b2YVRZuFCQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"6fbc79d91d282265805f7885c934f2e8c1da8e61ade1a1401685ab7b33fec96f","last_reissued_at":"2026-07-05T09:58:37.536548Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:58:37.536548Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"InfiGUIAgent: A Multimodal Generalist GUI Agent with Native Reasoning and Reflection","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.CL","cs.HC"],"primary_cat":"cs.AI","authors_text":"Congkai Xie, Fei Wu, Hongxia Yang, Pengxiang Li, Shengyu Zhang, Xiaotian Han, Xinchen Xu, Xueyu Hu, Yuhang Liu, Zishu Wei","submitted_at":"2025-01-08T15:45:21Z","abstract_excerpt":"Graphical User Interface (GUI) Agents, powered by multimodal large language models (MLLMs), have shown great potential for task automation on computing devices such as computers and mobile phones. However, existing agents face challenges in multi-step reasoning and reliance on textual annotations, limiting their effectiveness. We introduce \\textit{InfiGUIAgent}, an MLLM-based GUI Agent trained with a two-stage supervised fine-tuning pipeline. Stage 1 enhances fundamental skills such as GUI understanding and grounding, while Stage 2 integrates hierarchical reasoning and expectation-reflection r"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2501.04575","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2501.04575/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2501.04575","created_at":"2026-07-05T09:58:37.536610+00:00"},{"alias_kind":"arxiv_version","alias_value":"2501.04575v1","created_at":"2026-07-05T09:58:37.536610+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2501.04575","created_at":"2026-07-05T09:58:37.536610+00:00"},{"alias_kind":"pith_short_12","alias_value":"N66HTWI5FARG","created_at":"2026-07-05T09:58:37.536610+00:00"},{"alias_kind":"pith_short_16","alias_value":"N66HTWI5FARGLAC7","created_at":"2026-07-05T09:58:37.536610+00:00"},{"alias_kind":"pith_short_8","alias_value":"N66HTWI5","created_at":"2026-07-05T09:58:37.536610+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":8,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2605.19538","citing_title":"CaptchaMind: Training CAPTCHA Solvers via Reinforcement Learning with Explicit Reasoning Supervision","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2506.17697","citing_title":"Beyond Syntax: Action Semantics Learning for App Agents","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2504.14239","citing_title":"InfiGUI-R1: Advancing Multimodal GUI Agents from Reactive Actors to Deliberative Reasoners","ref_index":37,"is_internal_anchor":false},{"citing_arxiv_id":"2510.24168","citing_title":"MGA: Memory-Driven GUI Agent for Observation-Centric Interaction","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2604.21268","citing_title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","ref_index":89,"is_internal_anchor":false},{"citing_arxiv_id":"2604.06811","citing_title":"SkillTrojan: Backdoor Attacks on Skill-Based Agent Systems","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2605.07110","citing_title":"Securing Computer-Use Agents: A Unified Architecture-Lifecycle Framework for Deployment-Grounded Reliability","ref_index":82,"is_internal_anchor":false},{"citing_arxiv_id":"2605.02572","citing_title":"On Training Large Language Models for Long-Horizon Tasks: An Empirical Study of Horizon Length","ref_index":63,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/N66HTWI5FARGLAC7PCC4SNHS5D","json":"https://pith.science/pith/N66HTWI5FARGLAC7PCC4SNHS5D.json","graph_json":"https://pith.science/api/pith-number/N66HTWI5FARGLAC7PCC4SNHS5D/graph.json","events_json":"https://pith.science/api/pith-number/N66HTWI5FARGLAC7PCC4SNHS5D/events.json","paper":"https://pith.science/paper/N66HTWI5"},"agent_actions":{"view_html":"https://pith.science/pith/N66HTWI5FARGLAC7PCC4SNHS5D","download_json":"https://pith.science/pith/N66HTWI5FARGLAC7PCC4SNHS5D.json","view_paper":"https://pith.science/paper/N66HTWI5","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2501.04575&json=true","fetch_graph":"https://pith.science/api/pith-number/N66HTWI5FARGLAC7PCC4SNHS5D/graph.json","fetch_events":"https://pith.science/api/pith-number/N66HTWI5FARGLAC7PCC4SNHS5D/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/N66HTWI5FARGLAC7PCC4SNHS5D/action/timestamp_anchor","attest_storage":"https://pith.science/pith/N66HTWI5FARGLAC7PCC4SNHS5D/action/storage_attestation","attest_author":"https://pith.science/pith/N66HTWI5FARGLAC7PCC4SNHS5D/action/author_attestation","sign_citation":"https://pith.science/pith/N66HTWI5FARGLAC7PCC4SNHS5D/action/citation_signature","submit_replication":"https://pith.science/pith/N66HTWI5FARGLAC7PCC4SNHS5D/action/replication_record"}},"created_at":"2026-07-05T09:58:37.536610+00:00","updated_at":"2026-07-05T09:58:37.536610+00:00"}