{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:NKTL3DF3QFIJPZQF3MCORKXPFF","short_pith_number":"pith:NKTL3DF3","schema_version":"1.0","canonical_sha256":"6aa6bd8cbb815097e605db04e8aaef2963bc4156d5849fec5ff646de4f299425","source":{"kind":"arxiv","id":"2507.23779","version":1},"attestation_state":"computed","paper":{"title":"Phi-Ground Tech Report: Advancing Perception in GUI Grounding","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.MM"],"primary_cat":"cs.CV","authors_text":"Baining Guo, Chong Luo, Jialiang Zhu, Justin Wagle, Kai Qiu, Miaosen Zhang, Qi Dai, Tianyi Chen, Tim Franklin, Yifan Yang, Ziqiang Xu","submitted_at":"2025-07-31T17:59:09Z","abstract_excerpt":"With the development of multimodal reasoning models, Computer Use Agents (CUAs), akin to Jarvis from \\textit{\"Iron Man\"}, are becoming a reality. GUI grounding is a core component for CUAs to execute actual actions, similar to mechanical control in robotics, and it directly leads to the success or failure of the system. It determines actions such as clicking and typing, as well as related parameters like the coordinates for clicks. Current end-to-end grounding models still achieve less than 65\\% accuracy on challenging benchmarks like ScreenSpot-pro and UI-Vision, indicating they are far from "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2507.23779","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CV","submitted_at":"2025-07-31T17:59:09Z","cross_cats_sorted":["cs.AI","cs.MM"],"title_canon_sha256":"a46b19c9ba69b0cc01ff9e1b32bd7bff468e154cec3ef5d309038cd959a70ff2","abstract_canon_sha256":"d4924436a138430a19e98d67bb421b10e173f37243520226a73aa9f29f27be8d"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:46:30.807574Z","signature_b64":"j/Wp+bC3ErzRLZj9KbYbAF686wGjV9So/0Wv1+7kWkYnyBoD4zZQdtr2HKFpbeQQnaPUA6kpILAA+yMOWGHVAw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"6aa6bd8cbb815097e605db04e8aaef2963bc4156d5849fec5ff646de4f299425","last_reissued_at":"2026-07-05T11:46:30.807040Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:46:30.807040Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Phi-Ground Tech Report: Advancing Perception in GUI Grounding","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.MM"],"primary_cat":"cs.CV","authors_text":"Baining Guo, Chong Luo, Jialiang Zhu, Justin Wagle, Kai Qiu, Miaosen Zhang, Qi Dai, Tianyi Chen, Tim Franklin, Yifan Yang, Ziqiang Xu","submitted_at":"2025-07-31T17:59:09Z","abstract_excerpt":"With the development of multimodal reasoning models, Computer Use Agents (CUAs), akin to Jarvis from \\textit{\"Iron Man\"}, are becoming a reality. GUI grounding is a core component for CUAs to execute actual actions, similar to mechanical control in robotics, and it directly leads to the success or failure of the system. It determines actions such as clicking and typing, as well as related parameters like the coordinates for clicks. Current end-to-end grounding models still achieve less than 65\\% accuracy on challenging benchmarks like ScreenSpot-pro and UI-Vision, indicating they are far from "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2507.23779","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2507.23779/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2507.23779","created_at":"2026-07-05T11:46:30.807106+00:00"},{"alias_kind":"arxiv_version","alias_value":"2507.23779v1","created_at":"2026-07-05T11:46:30.807106+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2507.23779","created_at":"2026-07-05T11:46:30.807106+00:00"},{"alias_kind":"pith_short_12","alias_value":"NKTL3DF3QFIJ","created_at":"2026-07-05T11:46:30.807106+00:00"},{"alias_kind":"pith_short_16","alias_value":"NKTL3DF3QFIJPZQF","created_at":"2026-07-05T11:46:30.807106+00:00"},{"alias_kind":"pith_short_8","alias_value":"NKTL3DF3","created_at":"2026-07-05T11:46:30.807106+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":5,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.30084","citing_title":"One Forward Beats Two: InnerZoom for Accurate and Efficient GUI Grounding","ref_index":132,"is_internal_anchor":false},{"citing_arxiv_id":"2605.16402","citing_title":"WinDeskGround: A Benchmark for Robust GUI Grounding in Complex Multi-Window Desktop Environments","ref_index":21,"is_internal_anchor":false},{"citing_arxiv_id":"2605.12501","citing_title":"Covering Human Action Space for Computer Use: Data Synthesis and Benchmark","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2604.27955","citing_title":"GUI Agents with Reinforcement Learning: Toward Digital Inhabitants","ref_index":84,"is_internal_anchor":false},{"citing_arxiv_id":"2605.06664","citing_title":"BAMI: Training-Free Bias Mitigation in GUI Grounding","ref_index":36,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/NKTL3DF3QFIJPZQF3MCORKXPFF","json":"https://pith.science/pith/NKTL3DF3QFIJPZQF3MCORKXPFF.json","graph_json":"https://pith.science/api/pith-number/NKTL3DF3QFIJPZQF3MCORKXPFF/graph.json","events_json":"https://pith.science/api/pith-number/NKTL3DF3QFIJPZQF3MCORKXPFF/events.json","paper":"https://pith.science/paper/NKTL3DF3"},"agent_actions":{"view_html":"https://pith.science/pith/NKTL3DF3QFIJPZQF3MCORKXPFF","download_json":"https://pith.science/pith/NKTL3DF3QFIJPZQF3MCORKXPFF.json","view_paper":"https://pith.science/paper/NKTL3DF3","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2507.23779&json=true","fetch_graph":"https://pith.science/api/pith-number/NKTL3DF3QFIJPZQF3MCORKXPFF/graph.json","fetch_events":"https://pith.science/api/pith-number/NKTL3DF3QFIJPZQF3MCORKXPFF/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/NKTL3DF3QFIJPZQF3MCORKXPFF/action/timestamp_anchor","attest_storage":"https://pith.science/pith/NKTL3DF3QFIJPZQF3MCORKXPFF/action/storage_attestation","attest_author":"https://pith.science/pith/NKTL3DF3QFIJPZQF3MCORKXPFF/action/author_attestation","sign_citation":"https://pith.science/pith/NKTL3DF3QFIJPZQF3MCORKXPFF/action/citation_signature","submit_replication":"https://pith.science/pith/NKTL3DF3QFIJPZQF3MCORKXPFF/action/replication_record"}},"created_at":"2026-07-05T11:46:30.807106+00:00","updated_at":"2026-07-05T11:46:30.807106+00:00"}