{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:NJEGQ4QA5E4BQJSL5MP62N6EF3","short_pith_number":"pith:NJEGQ4QA","schema_version":"1.0","canonical_sha256":"6a48687200e93818264beb1fed37c42ecb31fb8634ae140e874944abb570e6fc","source":{"kind":"arxiv","id":"2506.15425","version":1},"attestation_state":"computed","paper":{"title":"Understanding GUI Agent Localization Biases through Logit Sharpness","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Jing Tang, Xingjian Tao, Yiwei Wang, Yujun Cai, Zhicheng Yang","submitted_at":"2025-06-18T12:55:35Z","abstract_excerpt":"Multimodal large language models (MLLMs) have enabled GUI agents to interact with operating systems by grounding language into spatial actions. Despite their promising performance, these models frequently exhibit hallucinations-systematic localization errors that compromise reliability. We propose a fine-grained evaluation framework that categorizes model predictions into four distinct types, revealing nuanced failure modes beyond traditional accuracy metrics. To better quantify model uncertainty, we introduce the Peak Sharpness Score (PSS), a metric that evaluates the alignment between semant"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2506.15425","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2025-06-18T12:55:35Z","cross_cats_sorted":[],"title_canon_sha256":"e33904f27f7ebb79b5c230ebf17c99f56429407773b24afcfe947f0e1718830f","abstract_canon_sha256":"f58c42b569e3646d6dd367b439af6811678a22ecb4a56803e39c5df7d46b7ac5"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:23:43.074842Z","signature_b64":"UHueQlw0ZCtCgphPDSrzXRRt5CPzm7UOYjQC1bFGrxiB6LuCjKuuGA31ZlqIV42d8LnSbqHfdXHqNIPuHvvjDQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"6a48687200e93818264beb1fed37c42ecb31fb8634ae140e874944abb570e6fc","last_reissued_at":"2026-07-05T11:23:43.074343Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:23:43.074343Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Understanding GUI Agent Localization Biases through Logit Sharpness","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CL","authors_text":"Jing Tang, Xingjian Tao, Yiwei Wang, Yujun Cai, Zhicheng Yang","submitted_at":"2025-06-18T12:55:35Z","abstract_excerpt":"Multimodal large language models (MLLMs) have enabled GUI agents to interact with operating systems by grounding language into spatial actions. Despite their promising performance, these models frequently exhibit hallucinations-systematic localization errors that compromise reliability. We propose a fine-grained evaluation framework that categorizes model predictions into four distinct types, revealing nuanced failure modes beyond traditional accuracy metrics. To better quantify model uncertainty, we introduce the Peak Sharpness Score (PSS), a metric that evaluates the alignment between semant"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2506.15425","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2506.15425/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2506.15425","created_at":"2026-07-05T11:23:43.074408+00:00"},{"alias_kind":"arxiv_version","alias_value":"2506.15425v1","created_at":"2026-07-05T11:23:43.074408+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2506.15425","created_at":"2026-07-05T11:23:43.074408+00:00"},{"alias_kind":"pith_short_12","alias_value":"NJEGQ4QA5E4B","created_at":"2026-07-05T11:23:43.074408+00:00"},{"alias_kind":"pith_short_16","alias_value":"NJEGQ4QA5E4BQJSL","created_at":"2026-07-05T11:23:43.074408+00:00"},{"alias_kind":"pith_short_8","alias_value":"NJEGQ4QA","created_at":"2026-07-05T11:23:43.074408+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":2,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2510.22102","citing_title":"Mitigating Coordinate Prediction Bias from Positional Encoding Failures","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2604.17284","citing_title":"HalluClear: Diagnosing, Evaluating and Mitigating Hallucinations in GUI Agents","ref_index":58,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/NJEGQ4QA5E4BQJSL5MP62N6EF3","json":"https://pith.science/pith/NJEGQ4QA5E4BQJSL5MP62N6EF3.json","graph_json":"https://pith.science/api/pith-number/NJEGQ4QA5E4BQJSL5MP62N6EF3/graph.json","events_json":"https://pith.science/api/pith-number/NJEGQ4QA5E4BQJSL5MP62N6EF3/events.json","paper":"https://pith.science/paper/NJEGQ4QA"},"agent_actions":{"view_html":"https://pith.science/pith/NJEGQ4QA5E4BQJSL5MP62N6EF3","download_json":"https://pith.science/pith/NJEGQ4QA5E4BQJSL5MP62N6EF3.json","view_paper":"https://pith.science/paper/NJEGQ4QA","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2506.15425&json=true","fetch_graph":"https://pith.science/api/pith-number/NJEGQ4QA5E4BQJSL5MP62N6EF3/graph.json","fetch_events":"https://pith.science/api/pith-number/NJEGQ4QA5E4BQJSL5MP62N6EF3/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/NJEGQ4QA5E4BQJSL5MP62N6EF3/action/timestamp_anchor","attest_storage":"https://pith.science/pith/NJEGQ4QA5E4BQJSL5MP62N6EF3/action/storage_attestation","attest_author":"https://pith.science/pith/NJEGQ4QA5E4BQJSL5MP62N6EF3/action/author_attestation","sign_citation":"https://pith.science/pith/NJEGQ4QA5E4BQJSL5MP62N6EF3/action/citation_signature","submit_replication":"https://pith.science/pith/NJEGQ4QA5E4BQJSL5MP62N6EF3/action/replication_record"}},"created_at":"2026-07-05T11:23:43.074408+00:00","updated_at":"2026-07-05T11:23:43.074408+00:00"}