{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2026:GU67LITUMZDX3PQQTXRWUYSLL4","short_pith_number":"pith:GU67LITU","schema_version":"1.0","canonical_sha256":"353df5a27466477dbe109de36a624b5f0005373a5b71fc2fbd93dcc653f7fabb","source":{"kind":"arxiv","id":"2607.28609","version":1},"attestation_state":"computed","paper":{"title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.CL","cs.CV"],"primary_cat":"cs.AI","authors_text":"Ben Kao, Bowen Yang, Fangzhi Xu, Hang Yan, Jiahui Gao, Jialin Cao, Jianbing Zhang, Jingyang Gong, Kaiming Jin, Kanzhi Cheng, Liheng Chen, Lingpeng Kong, Nuo Chen, Qiushi Sun, Tianbao Xie, Xinfeng Yuan, Xingdong Gong, Yian Wang, Zehao Li, Zhangyue Yin, Zhiyong Wu, Zhoumianze Liu, Zichen Ding","submitted_at":"2026-07-30T17:57:41Z","abstract_excerpt":"Computer-using agents (CUAs) are advancing rapidly across the digital world. A CUA trajectory records the agent's actions, states, and reasoning. Verifying whether it fulfilled the task instruction is central to CUA evaluation, data curation, and reinforcement learning. Neither human-written verifiers nor human annotators can provide such verification at scale, so the field increasingly turns to vision-language models (VLMs) as judges of CUA trajectories. But a fundamental question has long gone unexamined: are these VLM judges reliable enough? To study it systematically, we introduce OSReward"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2607.28609","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.AI","submitted_at":"2026-07-30T17:57:41Z","cross_cats_sorted":["cs.CL","cs.CV"],"title_canon_sha256":"e44e787471870edeebe446c080b46dcb855607bf6f4b88c7647a2b1e2f9148f3","abstract_canon_sha256":"e477fc49ebffe20cdc5b63f88a02321d6428e568481d92824f73f05d4d4d01eb"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"353df5a27466477dbe109de36a624b5f0005373a5b71fc2fbd93dcc653f7fabb","last_reissued_at":"2026-07-31T01:39:05.884903Z","signature_status":"unsigned_v0","first_computed_at":"2026-07-31T01:39:05.884903Z"},"graph_snapshot":{"paper":{"title":"OSReward: Instituting Standardized Evaluation for Cross-Platform Computer-Use Reward Models","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.CL","cs.CV"],"primary_cat":"cs.AI","authors_text":"Ben Kao, Bowen Yang, Fangzhi Xu, Hang Yan, Jiahui Gao, Jialin Cao, Jianbing Zhang, Jingyang Gong, Kaiming Jin, Kanzhi Cheng, Liheng Chen, Lingpeng Kong, Nuo Chen, Qiushi Sun, Tianbao Xie, Xinfeng Yuan, Xingdong Gong, Yian Wang, Zehao Li, Zhangyue Yin, Zhiyong Wu, Zhoumianze Liu, Zichen Ding","submitted_at":"2026-07-30T17:57:41Z","abstract_excerpt":"Computer-using agents (CUAs) are advancing rapidly across the digital world. A CUA trajectory records the agent's actions, states, and reasoning. Verifying whether it fulfilled the task instruction is central to CUA evaluation, data curation, and reinforcement learning. Neither human-written verifiers nor human annotators can provide such verification at scale, so the field increasingly turns to vision-language models (VLMs) as judges of CUA trajectories. But a fundamental question has long gone unexamined: are these VLM judges reliable enough? To study it systematically, we introduce OSReward"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2607.28609","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2607.28609/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2607.28609","created_at":"2026-07-31T01:39:05.888329+00:00"},{"alias_kind":"arxiv_version","alias_value":"2607.28609v1","created_at":"2026-07-31T01:39:05.888329+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2607.28609","created_at":"2026-07-31T01:39:05.888329+00:00"},{"alias_kind":"pith_short_12","alias_value":"GU67LITUMZDX","created_at":"2026-07-31T01:39:05.888329+00:00"},{"alias_kind":"pith_short_16","alias_value":"GU67LITUMZDX3PQQ","created_at":"2026-07-31T01:39:05.888329+00:00"},{"alias_kind":"pith_short_8","alias_value":"GU67LITU","created_at":"2026-07-31T01:39:05.888329+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":0,"internal_anchor_count":0,"sample":[]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/GU67LITUMZDX3PQQTXRWUYSLL4","json":"https://pith.science/pith/GU67LITUMZDX3PQQTXRWUYSLL4.json","graph_json":"https://pith.science/api/pith-number/GU67LITUMZDX3PQQTXRWUYSLL4/graph.json","events_json":"https://pith.science/api/pith-number/GU67LITUMZDX3PQQTXRWUYSLL4/events.json","paper":"https://pith.science/paper/GU67LITU"},"agent_actions":{"view_html":"https://pith.science/pith/GU67LITUMZDX3PQQTXRWUYSLL4","download_json":"https://pith.science/pith/GU67LITUMZDX3PQQTXRWUYSLL4.json","view_paper":"https://pith.science/paper/GU67LITU","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2607.28609&json=true","fetch_graph":"https://pith.science/api/pith-number/GU67LITUMZDX3PQQTXRWUYSLL4/graph.json","fetch_events":"https://pith.science/api/pith-number/GU67LITUMZDX3PQQTXRWUYSLL4/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/GU67LITUMZDX3PQQTXRWUYSLL4/action/timestamp_anchor","attest_storage":"https://pith.science/pith/GU67LITUMZDX3PQQTXRWUYSLL4/action/storage_attestation","attest_author":"https://pith.science/pith/GU67LITUMZDX3PQQTXRWUYSLL4/action/author_attestation","sign_citation":"https://pith.science/pith/GU67LITUMZDX3PQQTXRWUYSLL4/action/citation_signature","submit_replication":"https://pith.science/pith/GU67LITUMZDX3PQQTXRWUYSLL4/action/replication_record"}},"created_at":"2026-07-31T01:39:05.888329+00:00","updated_at":"2026-07-31T01:39:05.888329+00:00"}