{"bundle_type":"pith_open_graph_bundle","bundle_version":"1.0","pith_number":"pith:2025:UTZHHIC4S3LVXEF7RVWKG6TIX2","short_pith_number":"pith:UTZHHIC4","canonical_record":{"source":{"id":"2509.02544","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.AI","submitted_at":"2025-09-02T17:44:45Z","cross_cats_sorted":["cs.CL","cs.CV","cs.HC"],"title_canon_sha256":"511c07a3e52da370327f70264fc04111a9cd6ec7a7c3fb704efa8b6a9536198e","abstract_canon_sha256":"b8ed58451f5d362c09a735c5533d6cbd1375fbebd3fb8b92b2edf8d112f59ad5"},"schema_version":"1.0"},"canonical_sha256":"a4f273a05c96d75b90bf8d6ca37a68be910604e6432f4337fc5f1add6b0aaab4","source":{"kind":"arxiv","id":"2509.02544","version":2},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2509.02544","created_at":"2026-07-05T12:05:22Z"},{"alias_kind":"arxiv_version","alias_value":"2509.02544v2","created_at":"2026-07-05T12:05:22Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2509.02544","created_at":"2026-07-05T12:05:22Z"},{"alias_kind":"pith_short_12","alias_value":"UTZHHIC4S3LV","created_at":"2026-07-05T12:05:22Z"},{"alias_kind":"pith_short_16","alias_value":"UTZHHIC4S3LVXEF7","created_at":"2026-07-05T12:05:22Z"},{"alias_kind":"pith_short_8","alias_value":"UTZHHIC4","created_at":"2026-07-05T12:05:22Z"}],"events":[{"event_type":"record_created","subject_pith_number":"pith:2025:UTZHHIC4S3LVXEF7RVWKG6TIX2","target":"record","payload":{"canonical_record":{"source":{"id":"2509.02544","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.AI","submitted_at":"2025-09-02T17:44:45Z","cross_cats_sorted":["cs.CL","cs.CV","cs.HC"],"title_canon_sha256":"511c07a3e52da370327f70264fc04111a9cd6ec7a7c3fb704efa8b6a9536198e","abstract_canon_sha256":"b8ed58451f5d362c09a735c5533d6cbd1375fbebd3fb8b92b2edf8d112f59ad5"},"schema_version":"1.0"},"canonical_sha256":"a4f273a05c96d75b90bf8d6ca37a68be910604e6432f4337fc5f1add6b0aaab4","receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T12:05:22.005372Z","signature_b64":"A40kuKhkaZUD7fYFKiQeHDs1tAsYgpX2ytcnx65AU9S1JMFmJGGYgsV/AryH1esRPKxytpqSJV/LEeVSDuYbAQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"a4f273a05c96d75b90bf8d6ca37a68be910604e6432f4337fc5f1add6b0aaab4","last_reissued_at":"2026-07-05T12:05:22.004751Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T12:05:22.004751Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"source_kind":"arxiv","source_id":"2509.02544","source_version":2,"attestation_state":"computed"},"signer":{"signer_id":"pith.science","signer_type":"pith_registry","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"created_at":"2026-07-05T12:05:22Z","supersedes":[],"prev_event":null,"signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"ZTHXji4eV1bQ7cjFmttSJ6HmsYU1bPnL397zu9Y4VzBi5USS3h7jjhye/1IksylkcAtPDkFi6d+RK+2VHHdyBA==","signed_message":"open_graph_event_sha256_bytes","signed_at":"2026-08-05T15:16:22.271451Z"},"content_sha256":"583cd1c49623cb81643c3710baff02cb8933d5915f740dfc44f5c13d8857c846","schema_version":"1.0","event_id":"sha256:583cd1c49623cb81643c3710baff02cb8933d5915f740dfc44f5c13d8857c846"},{"event_type":"graph_snapshot","subject_pith_number":"pith:2025:UTZHHIC4S3LVXEF7RVWKG6TIX2","target":"graph","payload":{"graph_snapshot":{"paper":{"title":"UI-TARS-2 Technical Report: Advancing GUI Agent with Multi-Turn Reinforcement Learning","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"UI-TARS-2 reaches 88.2 on Online-Mind2Web and 59.8 mean game score by training a native GUI agent with multi-turn reinforcement learning and a data flywheel.","cross_cats":["cs.CL","cs.CV","cs.HC"],"primary_cat":"cs.AI","authors_text":"Aoyan Li, Baoquan Zhong, Bo Li, Bo Zhou, Chaolin Jin, Chen Dun, Chengquan Jiang, Chen Li, Chenxin Li, Chong Liu, Daoguang Zan, Dehua Ma, Faming Wu, Feng Lin, Fuxing Leng, Ge Zhang, Guang Shi, Guoliang Li, Haihua Yang, Hanbin Wang, Hangyu Guo, Haobin Chen, Hao Chen, Haoli Chen, Haoming Wang, Haotian Zhou, Haoyang Zou, Hao Yu, Hongda Zhu, Hongyi Guo, Huatong Song, Jiaheng Liu, Jiajun Shi, Jiale Yang, Jian Chen, Jiazhan Feng, Jie Tang, Jingjia Huang, Jing Su, Jinlin Pang, Junda Du, Junjie Fang, Junting Lu, Kai Cai, Kai Shen, Kaiyu Shi, Kuanye Li, Lichen Yuan, Li Han, Li Li, Lin Yan, Longxiang Liu, Meilan Han, Minchao Wang, Peiyao Zhao, Pengfei Liu, Qianli Ma, Qihua Han, Qi Liu, Qinghao Ye, Qinghao Zhao, Qinyu Luo, Renjie Zheng, Shihao Liang, Shijue Huang, Shulin Xin, Shuyue Guo, Siyao Liu, Songhua Cai, Taoran Lu, Tianhao Cheng, Wanjun Zhong, Wayne Xin Zhao, Wenhao Huang, Wen Heng, Wenqian Wang, Wenqi Fu, Woyu Lin, Xiaobo Ma, Xiaobo Qin, Xiaojun Xiao, Xiaokang Tong, Xiaolong Huang, Xinchun Zhang, Xinjie Chen, Xin Liu, Xinyao Li, Xujing Li, Yaohui Wang, Yichi Zhang, Yidi Du, Yi Lin, Yilin Chen, Yining Ye, Yiwen Wang, Youbin Wu, Yuanfan Li, Yujia Qin, Yu Miao, Yuwen Xiong, Yuxin Song, Zehui Chen, Zhaojian Li, Zhengxuan Jiang, Zhenzhu Yang, Zhiyong Wu, Zhiyuan Zeng, Zhi Zhang, Zhongkai Zhao, Zihao Wang, Zili Li, Ziyuan Zhao","submitted_at":"2025-09-02T17:44:45Z","abstract_excerpt":"The development of autonomous agents for graphical user interfaces (GUIs) presents major challenges in artificial intelligence. While recent advances in native agent models have shown promise by unifying perception, reasoning, action, and memory through end-to-end learning, open problems remain in data scalability, multi-turn reinforcement learning (RL), the limitations of GUI-only operation, and environment stability. In this technical report, we present UI-TARS-2, a native GUI-centered agent model that addresses these challenges through a systematic training methodology: a data flywheel for "},"claims":{"count":4,"items":[{"kind":"strongest_claim","text":"UI-TARS-2 achieves significant improvements over its predecessor UI-TARS-1.5. On GUI benchmarks, it reaches 88.2 on Online-Mind2Web, 47.5 on OSWorld, 50.6 on WindowsAgentArena, and 73.3 on AndroidWorld, outperforming strong baselines such as Claude and OpenAI agents. In game environments, it attains a mean normalized score of 59.8 across a 15-game suite.","source":"verdict.strongest_claim","status":"machine_extracted","claim_id":"C1","attestation":"unclaimed"},{"kind":"weakest_assumption","text":"The hybrid GUI environment and unified sandbox produce training and evaluation conditions that are stable and representative enough for the observed gains to transfer to real-world interactive scenarios outside the controlled benchmarks.","source":"verdict.weakest_assumption","status":"machine_extracted","claim_id":"C2","attestation":"unclaimed"},{"kind":"one_line_summary","text":"UI-TARS-2 reaches 88.2 on Online-Mind2Web, 47.5 on OSWorld, 50.6 on WindowsAgentArena, and 73.3 on AndroidWorld while attaining 59.8 mean normalized score on a 15-game suite through multi-turn RL and scalable data generation.","source":"verdict.one_line_summary","status":"machine_extracted","claim_id":"C3","attestation":"unclaimed"},{"kind":"headline","text":"UI-TARS-2 reaches 88.2 on Online-Mind2Web and 59.8 mean game score by training a native GUI agent with multi-turn reinforcement learning and a data flywheel.","source":"verdict.pith_extraction.headline","status":"machine_extracted","claim_id":"C4","attestation":"unclaimed"}],"snapshot_sha256":"8244b6d22e725b62f9e0e2b2fe76bae8ea02fe3310e316e223b568b08f10082d"},"source":{"id":"2509.02544","kind":"arxiv","version":2},"verdict":{"id":"88d143f7-b057-41af-8f31-578bc2c5bd7f","model_set":{"reader":"grok-4.3"},"created_at":"2026-05-13T10:08:29.204788Z","strongest_claim":"UI-TARS-2 achieves significant improvements over its predecessor UI-TARS-1.5. On GUI benchmarks, it reaches 88.2 on Online-Mind2Web, 47.5 on OSWorld, 50.6 on WindowsAgentArena, and 73.3 on AndroidWorld, outperforming strong baselines such as Claude and OpenAI agents. In game environments, it attains a mean normalized score of 59.8 across a 15-game suite.","one_line_summary":"UI-TARS-2 reaches 88.2 on Online-Mind2Web, 47.5 on OSWorld, 50.6 on WindowsAgentArena, and 73.3 on AndroidWorld while attaining 59.8 mean normalized score on a 15-game suite through multi-turn RL and scalable data generation.","pipeline_version":"pith-pipeline@v0.9.0","weakest_assumption":"The hybrid GUI environment and unified sandbox produce training and evaluation conditions that are stable and representative enough for the observed gains to transfer to real-world interactive scenarios outside the controlled benchmarks.","pith_extraction_headline":"UI-TARS-2 reaches 88.2 on Online-Mind2Web and 59.8 mean game score by training a native GUI agent with multi-turn reinforcement learning and a data flywheel."},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2509.02544/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":90,"sample":[{"doi":"","year":2024,"title":"Introducing the model context protocol","work_id":"76a54afd-9ea5-4227-82d4-895b22064898","ref_index":1,"cited_arxiv_id":"","is_internal_anchor":false},{"doi":"","year":null,"title":"Developing a computer use model.https://www.anthropic.com/news/developing-computer-use","work_id":"caabce93-ca86-4591-9b22-d17f67b8741f","ref_index":2,"cited_arxiv_id":"","is_internal_anchor":false},{"doi":"","year":null,"title":"Product announcement","work_id":"4d2efd78-a0ca-4820-89e3-11f71eb17bb0","ref_index":3,"cited_arxiv_id":"","is_internal_anchor":false},{"doi":"","year":2025,"title":"Claude 3.7 sonnet system card","work_id":"c03ad2ab-948d-4485-b8e1-c1f09252a581","ref_index":4,"cited_arxiv_id":"","is_internal_anchor":false},{"doi":"","year":2025,"title":"Claude’s extended thinking","work_id":"604b5fae-2b6c-42d3-a403-f342a8a5a875","ref_index":5,"cited_arxiv_id":"","is_internal_anchor":false}],"resolved_work":90,"snapshot_sha256":"112b5efebc1727951602bd1ef229b752e9293dd02e1e2413fd88a681ff51b524","internal_anchors":34},"formal_canon":{"evidence_count":2,"snapshot_sha256":"29d4abd40fb2fc89f29a2f5598589f975c251d12a03baf363ea290513136dccd"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"verdict_id":"88d143f7-b057-41af-8f31-578bc2c5bd7f"},"signer":{"signer_id":"pith.science","signer_type":"pith_registry","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"created_at":"2026-07-05T12:05:22Z","supersedes":[],"prev_event":null,"signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"MdPkKTx+wwPpRPgMPdaGG9jup32+UHq+11Bm3FjnzxQ/pkHJRC2g0yr35Tpvdn681+0GyNtS4CW6RFb4xtOGAw==","signed_message":"open_graph_event_sha256_bytes","signed_at":"2026-08-05T15:16:22.272303Z"},"content_sha256":"6b6e7faf6d6071b9ea318328e15d9687315d2e9bdc4bae741d3416cb36c28c17","schema_version":"1.0","event_id":"sha256:6b6e7faf6d6071b9ea318328e15d9687315d2e9bdc4bae741d3416cb36c28c17"}],"timestamp_proofs":[],"mirror_hints":[{"mirror_type":"https","name":"Pith Resolver","base_url":"https://pith.science","bundle_url":"https://pith.science/pith/UTZHHIC4S3LVXEF7RVWKG6TIX2/bundle.json","state_url":"https://pith.science/pith/UTZHHIC4S3LVXEF7RVWKG6TIX2/state.json","well_known_bundle_url":"https://pith.science/.well-known/pith/UTZHHIC4S3LVXEF7RVWKG6TIX2/bundle.json","status":"primary"}],"public_keys":[{"key_id":"pith-v1-2026-05","algorithm":"ed25519","format":"raw","public_key_b64":"stVStoiQhXFxp4s2pdzPNoqVNBMojDU/fJ2db5S3CbM=","public_key_hex":"b2d552b68890857171a78b36a5dccf368a953413288c353f7c9d9d6f94b709b3","fingerprint_sha256_b32_first128bits":"RVFV5Z2OI2J3ZUO7ERDEBCYNKS","fingerprint_sha256_hex":"8d4b5ee74e4693bcd1df2446408b0d54","rotates_at":null,"url":"https://pith.science/pith-signing-key.json","notes":"Pith uses this Ed25519 key to sign canonical record SHA-256 digests. Verify with: ed25519_verify(public_key, message=canonical_sha256_bytes, signature=base64decode(signature_b64))."}],"merge_version":"pith-open-graph-merge-v1","built_at":"2026-08-05T15:16:22Z","links":{"resolver":"https://pith.science/pith/UTZHHIC4S3LVXEF7RVWKG6TIX2","bundle":"https://pith.science/pith/UTZHHIC4S3LVXEF7RVWKG6TIX2/bundle.json","state":"https://pith.science/pith/UTZHHIC4S3LVXEF7RVWKG6TIX2/state.json","well_known_bundle":"https://pith.science/.well-known/pith/UTZHHIC4S3LVXEF7RVWKG6TIX2/bundle.json"},"state":{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2025:UTZHHIC4S3LVXEF7RVWKG6TIX2","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"b8ed58451f5d362c09a735c5533d6cbd1375fbebd3fb8b92b2edf8d112f59ad5","cross_cats_sorted":["cs.CL","cs.CV","cs.HC"],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.AI","submitted_at":"2025-09-02T17:44:45Z","title_canon_sha256":"511c07a3e52da370327f70264fc04111a9cd6ec7a7c3fb704efa8b6a9536198e"},"schema_version":"1.0","source":{"id":"2509.02544","kind":"arxiv","version":2}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2509.02544","created_at":"2026-07-05T12:05:22Z"},{"alias_kind":"arxiv_version","alias_value":"2509.02544v2","created_at":"2026-07-05T12:05:22Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2509.02544","created_at":"2026-07-05T12:05:22Z"},{"alias_kind":"pith_short_12","alias_value":"UTZHHIC4S3LV","created_at":"2026-07-05T12:05:22Z"},{"alias_kind":"pith_short_16","alias_value":"UTZHHIC4S3LVXEF7","created_at":"2026-07-05T12:05:22Z"},{"alias_kind":"pith_short_8","alias_value":"UTZHHIC4","created_at":"2026-07-05T12:05:22Z"}],"graph_snapshots":[{"event_id":"sha256:6b6e7faf6d6071b9ea318328e15d9687315d2e9bdc4bae741d3416cb36c28c17","target":"graph","created_at":"2026-07-05T12:05:22Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":4,"items":[{"attestation":"unclaimed","claim_id":"C1","kind":"strongest_claim","source":"verdict.strongest_claim","status":"machine_extracted","text":"UI-TARS-2 achieves significant improvements over its predecessor UI-TARS-1.5. On GUI benchmarks, it reaches 88.2 on Online-Mind2Web, 47.5 on OSWorld, 50.6 on WindowsAgentArena, and 73.3 on AndroidWorld, outperforming strong baselines such as Claude and OpenAI agents. In game environments, it attains a mean normalized score of 59.8 across a 15-game suite."},{"attestation":"unclaimed","claim_id":"C2","kind":"weakest_assumption","source":"verdict.weakest_assumption","status":"machine_extracted","text":"The hybrid GUI environment and unified sandbox produce training and evaluation conditions that are stable and representative enough for the observed gains to transfer to real-world interactive scenarios outside the controlled benchmarks."},{"attestation":"unclaimed","claim_id":"C3","kind":"one_line_summary","source":"verdict.one_line_summary","status":"machine_extracted","text":"UI-TARS-2 reaches 88.2 on Online-Mind2Web, 47.5 on OSWorld, 50.6 on WindowsAgentArena, and 73.3 on AndroidWorld while attaining 59.8 mean normalized score on a 15-game suite through multi-turn RL and scalable data generation."},{"attestation":"unclaimed","claim_id":"C4","kind":"headline","source":"verdict.pith_extraction.headline","status":"machine_extracted","text":"UI-TARS-2 reaches 88.2 on Online-Mind2Web and 59.8 mean game score by training a native GUI agent with multi-turn reinforcement learning and a data flywheel."}],"snapshot_sha256":"8244b6d22e725b62f9e0e2b2fe76bae8ea02fe3310e316e223b568b08f10082d"},"formal_canon":{"evidence_count":2,"snapshot_sha256":"29d4abd40fb2fc89f29a2f5598589f975c251d12a03baf363ea290513136dccd"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/2509.02544/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"The development of autonomous agents for graphical user interfaces (GUIs) presents major challenges in artificial intelligence. While recent advances in native agent models have shown promise by unifying perception, reasoning, action, and memory through end-to-end learning, open problems remain in data scalability, multi-turn reinforcement learning (RL), the limitations of GUI-only operation, and environment stability. In this technical report, we present UI-TARS-2, a native GUI-centered agent model that addresses these challenges through a systematic training methodology: a data flywheel for ","authors_text":"Aoyan Li, Baoquan Zhong, Bo Li, Bo Zhou, Chaolin Jin, Chen Dun, Chengquan Jiang, Chen Li, Chenxin Li, Chong Liu, Daoguang Zan, Dehua Ma, Faming Wu, Feng Lin, Fuxing Leng, Ge Zhang, Guang Shi, Guoliang Li, Haihua Yang, Hanbin Wang, Hangyu Guo, Haobin Chen, Hao Chen, Haoli Chen, Haoming Wang, Haotian Zhou, Haoyang Zou, Hao Yu, Hongda Zhu, Hongyi Guo, Huatong Song, Jiaheng Liu, Jiajun Shi, Jiale Yang, Jian Chen, Jiazhan Feng, Jie Tang, Jingjia Huang, Jing Su, Jinlin Pang, Junda Du, Junjie Fang, Junting Lu, Kai Cai, Kai Shen, Kaiyu Shi, Kuanye Li, Lichen Yuan, Li Han, Li Li, Lin Yan, Longxiang Liu, Meilan Han, Minchao Wang, Peiyao Zhao, Pengfei Liu, Qianli Ma, Qihua Han, Qi Liu, Qinghao Ye, Qinghao Zhao, Qinyu Luo, Renjie Zheng, Shihao Liang, Shijue Huang, Shulin Xin, Shuyue Guo, Siyao Liu, Songhua Cai, Taoran Lu, Tianhao Cheng, Wanjun Zhong, Wayne Xin Zhao, Wenhao Huang, Wen Heng, Wenqian Wang, Wenqi Fu, Woyu Lin, Xiaobo Ma, Xiaobo Qin, Xiaojun Xiao, Xiaokang Tong, Xiaolong Huang, Xinchun Zhang, Xinjie Chen, Xin Liu, Xinyao Li, Xujing Li, Yaohui Wang, Yichi Zhang, Yidi Du, Yi Lin, Yilin Chen, Yining Ye, Yiwen Wang, Youbin Wu, Yuanfan Li, Yujia Qin, Yu Miao, Yuwen Xiong, Yuxin Song, Zehui Chen, Zhaojian Li, Zhengxuan Jiang, Zhenzhu Yang, Zhiyong Wu, Zhiyuan Zeng, Zhi Zhang, Zhongkai Zhao, Zihao Wang, Zili Li, Ziyuan Zhao","cross_cats":["cs.CL","cs.CV","cs.HC"],"headline":"UI-TARS-2 reaches 88.2 on Online-Mind2Web and 59.8 mean game score by training a native GUI agent with multi-turn reinforcement learning and a data flywheel.","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.AI","submitted_at":"2025-09-02T17:44:45Z","title":"UI-TARS-2 Technical Report: Advancing GUI Agent with Multi-Turn Reinforcement Learning"},"references":{"count":90,"internal_anchors":34,"resolved_work":90,"sample":[{"cited_arxiv_id":"","doi":"","is_internal_anchor":false,"ref_index":1,"title":"Introducing the model context protocol","work_id":"76a54afd-9ea5-4227-82d4-895b22064898","year":2024},{"cited_arxiv_id":"","doi":"","is_internal_anchor":false,"ref_index":2,"title":"Developing a computer use model.https://www.anthropic.com/news/developing-computer-use","work_id":"caabce93-ca86-4591-9b22-d17f67b8741f","year":null},{"cited_arxiv_id":"","doi":"","is_internal_anchor":false,"ref_index":3,"title":"Product announcement","work_id":"4d2efd78-a0ca-4820-89e3-11f71eb17bb0","year":null},{"cited_arxiv_id":"","doi":"","is_internal_anchor":false,"ref_index":4,"title":"Claude 3.7 sonnet system card","work_id":"c03ad2ab-948d-4485-b8e1-c1f09252a581","year":2025},{"cited_arxiv_id":"","doi":"","is_internal_anchor":false,"ref_index":5,"title":"Claude’s extended thinking","work_id":"604b5fae-2b6c-42d3-a403-f342a8a5a875","year":2025}],"snapshot_sha256":"112b5efebc1727951602bd1ef229b752e9293dd02e1e2413fd88a681ff51b524"},"source":{"id":"2509.02544","kind":"arxiv","version":2},"verdict":{"created_at":"2026-05-13T10:08:29.204788Z","id":"88d143f7-b057-41af-8f31-578bc2c5bd7f","model_set":{"reader":"grok-4.3"},"one_line_summary":"UI-TARS-2 reaches 88.2 on Online-Mind2Web, 47.5 on OSWorld, 50.6 on WindowsAgentArena, and 73.3 on AndroidWorld while attaining 59.8 mean normalized score on a 15-game suite through multi-turn RL and scalable data generation.","pipeline_version":"pith-pipeline@v0.9.0","pith_extraction_headline":"UI-TARS-2 reaches 88.2 on Online-Mind2Web and 59.8 mean game score by training a native GUI agent with multi-turn reinforcement learning and a data flywheel.","strongest_claim":"UI-TARS-2 achieves significant improvements over its predecessor UI-TARS-1.5. On GUI benchmarks, it reaches 88.2 on Online-Mind2Web, 47.5 on OSWorld, 50.6 on WindowsAgentArena, and 73.3 on AndroidWorld, outperforming strong baselines such as Claude and OpenAI agents. In game environments, it attains a mean normalized score of 59.8 across a 15-game suite.","weakest_assumption":"The hybrid GUI environment and unified sandbox produce training and evaluation conditions that are stable and representative enough for the observed gains to transfer to real-world interactive scenarios outside the controlled benchmarks."}},"verdict_id":"88d143f7-b057-41af-8f31-578bc2c5bd7f"}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:583cd1c49623cb81643c3710baff02cb8933d5915f740dfc44f5c13d8857c846","target":"record","created_at":"2026-07-05T12:05:22Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"b8ed58451f5d362c09a735c5533d6cbd1375fbebd3fb8b92b2edf8d112f59ad5","cross_cats_sorted":["cs.CL","cs.CV","cs.HC"],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.AI","submitted_at":"2025-09-02T17:44:45Z","title_canon_sha256":"511c07a3e52da370327f70264fc04111a9cd6ec7a7c3fb704efa8b6a9536198e"},"schema_version":"1.0","source":{"id":"2509.02544","kind":"arxiv","version":2}},"canonical_sha256":"a4f273a05c96d75b90bf8d6ca37a68be910604e6432f4337fc5f1add6b0aaab4","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"a4f273a05c96d75b90bf8d6ca37a68be910604e6432f4337fc5f1add6b0aaab4","first_computed_at":"2026-07-05T12:05:22.004751Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-07-05T12:05:22.004751Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"A40kuKhkaZUD7fYFKiQeHDs1tAsYgpX2ytcnx65AU9S1JMFmJGGYgsV/AryH1esRPKxytpqSJV/LEeVSDuYbAQ==","signature_status":"signed_v1","signed_at":"2026-07-05T12:05:22.005372Z","signed_message":"canonical_sha256_bytes"},"source_id":"2509.02544","source_kind":"arxiv","source_version":2}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:583cd1c49623cb81643c3710baff02cb8933d5915f740dfc44f5c13d8857c846","sha256:6b6e7faf6d6071b9ea318328e15d9687315d2e9bdc4bae741d3416cb36c28c17"],"state_sha256":"4cbfb927a18737f75f3ad408eb43c1b7a6aeb5a19a99df83d7f5d226cc5c0098"},"bundle_signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"XhqZvYgsuJcSyoaA/lrj53uilhp0Kmj1bUqmF000qBhnT4r3vahlVuPaZR/Uejlmk6jgiROQN8quYnzLC9vjCg==","signed_message":"bundle_sha256_bytes","signed_at":"2026-08-05T15:16:22.277173Z","bundle_sha256":"dc4774981dbd56dfdad4d333e87fb1347a4f1f888d66e6371a87e8c86a12daf5"}}