{"bundle_type":"pith_open_graph_bundle","bundle_version":"1.0","pith_number":"pith:2025:JEKDSHX44TJRQNKWUT3AN6RC5X","short_pith_number":"pith:JEKDSHX4","canonical_record":{"source":{"id":"2505.07062","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2025-05-11T17:28:30Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"a307c51392425b701eb724935804e8d707c71e7a370e0c690afe66b5436d56a1","abstract_canon_sha256":"2e07866c30f89f0177f53a947c73ac3b33c891f4f0d4528868df401181623429"},"schema_version":"1.0"},"canonical_sha256":"4914391efce4d3183556a4f606fa22edc6d82f8fb8b180cfbfa8bdf101f03435","source":{"kind":"arxiv","id":"2505.07062","version":1},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2505.07062","created_at":"2026-07-05T11:01:42Z"},{"alias_kind":"arxiv_version","alias_value":"2505.07062v1","created_at":"2026-07-05T11:01:42Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2505.07062","created_at":"2026-07-05T11:01:42Z"},{"alias_kind":"pith_short_12","alias_value":"JEKDSHX44TJR","created_at":"2026-07-05T11:01:42Z"},{"alias_kind":"pith_short_16","alias_value":"JEKDSHX44TJRQNKW","created_at":"2026-07-05T11:01:42Z"},{"alias_kind":"pith_short_8","alias_value":"JEKDSHX4","created_at":"2026-07-05T11:01:42Z"}],"events":[{"event_type":"record_created","subject_pith_number":"pith:2025:JEKDSHX44TJRQNKWUT3AN6RC5X","target":"record","payload":{"canonical_record":{"source":{"id":"2505.07062","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2025-05-11T17:28:30Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"a307c51392425b701eb724935804e8d707c71e7a370e0c690afe66b5436d56a1","abstract_canon_sha256":"2e07866c30f89f0177f53a947c73ac3b33c891f4f0d4528868df401181623429"},"schema_version":"1.0"},"canonical_sha256":"4914391efce4d3183556a4f606fa22edc6d82f8fb8b180cfbfa8bdf101f03435","receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:01:42.093843Z","signature_b64":"vFpXeA5Mueg6Mncncx2dyJzh810P5jmyHSuPr7Ks0kcWBVyqLr+/WKlg/24nztlnIi7woeC3RS4gF14LsI74Dw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"4914391efce4d3183556a4f606fa22edc6d82f8fb8b180cfbfa8bdf101f03435","last_reissued_at":"2026-07-05T11:01:42.093408Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:01:42.093408Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"source_kind":"arxiv","source_id":"2505.07062","source_version":1,"attestation_state":"computed"},"signer":{"signer_id":"pith.science","signer_type":"pith_registry","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"created_at":"2026-07-05T11:01:42Z","supersedes":[],"prev_event":null,"signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"3GBdQcQGA+kpSbc03BQmczVe6uqK+XgqgOEdEVAJdlJOSP3LWOoNqgbcppbihXhr00QQvnM4Gb4LJ1bJ3T8vCg==","signed_message":"open_graph_event_sha256_bytes","signed_at":"2026-08-15T18:58:57.592162Z"},"content_sha256":"f77e909aa059f785453f84b5554ec88d40d6437331690a75cc8c9eb3c7439166","schema_version":"1.0","event_id":"sha256:f77e909aa059f785453f84b5554ec88d40d6437331690a75cc8c9eb3c7439166"},{"event_type":"graph_snapshot","subject_pith_number":"pith:2025:JEKDSHX44TJRQNKWUT3AN6RC5X","target":"graph","payload":{"graph_snapshot":{"paper":{"title":"Seed1.5-VL Technical Report","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"A vision-language model pairs a 532 million parameter encoder with a 20 billion active parameter mixture-of-experts language model to reach state-of-the-art results on 38 of 60 benchmarks.","cross_cats":["cs.AI"],"primary_cat":"cs.CV","authors_text":"Aoxue Zhang, Bairen Yi, Bencheng Liao, Can Huang, Can Zhang, Chaorui Deng, Chaoyi Deng, Chenggang Li, Cheng Lin, Cheng Yuan, Chengzhi Wei, Chenhui Gou, Chenwei Lou, Chundian Liu, Chunyuan Li, Deyao Zhu, Dong Guo, Donghong Zhong, Faming Wu, Feida Zhu, Feng Li, Feng Zhang, Fuxing Leng, Gang Wu, Guang Shi, Guodong Li, Guohong Xiao, Haibin Lin, Haihua Yang, Haobin Chen, Haoming Wang, Haoqi Fan, Heng Ji, Hongxiang Hao, Hui Shen, Huixia Li, Jiahao Li, Jialong Wu, Jianhua Zhu, Jianhui Duan, Jianpeng Jiao, Jian Wang, Jianyu Jiang, Jiashi Feng, Jiawei Wang, Jiaze Chen, Jihao Liu, Jingjia Huang, Jingji Chen, Jingqun Tang, Jingyu Sun, Jin Zeng, Joya Chen, Junda Feng, Junfeng Zhan, Junjie Fang, Jun Long, Junting Lu, Kai Hua, Kai Liu, Kai Shen, Kaiyuan Zhang, Kang Lei, Ke Shen, Ke Wang, Keyu Pan, Kunchang Li, Kun Zhang, Lanxin Li, Lei Li, Lei Shi, Liangqiang Chen, Liang Xiang, Li Han, Lin Chen, Lin Li, Lin Yan, Liping Yuan, Lishu Luo, Liying Chi, Longxiang Liu, Mengfei Du, Mingxuan Wang, Ningxin Pan, Peibin Chen, Pengfei Chen, Pengfei Liu, Pengfei Wu, Qinghao Ye, Qingqing Yuan, Qingyao Shuai, Qiuyan Tao, Renjie Zheng, Renrui Zhang, Rui Qian, Rui Wang, Rui Yang, Rui Zhao, Ru Zhang, Shaoqiang Xu, Shen Yan, Shihao Liang, Shipeng Yan, Shixiong Zhao, Shuai Peng, Shuaishuai Cao, Shuangye Li, Shuangzhi Wu, Shufan Liu, Shuhan Chang, Shu Zhong, Sihang Yuan, Sijin Wu, Songhua Cai, Tenglong Ao, Tianhao Yang, Tianheng Cheng, Tingting Zhang, Wanjun Zhong, Weihao Yu, Wei Jia, Weiwei Liu, Wei Weng, Wenhao Huang, Wenjia Zhu, Wenli Yang, Wenqian Wang, Wenzhi Wang, Xiang Long, XiangRui Yin, Xianhan Zeng, Xiaobo Qin, Xiaohan Ding, Xiaojun Xiao, Xiaolei Zhu, Xiao Li, Xiao Liu, Xiaoying Jia, Xiaoying Zhang, Xijin Zhang, Xinchen Zhang, Xin Liu, Xinyu Yang, Xiongcai Luo, Xiuli Chen, Xuantong Zhong, Xuanwei Zhang, Xuefeng Xiao, Xuehan Xiong, Xujing Li, Yanghua Peng, Yangrui Chen, Yanwei Li, Yan Wu, Yanxu Hu, Yawei Wen, Yifan Du, Yihao Zhang, Yi Lin, Yining Ye, Yiyuan Hu, Yiyuan Zhang, Yonghui Wu, Youbin Wu, Yudong Liu, Yue Ling, Yufeng Yuan, Yufeng Zhou, Yuhang Xu, Yuhong Yang, Yujia Qin, Yu Li, Yu Liu, Yunhao Fang, Yuntao Li, Yun Zhang, Yurui Ren, Yuwen Xiong, Yu Yue, Zanbo Wang, Zehua Hong, Zehua Wang, Zewei Sun, Zeyu Wang, Zhao Cai, Zhaoyue Zha, Zhecheng An, Zhehui Zhao, Zhengzhuo Xu, Zhipeng Chen, Zhiwu He, Zhiyong Wu, Zhuofan Zheng, Zihao Wang, Zilong Huang, Ziyu Zhu, Zuquan Song","submitted_at":"2025-05-11T17:28:30Z","abstract_excerpt":"We present Seed1.5-VL, a vision-language foundation model designed to advance general-purpose multimodal understanding and reasoning. Seed1.5-VL is composed with a 532M-parameter vision encoder and a Mixture-of-Experts (MoE) LLM of 20B active parameters. Despite its relatively compact architecture, it delivers strong performance across a wide spectrum of public VLM benchmarks and internal evaluation suites, achieving the state-of-the-art performance on 38 out of 60 public benchmarks. Moreover, in agent-centric tasks such as GUI control and gameplay, Seed1.5-VL outperforms leading multimodal sy"},"claims":{"count":4,"items":[{"kind":"strongest_claim","text":"achieving the state-of-the-art performance on 38 out of 60 public benchmarks. Moreover, in agent-centric tasks such as GUI control and gameplay, Seed1.5-VL outperforms leading multimodal systems, including OpenAI CUA and Claude 3.7.","source":"verdict.strongest_claim","status":"machine_extracted","claim_id":"C1","attestation":"unclaimed"},{"kind":"weakest_assumption","text":"That the chosen public benchmarks and internal suites measure genuine generalization rather than overfitting or data contamination from training data that overlaps with test sets.","source":"verdict.weakest_assumption","status":"machine_extracted","claim_id":"C2","attestation":"unclaimed"},{"kind":"one_line_summary","text":"Seed1.5-VL is a compact multimodal model that sets new records on dozens of vision-language benchmarks and outperforms prior systems on agent-style tasks.","source":"verdict.one_line_summary","status":"machine_extracted","claim_id":"C3","attestation":"unclaimed"},{"kind":"headline","text":"A vision-language model pairs a 532 million parameter encoder with a 20 billion active parameter mixture-of-experts language model to reach state-of-the-art results on 38 of 60 benchmarks.","source":"verdict.pith_extraction.headline","status":"machine_extracted","claim_id":"C4","attestation":"unclaimed"}],"snapshot_sha256":"851c5151d454e574bc2bc3d1e7ac463b4f4eac504aa4c355cccd744b17246727"},"source":{"id":"2505.07062","kind":"arxiv","version":1},"verdict":{"id":"a41f14ef-5c1f-4d8b-9a1d-8dfa6834039c","model_set":{"reader":"grok-4.3"},"created_at":"2026-05-11T05:21:59.657929Z","strongest_claim":"achieving the state-of-the-art performance on 38 out of 60 public benchmarks. Moreover, in agent-centric tasks such as GUI control and gameplay, Seed1.5-VL outperforms leading multimodal systems, including OpenAI CUA and Claude 3.7.","one_line_summary":"Seed1.5-VL is a compact multimodal model that sets new records on dozens of vision-language benchmarks and outperforms prior systems on agent-style tasks.","pipeline_version":"pith-pipeline@v0.9.0","weakest_assumption":"That the chosen public benchmarks and internal suites measure genuine generalization rather than overfitting or data contamination from training data that overlaps with test sets.","pith_extraction_headline":"A vision-language model pairs a 532 million parameter encoder with a 20 billion active parameter mixture-of-experts language model to reach state-of-the-art results on 38 of 60 benchmarks."},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2505.07062/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":208,"sample":[{"doi":"","year":2023,"title":"Fuyu-8b: A multimodal architecture for ai agents.https://www.adept.ai/blog/fuyu-8b, 2023","work_id":"144c2429-6010-4261-98eb-f2645e8a7c89","ref_index":1,"cited_arxiv_id":"","is_internal_anchor":false},{"doi":"","year":2024,"title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","work_id":"feef9556-a016-493c-abd2-0c97a23a7ebf","ref_index":2,"cited_arxiv_id":"2404.14219","is_internal_anchor":true},{"doi":"","year":2024,"title":"Countgd: Multi-modal open-world counting.Advances in Neural Information Processing Systems, 37:48810–48837","work_id":"0f8b00ac-7dc3-4d74-8956-c62ad1e7ecf7","ref_index":3,"cited_arxiv_id":"","is_internal_anchor":false},{"doi":"","year":2024,"title":"arXiv preprint arXiv:2407.02477 , year=","work_id":"e5f87824-1df3-4fd0-8461-241f137fcb96","ref_index":4,"cited_arxiv_id":"","is_internal_anchor":false},{"doi":"","year":2025,"title":"Claude 3.7 sonnet system card","work_id":"c03ad2ab-948d-4485-b8e1-c1f09252a581","ref_index":5,"cited_arxiv_id":"","is_internal_anchor":false}],"resolved_work":208,"snapshot_sha256":"8a194c47e477f1ab342fdd8adaa09180e143e5d3dcdfaee9bc43dfa80177b3e1","internal_anchors":53},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"verdict_id":"a41f14ef-5c1f-4d8b-9a1d-8dfa6834039c"},"signer":{"signer_id":"pith.science","signer_type":"pith_registry","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"created_at":"2026-07-05T11:01:42Z","supersedes":[],"prev_event":null,"signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"Nw+Vd/d9WUhTh0AO86wNJIqxpQAw19J+bk0dm/DJJ2fzPE8LxIo4kd0cGupMA/YYigv/kChUZyXo+/L1Nu0TDw==","signed_message":"open_graph_event_sha256_bytes","signed_at":"2026-08-15T18:58:57.593120Z"},"content_sha256":"6ea69b1d3ac34403d67e04adffbb7e891fa33e7455baa430a9ca5a33b8487b8e","schema_version":"1.0","event_id":"sha256:6ea69b1d3ac34403d67e04adffbb7e891fa33e7455baa430a9ca5a33b8487b8e"}],"timestamp_proofs":[],"mirror_hints":[{"mirror_type":"https","name":"Pith Resolver","base_url":"https://pith.science","bundle_url":"https://pith.science/pith/JEKDSHX44TJRQNKWUT3AN6RC5X/bundle.json","state_url":"https://pith.science/pith/JEKDSHX44TJRQNKWUT3AN6RC5X/state.json","well_known_bundle_url":"https://pith.science/.well-known/pith/JEKDSHX44TJRQNKWUT3AN6RC5X/bundle.json","status":"primary"}],"public_keys":[{"key_id":"pith-v1-2026-05","algorithm":"ed25519","format":"raw","public_key_b64":"stVStoiQhXFxp4s2pdzPNoqVNBMojDU/fJ2db5S3CbM=","public_key_hex":"b2d552b68890857171a78b36a5dccf368a953413288c353f7c9d9d6f94b709b3","fingerprint_sha256_b32_first128bits":"RVFV5Z2OI2J3ZUO7ERDEBCYNKS","fingerprint_sha256_hex":"8d4b5ee74e4693bcd1df2446408b0d54","rotates_at":null,"url":"https://pith.science/pith-signing-key.json","notes":"Pith uses this Ed25519 key to sign canonical record SHA-256 digests. Verify with: ed25519_verify(public_key, message=canonical_sha256_bytes, signature=base64decode(signature_b64))."}],"merge_version":"pith-open-graph-merge-v1","built_at":"2026-08-15T18:58:57Z","links":{"resolver":"https://pith.science/pith/JEKDSHX44TJRQNKWUT3AN6RC5X","bundle":"https://pith.science/pith/JEKDSHX44TJRQNKWUT3AN6RC5X/bundle.json","state":"https://pith.science/pith/JEKDSHX44TJRQNKWUT3AN6RC5X/state.json","well_known_bundle":"https://pith.science/.well-known/pith/JEKDSHX44TJRQNKWUT3AN6RC5X/bundle.json"},"state":{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2025:JEKDSHX44TJRQNKWUT3AN6RC5X","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"2e07866c30f89f0177f53a947c73ac3b33c891f4f0d4528868df401181623429","cross_cats_sorted":["cs.AI"],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2025-05-11T17:28:30Z","title_canon_sha256":"a307c51392425b701eb724935804e8d707c71e7a370e0c690afe66b5436d56a1"},"schema_version":"1.0","source":{"id":"2505.07062","kind":"arxiv","version":1}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2505.07062","created_at":"2026-07-05T11:01:42Z"},{"alias_kind":"arxiv_version","alias_value":"2505.07062v1","created_at":"2026-07-05T11:01:42Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2505.07062","created_at":"2026-07-05T11:01:42Z"},{"alias_kind":"pith_short_12","alias_value":"JEKDSHX44TJR","created_at":"2026-07-05T11:01:42Z"},{"alias_kind":"pith_short_16","alias_value":"JEKDSHX44TJRQNKW","created_at":"2026-07-05T11:01:42Z"},{"alias_kind":"pith_short_8","alias_value":"JEKDSHX4","created_at":"2026-07-05T11:01:42Z"}],"graph_snapshots":[{"event_id":"sha256:6ea69b1d3ac34403d67e04adffbb7e891fa33e7455baa430a9ca5a33b8487b8e","target":"graph","created_at":"2026-07-05T11:01:42Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":4,"items":[{"attestation":"unclaimed","claim_id":"C1","kind":"strongest_claim","source":"verdict.strongest_claim","status":"machine_extracted","text":"achieving the state-of-the-art performance on 38 out of 60 public benchmarks. Moreover, in agent-centric tasks such as GUI control and gameplay, Seed1.5-VL outperforms leading multimodal systems, including OpenAI CUA and Claude 3.7."},{"attestation":"unclaimed","claim_id":"C2","kind":"weakest_assumption","source":"verdict.weakest_assumption","status":"machine_extracted","text":"That the chosen public benchmarks and internal suites measure genuine generalization rather than overfitting or data contamination from training data that overlaps with test sets."},{"attestation":"unclaimed","claim_id":"C3","kind":"one_line_summary","source":"verdict.one_line_summary","status":"machine_extracted","text":"Seed1.5-VL is a compact multimodal model that sets new records on dozens of vision-language benchmarks and outperforms prior systems on agent-style tasks."},{"attestation":"unclaimed","claim_id":"C4","kind":"headline","source":"verdict.pith_extraction.headline","status":"machine_extracted","text":"A vision-language model pairs a 532 million parameter encoder with a 20 billion active parameter mixture-of-experts language model to reach state-of-the-art results on 38 of 60 benchmarks."}],"snapshot_sha256":"851c5151d454e574bc2bc3d1e7ac463b4f4eac504aa4c355cccd744b17246727"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/2505.07062/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"We present Seed1.5-VL, a vision-language foundation model designed to advance general-purpose multimodal understanding and reasoning. Seed1.5-VL is composed with a 532M-parameter vision encoder and a Mixture-of-Experts (MoE) LLM of 20B active parameters. Despite its relatively compact architecture, it delivers strong performance across a wide spectrum of public VLM benchmarks and internal evaluation suites, achieving the state-of-the-art performance on 38 out of 60 public benchmarks. Moreover, in agent-centric tasks such as GUI control and gameplay, Seed1.5-VL outperforms leading multimodal sy","authors_text":"Aoxue Zhang, Bairen Yi, Bencheng Liao, Can Huang, Can Zhang, Chaorui Deng, Chaoyi Deng, Chenggang Li, Cheng Lin, Cheng Yuan, Chengzhi Wei, Chenhui Gou, Chenwei Lou, Chundian Liu, Chunyuan Li, Deyao Zhu, Dong Guo, Donghong Zhong, Faming Wu, Feida Zhu, Feng Li, Feng Zhang, Fuxing Leng, Gang Wu, Guang Shi, Guodong Li, Guohong Xiao, Haibin Lin, Haihua Yang, Haobin Chen, Haoming Wang, Haoqi Fan, Heng Ji, Hongxiang Hao, Hui Shen, Huixia Li, Jiahao Li, Jialong Wu, Jianhua Zhu, Jianhui Duan, Jianpeng Jiao, Jian Wang, Jianyu Jiang, Jiashi Feng, Jiawei Wang, Jiaze Chen, Jihao Liu, Jingjia Huang, Jingji Chen, Jingqun Tang, Jingyu Sun, Jin Zeng, Joya Chen, Junda Feng, Junfeng Zhan, Junjie Fang, Jun Long, Junting Lu, Kai Hua, Kai Liu, Kai Shen, Kaiyuan Zhang, Kang Lei, Ke Shen, Ke Wang, Keyu Pan, Kunchang Li, Kun Zhang, Lanxin Li, Lei Li, Lei Shi, Liangqiang Chen, Liang Xiang, Li Han, Lin Chen, Lin Li, Lin Yan, Liping Yuan, Lishu Luo, Liying Chi, Longxiang Liu, Mengfei Du, Mingxuan Wang, Ningxin Pan, Peibin Chen, Pengfei Chen, Pengfei Liu, Pengfei Wu, Qinghao Ye, Qingqing Yuan, Qingyao Shuai, Qiuyan Tao, Renjie Zheng, Renrui Zhang, Rui Qian, Rui Wang, Rui Yang, Rui Zhao, Ru Zhang, Shaoqiang Xu, Shen Yan, Shihao Liang, Shipeng Yan, Shixiong Zhao, Shuai Peng, Shuaishuai Cao, Shuangye Li, Shuangzhi Wu, Shufan Liu, Shuhan Chang, Shu Zhong, Sihang Yuan, Sijin Wu, Songhua Cai, Tenglong Ao, Tianhao Yang, Tianheng Cheng, Tingting Zhang, Wanjun Zhong, Weihao Yu, Wei Jia, Weiwei Liu, Wei Weng, Wenhao Huang, Wenjia Zhu, Wenli Yang, Wenqian Wang, Wenzhi Wang, Xiang Long, XiangRui Yin, Xianhan Zeng, Xiaobo Qin, Xiaohan Ding, Xiaojun Xiao, Xiaolei Zhu, Xiao Li, Xiao Liu, Xiaoying Jia, Xiaoying Zhang, Xijin Zhang, Xinchen Zhang, Xin Liu, Xinyu Yang, Xiongcai Luo, Xiuli Chen, Xuantong Zhong, Xuanwei Zhang, Xuefeng Xiao, Xuehan Xiong, Xujing Li, Yanghua Peng, Yangrui Chen, Yanwei Li, Yan Wu, Yanxu Hu, Yawei Wen, Yifan Du, Yihao Zhang, Yi Lin, Yining Ye, Yiyuan Hu, Yiyuan Zhang, Yonghui Wu, Youbin Wu, Yudong Liu, Yue Ling, Yufeng Yuan, Yufeng Zhou, Yuhang Xu, Yuhong Yang, Yujia Qin, Yu Li, Yu Liu, Yunhao Fang, Yuntao Li, Yun Zhang, Yurui Ren, Yuwen Xiong, Yu Yue, Zanbo Wang, Zehua Hong, Zehua Wang, Zewei Sun, Zeyu Wang, Zhao Cai, Zhaoyue Zha, Zhecheng An, Zhehui Zhao, Zhengzhuo Xu, Zhipeng Chen, Zhiwu He, Zhiyong Wu, Zhuofan Zheng, Zihao Wang, Zilong Huang, Ziyu Zhu, Zuquan Song","cross_cats":["cs.AI"],"headline":"A vision-language model pairs a 532 million parameter encoder with a 20 billion active parameter mixture-of-experts language model to reach state-of-the-art results on 38 of 60 benchmarks.","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report"},"references":{"count":208,"internal_anchors":53,"resolved_work":208,"sample":[{"cited_arxiv_id":"","doi":"","is_internal_anchor":false,"ref_index":1,"title":"Fuyu-8b: A multimodal architecture for ai agents.https://www.adept.ai/blog/fuyu-8b, 2023","work_id":"144c2429-6010-4261-98eb-f2645e8a7c89","year":2023},{"cited_arxiv_id":"2404.14219","doi":"","is_internal_anchor":true,"ref_index":2,"title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","work_id":"feef9556-a016-493c-abd2-0c97a23a7ebf","year":2024},{"cited_arxiv_id":"","doi":"","is_internal_anchor":false,"ref_index":3,"title":"Countgd: Multi-modal open-world counting.Advances in Neural Information Processing Systems, 37:48810–48837","work_id":"0f8b00ac-7dc3-4d74-8956-c62ad1e7ecf7","year":2024},{"cited_arxiv_id":"","doi":"","is_internal_anchor":false,"ref_index":4,"title":"arXiv preprint arXiv:2407.02477 , year=","work_id":"e5f87824-1df3-4fd0-8461-241f137fcb96","year":2024},{"cited_arxiv_id":"","doi":"","is_internal_anchor":false,"ref_index":5,"title":"Claude 3.7 sonnet system card","work_id":"c03ad2ab-948d-4485-b8e1-c1f09252a581","year":2025}],"snapshot_sha256":"8a194c47e477f1ab342fdd8adaa09180e143e5d3dcdfaee9bc43dfa80177b3e1"},"source":{"id":"2505.07062","kind":"arxiv","version":1},"verdict":{"created_at":"2026-05-11T05:21:59.657929Z","id":"a41f14ef-5c1f-4d8b-9a1d-8dfa6834039c","model_set":{"reader":"grok-4.3"},"one_line_summary":"Seed1.5-VL is a compact multimodal model that sets new records on dozens of vision-language benchmarks and outperforms prior systems on agent-style tasks.","pipeline_version":"pith-pipeline@v0.9.0","pith_extraction_headline":"A vision-language model pairs a 532 million parameter encoder with a 20 billion active parameter mixture-of-experts language model to reach state-of-the-art results on 38 of 60 benchmarks.","strongest_claim":"achieving the state-of-the-art performance on 38 out of 60 public benchmarks. Moreover, in agent-centric tasks such as GUI control and gameplay, Seed1.5-VL outperforms leading multimodal systems, including OpenAI CUA and Claude 3.7.","weakest_assumption":"That the chosen public benchmarks and internal suites measure genuine generalization rather than overfitting or data contamination from training data that overlaps with test sets."}},"verdict_id":"a41f14ef-5c1f-4d8b-9a1d-8dfa6834039c"}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:f77e909aa059f785453f84b5554ec88d40d6437331690a75cc8c9eb3c7439166","target":"record","created_at":"2026-07-05T11:01:42Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"2e07866c30f89f0177f53a947c73ac3b33c891f4f0d4528868df401181623429","cross_cats_sorted":["cs.AI"],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2025-05-11T17:28:30Z","title_canon_sha256":"a307c51392425b701eb724935804e8d707c71e7a370e0c690afe66b5436d56a1"},"schema_version":"1.0","source":{"id":"2505.07062","kind":"arxiv","version":1}},"canonical_sha256":"4914391efce4d3183556a4f606fa22edc6d82f8fb8b180cfbfa8bdf101f03435","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"4914391efce4d3183556a4f606fa22edc6d82f8fb8b180cfbfa8bdf101f03435","first_computed_at":"2026-07-05T11:01:42.093408Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-07-05T11:01:42.093408Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"vFpXeA5Mueg6Mncncx2dyJzh810P5jmyHSuPr7Ks0kcWBVyqLr+/WKlg/24nztlnIi7woeC3RS4gF14LsI74Dw==","signature_status":"signed_v1","signed_at":"2026-07-05T11:01:42.093843Z","signed_message":"canonical_sha256_bytes"},"source_id":"2505.07062","source_kind":"arxiv","source_version":1}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:f77e909aa059f785453f84b5554ec88d40d6437331690a75cc8c9eb3c7439166","sha256:6ea69b1d3ac34403d67e04adffbb7e891fa33e7455baa430a9ca5a33b8487b8e"],"state_sha256":"66a7eee6f9dff7af5e4e98e9500e045274f1d0905026a019bf9f12e6735af008"},"bundle_signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"zWf3Bbk/dZEpWvQEp5qFMb2G0u9yqAmUBPOAduCGNVot+WwddJJ2ZSVvbV8txY6FuYdxo6/rRb3RQKF3KFRsBw==","signed_message":"bundle_sha256_bytes","signed_at":"2026-08-15T18:58:57.598573Z","bundle_sha256":"486b54329b0d6c38108b646185abdd5cbad6bb98057db511c1614ca4df8d6388"}}