{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:YERRZZUIW4Y2O6D7CUG3H3ZLF4","short_pith_number":"pith:YERRZZUI","schema_version":"1.0","canonical_sha256":"c1231ce688b731a7787f150db3ef2b2f34fdd2bebda9dc79d431ee400a5aa20a","source":{"kind":"arxiv","id":"2501.08453","version":1},"attestation_state":"computed","paper":{"title":"Vchitect-2.0: Parallel Transformer for Scaling Up Video Diffusion Models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.CV","authors_text":"Chenyang Si, Dahua Lin, Dongwei Pan, Hengjie Li, Jingwen He, Junhao Song, Long Zhuo, Peng Gao, Weichen Fan, Xinyuan Chen, Yaohui Wang, Yinan He, Yi Wang, Yuming Jiang, Yu Qiao, Zhenyu Yang, Ziqi Huang, Ziwei Liu, Ziyue Dong","submitted_at":"2025-01-14T21:53:11Z","abstract_excerpt":"We present Vchitect-2.0, a parallel transformer architecture designed to scale up video diffusion models for large-scale text-to-video generation. The overall Vchitect-2.0 system has several key designs. (1) By introducing a novel Multimodal Diffusion Block, our approach achieves consistent alignment between text descriptions and generated video frames, while maintaining temporal coherence across sequences. (2) To overcome memory and computational bottlenecks, we propose a Memory-efficient Training framework that incorporates hybrid parallelism and other memory reduction techniques, enabling e"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2501.08453","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2025-01-14T21:53:11Z","cross_cats_sorted":["cs.LG"],"title_canon_sha256":"e2f9b866975d3734123e6dac3881037a9863ffea31b0617a67666ea6d0711d28","abstract_canon_sha256":"a60848b7ee86af31aec121c375ce0d35ba3d5558a5017dc56568c8a3cf4d62e3"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:01:02.814021Z","signature_b64":"9wrxWlhdT+EXQNEI4ieKU5kXZ6/QFs+OHlk9zwuxG6o/i/1dWfISfx3Ixws/h3GRvtY+yvqcTZd4nMVlFg+ACQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"c1231ce688b731a7787f150db3ef2b2f34fdd2bebda9dc79d431ee400a5aa20a","last_reissued_at":"2026-07-05T10:01:02.813559Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:01:02.813559Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Vchitect-2.0: Parallel Transformer for Scaling Up Video Diffusion Models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.CV","authors_text":"Chenyang Si, Dahua Lin, Dongwei Pan, Hengjie Li, Jingwen He, Junhao Song, Long Zhuo, Peng Gao, Weichen Fan, Xinyuan Chen, Yaohui Wang, Yinan He, Yi Wang, Yuming Jiang, Yu Qiao, Zhenyu Yang, Ziqi Huang, Ziwei Liu, Ziyue Dong","submitted_at":"2025-01-14T21:53:11Z","abstract_excerpt":"We present Vchitect-2.0, a parallel transformer architecture designed to scale up video diffusion models for large-scale text-to-video generation. The overall Vchitect-2.0 system has several key designs. (1) By introducing a novel Multimodal Diffusion Block, our approach achieves consistent alignment between text descriptions and generated video frames, while maintaining temporal coherence across sequences. (2) To overcome memory and computational bottlenecks, we propose a Memory-efficient Training framework that incorporates hybrid parallelism and other memory reduction techniques, enabling e"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2501.08453","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2501.08453/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2501.08453","created_at":"2026-07-05T10:01:02.813626+00:00"},{"alias_kind":"arxiv_version","alias_value":"2501.08453v1","created_at":"2026-07-05T10:01:02.813626+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2501.08453","created_at":"2026-07-05T10:01:02.813626+00:00"},{"alias_kind":"pith_short_12","alias_value":"YERRZZUIW4Y2","created_at":"2026-07-05T10:01:02.813626+00:00"},{"alias_kind":"pith_short_16","alias_value":"YERRZZUIW4Y2O6D7","created_at":"2026-07-05T10:01:02.813626+00:00"},{"alias_kind":"pith_short_8","alias_value":"YERRZZUI","created_at":"2026-07-05T10:01:02.813626+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":9,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.26916","citing_title":"PhysRAG: Enhancing Physics-Awareness in Video Generation via Retrieval-Augmented Generation","ref_index":19,"is_internal_anchor":false},{"citing_arxiv_id":"2607.01701","citing_title":"Arachne: Orchestrating Cascades for Efficient Text-to-Video Model Training","ref_index":10,"is_internal_anchor":false},{"citing_arxiv_id":"2606.09828","citing_title":"Latent Spatial Memory for Video World Models","ref_index":36,"is_internal_anchor":false},{"citing_arxiv_id":"2605.25801","citing_title":"PixelWizard: Towards Efficient High-Fidelity Video Generation at Ultra-Large Spatial Resolution","ref_index":47,"is_internal_anchor":false},{"citing_arxiv_id":"2605.18736","citing_title":"Spectral Progressive Diffusion for Efficient Image and Video Generation","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2605.18736","citing_title":"Spectral Progressive Diffusion for Efficient Image and Video Generation","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2509.24702","citing_title":"Enhancing Physical Plausibility in Video Generation by Reasoning the Implausibility","ref_index":9,"is_internal_anchor":false},{"citing_arxiv_id":"2503.21755","citing_title":"VBench-2.0: Advancing Video Generation Benchmark Suite for Intrinsic Faithfulness","ref_index":64,"is_internal_anchor":false},{"citing_arxiv_id":"2604.19473","citing_title":"TS-Attn: Temporal-wise Separable Attention for Multi-Event Video Generation","ref_index":5,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/YERRZZUIW4Y2O6D7CUG3H3ZLF4","json":"https://pith.science/pith/YERRZZUIW4Y2O6D7CUG3H3ZLF4.json","graph_json":"https://pith.science/api/pith-number/YERRZZUIW4Y2O6D7CUG3H3ZLF4/graph.json","events_json":"https://pith.science/api/pith-number/YERRZZUIW4Y2O6D7CUG3H3ZLF4/events.json","paper":"https://pith.science/paper/YERRZZUI"},"agent_actions":{"view_html":"https://pith.science/pith/YERRZZUIW4Y2O6D7CUG3H3ZLF4","download_json":"https://pith.science/pith/YERRZZUIW4Y2O6D7CUG3H3ZLF4.json","view_paper":"https://pith.science/paper/YERRZZUI","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2501.08453&json=true","fetch_graph":"https://pith.science/api/pith-number/YERRZZUIW4Y2O6D7CUG3H3ZLF4/graph.json","fetch_events":"https://pith.science/api/pith-number/YERRZZUIW4Y2O6D7CUG3H3ZLF4/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/YERRZZUIW4Y2O6D7CUG3H3ZLF4/action/timestamp_anchor","attest_storage":"https://pith.science/pith/YERRZZUIW4Y2O6D7CUG3H3ZLF4/action/storage_attestation","attest_author":"https://pith.science/pith/YERRZZUIW4Y2O6D7CUG3H3ZLF4/action/author_attestation","sign_citation":"https://pith.science/pith/YERRZZUIW4Y2O6D7CUG3H3ZLF4/action/citation_signature","submit_replication":"https://pith.science/pith/YERRZZUIW4Y2O6D7CUG3H3ZLF4/action/replication_record"}},"created_at":"2026-07-05T10:01:02.813626+00:00","updated_at":"2026-07-05T10:01:02.813626+00:00"}