{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:XLHAIQ4W2PHD4M5UZDNY2I7LDD","short_pith_number":"pith:XLHAIQ4W","schema_version":"1.0","canonical_sha256":"bace044396d3ce3e33b4c8db8d23eb18f58efdc47874cdbacfce1c9c2267a619","source":{"kind":"arxiv","id":"2506.03065","version":1},"attestation_state":"computed","paper":{"title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.LG"],"primary_cat":"cs.CV","authors_text":"Gang Yu, Maosen Zhao, Mingzhu Shen, Pengtao Chen, Peng Ye, Tao Chen, Wei Cheng, Xianfang Zeng","submitted_at":"2025-06-03T16:42:37Z","abstract_excerpt":"While Diffusion Transformers (DiTs) have achieved breakthroughs in video generation, this long sequence generation task remains constrained by the quadratic complexity of attention mechanisms, resulting in significant inference latency. Through detailed analysis of attention maps in Video Diffusion Transformer (vDiT), we identify three recurring sparsity patterns: diagonal, multi-diagonal, and vertical-stripe structures. And even 3-6\\% attention heads can be skipped. Crucially, these patterns exhibit strong layer-depth and head-position correlations but show limited dependence on the input con"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2506.03065","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CV","submitted_at":"2025-06-03T16:42:37Z","cross_cats_sorted":["cs.AI","cs.LG"],"title_canon_sha256":"c56adeb415130a886247bf11feabdadd197e1712a3a31a0b29cc0f07c6b6f80c","abstract_canon_sha256":"93bc996fd861b0d3dc79cb5d4da9d5be823a79fc64d9ef7ff04860efe0ba88a1"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:15:14.275922Z","signature_b64":"BiC3iOfINZLZ1WlvNuhNRrtsnnFUpNRelObYBYbxJKWpbEOSXZ0bDKBr+EMtJwniwg3BFDhFsPgMYsGUjvBCCg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"bace044396d3ce3e33b4c8db8d23eb18f58efdc47874cdbacfce1c9c2267a619","last_reissued_at":"2026-07-05T11:15:14.275432Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:15:14.275432Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Sparse-vDiT: Unleashing the Power of Sparse Attention to Accelerate Video Diffusion Transformers","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.LG"],"primary_cat":"cs.CV","authors_text":"Gang Yu, Maosen Zhao, Mingzhu Shen, Pengtao Chen, Peng Ye, Tao Chen, Wei Cheng, Xianfang Zeng","submitted_at":"2025-06-03T16:42:37Z","abstract_excerpt":"While Diffusion Transformers (DiTs) have achieved breakthroughs in video generation, this long sequence generation task remains constrained by the quadratic complexity of attention mechanisms, resulting in significant inference latency. Through detailed analysis of attention maps in Video Diffusion Transformer (vDiT), we identify three recurring sparsity patterns: diagonal, multi-diagonal, and vertical-stripe structures. And even 3-6\\% attention heads can be skipped. Crucially, these patterns exhibit strong layer-depth and head-position correlations but show limited dependence on the input con"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2506.03065","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2506.03065/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2506.03065","created_at":"2026-07-05T11:15:14.275491+00:00"},{"alias_kind":"arxiv_version","alias_value":"2506.03065v1","created_at":"2026-07-05T11:15:14.275491+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2506.03065","created_at":"2026-07-05T11:15:14.275491+00:00"},{"alias_kind":"pith_short_12","alias_value":"XLHAIQ4W2PHD","created_at":"2026-07-05T11:15:14.275491+00:00"},{"alias_kind":"pith_short_16","alias_value":"XLHAIQ4W2PHD4M5U","created_at":"2026-07-05T11:15:14.275491+00:00"},{"alias_kind":"pith_short_8","alias_value":"XLHAIQ4W","created_at":"2026-07-05T11:15:14.275491+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":7,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.23019","citing_title":"ScalingAttention: Discovering Intrinsic Sparse Attention Topology for Video Diffusion Transformers","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2606.01556","citing_title":"TwinQuant: Learnable Subspace Decomposition for 4-Bit LLM Quantization","ref_index":70,"is_internal_anchor":false},{"citing_arxiv_id":"2606.01399","citing_title":"PAI-Studio: Cinematic Video Background Replacement with Camera-Aware Motion","ref_index":9,"is_internal_anchor":false},{"citing_arxiv_id":"2605.30325","citing_title":"Veda: Scalable Video Diffusion via Distilled Sparse Attention","ref_index":1,"is_internal_anchor":false},{"citing_arxiv_id":"2605.14513","citing_title":"HASTE: Training-Free Video Diffusion Acceleration via Head-Wise Adaptive Sparse Attention","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2604.12219","citing_title":"Ride the Wave: Precision-Allocated Sparse Attention for Smooth Video Generation","ref_index":1,"is_internal_anchor":false},{"citing_arxiv_id":"2604.15911","citing_title":"Efficient Video Diffusion Models: Advancements and Challenges","ref_index":238,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/XLHAIQ4W2PHD4M5UZDNY2I7LDD","json":"https://pith.science/pith/XLHAIQ4W2PHD4M5UZDNY2I7LDD.json","graph_json":"https://pith.science/api/pith-number/XLHAIQ4W2PHD4M5UZDNY2I7LDD/graph.json","events_json":"https://pith.science/api/pith-number/XLHAIQ4W2PHD4M5UZDNY2I7LDD/events.json","paper":"https://pith.science/paper/XLHAIQ4W"},"agent_actions":{"view_html":"https://pith.science/pith/XLHAIQ4W2PHD4M5UZDNY2I7LDD","download_json":"https://pith.science/pith/XLHAIQ4W2PHD4M5UZDNY2I7LDD.json","view_paper":"https://pith.science/paper/XLHAIQ4W","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2506.03065&json=true","fetch_graph":"https://pith.science/api/pith-number/XLHAIQ4W2PHD4M5UZDNY2I7LDD/graph.json","fetch_events":"https://pith.science/api/pith-number/XLHAIQ4W2PHD4M5UZDNY2I7LDD/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/XLHAIQ4W2PHD4M5UZDNY2I7LDD/action/timestamp_anchor","attest_storage":"https://pith.science/pith/XLHAIQ4W2PHD4M5UZDNY2I7LDD/action/storage_attestation","attest_author":"https://pith.science/pith/XLHAIQ4W2PHD4M5UZDNY2I7LDD/action/author_attestation","sign_citation":"https://pith.science/pith/XLHAIQ4W2PHD4M5UZDNY2I7LDD/action/citation_signature","submit_replication":"https://pith.science/pith/XLHAIQ4W2PHD4M5UZDNY2I7LDD/action/replication_record"}},"created_at":"2026-07-05T11:15:14.275491+00:00","updated_at":"2026-07-05T11:15:14.275491+00:00"}