{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:3VI2VK7W4ZXCBMTGIFMWWZNKV6","short_pith_number":"pith:3VI2VK7W","schema_version":"1.0","canonical_sha256":"dd51aaabf6e66e20b26641596b65aaafac6fd9cf0da0991290feecd7ab113fa1","source":{"kind":"arxiv","id":"2305.13077","version":1},"attestation_state":"computed","paper":{"title":"ControlVideo: Training-free Controllable Text-to-Video Generation","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Dongsheng Jiang, Qi Tian, Wangmeng Zuo, Xiaopeng Zhang, Yabo Zhang, Yuxiang Wei","submitted_at":"2023-05-22T14:48:53Z","abstract_excerpt":"Text-driven diffusion models have unlocked unprecedented abilities in image generation, whereas their video counterpart still lags behind due to the excessive training cost of temporal modeling. Besides the training burden, the generated videos also suffer from appearance inconsistency and structural flickers, especially in long video synthesis. To address these challenges, we design a \\emph{training-free} framework called \\textbf{ControlVideo} to enable natural and efficient text-to-video generation. ControlVideo, adapted from ControlNet, leverages coarsely structural consistency from input m"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2305.13077","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CV","submitted_at":"2023-05-22T14:48:53Z","cross_cats_sorted":[],"title_canon_sha256":"b76e1385c9196927b447f574ae9dbdaa4be884bdc2cbda7cf5c3b56a18a2d3bf","abstract_canon_sha256":"4b90a8fa7de07340c0079dd87a98eab67b0110514b82a5269674045f6b5d8c05"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T06:12:26.244448Z","signature_b64":"zUzR46Om9EmUsh/hAkQbJNOR9C9kiOxH9WLbJ9l7RxlXP1agDoEGXWYu/PLJGPxeHQ738eMYudzHdPkOkuD5Dg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"dd51aaabf6e66e20b26641596b65aaafac6fd9cf0da0991290feecd7ab113fa1","last_reissued_at":"2026-07-05T06:12:26.243967Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T06:12:26.243967Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"ControlVideo: Training-free Controllable Text-to-Video Generation","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Dongsheng Jiang, Qi Tian, Wangmeng Zuo, Xiaopeng Zhang, Yabo Zhang, Yuxiang Wei","submitted_at":"2023-05-22T14:48:53Z","abstract_excerpt":"Text-driven diffusion models have unlocked unprecedented abilities in image generation, whereas their video counterpart still lags behind due to the excessive training cost of temporal modeling. Besides the training burden, the generated videos also suffer from appearance inconsistency and structural flickers, especially in long video synthesis. To address these challenges, we design a \\emph{training-free} framework called \\textbf{ControlVideo} to enable natural and efficient text-to-video generation. ControlVideo, adapted from ControlNet, leverages coarsely structural consistency from input m"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2305.13077","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2305.13077/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2305.13077","created_at":"2026-07-05T06:12:26.244027+00:00"},{"alias_kind":"arxiv_version","alias_value":"2305.13077v1","created_at":"2026-07-05T06:12:26.244027+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2305.13077","created_at":"2026-07-05T06:12:26.244027+00:00"},{"alias_kind":"pith_short_12","alias_value":"3VI2VK7W4ZXC","created_at":"2026-07-05T06:12:26.244027+00:00"},{"alias_kind":"pith_short_16","alias_value":"3VI2VK7W4ZXCBMTG","created_at":"2026-07-05T06:12:26.244027+00:00"},{"alias_kind":"pith_short_8","alias_value":"3VI2VK7W","created_at":"2026-07-05T06:12:26.244027+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":16,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.24636","citing_title":"CineCap: Structured Reasoning with Spatio-Temporal Anchors for Cinematographic Video Captioning","ref_index":53,"is_internal_anchor":false},{"citing_arxiv_id":"2606.22042","citing_title":"IDAG-Edit: Multi-Object Video Editing via Instance-Decoupled Attention and Guidance","ref_index":9,"is_internal_anchor":false},{"citing_arxiv_id":"2606.19676","citing_title":"TeleMorpher: Toward Robust Simultaneous Motion-Location Editing","ref_index":38,"is_internal_anchor":false},{"citing_arxiv_id":"2607.02517","citing_title":"WorldDirector: Building Controllable World Simulators with Persistent Dynamic Memory","ref_index":52,"is_internal_anchor":false},{"citing_arxiv_id":"2605.25266","citing_title":"DeltaCam: Differential Intrinsic Camera Modeling for Video Generation","ref_index":44,"is_internal_anchor":false},{"citing_arxiv_id":"2606.27964","citing_title":"Directing the World: Fast Autoregressive Video Generation with Compositional Human-Camera Control","ref_index":24,"is_internal_anchor":false},{"citing_arxiv_id":"2411.15115","citing_title":"Self-Correcting Text-to-Video Generation with Misalignment Detection and Localized Refinement","ref_index":59,"is_internal_anchor":false},{"citing_arxiv_id":"2503.06310","citing_title":"Scene-Action Prompt Fusion for Coherent Text-to-Video Storytelling","ref_index":43,"is_internal_anchor":false},{"citing_arxiv_id":"2504.18576","citing_title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","ref_index":75,"is_internal_anchor":false},{"citing_arxiv_id":"2505.16819","citing_title":"Character-Centered Dialogue Generation from Scene-Level Prompts","ref_index":70,"is_internal_anchor":false},{"citing_arxiv_id":"2605.18010","citing_title":"Functionalization via Structure Completion and Motion Rectification","ref_index":248,"is_internal_anchor":false},{"citing_arxiv_id":"2310.19512","citing_title":"VideoCrafter1: Open Diffusion Models for High-Quality Video Generation","ref_index":61,"is_internal_anchor":false},{"citing_arxiv_id":"2404.02101","citing_title":"CameraCtrl: Enabling Camera Control for Text-to-Video Generation","ref_index":168,"is_internal_anchor":false},{"citing_arxiv_id":"2604.22586","citing_title":"FlowAnchor: Stabilizing the Editing Signal for Inversion-Free Video Editing","ref_index":39,"is_internal_anchor":false},{"citing_arxiv_id":"2605.01720","citing_title":"SignVerse-2M: A Two-Million-Clip Pose-Native Universe of 55+ Sign Languages","ref_index":21,"is_internal_anchor":false},{"citing_arxiv_id":"2604.15911","citing_title":"Efficient Video Diffusion Models: Advancements and Challenges","ref_index":190,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/3VI2VK7W4ZXCBMTGIFMWWZNKV6","json":"https://pith.science/pith/3VI2VK7W4ZXCBMTGIFMWWZNKV6.json","graph_json":"https://pith.science/api/pith-number/3VI2VK7W4ZXCBMTGIFMWWZNKV6/graph.json","events_json":"https://pith.science/api/pith-number/3VI2VK7W4ZXCBMTGIFMWWZNKV6/events.json","paper":"https://pith.science/paper/3VI2VK7W"},"agent_actions":{"view_html":"https://pith.science/pith/3VI2VK7W4ZXCBMTGIFMWWZNKV6","download_json":"https://pith.science/pith/3VI2VK7W4ZXCBMTGIFMWWZNKV6.json","view_paper":"https://pith.science/paper/3VI2VK7W","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2305.13077&json=true","fetch_graph":"https://pith.science/api/pith-number/3VI2VK7W4ZXCBMTGIFMWWZNKV6/graph.json","fetch_events":"https://pith.science/api/pith-number/3VI2VK7W4ZXCBMTGIFMWWZNKV6/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/3VI2VK7W4ZXCBMTGIFMWWZNKV6/action/timestamp_anchor","attest_storage":"https://pith.science/pith/3VI2VK7W4ZXCBMTGIFMWWZNKV6/action/storage_attestation","attest_author":"https://pith.science/pith/3VI2VK7W4ZXCBMTGIFMWWZNKV6/action/author_attestation","sign_citation":"https://pith.science/pith/3VI2VK7W4ZXCBMTGIFMWWZNKV6/action/citation_signature","submit_replication":"https://pith.science/pith/3VI2VK7W4ZXCBMTGIFMWWZNKV6/action/replication_record"}},"created_at":"2026-07-05T06:12:26.244027+00:00","updated_at":"2026-07-05T06:12:26.244027+00:00"}