{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:M6CAAPZCLEB4PU2PMT7GFYNXKC","short_pith_number":"pith:M6CAAPZC","schema_version":"1.0","canonical_sha256":"6784003f225903c7d34f64fe62e1b750894db04c40d8ffff129a7e2307bfadce","source":{"kind":"arxiv","id":"2305.13840","version":3},"attestation_state":"computed","paper":{"title":"Control-A-Video: Controllable Text-to-Video Diffusion Models with Motion Prior and Reward Feedback Learning","license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","headline":"","cross_cats":["cs.AI","cs.LG","cs.MM"],"primary_cat":"cs.CV","authors_text":"Hefeng Wu, Jiashi Li, Jie Wu, Liang Lin, Pan Xie, Weifeng Chen, Xin Xia, Xuefeng Xiao, Yatai Ji","submitted_at":"2023-05-23T09:03:19Z","abstract_excerpt":"Recent advances in text-to-image (T2I) diffusion models have enabled impressive image generation capabilities guided by text prompts. However, extending these techniques to video generation remains challenging, with existing text-to-video (T2V) methods often struggling to produce high-quality and motion-consistent videos. In this work, we introduce Control-A-Video, a controllable T2V diffusion model that can generate videos conditioned on text prompts and reference control maps like edge and depth maps. To tackle video quality and motion consistency issues, we propose novel strategies to incor"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2305.13840","kind":"arxiv","version":3},"metadata":{"license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","primary_cat":"cs.CV","submitted_at":"2023-05-23T09:03:19Z","cross_cats_sorted":["cs.AI","cs.LG","cs.MM"],"title_canon_sha256":"58bcac097c1b4a2274e7ff19f592895f720f44ec2ccccd819807d25424f1e1d7","abstract_canon_sha256":"1ae85c7da91a5c3d36999e56c8112d08df9e6a98130ee44417ddfcb4b98ca579"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T08:54:02.135692Z","signature_b64":"0f8S7DQ1gAecwhysQho3kP+hlLQGSbYao35GqZrfk5hM3WWsxBVuPx87nhtQS54CvCeOdwt63J3tIJp+dHJGBw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"6784003f225903c7d34f64fe62e1b750894db04c40d8ffff129a7e2307bfadce","last_reissued_at":"2026-07-05T08:54:02.135271Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T08:54:02.135271Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Control-A-Video: Controllable Text-to-Video Diffusion Models with Motion Prior and Reward Feedback Learning","license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","headline":"","cross_cats":["cs.AI","cs.LG","cs.MM"],"primary_cat":"cs.CV","authors_text":"Hefeng Wu, Jiashi Li, Jie Wu, Liang Lin, Pan Xie, Weifeng Chen, Xin Xia, Xuefeng Xiao, Yatai Ji","submitted_at":"2023-05-23T09:03:19Z","abstract_excerpt":"Recent advances in text-to-image (T2I) diffusion models have enabled impressive image generation capabilities guided by text prompts. However, extending these techniques to video generation remains challenging, with existing text-to-video (T2V) methods often struggling to produce high-quality and motion-consistent videos. In this work, we introduce Control-A-Video, a controllable T2V diffusion model that can generate videos conditioned on text prompts and reference control maps like edge and depth maps. To tackle video quality and motion consistency issues, we propose novel strategies to incor"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2305.13840","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2305.13840/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2305.13840","created_at":"2026-07-05T08:54:02.135327+00:00"},{"alias_kind":"arxiv_version","alias_value":"2305.13840v3","created_at":"2026-07-05T08:54:02.135327+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2305.13840","created_at":"2026-07-05T08:54:02.135327+00:00"},{"alias_kind":"pith_short_12","alias_value":"M6CAAPZCLEB4","created_at":"2026-07-05T08:54:02.135327+00:00"},{"alias_kind":"pith_short_16","alias_value":"M6CAAPZCLEB4PU2P","created_at":"2026-07-05T08:54:02.135327+00:00"},{"alias_kind":"pith_short_8","alias_value":"M6CAAPZC","created_at":"2026-07-05T08:54:02.135327+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":20,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.13432","citing_title":"OmniDirector: General Multi-Shot Camera Cloning without Cross-Paired Data","ref_index":64,"is_internal_anchor":false},{"citing_arxiv_id":"2605.10543","citing_title":"TIE: Time Interval Encoding for Video Generation over Events","ref_index":6,"is_internal_anchor":false},{"citing_arxiv_id":"2606.02586","citing_title":"Fewer, Better Frames: A Compute-Normalized Proof of Concept for Coherence-First World-Model Rendering with Model-Guided FSR4 Frame Generation","ref_index":28,"is_internal_anchor":false},{"citing_arxiv_id":"2605.15116","citing_title":"DriveCtrl: Conditioned Sim-to-Real Driving Video Generation","ref_index":22,"is_internal_anchor":false},{"citing_arxiv_id":"2606.29020","citing_title":"Semantic-Aware, Physics-Informed, Geometry-Grounded Weather Video Synthesis","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2605.29509","citing_title":"KGEdit: Ambiguity-Aware Knowledge Graphs for Training-Free Precise Video Generation and Editing","ref_index":14,"is_internal_anchor":false},{"citing_arxiv_id":"2605.23602","citing_title":"GlowGS: Generative Semantic Feature Learning for 3D Gaussian Splatting in Nighttime Glow Scenes","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2504.18576","citing_title":"DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment","ref_index":9,"is_internal_anchor":false},{"citing_arxiv_id":"2603.29092","citing_title":"TrajectoryMover: Generative Movement of Object Trajectories in Videos","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2605.15256","citing_title":"ReactiveGWM: Steering NPC in Reactive Game World Models","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2311.04145","citing_title":"I2VGen-XL: High-Quality Image-to-Video Synthesis via Cascaded Diffusion Models","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2503.07598","citing_title":"VACE: All-in-One Video Creation and Editing","ref_index":10,"is_internal_anchor":false},{"citing_arxiv_id":"2602.13669","citing_title":"EchoTorrent: Towards Swift, Sustained, and Streaming Multi-Modal Video Generation","ref_index":44,"is_internal_anchor":false},{"citing_arxiv_id":"2603.29092","citing_title":"TrajectoryMover: Generative Movement of Object Trajectories in Videos","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2604.02467","citing_title":"VERTIGO: Visual Preference Optimization for Cinematic Camera Trajectory Generation","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2402.17177","citing_title":"Sora: A Review on Background, Technology, Limitations, and Opportunities of Large Vision Models","ref_index":186,"is_internal_anchor":false},{"citing_arxiv_id":"2404.02101","citing_title":"CameraCtrl: Enabling Camera Control for Text-to-Video Generation","ref_index":106,"is_internal_anchor":false},{"citing_arxiv_id":"2412.14803","citing_title":"Video Prediction Policy: A Generalist Robot Policy with Predictive Visual Representations","ref_index":91,"is_internal_anchor":false},{"citing_arxiv_id":"2605.10543","citing_title":"TIE: Time Interval Encoding for Video Generation over Events","ref_index":6,"is_internal_anchor":false},{"citing_arxiv_id":"2604.19679","citing_title":"MMControl: Unified Multi-Modal Control for Joint Audio-Video Generation","ref_index":3,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/M6CAAPZCLEB4PU2PMT7GFYNXKC","json":"https://pith.science/pith/M6CAAPZCLEB4PU2PMT7GFYNXKC.json","graph_json":"https://pith.science/api/pith-number/M6CAAPZCLEB4PU2PMT7GFYNXKC/graph.json","events_json":"https://pith.science/api/pith-number/M6CAAPZCLEB4PU2PMT7GFYNXKC/events.json","paper":"https://pith.science/paper/M6CAAPZC"},"agent_actions":{"view_html":"https://pith.science/pith/M6CAAPZCLEB4PU2PMT7GFYNXKC","download_json":"https://pith.science/pith/M6CAAPZCLEB4PU2PMT7GFYNXKC.json","view_paper":"https://pith.science/paper/M6CAAPZC","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2305.13840&json=true","fetch_graph":"https://pith.science/api/pith-number/M6CAAPZCLEB4PU2PMT7GFYNXKC/graph.json","fetch_events":"https://pith.science/api/pith-number/M6CAAPZCLEB4PU2PMT7GFYNXKC/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/M6CAAPZCLEB4PU2PMT7GFYNXKC/action/timestamp_anchor","attest_storage":"https://pith.science/pith/M6CAAPZCLEB4PU2PMT7GFYNXKC/action/storage_attestation","attest_author":"https://pith.science/pith/M6CAAPZCLEB4PU2PMT7GFYNXKC/action/author_attestation","sign_citation":"https://pith.science/pith/M6CAAPZCLEB4PU2PMT7GFYNXKC/action/citation_signature","submit_replication":"https://pith.science/pith/M6CAAPZCLEB4PU2PMT7GFYNXKC/action/replication_record"}},"created_at":"2026-07-05T08:54:02.135327+00:00","updated_at":"2026-07-05T08:54:02.135327+00:00"}