{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:C22D34K56M5WZFZJN56VTVIZXL","short_pith_number":"pith:C22D34K5","schema_version":"1.0","canonical_sha256":"16b43df15df33b6c97296f7d59d519bae852d5ac257ddf21cdc6fa818e9f75fb","source":{"kind":"arxiv","id":"2407.08737","version":1},"attestation_state":"computed","paper":{"title":"Video Diffusion Alignment via Reward Gradients","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.LG","cs.RO"],"primary_cat":"cs.CV","authors_text":"Deepak Pathak, Katerina Fragkiadaki, Mihir Prabhudesai, Russell Mendonca, Zheyang Qin","submitted_at":"2024-07-11T17:59:45Z","abstract_excerpt":"We have made significant progress towards building foundational video diffusion models. As these models are trained using large-scale unsupervised data, it has become crucial to adapt these models to specific downstream tasks. Adapting these models via supervised fine-tuning requires collecting target datasets of videos, which is challenging and tedious. In this work, we utilize pre-trained reward models that are learned via preferences on top of powerful vision discriminative models to adapt video diffusion models. These models contain dense gradient information with respect to generated RGB "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2407.08737","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2024-07-11T17:59:45Z","cross_cats_sorted":["cs.AI","cs.LG","cs.RO"],"title_canon_sha256":"7968a028326e2c46a76cc16173374fbb2ec84a723a7092af15d8c3d0c16d6a57","abstract_canon_sha256":"9f8c6be3921920503fc7a24702a2e4e1cbe7dfdc5d2073254fcf2fc53b61067e"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T08:42:52.197567Z","signature_b64":"xAYJZVYomV/Xm/ZxLB9A0BLLhZ2onTsMcczwn7gkTHVDuVmRs4mUw9FwU881fvJ6/UKJSZN3PnGxbM5T9sEICg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"16b43df15df33b6c97296f7d59d519bae852d5ac257ddf21cdc6fa818e9f75fb","last_reissued_at":"2026-07-05T08:42:52.197112Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T08:42:52.197112Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Video Diffusion Alignment via Reward Gradients","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.LG","cs.RO"],"primary_cat":"cs.CV","authors_text":"Deepak Pathak, Katerina Fragkiadaki, Mihir Prabhudesai, Russell Mendonca, Zheyang Qin","submitted_at":"2024-07-11T17:59:45Z","abstract_excerpt":"We have made significant progress towards building foundational video diffusion models. As these models are trained using large-scale unsupervised data, it has become crucial to adapt these models to specific downstream tasks. Adapting these models via supervised fine-tuning requires collecting target datasets of videos, which is challenging and tedious. In this work, we utilize pre-trained reward models that are learned via preferences on top of powerful vision discriminative models to adapt video diffusion models. These models contain dense gradient information with respect to generated RGB "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2407.08737","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2407.08737/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2407.08737","created_at":"2026-07-05T08:42:52.197169+00:00"},{"alias_kind":"arxiv_version","alias_value":"2407.08737v1","created_at":"2026-07-05T08:42:52.197169+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2407.08737","created_at":"2026-07-05T08:42:52.197169+00:00"},{"alias_kind":"pith_short_12","alias_value":"C22D34K56M5W","created_at":"2026-07-05T08:42:52.197169+00:00"},{"alias_kind":"pith_short_16","alias_value":"C22D34K56M5WZFZJ","created_at":"2026-07-05T08:42:52.197169+00:00"},{"alias_kind":"pith_short_8","alias_value":"C22D34K5","created_at":"2026-07-05T08:42:52.197169+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":19,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2607.07693","citing_title":"Selective Timestep Weighting and Advantage-Based Replay for Sample-Efficient Diffusion RLHF","ref_index":30,"is_internal_anchor":true},{"citing_arxiv_id":"2606.00267","citing_title":"StressDream: Steering Video World Models for Robust Policy Evaluation and Improvement","ref_index":87,"is_internal_anchor":false},{"citing_arxiv_id":"2605.14988","citing_title":"Compositional Video Generation via Inference-Time Guidance","ref_index":42,"is_internal_anchor":false},{"citing_arxiv_id":"2605.23346","citing_title":"Contrastive Distribution Matching for Amortized Sequential Monte Carlo in Discrete Diffusion","ref_index":61,"is_internal_anchor":false},{"citing_arxiv_id":"2412.15689","citing_title":"DOLLAR: Few-Step Video Generation via Distillation and Latent Reward Optimization","ref_index":41,"is_internal_anchor":false},{"citing_arxiv_id":"2605.15803","citing_title":"Embedding-perturbed Exploration Preference Optimization for Flow Models","ref_index":67,"is_internal_anchor":false},{"citing_arxiv_id":"2512.01236","citing_title":"PSR: Scaling Multi-Subject Personalized Image Generation with Pairwise Subject-Consistency Rewards","ref_index":26,"is_internal_anchor":false},{"citing_arxiv_id":"2512.04678","citing_title":"Reward Forcing: Efficient Streaming Video Generation with Rewarded Distribution Matching Distillation","ref_index":56,"is_internal_anchor":false},{"citing_arxiv_id":"2412.21059","citing_title":"VisionReward: Fine-Grained Multi-Dimensional Human Preference Learning for Image and Video Generation","ref_index":33,"is_internal_anchor":false},{"citing_arxiv_id":"2603.00918","citing_title":"Improving Text-to-Image Generation with Intrinsic Self-Confidence Rewards","ref_index":52,"is_internal_anchor":false},{"citing_arxiv_id":"2604.02467","citing_title":"VERTIGO: Visual Preference Optimization for Cinematic Camera Trajectory Generation","ref_index":39,"is_internal_anchor":false},{"citing_arxiv_id":"2604.02868","citing_title":"Few-Shot Distribution-Aligned Flow Matching for Data Synthesis in Medical Image Segmentation","ref_index":1,"is_internal_anchor":false},{"citing_arxiv_id":"2509.16117","citing_title":"DiffusionNFT: Online Diffusion Reinforcement with Forward Process","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2501.13918","citing_title":"Improving Video Generation with Human Feedback","ref_index":59,"is_internal_anchor":false},{"citing_arxiv_id":"2505.07818","citing_title":"DanceGRPO: Unleashing GRPO on Visual Generation","ref_index":55,"is_internal_anchor":false},{"citing_arxiv_id":"2505.05470","citing_title":"Flow-GRPO: Training Flow Matching Models via Online RL","ref_index":33,"is_internal_anchor":false},{"citing_arxiv_id":"2604.19234","citing_title":"Learning to Credit the Right Steps: Objective-aware Process Optimization for Visual Generation","ref_index":32,"is_internal_anchor":false},{"citing_arxiv_id":"2605.07503","citing_title":"Diffusion-APO: Trajectory-Aware Direct Preference Alignment for Video Diffusion Transformers","ref_index":28,"is_internal_anchor":false},{"citing_arxiv_id":"2604.14910","citing_title":"Reward-Aware Trajectory Shaping for Few-step Visual Generation","ref_index":24,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/C22D34K56M5WZFZJN56VTVIZXL","json":"https://pith.science/pith/C22D34K56M5WZFZJN56VTVIZXL.json","graph_json":"https://pith.science/api/pith-number/C22D34K56M5WZFZJN56VTVIZXL/graph.json","events_json":"https://pith.science/api/pith-number/C22D34K56M5WZFZJN56VTVIZXL/events.json","paper":"https://pith.science/paper/C22D34K5"},"agent_actions":{"view_html":"https://pith.science/pith/C22D34K56M5WZFZJN56VTVIZXL","download_json":"https://pith.science/pith/C22D34K56M5WZFZJN56VTVIZXL.json","view_paper":"https://pith.science/paper/C22D34K5","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2407.08737&json=true","fetch_graph":"https://pith.science/api/pith-number/C22D34K56M5WZFZJN56VTVIZXL/graph.json","fetch_events":"https://pith.science/api/pith-number/C22D34K56M5WZFZJN56VTVIZXL/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/C22D34K56M5WZFZJN56VTVIZXL/action/timestamp_anchor","attest_storage":"https://pith.science/pith/C22D34K56M5WZFZJN56VTVIZXL/action/storage_attestation","attest_author":"https://pith.science/pith/C22D34K56M5WZFZJN56VTVIZXL/action/author_attestation","sign_citation":"https://pith.science/pith/C22D34K56M5WZFZJN56VTVIZXL/action/citation_signature","submit_replication":"https://pith.science/pith/C22D34K56M5WZFZJN56VTVIZXL/action/replication_record"}},"created_at":"2026-07-05T08:42:52.197169+00:00","updated_at":"2026-07-05T08:42:52.197169+00:00"}