{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:MO4C4JLBU7IP4KANAUTPYMRQSO","short_pith_number":"pith:MO4C4JLB","schema_version":"1.0","canonical_sha256":"63b82e2561a7d0fe280d0526fc323093ba119593431e1dee3e298955c86dccf9","source":{"kind":"arxiv","id":"2509.08519","version":1},"attestation_state":"computed","paper":{"title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.MM"],"primary_cat":"cs.CV","authors_text":"Bingchuan Li, Gen Li, Jiawei Liu, Lijie Liu, Liyang Chen, Qian He, Tianxiang Ma, Xu He, Zhiyong Wu, Zhuowei Chen","submitted_at":"2025-09-10T11:54:29Z","abstract_excerpt":"Human-Centric Video Generation (HCVG) methods seek to synthesize human videos from multimodal inputs, including text, image, and audio. Existing methods struggle to effectively coordinate these heterogeneous modalities due to two challenges: the scarcity of training data with paired triplet conditions and the difficulty of collaborating the sub-tasks of subject preservation and audio-visual sync with multimodal inputs. In this work, we present HuMo, a unified HCVG framework for collaborative multimodal control. For the first challenge, we construct a high-quality dataset with diverse and paire"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2509.08519","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2025-09-10T11:54:29Z","cross_cats_sorted":["cs.MM"],"title_canon_sha256":"22d0f863f2160abcb9ba4068ad65b51bd652f6b0acf282b70a8696b26984f2d7","abstract_canon_sha256":"be72d0828be92037c1fb1d108c9dee8cfc3f619d210b54a44de8e00db1da5751"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T12:08:31.625922Z","signature_b64":"goaRbj8j/+HVrCp/HVNWjiIZg6YegV273PboyMINNN017WWnmp9C2oCGPIHpIrz8Dqt875VB/VNiJOUCBpNYCA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"63b82e2561a7d0fe280d0526fc323093ba119593431e1dee3e298955c86dccf9","last_reissued_at":"2026-07-05T12:08:31.625452Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T12:08:31.625452Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.MM"],"primary_cat":"cs.CV","authors_text":"Bingchuan Li, Gen Li, Jiawei Liu, Lijie Liu, Liyang Chen, Qian He, Tianxiang Ma, Xu He, Zhiyong Wu, Zhuowei Chen","submitted_at":"2025-09-10T11:54:29Z","abstract_excerpt":"Human-Centric Video Generation (HCVG) methods seek to synthesize human videos from multimodal inputs, including text, image, and audio. Existing methods struggle to effectively coordinate these heterogeneous modalities due to two challenges: the scarcity of training data with paired triplet conditions and the difficulty of collaborating the sub-tasks of subject preservation and audio-visual sync with multimodal inputs. In this work, we present HuMo, a unified HCVG framework for collaborative multimodal control. For the first challenge, we construct a high-quality dataset with diverse and paire"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2509.08519","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2509.08519/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2509.08519","created_at":"2026-07-05T12:08:31.625506+00:00"},{"alias_kind":"arxiv_version","alias_value":"2509.08519v1","created_at":"2026-07-05T12:08:31.625506+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2509.08519","created_at":"2026-07-05T12:08:31.625506+00:00"},{"alias_kind":"pith_short_12","alias_value":"MO4C4JLBU7IP","created_at":"2026-07-05T12:08:31.625506+00:00"},{"alias_kind":"pith_short_16","alias_value":"MO4C4JLBU7IP4KAN","created_at":"2026-07-05T12:08:31.625506+00:00"},{"alias_kind":"pith_short_8","alias_value":"MO4C4JLB","created_at":"2026-07-05T12:08:31.625506+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":16,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.26058","citing_title":"DomainShuttle: Freeform Open Domain Subject-driven Text-to-video Generation","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2606.10839","citing_title":"HarmoView: Harmonizing Multi-View Constraints for Identity-Consistent Video Generation","ref_index":3,"is_internal_anchor":false},{"citing_arxiv_id":"2606.02441","citing_title":"Spatial-Temporal Decoupled Reference Conditioning for Identity-Preserving Text-to-Video Generation","ref_index":6,"is_internal_anchor":false},{"citing_arxiv_id":"2605.24652","citing_title":"AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2605.26486","citing_title":"LongCat-Video-Avatar 1.5 Technical Report","ref_index":14,"is_internal_anchor":false},{"citing_arxiv_id":"2512.23994","citing_title":"PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation","ref_index":35,"is_internal_anchor":false},{"citing_arxiv_id":"2605.17488","citing_title":"Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation","ref_index":3,"is_internal_anchor":false},{"citing_arxiv_id":"2605.18748","citing_title":"Aurora: Unified Video Editing with a Tool-Using Agent","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2512.00336","citing_title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2510.01284","citing_title":"Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation","ref_index":3,"is_internal_anchor":false},{"citing_arxiv_id":"2512.23994","citing_title":"PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation","ref_index":35,"is_internal_anchor":false},{"citing_arxiv_id":"2601.10632","citing_title":"CoMoVi: Co-Generation of 3D Human Motions and Realistic Videos","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2604.27918","citing_title":"Generate Your Talking Avatar from Video Reference","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2604.19720","citing_title":"ReImagine: Rethinking Controllable High-Quality Human Video Generation via Image-First Synthesis","ref_index":2,"is_internal_anchor":false},{"citing_arxiv_id":"2604.19636","citing_title":"CoInteract: Physically-Consistent Human-Object Interaction Video Synthesis via Spatially-Structured Co-Generation","ref_index":5,"is_internal_anchor":false},{"citing_arxiv_id":"2604.11804","citing_title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","ref_index":4,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/MO4C4JLBU7IP4KANAUTPYMRQSO","json":"https://pith.science/pith/MO4C4JLBU7IP4KANAUTPYMRQSO.json","graph_json":"https://pith.science/api/pith-number/MO4C4JLBU7IP4KANAUTPYMRQSO/graph.json","events_json":"https://pith.science/api/pith-number/MO4C4JLBU7IP4KANAUTPYMRQSO/events.json","paper":"https://pith.science/paper/MO4C4JLB"},"agent_actions":{"view_html":"https://pith.science/pith/MO4C4JLBU7IP4KANAUTPYMRQSO","download_json":"https://pith.science/pith/MO4C4JLBU7IP4KANAUTPYMRQSO.json","view_paper":"https://pith.science/paper/MO4C4JLB","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2509.08519&json=true","fetch_graph":"https://pith.science/api/pith-number/MO4C4JLBU7IP4KANAUTPYMRQSO/graph.json","fetch_events":"https://pith.science/api/pith-number/MO4C4JLBU7IP4KANAUTPYMRQSO/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/MO4C4JLBU7IP4KANAUTPYMRQSO/action/timestamp_anchor","attest_storage":"https://pith.science/pith/MO4C4JLBU7IP4KANAUTPYMRQSO/action/storage_attestation","attest_author":"https://pith.science/pith/MO4C4JLBU7IP4KANAUTPYMRQSO/action/author_attestation","sign_citation":"https://pith.science/pith/MO4C4JLBU7IP4KANAUTPYMRQSO/action/citation_signature","submit_replication":"https://pith.science/pith/MO4C4JLBU7IP4KANAUTPYMRQSO/action/replication_record"}},"created_at":"2026-07-05T12:08:31.625506+00:00","updated_at":"2026-07-05T12:08:31.625506+00:00"}