{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:IQXLMXADX5OR3FFXAQTUN7UUY5","short_pith_number":"pith:IQXLMXAD","schema_version":"1.0","canonical_sha256":"442eb65c03bf5d1d94b7042746fe94c775fecbdb507c8a4abbcad8a9df3bb60b","source":{"kind":"arxiv","id":"2406.08801","version":2},"attestation_state":"computed","paper":{"title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Ce Liu, Hanlin Shang, Hui Li, Jingdong Wang, Liwei Zhang, Mingwang Xu, Qingkun Su, Siyu Zhu, Yao Yao","submitted_at":"2024-06-13T04:33:20Z","abstract_excerpt":"The field of portrait image animation, driven by speech audio input, has experienced significant advancements in the generation of realistic and dynamic portraits. This research delves into the complexities of synchronizing facial movements and creating visually appealing, temporally consistent animations within the framework of diffusion-based methodologies. Moving away from traditional paradigms that rely on parametric models for intermediate facial representations, our innovative approach embraces the end-to-end diffusion paradigm and introduces a hierarchical audio-driven visual synthesis "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2406.08801","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CV","submitted_at":"2024-06-13T04:33:20Z","cross_cats_sorted":[],"title_canon_sha256":"7519a60770070feb8d1244358a6a8d03b9a042c49356b4634d82118d0b1ee671","abstract_canon_sha256":"5b4b464b5184ce5f1b2e39bd04bf57398bb7bfe69463eea72e7c0a88065bb406"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T08:32:42.889648Z","signature_b64":"TrT1i5MfueKPiWmXEnXBkdP5GnvYnwhv/BwI52mYRFJ+eRnKaxg3OmEyzYIJ+bwiiyfedZoW8rcauj/fE1LaAw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"442eb65c03bf5d1d94b7042746fe94c775fecbdb507c8a4abbcad8a9df3bb60b","last_reissued_at":"2026-07-05T08:32:42.889171Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T08:32:42.889171Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Ce Liu, Hanlin Shang, Hui Li, Jingdong Wang, Liwei Zhang, Mingwang Xu, Qingkun Su, Siyu Zhu, Yao Yao","submitted_at":"2024-06-13T04:33:20Z","abstract_excerpt":"The field of portrait image animation, driven by speech audio input, has experienced significant advancements in the generation of realistic and dynamic portraits. This research delves into the complexities of synchronizing facial movements and creating visually appealing, temporally consistent animations within the framework of diffusion-based methodologies. Moving away from traditional paradigms that rely on parametric models for intermediate facial representations, our innovative approach embraces the end-to-end diffusion paradigm and introduces a hierarchical audio-driven visual synthesis "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2406.08801","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2406.08801/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2406.08801","created_at":"2026-07-05T08:32:42.889230+00:00"},{"alias_kind":"arxiv_version","alias_value":"2406.08801v2","created_at":"2026-07-05T08:32:42.889230+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2406.08801","created_at":"2026-07-05T08:32:42.889230+00:00"},{"alias_kind":"pith_short_12","alias_value":"IQXLMXADX5OR","created_at":"2026-07-05T08:32:42.889230+00:00"},{"alias_kind":"pith_short_16","alias_value":"IQXLMXADX5OR3FFX","created_at":"2026-07-05T08:32:42.889230+00:00"},{"alias_kind":"pith_short_8","alias_value":"IQXLMXAD","created_at":"2026-07-05T08:32:42.889230+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":29,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.01620","citing_title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","ref_index":58,"is_internal_anchor":false},{"citing_arxiv_id":"2606.01031","citing_title":"Temporally-Aligned Evaluation for Audio-Driven Talking Head Generation","ref_index":43,"is_internal_anchor":false},{"citing_arxiv_id":"2605.06280","citing_title":"Eulerian Motion Guidance: Robust Image Animation via Bidirectional Geometric Consistency","ref_index":32,"is_internal_anchor":false},{"citing_arxiv_id":"2606.30849","citing_title":"SyncCache: Exploiting Asymmetric Dynamics for Fast Audio-Driven Portrait Animation","ref_index":40,"is_internal_anchor":false},{"citing_arxiv_id":"2605.24176","citing_title":"Loki: Representation over Architecture for Diffusion-Based Portrait Animation","ref_index":6,"is_internal_anchor":false},{"citing_arxiv_id":"2605.25488","citing_title":"Test-Time Self-Adaptive Conditioning for Stable Audio-Driven Talking-Head Generation","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2605.30230","citing_title":"IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation","ref_index":42,"is_internal_anchor":false},{"citing_arxiv_id":"2411.16748","citing_title":"Multimodal Diffusion Transformer with Memory Bank for Scalable Long-Duration Talking Video Generation","ref_index":22,"is_internal_anchor":false},{"citing_arxiv_id":"2506.23552","citing_title":"JAM-Flow: Joint Audio-Motion Synthesis with Flow Matching","ref_index":43,"is_internal_anchor":false},{"citing_arxiv_id":"2605.17248","citing_title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","ref_index":73,"is_internal_anchor":false},{"citing_arxiv_id":"2605.16918","citing_title":"HighSync: High-Quality Lip Synchronization via Latent Diffusion Models","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2509.12052","citing_title":"FluentAvatar: Flicker-Free Talking-Head Animation via Phoneme-Guided Autoregressive Modeling","ref_index":27,"is_internal_anchor":false},{"citing_arxiv_id":"2605.06280","citing_title":"Eulerian Motion Guidance: Robust Image Animation via Bidirectional Geometric Consistency","ref_index":32,"is_internal_anchor":false},{"citing_arxiv_id":"2604.27918","citing_title":"Generate Your Talking Avatar from Video Reference","ref_index":45,"is_internal_anchor":false},{"citing_arxiv_id":"2604.23688","citing_title":"Do Protective Perturbations Really Protect Portrait Privacy under Real-world Image Transformations?","ref_index":40,"is_internal_anchor":false},{"citing_arxiv_id":"2604.23586","citing_title":"Talker-T2AV: Joint Talking Audio-Video Generation with Autoregressive Diffusion Modeling","ref_index":25,"is_internal_anchor":false},{"citing_arxiv_id":"2604.23632","citing_title":"Hallo-Live: Real-Time Streaming Joint Audio-Video Avatar Generation with Asynchronous Dual-Stream and Human-Centric Preference Distillation","ref_index":45,"is_internal_anchor":false},{"citing_arxiv_id":"2605.06280","citing_title":"Eulerian Motion Guidance: Robust Image Animation via Bidirectional Geometric Consistency","ref_index":31,"is_internal_anchor":false},{"citing_arxiv_id":"2605.02948","citing_title":"AsymTalker: Identity-Consistent Long-Term Talking Head Generation via Asymmetric Distillation","ref_index":19,"is_internal_anchor":false},{"citing_arxiv_id":"2604.22865","citing_title":"MeshLAM: Feed-Forward One-Shot Animatable Textured Mesh Avatar Reconstruction","ref_index":68,"is_internal_anchor":false},{"citing_arxiv_id":"2604.19679","citing_title":"MMControl: Unified Multi-Modal Control for Joint Audio-Video Generation","ref_index":22,"is_internal_anchor":false},{"citing_arxiv_id":"2604.12941","citing_title":"Direct Discrepancy Replay: Distribution-Discrepancy Condensation and Manifold-Consistent Replay for Continual Face Forgery Detection","ref_index":39,"is_internal_anchor":false},{"citing_arxiv_id":"2604.10367","citing_title":"Beyond Monologue: Interactive Talking-Listening Avatar Generation with Conversational Audio Context-Aware Kernels","ref_index":45,"is_internal_anchor":false},{"citing_arxiv_id":"2604.08405","citing_title":"SyncBreaker:Stage-Aware Multimodal Adversarial Attacks on Audio-Driven Talking Head Generation","ref_index":57,"is_internal_anchor":false},{"citing_arxiv_id":"2605.06280","citing_title":"Eulerian Motion Guidance: Robust Image Animation via Bidirectional Geometric Consistency","ref_index":32,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/IQXLMXADX5OR3FFXAQTUN7UUY5","json":"https://pith.science/pith/IQXLMXADX5OR3FFXAQTUN7UUY5.json","graph_json":"https://pith.science/api/pith-number/IQXLMXADX5OR3FFXAQTUN7UUY5/graph.json","events_json":"https://pith.science/api/pith-number/IQXLMXADX5OR3FFXAQTUN7UUY5/events.json","paper":"https://pith.science/paper/IQXLMXAD"},"agent_actions":{"view_html":"https://pith.science/pith/IQXLMXADX5OR3FFXAQTUN7UUY5","download_json":"https://pith.science/pith/IQXLMXADX5OR3FFXAQTUN7UUY5.json","view_paper":"https://pith.science/paper/IQXLMXAD","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2406.08801&json=true","fetch_graph":"https://pith.science/api/pith-number/IQXLMXADX5OR3FFXAQTUN7UUY5/graph.json","fetch_events":"https://pith.science/api/pith-number/IQXLMXADX5OR3FFXAQTUN7UUY5/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/IQXLMXADX5OR3FFXAQTUN7UUY5/action/timestamp_anchor","attest_storage":"https://pith.science/pith/IQXLMXADX5OR3FFXAQTUN7UUY5/action/storage_attestation","attest_author":"https://pith.science/pith/IQXLMXADX5OR3FFXAQTUN7UUY5/action/author_attestation","sign_citation":"https://pith.science/pith/IQXLMXADX5OR3FFXAQTUN7UUY5/action/citation_signature","submit_replication":"https://pith.science/pith/IQXLMXADX5OR3FFXAQTUN7UUY5/action/replication_record"}},"created_at":"2026-07-05T08:32:42.889230+00:00","updated_at":"2026-07-05T08:32:42.889230+00:00"}