{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:F3K5CHI3PLUXEJBMWJTNJBLKUK","short_pith_number":"pith:F3K5CHI3","schema_version":"1.0","canonical_sha256":"2ed5d11d1b7ae972242cb266d4856aa2a451d384f7165012ea42d44efe346bc7","source":{"kind":"arxiv","id":"2409.02634","version":3},"attestation_state":"computed","paper":{"title":"Loopy: Taming Audio-Driven Portrait Avatar with Long-Term Motion Dependency","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Chao Liang, Gaojie Lin, Jianwen Jiang, Jiaqi Yang, Tianyun Zhong, Yanbo Zheng","submitted_at":"2024-09-04T11:55:14Z","abstract_excerpt":"With the introduction of diffusion-based video generation techniques, audio-conditioned human video generation has recently achieved significant breakthroughs in both the naturalness of motion and the synthesis of portrait details. Due to the limited control of audio signals in driving human motion, existing methods often add auxiliary spatial signals to stabilize movements, which may compromise the naturalness and freedom of motion. In this paper, we propose an end-to-end audio-only conditioned video diffusion model named Loopy. Specifically, we designed an inter- and intra-clip temporal modu"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2409.02634","kind":"arxiv","version":3},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2024-09-04T11:55:14Z","cross_cats_sorted":[],"title_canon_sha256":"d2ffef447e4dd97da8cbdd5a45644828ad95dcd72680dc1f83f5a83c04c0183d","abstract_canon_sha256":"8837c94591bafac4944c93d4cd10a8007a96803a4c48232deb6b74572f788687"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:44:15.922886Z","signature_b64":"dGi+cjYEk6vnU5EoIh9k5d7RpT7YBZGeEB1dI61KTwybaCYhXa+ardDKqkx621012yYa2pB6OqPYGatDsyOXCA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"2ed5d11d1b7ae972242cb266d4856aa2a451d384f7165012ea42d44efe346bc7","last_reissued_at":"2026-07-05T10:44:15.922396Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:44:15.922396Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Loopy: Taming Audio-Driven Portrait Avatar with Long-Term Motion Dependency","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Chao Liang, Gaojie Lin, Jianwen Jiang, Jiaqi Yang, Tianyun Zhong, Yanbo Zheng","submitted_at":"2024-09-04T11:55:14Z","abstract_excerpt":"With the introduction of diffusion-based video generation techniques, audio-conditioned human video generation has recently achieved significant breakthroughs in both the naturalness of motion and the synthesis of portrait details. Due to the limited control of audio signals in driving human motion, existing methods often add auxiliary spatial signals to stabilize movements, which may compromise the naturalness and freedom of motion. In this paper, we propose an end-to-end audio-only conditioned video diffusion model named Loopy. Specifically, we designed an inter- and intra-clip temporal modu"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2409.02634","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2409.02634/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2409.02634","created_at":"2026-07-05T10:44:15.922456+00:00"},{"alias_kind":"arxiv_version","alias_value":"2409.02634v3","created_at":"2026-07-05T10:44:15.922456+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2409.02634","created_at":"2026-07-05T10:44:15.922456+00:00"},{"alias_kind":"pith_short_12","alias_value":"F3K5CHI3PLUX","created_at":"2026-07-05T10:44:15.922456+00:00"},{"alias_kind":"pith_short_16","alias_value":"F3K5CHI3PLUXEJBM","created_at":"2026-07-05T10:44:15.922456+00:00"},{"alias_kind":"pith_short_8","alias_value":"F3K5CHI3","created_at":"2026-07-05T10:44:15.922456+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":9,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2605.30230","citing_title":"IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation","ref_index":21,"is_internal_anchor":false},{"citing_arxiv_id":"2411.09209","citing_title":"JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2505.21996","citing_title":"VRAG: Learning World Models for Interactive Video Generation","ref_index":68,"is_internal_anchor":false},{"citing_arxiv_id":"2509.12052","citing_title":"FluentAvatar: Flicker-Free Talking-Head Animation via Phoneme-Guided Autoregressive Modeling","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2512.14234","citing_title":"ViBES: A Conversational Agent with Behaviorally-Intelligent 3D Virtual Body","ref_index":45,"is_internal_anchor":false},{"citing_arxiv_id":"2604.11804","citing_title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","ref_index":30,"is_internal_anchor":false},{"citing_arxiv_id":"2604.08405","citing_title":"SyncBreaker:Stage-Aware Multimodal Adversarial Attacks on Audio-Driven Talking Head Generation","ref_index":25,"is_internal_anchor":false},{"citing_arxiv_id":"2605.07478","citing_title":"AudioFace: Language-Assisted Speech-Driven Facial Animation with Multimodal Language Models","ref_index":22,"is_internal_anchor":false},{"citing_arxiv_id":"2605.02948","citing_title":"AsymTalker: Identity-Consistent Long-Term Talking Head Generation via Asymmetric Distillation","ref_index":20,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/F3K5CHI3PLUXEJBMWJTNJBLKUK","json":"https://pith.science/pith/F3K5CHI3PLUXEJBMWJTNJBLKUK.json","graph_json":"https://pith.science/api/pith-number/F3K5CHI3PLUXEJBMWJTNJBLKUK/graph.json","events_json":"https://pith.science/api/pith-number/F3K5CHI3PLUXEJBMWJTNJBLKUK/events.json","paper":"https://pith.science/paper/F3K5CHI3"},"agent_actions":{"view_html":"https://pith.science/pith/F3K5CHI3PLUXEJBMWJTNJBLKUK","download_json":"https://pith.science/pith/F3K5CHI3PLUXEJBMWJTNJBLKUK.json","view_paper":"https://pith.science/paper/F3K5CHI3","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2409.02634&json=true","fetch_graph":"https://pith.science/api/pith-number/F3K5CHI3PLUXEJBMWJTNJBLKUK/graph.json","fetch_events":"https://pith.science/api/pith-number/F3K5CHI3PLUXEJBMWJTNJBLKUK/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/F3K5CHI3PLUXEJBMWJTNJBLKUK/action/timestamp_anchor","attest_storage":"https://pith.science/pith/F3K5CHI3PLUXEJBMWJTNJBLKUK/action/storage_attestation","attest_author":"https://pith.science/pith/F3K5CHI3PLUXEJBMWJTNJBLKUK/action/author_attestation","sign_citation":"https://pith.science/pith/F3K5CHI3PLUXEJBMWJTNJBLKUK/action/citation_signature","submit_replication":"https://pith.science/pith/F3K5CHI3PLUXEJBMWJTNJBLKUK/action/replication_record"}},"created_at":"2026-07-05T10:44:15.922456+00:00","updated_at":"2026-07-05T10:44:15.922456+00:00"}