Pith. sign in

Paper Citation Record · LEDGER

InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing

As of 17 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 16 inbound Pith citation observations for arXiv:2508.14033.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2508.14033 v1

Coverage vector

measured 28 of 28 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-05T18:50:16.315801Z

measured 44 of 44 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-17T06:30:58.91139+00:00

measured 16 of 16 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-16T00:21:12.170183Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-07-10T01:46:41.083754Z

Reference resolution

28 of 28 outbound references displayed

  • verified exact1
  • verified fuzzy0
  • unresolved26
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch1

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation ab09bcec-d3a2-40f7-9f11-4c6229fdc586 · outbound

This paper cites SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers.

InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers

Reference 5

Resolution
metadata mismatch
local_arxiv, observed 2026-08-05T18:50:16.689954Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-05T18:50:16.222228Z digest=sha256:2989b9461414fd9e2174fc8ca11895a2f1c3f6b532e39b82d68528e63b426b6d

Observation 8257c4c0-00c6-470e-8bda-8d31a86c63d9 · outbound

This paper cites Preserve Your Own Correlation: A Noise Prior for Video Diffusion Models.

InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing Preserve Your Own Correlation: A Noise Prior for Video Diffusion Models

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-05T18:50:16.226522Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T18:50:16.226522Z digest=sha256:8b5608f864b988f6f2cc8b18fef8a5485ab462314e641473ac54fb82bd7092a2

Observation 38caf191-4c42-4523-ba82-abae55629f3a · outbound

This paper cites Latent Video Diffusion Models for High-Fidelity Long Video Generation.

InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing Latent Video Diffusion Models for High-Fidelity Long Video Generation

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-05T18:50:16.230626Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T18:50:16.230626Z digest=sha256:454c8a60526ee191345a0f493d84deaa1e7922c131c468e3768d3a3835b708f0

Observation 474176f5-0c27-40ff-8bcd-eda3b4608e45 · outbound

This paper cites Sonic: Shifting Focus to Global Audio Perception in Portrait Animation.

InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing Sonic: Shifting Focus to Global Audio Perception in Portrait Animation

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-05T18:50:16.238863Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T18:50:16.238863Z digest=sha256:f49065e696a0153dfcf17667d90dac10354fadbc1b524cf8a6723d09c33c4cc7

Observation e8210801-9375-422e-81ab-622b02bb236d · outbound

This paper cites Loopy: Taming Audio-Driven Portrait Avatar with Long-Term Motion Dependency.

InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing Loopy: Taming Audio-Driven Portrait Avatar with Long-Term Motion Dependency

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-05T18:50:16.242885Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T18:50:16.242885Z digest=sha256:6b09c51cbab986af409a633726fa305621a712d1d531347d099850033ffb2fce

Observation dc40bea0-8f73-4da4-a842-e54029d6a5f6 · outbound

This paper cites Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation.

InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-05T18:50:16.246901Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T18:50:16.246901Z digest=sha256:5bc0cc9c073c8c7555dee09294197fa3ada25c3c8c6c1d67972e3a1cf045c233

Observation 747dca05-13f9-470c-85ca-3cbc1f378809 · outbound

This paper cites OmniHuman-1: Rethinking the Scaling-Up of One-Stage Conditioned Human Animation Models.

InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing OmniHuman-1: Rethinking the Scaling-Up of One-Stage Conditioned Human Animation Models

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-05T18:50:16.250863Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T18:50:16.250863Z digest=sha256:4fafc0c3e7fcac4466254966b8435875a8ad1f8a502e55cde06cc669d2509fb7

Observation 442ef830-b345-4b4e-87ac-6f40b39a7e1b · outbound

This paper cites Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow.

InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-05T18:50:16.255055Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T18:50:16.255055Z digest=sha256:4dcc6e6d2d0b0376c484cf4a5c6f6df1a4396ebc17153d53f7744ad4b2f80e9f

Observation be359368-439a-45ef-a39f-213465330d01 · outbound

This paper cites Echomimicv2: Towards striking, simplified, and semi-body human animation.arXiv preprint arXiv:2411.10061,.

InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing Echomimicv2: Towards striking, simplified, and semi-body human animation.arXiv preprint arXiv:2411.10061,

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-05T18:50:16.258924Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T18:50:16.258924Z digest=sha256:d77eedaf9011089e001d954c28cbe20e9539efafba5326d9e83eadc8375d1e96

Observation 4b6740c0-d4cd-494a-aeca-efa089ce0255 · outbound

This paper cites Denoising Diffusion Implicit Models.

InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing Denoising Diffusion Implicit Models

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-05T18:50:16.270062Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T18:50:16.270062Z digest=sha256:dfb02883149e39618706a1cce0dd74c73702c00870e3b09ebeec31cbb4b577fe

Observation 66570f13-5e7a-4442-9bca-2b84f46e50b1 · outbound

This paper cites EMO2: End-Effector Guided Audio-Driven Avatar Video Generation.

InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing EMO2: End-Effector Guided Audio-Driven Avatar Video Generation

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-05T18:50:16.273895Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T18:50:16.273895Z digest=sha256:6c66a76e35dd97bb924093f05740e7b1cf2a2f39707c4f158e436b4ce4074e6f

Observation 3867d22b-ded7-46e9-8995-d25f4a2a5c66 · outbound

This paper cites StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation.

InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-05T18:50:16.277725Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T18:50:16.277725Z digest=sha256:e59020b2b43df65a221984df99682e787c7fd87f4b2c0eb173bd9e3d64c92b86

Observation 0464bfe3-68b9-4d06-8095-c1e1aa39683a · outbound

This paper cites Wan: Open and Advanced Large-Scale Video Generative Models.

InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing Wan: Open and Advanced Large-Scale Video Generative Models

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-05T18:50:16.281778Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T18:50:16.281778Z digest=sha256:456e44933a6058916dbb7562258acc2a3a1ae9ef6daf9d3fb5edf459ee8a96e4

Observation ce572680-1171-40d8-af1b-acf777ebf76e · outbound

This paper cites FantasyTalking: Realistic Talking Portrait Generation via Coherent Motion Synthesis.

InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing FantasyTalking: Realistic Talking Portrait Generation via Coherent Motion Synthesis

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-05T18:50:16.285909Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T18:50:16.285909Z digest=sha256:aa32d2ca9c2e8e5276a085ba872ca5892a3f5d75c160fa2512be42738fdc0515

Observation 579ea692-c4df-4f52-9229-a7b404e6c94e · outbound

This paper cites AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation.

InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-05T18:50:16.290012Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T18:50:16.290012Z digest=sha256:68ad56eee7b4d9bffb4b83a8de0766112fe8910fca7d5818cc99882cf2ab67cd

Observation 0973cc2f-93fd-45f6-ba53-640cd756a9fb · outbound

This paper cites HunyuanVideo: A Systematic Framework For Large Video Generative Models.

InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing HunyuanVideo: A Systematic Framework For Large Video Generative Models

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-05T18:50:16.294004Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T18:50:16.294004Z digest=sha256:df91a99a9dbec5c70f722b748c61b6b9393e5699498ca5ff30b8231bca52c0c3

Observation 19ef1e5d-8a17-44dc-b467-54d2949b301b · outbound

This paper cites Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation.

InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-05T18:50:16.297962Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T18:50:16.297962Z digest=sha256:fae2d24ad13f4bae80ea109e3d4d615f74e83b3c69c55fbec026a84083628a8d

Observation 824bfab3-b5f8-4756-86cf-c406ba731657 · outbound

This paper cites VideoGPT: Video Generation using VQ-VAE and Transformers.

InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing VideoGPT: Video Generation using VQ-VAE and Transformers

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-05T18:50:16.302856Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T18:50:16.302856Z digest=sha256:66423dad92a8281a1043699a1bfa45d85f308d03668a52220dc5c58a3c1b5aad

Observation 4af40de3-25b5-4ebc-8ff7-9f8d52990a57 · outbound

This paper cites CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer.

InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-05T18:50:16.307637Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T18:50:16.307637Z digest=sha256:66519d090d33c018963bff9e4482342795bd9288c85cedc685b02d09a33cc1ba

Observation 4a19a2d5-4538-4199-8f15-632ebf821315 · outbound

This paper cites MuseTalk: Real-Time High-Fidelity Video Dubbing via Spatio-Temporal Sampling.

InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing MuseTalk: Real-Time High-Fidelity Video Dubbing via Spatio-Temporal Sampling

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-05T18:50:16.311819Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T18:50:16.311819Z digest=sha256:41582288b56950fbc5bbfcc8246a64b2018f158a66b67791170723334ef5adc1

Observation b2787ca5-55b9-4613-81a2-0064ab32a68a · outbound

This paper cites MagicVideo: Efficient Video Generation With Latent Diffusion Models.

InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing MagicVideo: Efficient Video Generation With Latent Diffusion Models

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-05T18:50:16.315801Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T18:50:16.315801Z digest=sha256:c8540fbd2fcd6e2ffd3df84e70ba3f89f592d66813a3aed3a5ff6f84a0e07491

Observation c13b9691-63b7-4200-b309-67be32579770 · outbound

This paper cites wav2vec: Unsupervised Pre-training for Speech Recognition.

InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing wav2vec: Unsupervised Pre-training for Speech Recognition

Reference 2019

Resolution
unresolved
no resolver link, observed 2026-08-05T18:50:16.266125Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T18:50:16.266125Z digest=sha256:fb730569b02e4052274271ec11d9017bfe10f8ec7d289617e1e1e783a86ed315

Observation 42883cef-0118-4154-b578-ac67970f0cd1 · outbound

This paper cites wav2vec 2.0: A Framework for Self-Supervised Learning of Speech Representations.

InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing wav2vec 2.0: A Framework for Self-Supervised Learning of Speech Representations

Reference 2020

Resolution
unresolved
no resolver link, observed 2026-08-05T18:50:16.202974Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T18:50:16.202974Z digest=sha256:926a4d7adaaa80a8596b688b966b9aa05b96020b17c78b595b3b649200d7a4de

Observation 0fa3fd89-add1-477e-a523-373614124296 · outbound

This paper cites Scalable Diffusion Models with Transformers.

InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing Scalable Diffusion Models with Transformers

Reference 2021

Resolution
unresolved
no resolver link, observed 2026-08-05T18:50:16.262570Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T18:50:16.262570Z digest=sha256:8b8b5bc5c8636eaaebb9377693cc5e1a415fb221832c8af9f7a60f76331d0527

Observation 014fa5a8-e3a7-4b3f-b43c-51b492f94534 · outbound

This paper cites Imagen Video: High Definition Video Generation with Diffusion Models.

InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing Imagen Video: High Definition Video Generation with Diffusion Models

Reference 2022

Resolution
unresolved
no resolver link, observed 2026-08-05T18:50:16.235021Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T18:50:16.235021Z digest=sha256:681e96db418503ab77395f771dd0d7bf725c7cbc97e0796fbdebb57da74ea82d

Observation 3ba92e8b-0db8-49f0-99a5-6d3c0095b1eb · outbound

This paper cites Hallo3: Highly Dynamic and Realistic Portrait Image Animation with Video Diffusion Transformer.

InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing Hallo3: Highly Dynamic and Realistic Portrait Image Animation with Video Diffusion Transformer

Reference 2023

Resolution
unresolved
no resolver link, observed 2026-08-05T18:50:16.217430Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T18:50:16.217430Z digest=sha256:6952c21beff3710cdffe8ab688557ace5047bba3dce58f39e381ca02ed236b7a

Observation 4e38b2e0-a4b8-4d3e-8f2d-23f112e447c1 · outbound

This paper cites HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters.

InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-08-05T18:50:16.212957Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T18:50:16.212957Z digest=sha256:5112e31f0ddc1deff76bddbc33f80db6a399fb73e782ed8a29033d59452d43e3

Observation 25d22e94-016f-4809-89f1-b28ce8b293e4 · outbound

This paper cites KeySync: A Robust Approach for Leakage-free Lip Synchronization in High Resolution.

InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing KeySync: A Robust Approach for Leakage-free Lip Synchronization in High Resolution

Reference 2025

Resolution
verified exact
local_arxiv, observed 2026-08-05T18:50:16.734496Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-08-05T18:50:16.208292Z digest=sha256:0e080d5fb93af217a30df707026c1a856b82d6558d9dfbe4354147559114b140

Pith citing papers

Observation 184ca7a0-da8e-42b6-88e8-a749e06760ef · inbound

Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length cites this paper.

Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing

Reference 47

Resolution
verified exact
arxiv_id, observed 2026-05-17T01:58:51.413201Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-17T01:56:44.123092Z digest=sha256:ca361d2e44bdf7520cf892826d34aa44e509bfc94a172161d1f69424d4b8fd3f

Observation dcfaf336-cea5-4464-abb7-4b61cee2862c · inbound

Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length cites this paper.

Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-03T18:39:43.445612Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T18:39:43.445612Z digest=sha256:2fd3a2c89aaa8c7e68bc57095f4421d66c5cb171d79f3ececce734058391099b

Observation 7e920353-cfeb-4d1c-a25f-5248dc418040 · inbound

JUST-DUB-IT: Video Dubbing via Joint Audio-Visual Diffusion cites this paper.

JUST-DUB-IT: Video Dubbing via Joint Audio-Visual Diffusion InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing

Reference 25

Resolution
verified exact
arxiv_id, observed 2026-05-16T09:57:42.886733Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-16T09:55:32.044506Z digest=sha256:9ff2fdb4f324aa9732006e68656b536e9cbe6d0b871e4373d4d47b2d5563b476

Observation 0b8c14e7-71a6-43e5-9067-219f8bf328b3 · inbound

EchoTorrent: Towards Swift, Sustained, and Streaming Multi-Modal Video Generation cites this paper.

EchoTorrent: Towards Swift, Sustained, and Streaming Multi-Modal Video Generation InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing

Reference 12

Resolution
verified exact
arxiv_id, observed 2026-05-15T22:20:22.292840Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-15T22:20:16.320171Z digest=sha256:2cce6d839735006a8cc2bf505ad2eb99b84d5a33f063fbf4518aa870bca62734

Observation fdac28bf-7364-4d7b-9fe5-91eef7a43cc1 · inbound

Video Generation Models as World Models: Efficient Paradigms, Architectures and Algorithms cites this paper.

Video Generation Models as World Models: Efficient Paradigms, Architectures and Algorithms InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing

Reference 48

Resolution
verified exact
arxiv_id, observed 2026-05-14T01:38:35.780386Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-14T01:35:14.878069Z digest=sha256:b5ef0c61f5579bf1f8a6ee31638063685e9670149fada90625c544d4f225c5f2

Observation f0623cb4-1003-4e6d-83ab-c65365fa8fe4 · inbound

TurboTalk: Progressive Distillation for One-Step Audio-Driven Talking Avatar Generation cites this paper.

TurboTalk: Progressive Distillation for One-Step Audio-Driven Talking Avatar Generation InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing

Reference 31

Resolution
verified exact
arxiv_id, observed 2026-05-10T11:15:10.365170Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-10T11:13:27.689539Z digest=sha256:459450a3d0dfeea904c3aff4a97c99e63f82c99eedc159842dc3bb06edd66089

Observation dc87ce2f-d742-434d-900e-203d7ba985cc · inbound

OmniHuman: A Large-scale Dataset and Benchmark for Human-Centric Video Generation cites this paper.

OmniHuman: A Large-scale Dataset and Benchmark for Human-Centric Video Generation InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing

Reference 55

Resolution
metadata mismatch
arxiv_id, observed 2026-05-10T05:20:54.898802Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-10T05:19:49.671136Z digest=sha256:6f78cac2d799ae87807fe84198124613577f5779a13b8540846e27fa4418851a

Observation c9e3fd2e-4187-4823-aa81-0a5beefce885 · inbound

OmniHuman: A Large-scale Dataset and Benchmark for Human-Centric Video Generation cites this paper.

OmniHuman: A Large-scale Dataset and Benchmark for Human-Centric Video Generation InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing

Reference 55

Resolution
metadata mismatch
local_arxiv, observed 2026-07-05T12:41:04.320391Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-07-05T12:34:41.758238Z digest=sha256:1815a1923410fe7eb756c729efceeb7e9cd2df838d45c15e66deb6d5a1fc1939

Observation 502f07fc-0591-45e7-8ce3-b659266e83fa · inbound

CoInteract: Physically-Consistent Human-Object Interaction Video Synthesis via Spatially-Structured Co-Generation cites this paper.

CoInteract: Physically-Consistent Human-Object Interaction Video Synthesis via Spatially-Structured Co-Generation InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing

Reference 54

Resolution
metadata mismatch
arxiv_id, observed 2026-05-11T12:41:04.442121Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-10T03:14:45.834520Z digest=sha256:0b53fc774d4e2baa947cd8f103465737c3e3299ea591831cdca5f68d116a013b

Observation acb20e8b-fb31-41f3-88e4-d90f4b9e2e1e · inbound

AsymTalker: Identity-Consistent Long-Term Talking Head Generation via Asymmetric Distillation cites this paper.

AsymTalker: Identity-Consistent Long-Term Talking Head Generation via Asymmetric Distillation InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing

Reference 44

Resolution
verified exact
arxiv_id, observed 2026-05-11T03:45:57.426843Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-05-11T02:18:58.996355Z digest=sha256:a182fe6ea468abfc007ad39009a56789ffd801dd1106a849839371a93c4c9d2a

Observation 03f8bafa-4f21-4467-a1c6-69091ca72bab · inbound

LongCat-Video-Avatar 1.5 Technical Report cites this paper.

LongCat-Video-Avatar 1.5 Technical Report InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing

Reference 5

Resolution
verified exact
arxiv_id, observed 2026-06-29T18:33:50.661119Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-06-29T18:28:16.968339Z digest=sha256:9409feae6fffb6fb2c8881a9a1d099f14c5c4100ee4b780d3cbf0df74ec42949

Observation ee905ee5-cd22-4725-8908-96be10b361af · inbound

DomainShuttle: Freeform Open Domain Subject-driven Text-to-video Generation cites this paper.

DomainShuttle: Freeform Open Domain Subject-driven Text-to-video Generation InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing

Reference 25

Resolution
verified exact
arxiv_id, observed 2026-07-04T21:10:09.703751Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-06-25T19:00:23.260939Z digest=sha256:03b99366518a38cca61a999d400d1a35b76ab15d1e2fc54d3106939c69550f5c

Observation 7d951be3-2251-4f27-ab18-6b549203f47c · inbound

OPSD-V: On-Policy Self-Distillation for Post-Training Few-Step Autoregressive Video Generators cites this paper.

OPSD-V: On-Policy Self-Distillation for Post-Training Few-Step Autoregressive Video Generators InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing

Reference 22

Resolution
verified exact
local_arxiv, observed 2026-07-10T01:46:41.084892Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=pdf_text observed=2026-07-10T01:43:20.551939Z digest=sha256:04c9cc2ebefba7ff9bc1192da13b26da8d66bff9bbc03c6ee340827dbd33bcd9

Observation 40a9d6e5-5bc3-49e9-8a5d-1e4d488177d4 · inbound

LeapTalk: Breaking the Latency-Quality Trade-off in Talking Head Generation cites this paper.

LeapTalk: Breaking the Latency-Quality Trade-off in Talking Head Generation InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing

Reference 129

Resolution
unresolved
no resolver link, observed 2026-08-04T01:32:13.200656Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T01:32:13.200656Z digest=sha256:dd7d595386bc389f272d4ce54c54acddcc25086dfcb4b25507cb32e55834bb6d

Observation 5176338c-a61e-42d7-9fff-d6d985b4da34 · inbound

Diff-VF: Training-free High-quality Long Video Generation via Diffusion Model cites this paper.

Diff-VF: Training-free High-quality Long Video Generation via Diffusion Model InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-07T20:04:20.526722Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T20:04:20.526722Z digest=sha256:0e65e029e29e0b758bc19da0970c3ba5a203716bcdb92360de4b18aa084fc53d

Observation 7f8f4b10-de11-45d0-8722-507d9acc7dfd · inbound

Avatar-Forever: Decoupled Parallel Training for High-Quality Real-Time Infinite Avatars cites this paper.

Avatar-Forever: Decoupled Parallel Training for High-Quality Real-Time Infinite Avatars InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-16T00:21:12.170183Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-16T00:21:12.170183Z digest=sha256:8a18d55e85c10f78dda3c14c7a94bfafdf98f6a0e4c3eef545b3e1a60ba5039e