{"as_of":"2026-08-17T14:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:87c280c4edbddc6ad8899d6813c61e9b06b3c884cd75cb10a2bc98f5645ab013","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T18:50:16.315801Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":16,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:21:12.170183Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T01:46:41.083754Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.14033","last_updated":"2025-08-19T17:55:23Z","snapshot_observed_at":"2026-08-14T22:06:04.675421Z","submitted_at":"2025-08-19T17:55:23Z","title":"InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing","version":1},"cited_work":{"arxiv_id":"2508.14033","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.14033","snapshot_observed_at":"2026-07-10T01:46:41.083754Z","title":"Infinitetalk: Audio-driven video generation for sparse-frame video dubbing","venue":"cs.CV","work_id":"4b6758ec-668a-4f73-9bf3-76af66186225","year":2025},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-13T11:03:16.956715Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":5},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-17T01:56:44.123092Z"},"links":{"cited_paper":"/paper/2508.14033","citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:ca361d2e44bdf7520cf892826d34aa44e509bfc94a172161d1f69424d4b8fd3f","observation_id":"184ca7a0-da8e-42b6-88e8-a749e06760ef","resolution":{"observed_at":"2026-05-17T01:58:51.413201Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.14033","last_updated":"2025-08-19T17:55:23Z","snapshot_observed_at":"2026-08-14T22:06:04.675421Z","submitted_at":"2025-08-19T17:55:23Z","title":"InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.14033","snapshot_observed_at":"2026-08-03T18:39:43.445612Z","title":"Infinitetalk: Audio-driven video generation for sparse-frame video dubbing.arXiv preprint arXiv:2508.14033, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-13T11:03:16.956715Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:43.445612Z"},"links":{"cited_paper":"/paper/2508.14033","citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:2fd3a2c89aaa8c7e68bc57095f4421d66c5cb171d79f3ececce734058391099b","observation_id":"dcfaf336-cea5-4464-abb7-4b61cee2862c","resolution":{"observed_at":"2026-08-03T18:39:43.445612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.14033","last_updated":"2025-08-19T17:55:23Z","snapshot_observed_at":"2026-08-14T22:06:04.675421Z","submitted_at":"2025-08-19T17:55:23Z","title":"InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing","version":1},"cited_work":{"arxiv_id":"2508.14033","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.14033","snapshot_observed_at":"2026-07-10T01:46:41.083754Z","title":"Infinitetalk: Audio-driven video generation for sparse-frame video dubbing","venue":"cs.CV","work_id":"4b6758ec-668a-4f73-9bf3-76af66186225","year":2025},"citing_paper":{"arxiv_id":"2601.22143","last_updated":"2026-05-11T12:30:46Z","snapshot_observed_at":"2026-08-11T10:16:09.917783Z","submitted_at":"2026-01-29T18:57:13Z","title":"JUST-DUB-IT: Video Dubbing via Joint Audio-Visual Diffusion","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-16T09:55:32.044506Z"},"links":{"cited_paper":"/paper/2508.14033","citing_paper":"/paper/2601.22143"},"observation_digest":"sha256:9ff2fdb4f324aa9732006e68656b536e9cbe6d0b871e4373d4d47b2d5563b476","observation_id":"7e920353-cfeb-4d1c-a25f-5248dc418040","resolution":{"observed_at":"2026-05-16T09:57:42.886733Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.14033","last_updated":"2025-08-19T17:55:23Z","snapshot_observed_at":"2026-08-14T22:06:04.675421Z","submitted_at":"2025-08-19T17:55:23Z","title":"InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing","version":1},"cited_work":{"arxiv_id":"2508.14033","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.14033","snapshot_observed_at":"2026-07-10T01:46:41.083754Z","title":"Infinitetalk: Audio-driven video generation for sparse-frame video dubbing","venue":"cs.CV","work_id":"4b6758ec-668a-4f73-9bf3-76af66186225","year":2025},"citing_paper":{"arxiv_id":"2602.13669","last_updated":"2026-04-22T07:41:44Z","snapshot_observed_at":"2026-08-11T04:55:53.338738Z","submitted_at":"2026-02-14T08:32:38Z","title":"EchoTorrent: Towards Swift, Sustained, and Streaming Multi-Modal Video Generation","version":5},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-15T22:20:16.320171Z"},"links":{"cited_paper":"/paper/2508.14033","citing_paper":"/paper/2602.13669"},"observation_digest":"sha256:2cce6d839735006a8cc2bf505ad2eb99b84d5a33f063fbf4518aa870bca62734","observation_id":"0b8c14e7-71a6-43e5-9067-219f8bf328b3","resolution":{"observed_at":"2026-05-15T22:20:22.292840Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.14033","last_updated":"2025-08-19T17:55:23Z","snapshot_observed_at":"2026-08-14T22:06:04.675421Z","submitted_at":"2025-08-19T17:55:23Z","title":"InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing","version":1},"cited_work":{"arxiv_id":"2508.14033","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.14033","snapshot_observed_at":"2026-07-10T01:46:41.083754Z","title":"Infinitetalk: Audio-driven video generation for sparse-frame video dubbing","venue":"cs.CV","work_id":"4b6758ec-668a-4f73-9bf3-76af66186225","year":2025},"citing_paper":{"arxiv_id":"2603.28489","last_updated":"2026-07-04T13:25:12Z","snapshot_observed_at":"2026-08-05T11:17:52.410204Z","submitted_at":"2026-03-30T14:23:45Z","title":"Video Generation Models as World Models: Efficient Paradigms, Architectures and Algorithms","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-14T01:35:14.878069Z"},"links":{"cited_paper":"/paper/2508.14033","citing_paper":"/paper/2603.28489"},"observation_digest":"sha256:b5ef0c61f5579bf1f8a6ee31638063685e9670149fada90625c544d4f225c5f2","observation_id":"fdac28bf-7364-4d7b-9fe5-91eef7a43cc1","resolution":{"observed_at":"2026-05-14T01:38:35.780386Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.14033","last_updated":"2025-08-19T17:55:23Z","snapshot_observed_at":"2026-08-14T22:06:04.675421Z","submitted_at":"2025-08-19T17:55:23Z","title":"InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing","version":1},"cited_work":{"arxiv_id":"2508.14033","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.14033","snapshot_observed_at":"2026-07-10T01:46:41.083754Z","title":"Infinitetalk: Audio-driven video generation for sparse-frame video dubbing","venue":"cs.CV","work_id":"4b6758ec-668a-4f73-9bf3-76af66186225","year":2025},"citing_paper":{"arxiv_id":"2604.14580","last_updated":"2026-05-05T22:56:58Z","snapshot_observed_at":"2026-08-14T00:06:57.661654Z","submitted_at":"2026-04-16T03:19:29Z","title":"TurboTalk: Progressive Distillation for One-Step Audio-Driven Talking Avatar Generation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T11:13:27.689539Z"},"links":{"cited_paper":"/paper/2508.14033","citing_paper":"/paper/2604.14580"},"observation_digest":"sha256:459450a3d0dfeea904c3aff4a97c99e63f82c99eedc159842dc3bb06edd66089","observation_id":"f0623cb4-1003-4e6d-83ab-c65365fa8fe4","resolution":{"observed_at":"2026-05-10T11:15:10.365170Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.14033","last_updated":"2025-08-19T17:55:23Z","snapshot_observed_at":"2026-08-14T22:06:04.675421Z","submitted_at":"2025-08-19T17:55:23Z","title":"InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing","version":1},"cited_work":{"arxiv_id":"2508.14033","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.14033","snapshot_observed_at":"2026-07-10T01:46:41.083754Z","title":"Infinitetalk: Audio-driven video generation for sparse-frame video dubbing","venue":"cs.CV","work_id":"4b6758ec-668a-4f73-9bf3-76af66186225","year":2025},"citing_paper":{"arxiv_id":"2604.18326","last_updated":"2026-05-30T12:42:13Z","snapshot_observed_at":"2026-08-16T04:04:29.404446Z","submitted_at":"2026-04-20T14:28:51Z","title":"OmniHuman: A Large-scale Dataset and Benchmark for Human-Centric Video Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-10T05:19:49.671136Z"},"links":{"cited_paper":"/paper/2508.14033","citing_paper":"/paper/2604.18326"},"observation_digest":"sha256:6f78cac2d799ae87807fe84198124613577f5779a13b8540846e27fa4418851a","observation_id":"dc87ce2f-d742-434d-900e-203d7ba985cc","resolution":{"observed_at":"2026-05-10T05:20:54.898802Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.14033","last_updated":"2025-08-19T17:55:23Z","snapshot_observed_at":"2026-08-14T22:06:04.675421Z","submitted_at":"2025-08-19T17:55:23Z","title":"InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing","version":1},"cited_work":{"arxiv_id":"2508.14033","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.14033","snapshot_observed_at":"2026-07-10T01:46:41.083754Z","title":"Infinitetalk: Audio-driven video generation for sparse-frame video dubbing","venue":"cs.CV","work_id":"4b6758ec-668a-4f73-9bf3-76af66186225","year":2025},"citing_paper":{"arxiv_id":"2604.18326","last_updated":"2026-05-30T12:42:13Z","snapshot_observed_at":"2026-08-16T04:04:29.404446Z","submitted_at":"2026-04-20T14:28:51Z","title":"OmniHuman: A Large-scale Dataset and Benchmark for Human-Centric Video Generation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-05T12:34:41.758238Z"},"links":{"cited_paper":"/paper/2508.14033","citing_paper":"/paper/2604.18326"},"observation_digest":"sha256:1815a1923410fe7eb756c729efceeb7e9cd2df838d45c15e66deb6d5a1fc1939","observation_id":"c9e3fd2e-4187-4823-aa81-0a5beefce885","resolution":{"observed_at":"2026-07-05T12:41:04.320391Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.14033","last_updated":"2025-08-19T17:55:23Z","snapshot_observed_at":"2026-08-14T22:06:04.675421Z","submitted_at":"2025-08-19T17:55:23Z","title":"InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing","version":1},"cited_work":{"arxiv_id":"2508.14033","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.14033","snapshot_observed_at":"2026-07-10T01:46:41.083754Z","title":"Infinitetalk: Audio-driven video generation for sparse-frame video dubbing","venue":"cs.CV","work_id":"4b6758ec-668a-4f73-9bf3-76af66186225","year":2025},"citing_paper":{"arxiv_id":"2604.19636","last_updated":"2026-04-21T16:25:43Z","snapshot_observed_at":"2026-08-15T00:39:55.994416Z","submitted_at":"2026-04-21T16:25:43Z","title":"CoInteract: Physically-Consistent Human-Object Interaction Video Synthesis via Spatially-Structured Co-Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-10T03:14:45.834520Z"},"links":{"cited_paper":"/paper/2508.14033","citing_paper":"/paper/2604.19636"},"observation_digest":"sha256:0b53fc774d4e2baa947cd8f103465737c3e3299ea591831cdca5f68d116a013b","observation_id":"502f07fc-0591-45e7-8ce3-b659266e83fa","resolution":{"observed_at":"2026-05-11T12:41:04.442121Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.14033","last_updated":"2025-08-19T17:55:23Z","snapshot_observed_at":"2026-08-14T22:06:04.675421Z","submitted_at":"2025-08-19T17:55:23Z","title":"InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing","version":1},"cited_work":{"arxiv_id":"2508.14033","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.14033","snapshot_observed_at":"2026-07-10T01:46:41.083754Z","title":"Infinitetalk: Audio-driven video generation for sparse-frame video dubbing","venue":"cs.CV","work_id":"4b6758ec-668a-4f73-9bf3-76af66186225","year":2025},"citing_paper":{"arxiv_id":"2605.02948","last_updated":"2026-05-11T03:04:55Z","snapshot_observed_at":"2026-08-15T15:07:40.497568Z","submitted_at":"2026-05-01T16:38:06Z","title":"AsymTalker: Identity-Consistent Long-Term Talking Head Generation via Asymmetric Distillation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-11T02:18:58.996355Z"},"links":{"cited_paper":"/paper/2508.14033","citing_paper":"/paper/2605.02948"},"observation_digest":"sha256:a182fe6ea468abfc007ad39009a56789ffd801dd1106a849839371a93c4c9d2a","observation_id":"acb20e8b-fb31-41f3-88e4-d90f4b9e2e1e","resolution":{"observed_at":"2026-05-11T03:45:57.426843Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.14033","last_updated":"2025-08-19T17:55:23Z","snapshot_observed_at":"2026-08-14T22:06:04.675421Z","submitted_at":"2025-08-19T17:55:23Z","title":"InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing","version":1},"cited_work":{"arxiv_id":"2508.14033","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.14033","snapshot_observed_at":"2026-07-10T01:46:41.083754Z","title":"Infinitetalk: Audio-driven video generation for sparse-frame video dubbing","venue":"cs.CV","work_id":"4b6758ec-668a-4f73-9bf3-76af66186225","year":2025},"citing_paper":{"arxiv_id":"2605.26486","last_updated":"2026-05-26T02:54:12Z","snapshot_observed_at":"2026-08-16T20:09:48.499781Z","submitted_at":"2026-05-26T02:54:12Z","title":"LongCat-Video-Avatar 1.5 Technical Report","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T18:28:16.968339Z"},"links":{"cited_paper":"/paper/2508.14033","citing_paper":"/paper/2605.26486"},"observation_digest":"sha256:9409feae6fffb6fb2c8881a9a1d099f14c5c4100ee4b780d3cbf0df74ec42949","observation_id":"03f8bafa-4f21-4467-a1c6-69091ca72bab","resolution":{"observed_at":"2026-06-29T18:33:50.661119Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.14033","last_updated":"2025-08-19T17:55:23Z","snapshot_observed_at":"2026-08-14T22:06:04.675421Z","submitted_at":"2025-08-19T17:55:23Z","title":"InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing","version":1},"cited_work":{"arxiv_id":"2508.14033","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.14033","snapshot_observed_at":"2026-07-10T01:46:41.083754Z","title":"Infinitetalk: Audio-driven video generation for sparse-frame video dubbing","venue":"cs.CV","work_id":"4b6758ec-668a-4f73-9bf3-76af66186225","year":2025},"citing_paper":{"arxiv_id":"2606.26058","last_updated":"2026-06-24T17:33:13Z","snapshot_observed_at":"2026-08-10T18:08:57.833777Z","submitted_at":"2026-06-24T17:33:13Z","title":"DomainShuttle: Freeform Open Domain Subject-driven Text-to-video Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-25T19:00:23.260939Z"},"links":{"cited_paper":"/paper/2508.14033","citing_paper":"/paper/2606.26058"},"observation_digest":"sha256:03b99366518a38cca61a999d400d1a35b76ab15d1e2fc54d3106939c69550f5c","observation_id":"ee905ee5-cd22-4725-8908-96be10b361af","resolution":{"observed_at":"2026-07-04T21:10:09.703751Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.14033","last_updated":"2025-08-19T17:55:23Z","snapshot_observed_at":"2026-08-14T22:06:04.675421Z","submitted_at":"2025-08-19T17:55:23Z","title":"InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing","version":1},"cited_work":{"arxiv_id":"2508.14033","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.14033","snapshot_observed_at":"2026-07-10T01:46:41.083754Z","title":"Infinitetalk: Audio-driven video generation for sparse-frame video dubbing","venue":"cs.CV","work_id":"4b6758ec-668a-4f73-9bf3-76af66186225","year":2025},"citing_paper":{"arxiv_id":"2607.08766","last_updated":"2026-07-09T17:59:11Z","snapshot_observed_at":"2026-08-13T19:46:11.199620Z","submitted_at":"2026-07-09T17:59:11Z","title":"OPSD-V: On-Policy Self-Distillation for Post-Training Few-Step Autoregressive Video Generators","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-10T01:43:20.551939Z"},"links":{"cited_paper":"/paper/2508.14033","citing_paper":"/paper/2607.08766"},"observation_digest":"sha256:04c9cc2ebefba7ff9bc1192da13b26da8d66bff9bbc03c6ee340827dbd33bcd9","observation_id":"7d951be3-2251-4f27-ab18-6b549203f47c","resolution":{"observed_at":"2026-07-10T01:46:41.084892Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.14033","last_updated":"2025-08-19T17:55:23Z","snapshot_observed_at":"2026-08-14T22:06:04.675421Z","submitted_at":"2025-08-19T17:55:23Z","title":"InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.14033","snapshot_observed_at":"2026-08-04T01:32:13.200656Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00079","last_updated":"2026-07-29T14:44:57Z","snapshot_observed_at":"2026-08-07T16:05:36.413106Z","submitted_at":"2026-07-29T14:44:57Z","title":"LeapTalk: Breaking the Latency-Quality Trade-off in Talking Head Generation","version":1},"reference_index":129,"source":"arxiv_source","source_observed_at":"2026-08-04T01:32:13.200656Z"},"links":{"cited_paper":"/paper/2508.14033","citing_paper":"/paper/2608.00079"},"observation_digest":"sha256:dd7d595386bc389f272d4ce54c54acddcc25086dfcb4b25507cb32e55834bb6d","observation_id":"40a9d6e5-5bc3-49e9-8a5d-1e4d488177d4","resolution":{"observed_at":"2026-08-04T01:32:13.200656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.14033","last_updated":"2025-08-19T17:55:23Z","snapshot_observed_at":"2026-08-14T22:06:04.675421Z","submitted_at":"2025-08-19T17:55:23Z","title":"InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.14033","snapshot_observed_at":"2026-08-07T20:04:20.526722Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05976","last_updated":"2026-08-06T12:53:46Z","snapshot_observed_at":"2026-08-17T12:22:54.557808Z","submitted_at":"2026-08-06T12:53:46Z","title":"Diff-VF: Training-free High-quality Long Video Generation via Diffusion Model","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T20:04:20.526722Z"},"links":{"cited_paper":"/paper/2508.14033","citing_paper":"/paper/2608.05976"},"observation_digest":"sha256:c09dc7cc7b08a4938edf3c33ffe945cef8ad4c5123c41dad44f5b962f20f2f49","observation_id":"5176338c-a61e-42d7-9fff-d6d985b4da34","resolution":{"observed_at":"2026-08-07T20:04:20.526722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.14033","last_updated":"2025-08-19T17:55:23Z","snapshot_observed_at":"2026-08-14T22:06:04.675421Z","submitted_at":"2025-08-19T17:55:23Z","title":"InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.14033","snapshot_observed_at":"2026-08-16T00:21:12.170183Z","title":"Infinitetalk: Audio-driven video generation for sparse-frame video dubbing.arXiv preprint arXiv:2508.14033, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12107","last_updated":"2026-08-12T14:29:08Z","snapshot_observed_at":"2026-08-17T09:33:56.897818Z","submitted_at":"2026-08-12T14:29:08Z","title":"Avatar-Forever: Decoupled Parallel Training for High-Quality Real-Time Infinite Avatars","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T00:21:12.170183Z"},"links":{"cited_paper":"/paper/2508.14033","citing_paper":"/paper/2608.12107"},"observation_digest":"sha256:e379c197abd3c455cf932bd2323656e67d06d04df1bdd24615422c5c001a6f09","observation_id":"7f8f4b10-de11-45d0-8722-507d9acc7dfd","resolution":{"observed_at":"2026-08-16T00:21:12.170183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.14033/citation-record","integrity":"/paper/2508.14033/integrity","json":"/paper/2508.14033/citation-record.json","paper":"/paper/2508.14033"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-15T11:14:14.860047Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":"2506.00830","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.00830","snapshot_observed_at":"2026-08-05T18:50:16.683799Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","venue":"cs.CV","work_id":"536e56d9-0b2c-4cda-87d3-96be03358761","year":2025},"citing_paper":{"arxiv_id":"2508.14033","last_updated":"2025-08-19T17:55:23Z","snapshot_observed_at":"2026-08-14T22:06:04.675421Z","submitted_at":"2025-08-19T17:55:23Z","title":"InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T18:50:16.222228Z"},"links":{"cited_paper":"/paper/2506.00830","citing_paper":"/paper/2508.14033"},"observation_digest":"sha256:2989b9461414fd9e2174fc8ca11895a2f1c3f6b532e39b82d68528e63b426b6d","observation_id":"ab09bcec-d3a2-40f7-9f11-4c6229fdc586","resolution":{"observed_at":"2026-08-05T18:50:16.689954Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10474","last_updated":"2024-03-26T01:11:52Z","snapshot_observed_at":"2026-08-16T15:32:15.336874Z","submitted_at":"2023-05-17T17:59:16Z","title":"Preserve Your Own Correlation: A Noise Prior for Video Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10474","snapshot_observed_at":"2026-08-05T18:50:16.226522Z","title":"Preserve your own correlation: A noise prior for video diffusion models.arXiv preprint arXiv:2305.10474,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.14033","last_updated":"2025-08-19T17:55:23Z","snapshot_observed_at":"2026-08-14T22:06:04.675421Z","submitted_at":"2025-08-19T17:55:23Z","title":"InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T18:50:16.226522Z"},"links":{"cited_paper":"/paper/2305.10474","citing_paper":"/paper/2508.14033"},"observation_digest":"sha256:8b5608f864b988f6f2cc8b18fef8a5485ab462314e641473ac54fb82bd7092a2","observation_id":"8257c4c0-00c6-470e-8bda-8d31a86c63d9","resolution":{"observed_at":"2026-08-05T18:50:16.226522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-08-13T08:59:59.906684Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-08-05T18:50:16.230626Z","title":"Latent video diffusion models for high-fidelity video generation with arbitrary lengths.arXiv preprint arXiv:2211.13221,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.14033","last_updated":"2025-08-19T17:55:23Z","snapshot_observed_at":"2026-08-14T22:06:04.675421Z","submitted_at":"2025-08-19T17:55:23Z","title":"InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T18:50:16.230626Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2508.14033"},"observation_digest":"sha256:454c8a60526ee191345a0f493d84deaa1e7922c131c468e3768d3a3835b708f0","observation_id":"38caf191-4c42-4523-ba82-abae55629f3a","resolution":{"observed_at":"2026-08-05T18:50:16.230626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16331","last_updated":"2025-06-05T11:49:59Z","snapshot_observed_at":"2026-08-14T22:06:30.252612Z","submitted_at":"2024-11-25T12:24:52Z","title":"Sonic: Shifting Focus to Global Audio Perception in Portrait Animation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16331","snapshot_observed_at":"2026-08-05T18:50:16.238863Z","title":"Sonic: Shifting focus to global audio perception in portrait animation.arXiv preprint arXiv:2411.16331,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.14033","last_updated":"2025-08-19T17:55:23Z","snapshot_observed_at":"2026-08-14T22:06:04.675421Z","submitted_at":"2025-08-19T17:55:23Z","title":"InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T18:50:16.238863Z"},"links":{"cited_paper":"/paper/2411.16331","citing_paper":"/paper/2508.14033"},"observation_digest":"sha256:f49065e696a0153dfcf17667d90dac10354fadbc1b524cf8a6723d09c33c4cc7","observation_id":"474176f5-0c27-40ff-8bcd-eda3b4608e45","resolution":{"observed_at":"2026-08-05T18:50:16.238863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02634","last_updated":"2025-04-04T05:13:40Z","snapshot_observed_at":"2026-08-16T13:21:27.388712Z","submitted_at":"2024-09-04T11:55:14Z","title":"Loopy: Taming Audio-Driven Portrait Avatar with Long-Term Motion Dependency","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02634","snapshot_observed_at":"2026-08-05T18:50:16.242885Z","title":"Loopy: Taming audio-driven portrait avatar with long-term motion dependency.arXiv preprint arXiv:2409.02634,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.14033","last_updated":"2025-08-19T17:55:23Z","snapshot_observed_at":"2026-08-14T22:06:04.675421Z","submitted_at":"2025-08-19T17:55:23Z","title":"InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T18:50:16.242885Z"},"links":{"cited_paper":"/paper/2409.02634","citing_paper":"/paper/2508.14033"},"observation_digest":"sha256:6b09c51cbab986af409a633726fa305621a712d1d531347d099850033ffb2fce","observation_id":"e8210801-9375-422e-81ab-622b02bb236d","resolution":{"observed_at":"2026-08-05T18:50:16.242885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22647","snapshot_observed_at":"2026-08-05T18:50:16.246901Z","title":"Let them talk: Audio-driven multi-person conversational video generation.arXiv preprint arXiv:2505.22647, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.14033","last_updated":"2025-08-19T17:55:23Z","snapshot_observed_at":"2026-08-14T22:06:04.675421Z","submitted_at":"2025-08-19T17:55:23Z","title":"InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T18:50:16.246901Z"},"links":{"cited_paper":"/paper/2505.22647","citing_paper":"/paper/2508.14033"},"observation_digest":"sha256:5bc0cc9c073c8c7555dee09294197fa3ada25c3c8c6c1d67972e3a1cf045c233","observation_id":"dc40bea0-8f73-4da4-a842-e54029d6a5f6","resolution":{"observed_at":"2026-08-05T18:50:16.246901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01061","last_updated":"2025-06-30T08:26:56Z","snapshot_observed_at":"2026-08-15T11:53:30.534687Z","submitted_at":"2025-02-03T05:17:32Z","title":"OmniHuman-1: Rethinking the Scaling-Up of One-Stage Conditioned Human Animation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01061","snapshot_observed_at":"2026-08-05T18:50:16.250863Z","title":"Cyberhost: A one-stage diffusion framework for audio-driven talking body generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.14033","last_updated":"2025-08-19T17:55:23Z","snapshot_observed_at":"2026-08-14T22:06:04.675421Z","submitted_at":"2025-08-19T17:55:23Z","title":"InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T18:50:16.250863Z"},"links":{"cited_paper":"/paper/2502.01061","citing_paper":"/paper/2508.14033"},"observation_digest":"sha256:4fafc0c3e7fcac4466254966b8435875a8ad1f8a502e55cde06cc669d2509fb7","observation_id":"747dca05-13f9-470c-85ca-3cbc1f378809","resolution":{"observed_at":"2026-08-05T18:50:16.250863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-05T18:50:16.255055Z","title":"Chenlin Meng, Yutong He, Yang Song, Jiaming Song, Jiajun Wu, Jun-Yan Zhu, and Stefano Ermon","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.14033","last_updated":"2025-08-19T17:55:23Z","snapshot_observed_at":"2026-08-14T22:06:04.675421Z","submitted_at":"2025-08-19T17:55:23Z","title":"InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T18:50:16.255055Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2508.14033"},"observation_digest":"sha256:4dcc6e6d2d0b0376c484cf4a5c6f6df1a4396ebc17153d53f7744ad4b2f80e9f","observation_id":"442ef830-b345-4b4e-87ac-6f40b39a7e1b","resolution":{"observed_at":"2026-08-05T18:50:16.255055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T18:50:16.258924Z","title":"Echomimicv2: Towards striking, simplified, and semi-body human animation.arXiv preprint arXiv:2411.10061,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.14033","last_updated":"2025-08-19T17:55:23Z","snapshot_observed_at":"2026-08-14T22:06:04.675421Z","submitted_at":"2025-08-19T17:55:23Z","title":"InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T18:50:16.258924Z"},"links":{"citing_paper":"/paper/2508.14033"},"observation_digest":"sha256:d77eedaf9011089e001d954c28cbe20e9539efafba5326d9e83eadc8375d1e96","observation_id":"be359368-439a-45ef-a39f-213465330d01","resolution":{"observed_at":"2026-08-05T18:50:16.258924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-05T18:50:16.270062Z","title":"Denoising diffusion implicit models.arXiv preprint arXiv:2010.02502,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2508.14033","last_updated":"2025-08-19T17:55:23Z","snapshot_observed_at":"2026-08-14T22:06:04.675421Z","submitted_at":"2025-08-19T17:55:23Z","title":"InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T18:50:16.270062Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2508.14033"},"observation_digest":"sha256:dfb02883149e39618706a1cce0dd74c73702c00870e3b09ebeec31cbb4b577fe","observation_id":"4b6740c0-d4cd-494a-aeca-efa089ce0255","resolution":{"observed_at":"2026-08-05T18:50:16.270062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-15T05:23:08.447798Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10687","snapshot_observed_at":"2026-08-05T18:50:16.273895Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.14033","last_updated":"2025-08-19T17:55:23Z","snapshot_observed_at":"2026-08-14T22:06:04.675421Z","submitted_at":"2025-08-19T17:55:23Z","title":"InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T18:50:16.273895Z"},"links":{"cited_paper":"/paper/2501.10687","citing_paper":"/paper/2508.14033"},"observation_digest":"sha256:6c66a76e35dd97bb924093f05740e7b1cf2a2f39707c4f158e436b4ce4074e6f","observation_id":"66570f13-5e7a-4442-9bca-2b84f46e50b1","resolution":{"observed_at":"2026-08-05T18:50:16.273895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-16T23:21:10.223534Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.08248","snapshot_observed_at":"2026-08-05T18:50:16.277725Z","title":"Stableavatar: Infinite-length audio-driven avatar video generation.arXiv preprint arXiv:2508.08248,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.14033","last_updated":"2025-08-19T17:55:23Z","snapshot_observed_at":"2026-08-14T22:06:04.675421Z","submitted_at":"2025-08-19T17:55:23Z","title":"InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T18:50:16.277725Z"},"links":{"cited_paper":"/paper/2508.08248","citing_paper":"/paper/2508.14033"},"observation_digest":"sha256:e59020b2b43df65a221984df99682e787c7fd87f4b2c0eb173bd9e3d64c92b86","observation_id":"3867d22b-ded7-46e9-8995-d25f4a2a5c66","resolution":{"observed_at":"2026-08-05T18:50:16.277725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-08-12T22:34:51.361078Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-05T18:50:16.281778Z","title":"Wan: Open and advanced large-scale video generative models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.14033","last_updated":"2025-08-19T17:55:23Z","snapshot_observed_at":"2026-08-14T22:06:04.675421Z","submitted_at":"2025-08-19T17:55:23Z","title":"InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T18:50:16.281778Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2508.14033"},"observation_digest":"sha256:456e44933a6058916dbb7562258acc2a3a1ae9ef6daf9d3fb5edf459ee8a96e4","observation_id":"0464bfe3-68b9-4d06-8095-c1e1aa39683a","resolution":{"observed_at":"2026-08-05T18:50:16.281778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04842","last_updated":"2025-04-07T08:56:01Z","snapshot_observed_at":"2026-08-16T12:43:28.043771Z","submitted_at":"2025-04-07T08:56:01Z","title":"FantasyTalking: Realistic Talking Portrait Generation via Coherent Motion Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04842","snapshot_observed_at":"2026-08-05T18:50:16.285909Z","title":"Fantasytalking: Realistic talking portrait generation via coherent motion synthesis.arXiv preprint arXiv:2504.04842,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.14033","last_updated":"2025-08-19T17:55:23Z","snapshot_observed_at":"2026-08-14T22:06:04.675421Z","submitted_at":"2025-08-19T17:55:23Z","title":"InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T18:50:16.285909Z"},"links":{"cited_paper":"/paper/2504.04842","citing_paper":"/paper/2508.14033"},"observation_digest":"sha256:aa32d2ca9c2e8e5276a085ba872ca5892a3f5d75c160fa2512be42738fdc0515","observation_id":"ce572680-1171-40d8-af1b-acf777ebf76e","resolution":{"observed_at":"2026-08-05T18:50:16.285909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-16T14:06:16.545839Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-08-05T18:50:16.290012Z","title":"Lavie: High-quality video generation with cascaded latent diffusion models, 2023a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.14033","last_updated":"2025-08-19T17:55:23Z","snapshot_observed_at":"2026-08-14T22:06:04.675421Z","submitted_at":"2025-08-19T17:55:23Z","title":"InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T18:50:16.290012Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2508.14033"},"observation_digest":"sha256:68ad56eee7b4d9bffb4b83a8de0766112fe8910fca7d5818cc99882cf2ab67cd","observation_id":"579ea692-c4df-4f52-9229-a7b404e6c94e","resolution":{"observed_at":"2026-08-05T18:50:16.290012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-17T07:44:10.213698Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T18:50:16.294004Z","title":"Jinbo Xing, Menghan Xia, Yuxin Liu, Yuechen Zhang, Yong Zhang, Yingqing He, Hanyuan Liu, Haoxin Chen, Xiaodong Cun, Xintao Wang, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.14033","last_updated":"2025-08-19T17:55:23Z","snapshot_observed_at":"2026-08-14T22:06:04.675421Z","submitted_at":"2025-08-19T17:55:23Z","title":"InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T18:50:16.294004Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2508.14033"},"observation_digest":"sha256:df91a99a9dbec5c70f722b748c61b6b9393e5699498ca5ff30b8231bca52c0c3","observation_id":"0973cc2f-93fd-45f6-ba53-640cd756a9fb","resolution":{"observed_at":"2026-08-05T18:50:16.294004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-08-16T13:43:29.827089Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-08-05T18:50:16.297962Z","title":"Hallo: Hierarchical audio-driven visual synthesis for portrait image animation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.14033","last_updated":"2025-08-19T17:55:23Z","snapshot_observed_at":"2026-08-14T22:06:04.675421Z","submitted_at":"2025-08-19T17:55:23Z","title":"InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T18:50:16.297962Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2508.14033"},"observation_digest":"sha256:fae2d24ad13f4bae80ea109e3d4d615f74e83b3c69c55fbec026a84083628a8d","observation_id":"19ef1e5d-8a17-44dc-b467-54d2949b301b","resolution":{"observed_at":"2026-08-05T18:50:16.297962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.10157","last_updated":"2021-09-14T21:20:06Z","snapshot_observed_at":"2026-08-17T06:54:13.493934Z","submitted_at":"2021-04-20T17:58:03Z","title":"VideoGPT: Video Generation using VQ-VAE and Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.10157","snapshot_observed_at":"2026-08-05T18:50:16.302856Z","title":"Videogpt: Video generation using vq-vae and transformers.arXiv preprint arXiv:2104.10157,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.14033","last_updated":"2025-08-19T17:55:23Z","snapshot_observed_at":"2026-08-14T22:06:04.675421Z","submitted_at":"2025-08-19T17:55:23Z","title":"InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T18:50:16.302856Z"},"links":{"cited_paper":"/paper/2104.10157","citing_paper":"/paper/2508.14033"},"observation_digest":"sha256:66423dad92a8281a1043699a1bfa45d85f308d03668a52220dc5c58a3c1b5aad","observation_id":"824bfab3-b5f8-4756-86cf-c406ba731657","resolution":{"observed_at":"2026-08-05T18:50:16.302856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-08-15T19:52:28.153954Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-05T18:50:16.307637Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer.arXiv preprint arXiv:2408.06072,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.14033","last_updated":"2025-08-19T17:55:23Z","snapshot_observed_at":"2026-08-14T22:06:04.675421Z","submitted_at":"2025-08-19T17:55:23Z","title":"InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T18:50:16.307637Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2508.14033"},"observation_digest":"sha256:66519d090d33c018963bff9e4482342795bd9288c85cedc685b02d09a33cc1ba","observation_id":"4af40de3-25b5-4ebc-8ff7-9f8d52990a57","resolution":{"observed_at":"2026-08-05T18:50:16.307637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10122","last_updated":"2025-03-26T10:48:17Z","snapshot_observed_at":"2026-08-16T13:09:46.866215Z","submitted_at":"2024-10-14T03:22:26Z","title":"MuseTalk: Real-Time High-Fidelity Video Dubbing via Spatio-Temporal Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10122","snapshot_observed_at":"2026-08-05T18:50:16.311819Z","title":"14 Zhimeng Zhang, Lincheng Li, Yu Ding, and Changjie Fan","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.14033","last_updated":"2025-08-19T17:55:23Z","snapshot_observed_at":"2026-08-14T22:06:04.675421Z","submitted_at":"2025-08-19T17:55:23Z","title":"InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T18:50:16.311819Z"},"links":{"cited_paper":"/paper/2410.10122","citing_paper":"/paper/2508.14033"},"observation_digest":"sha256:41582288b56950fbc5bbfcc8246a64b2018f158a66b67791170723334ef5adc1","observation_id":"4a19a2d5-4538-4199-8f15-632ebf821315","resolution":{"observed_at":"2026-08-05T18:50:16.311819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11018","last_updated":"2023-05-11T11:23:03Z","snapshot_observed_at":"2026-08-16T05:49:16.026825Z","submitted_at":"2022-11-20T16:40:31Z","title":"MagicVideo: Efficient Video Generation With Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11018","snapshot_observed_at":"2026-08-05T18:50:16.315801Z","title":"Magicvideo: Efficient video generation with latent diffusion models.arXiv preprint arXiv:2211.11018,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.14033","last_updated":"2025-08-19T17:55:23Z","snapshot_observed_at":"2026-08-14T22:06:04.675421Z","submitted_at":"2025-08-19T17:55:23Z","title":"InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T18:50:16.315801Z"},"links":{"cited_paper":"/paper/2211.11018","citing_paper":"/paper/2508.14033"},"observation_digest":"sha256:c8540fbd2fcd6e2ffd3df84e70ba3f89f592d66813a3aed3a5ff6f84a0e07491","observation_id":"b2787ca5-55b9-4613-81a2-0064ab32a68a","resolution":{"observed_at":"2026-08-05T18:50:16.315801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-08-05T18:50:16.266125Z","title":"Uriel Singer, Adam Polyak, Thomas Hayes, Xi Yin, Jie An, Songyang Zhang, Qiyuan Hu, Harry Yang, Oron Ashual, Oran Gafni, et al","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2508.14033","last_updated":"2025-08-19T17:55:23Z","snapshot_observed_at":"2026-08-14T22:06:04.675421Z","submitted_at":"2025-08-19T17:55:23Z","title":"InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-05T18:50:16.266125Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2508.14033"},"observation_digest":"sha256:5b3fb6889c9409b5617b2fba78e0ea881959933c90b7263e8568087577d0358e","observation_id":"c13b9691-63b7-4200-b309-67be32579770","resolution":{"observed_at":"2026-08-05T18:50:16.266125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.11477","last_updated":"2020-10-22T06:09:10Z","snapshot_observed_at":"2026-08-14T22:05:39.651975Z","submitted_at":"2020-06-20T02:35:02Z","title":"wav2vec 2.0: A Framework for Self-Supervised Learning of Speech Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.11477","snapshot_observed_at":"2026-08-05T18:50:16.202974Z","title":"Antoni Bigata, Rodrigo Mira, Stella Bounareli, Michał Stypułkowski, Konstantinos V ougioukas, Stavros Petridis, and Maja Pantic","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2508.14033","last_updated":"2025-08-19T17:55:23Z","snapshot_observed_at":"2026-08-14T22:06:04.675421Z","submitted_at":"2025-08-19T17:55:23Z","title":"InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-05T18:50:16.202974Z"},"links":{"cited_paper":"/paper/2006.11477","citing_paper":"/paper/2508.14033"},"observation_digest":"sha256:926a4d7adaaa80a8596b688b966b9aa05b96020b17c78b595b3b649200d7a4de","observation_id":"42883cef-0118-4154-b578-ac67970f0cd1","resolution":{"observed_at":"2026-08-05T18:50:16.202974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09748","last_updated":"2023-03-02T09:06:55Z","snapshot_observed_at":"2026-07-06T14:32:37.317828Z","submitted_at":"2022-12-19T18:59:58Z","title":"Scalable Diffusion Models with Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09748","snapshot_observed_at":"2026-08-05T18:50:16.262570Z","title":"Scalable diffusion models with transformers.arXiv preprint arXiv:2212.09748,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.14033","last_updated":"2025-08-19T17:55:23Z","snapshot_observed_at":"2026-08-14T22:06:04.675421Z","submitted_at":"2025-08-19T17:55:23Z","title":"InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-05T18:50:16.262570Z"},"links":{"cited_paper":"/paper/2212.09748","citing_paper":"/paper/2508.14033"},"observation_digest":"sha256:8b8b5bc5c8636eaaebb9377693cc5e1a415fb221832c8af9f7a60f76331d0527","observation_id":"0fa3fd89-add1-477e-a523-373614124296","resolution":{"observed_at":"2026-08-05T18:50:16.262570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-05T18:50:16.235021Z","title":"Imagen video: High definition video generation with diffusion models.arXiv preprint arXiv:2210.02303, 2022a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.14033","last_updated":"2025-08-19T17:55:23Z","snapshot_observed_at":"2026-08-14T22:06:04.675421Z","submitted_at":"2025-08-19T17:55:23Z","title":"InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-05T18:50:16.235021Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2508.14033"},"observation_digest":"sha256:681e96db418503ab77395f771dd0d7bf725c7cbc97e0796fbdebb57da74ea82d","observation_id":"014fa5a8-e3a7-4b3f-b43c-51b492f94534","resolution":{"observed_at":"2026-08-05T18:50:16.235021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00733","last_updated":"2025-03-13T08:23:27Z","snapshot_observed_at":"2026-08-12T11:06:26.827328Z","submitted_at":"2024-12-01T08:54:30Z","title":"Hallo3: Highly Dynamic and Realistic Portrait Image Animation with Video Diffusion Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00733","snapshot_observed_at":"2026-08-05T18:50:16.217430Z","title":"Hallo3: Highly dynamic and realistic portrait image animation with video diffusion transformer.arXiv preprint arXiv:2412.00733,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.14033","last_updated":"2025-08-19T17:55:23Z","snapshot_observed_at":"2026-08-14T22:06:04.675421Z","submitted_at":"2025-08-19T17:55:23Z","title":"InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T18:50:16.217430Z"},"links":{"cited_paper":"/paper/2412.00733","citing_paper":"/paper/2508.14033"},"observation_digest":"sha256:6952c21beff3710cdffe8ab688557ace5047bba3dce58f39e381ca02ed236b7a","observation_id":"3ba92e8b-0db8-49f0-99a5-6d3c0095b1eb","resolution":{"observed_at":"2026-08-05T18:50:16.217430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-07T13:55:40.621856Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20156","snapshot_observed_at":"2026-08-05T18:50:16.212957Z","title":"Hunyuanvideo-avatar: High-fidelity audio-driven human animation for multiple characters.arXiv preprint arXiv:2505.20156, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.14033","last_updated":"2025-08-19T17:55:23Z","snapshot_observed_at":"2026-08-14T22:06:04.675421Z","submitted_at":"2025-08-19T17:55:23Z","title":"InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T18:50:16.212957Z"},"links":{"cited_paper":"/paper/2505.20156","citing_paper":"/paper/2508.14033"},"observation_digest":"sha256:5112e31f0ddc1deff76bddbc33f80db6a399fb73e782ed8a29033d59452d43e3","observation_id":"4e38b2e0-a4b8-4d3e-8f2d-23f112e447c1","resolution":{"observed_at":"2026-08-05T18:50:16.212957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00497","last_updated":"2025-05-01T12:56:17Z","snapshot_observed_at":"2026-08-16T04:38:16.112591Z","submitted_at":"2025-05-01T12:56:17Z","title":"KeySync: A Robust Approach for Leakage-free Lip Synchronization in High Resolution","version":1},"cited_work":{"arxiv_id":"2505.00497","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.00497","snapshot_observed_at":"2026-08-05T18:50:16.728884Z","title":"KeySync: A Robust Approach for Leakage-free Lip Synchronization in High Resolution","venue":"cs.CV","work_id":"5e704d50-f343-407b-aec3-d63102988544","year":2025},"citing_paper":{"arxiv_id":"2508.14033","last_updated":"2025-08-19T17:55:23Z","snapshot_observed_at":"2026-08-14T22:06:04.675421Z","submitted_at":"2025-08-19T17:55:23Z","title":"InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T18:50:16.208292Z"},"links":{"cited_paper":"/paper/2505.00497","citing_paper":"/paper/2508.14033"},"observation_digest":"sha256:0e080d5fb93af217a30df707026c1a856b82d6558d9dfbe4354147559114b140","observation_id":"25d22e94-016f-4809-89f1-b28ce8b293e4","resolution":{"observed_at":"2026-08-05T18:50:16.734496Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.14033","last_updated":"2025-08-19T17:55:23Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T22:06:04.675421Z","submitted_at":"2025-08-19T17:55:23Z","title":"InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":26,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 16 inbound Pith citation observations for arXiv:2508.14033."}