{"as_of":"2026-08-09T08:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8f2d290ee910fd926b8cd07fb5b66853d923a868c07557051158f43d0afeb454","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:18:27.810835Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T06:45:49.611770Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-17T01:58:51.404766Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":"2506.05806","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05806","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llia–enabling low-latency interactive avatars: Real-time audio-driven portrait video generation with diffusion models","venue":null,"work_id":"94be5fa7-10f4-4d43-b623-37373f210233","year":2025},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T23:09:55.836036Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":5},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-17T01:56:44.123092Z"},"links":{"cited_paper":"/paper/2506.05806","citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:5ae4c8a196ea97429602a3a0ba780f70922e9d1096f8e8301c4551b8618d04b8","observation_id":"d188d4fa-de9f-4e3e-9ba6-660af4482247","resolution":{"observed_at":"2026-05-17T01:58:51.407987Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05806","snapshot_observed_at":"2026-08-03T18:39:43.646679Z","title":"Llia–enabling low-latency interactive avatars: Real-time audio-driven portrait video generation with diffusion models.arXiv preprint arXiv:2506.05806, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T23:09:55.836036Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:43.646679Z"},"links":{"cited_paper":"/paper/2506.05806","citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:be9b9a980a892765b10dc9427d8636ef2b674fcbe1513ac2b10239b4540cf9e3","observation_id":"fb09a11e-2136-4d79-978a-df66026497ea","resolution":{"observed_at":"2026-08-03T18:39:43.646679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05806","snapshot_observed_at":"2026-08-04T06:45:49.611770Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02474","last_updated":"2026-08-03T16:42:54Z","snapshot_observed_at":"2026-08-07T12:23:54.414253Z","submitted_at":"2026-08-03T16:42:54Z","title":"EchoCache: Energy-Guided Cross-Modal Caching for Efficient Audio-Driven Video Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T06:45:49.611770Z"},"links":{"cited_paper":"/paper/2506.05806","citing_paper":"/paper/2608.02474"},"observation_digest":"sha256:6bec0bda2e1d71b2903fe08323c9fee938adc89a3a6eb3a39f86d27fc9d41a2a","observation_id":"72ceac6e-82b4-470d-b963-349472f310d9","resolution":{"observed_at":"2026-08-04T06:45:49.611770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.05806/citation-record","integrity":"/paper/2506.05806/integrity","json":"/paper/2506.05806/citation-record.json","paper":"/paper/2506.05806"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:23.196349Z","title":"A lip sync expert is all you need for speech to lip generation in the wild","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:23.196349Z"},"links":{"citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:83afde7b27b89826930c2003d1c12626cc64cf4428db1638923e565d1dc718b0","observation_id":"ca17bc80-f60d-4a04-98ef-1412b9481454","resolution":{"observed_at":"2026-08-07T10:18:23.196349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:23.303790Z","title":"Emo: Emote portrait alive generating expressive portrait videos with audio2video diffusion model under weak conditions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:23.303790Z"},"links":{"citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:752c25bb02d3c03a8050f1ca7a76a4a22f5f24a91871e50e6e850ec0ca7998ab","observation_id":"414366dc-3bdd-410c-bb28-36aa5f59796e","resolution":{"observed_at":"2026-08-07T10:18:23.303790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:23.353953Z","title":"Vasa-1: Lifelike audio-driven talking faces generated in real time.Advances in Neural Information Processing Systems, 37:660–684, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:23.353953Z"},"links":{"citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:a67973c846b949a7811da66a4e403b9d9bcf8f13aee4134cbc8e08797901aa21","observation_id":"f43dcb10-69d6-49e7-bdeb-7d8b0775adde","resolution":{"observed_at":"2026-08-07T10:18:23.353953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:29.618673Z","title":"Sadtalker: Learning realistic 3d motion coefficients for stylized audio-driven single image talking face animation","venue":null,"work_id":"2b0572b2-3675-44d9-a4d1-50ca13e90cc2","year":2023},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:23.468957Z"},"links":{"citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:226dec628064b7bc393de4de2b994c5bebf1a80b38f017de8b39ecfb34b5a390","observation_id":"bff6e7e8-659e-4164-a4ff-5516565eb2fe","resolution":{"observed_at":"2026-08-07T10:18:29.735534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-07T10:18:23.581989Z","title":"Denoising diffusion implicit models.arXiv preprint arXiv:2010.02502, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:23.581989Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:01baacbb2f2176956a22c5b1b7105aa7c21f1fba3c406ef75c29d456a0176810","observation_id":"67a55ddd-daf9-4f89-b61c-93d999784cdc","resolution":{"observed_at":"2026-08-07T10:18:23.581989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:23.702045Z","title":"Denoising diffusion probabilistic models.Advances in neural information processing systems, 33:6840–6851, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:23.702045Z"},"links":{"citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:4070e21424d3d5d11025350ae46728d9e29cad9927153fa9d0a74dba7b82f138","observation_id":"c55c8c15-75b7-4eff-bc7f-ef6a04219bd3","resolution":{"observed_at":"2026-08-07T10:18:23.702045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T10:18:23.849703Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets.arXiv preprint arXiv:2311.15127, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:23.849703Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:4aec4304bcdbac0874aaddeb2052d53ac04ea63857a59152d17e01596ca3615d","observation_id":"3dd28e69-e6fd-4311-9756-8f0bc0ac0d65","resolution":{"observed_at":"2026-08-07T10:18:23.849703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:29.384683Z","title":"Megaportraits: One-shot megapixel neural head avatars","venue":null,"work_id":"be0f7b03-3285-4533-8d82-118d2d0305d4","year":2022},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:23.901840Z"},"links":{"citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:c2e2ddc15f54e87b1a8874c6b497616dbe45d0ac41bae4ae4685dc4512184c06","observation_id":"7d26a6e7-3c58-4ad6-a627-9edd312330b6","resolution":{"observed_at":"2026-08-07T10:18:29.479575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04037","last_updated":"2024-12-05T10:20:34Z","snapshot_observed_at":"2026-08-03T17:56:36.278072Z","submitted_at":"2024-12-05T10:20:34Z","title":"INFP: Audio-Driven Interactive Head Generation in Dyadic Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04037","snapshot_observed_at":"2026-08-07T10:18:23.943246Z","title":"Infp: Audio-driven interactive head generation in dyadic conversations.arXiv preprint arXiv:2412.04037, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:23.943246Z"},"links":{"cited_paper":"/paper/2412.04037","citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:fe13fe39c06f2a39b46cdd595bf8021c6dbe79af25d4b245f7f32f2df1d6ba10","observation_id":"bc068e31-25cc-4c12-bd41-c1c26721d8de","resolution":{"observed_at":"2026-08-07T10:18:23.943246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:24.000147Z","title":"Echomimic: Lifelike audio-driven portrait animations through editable landmark conditions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:24.000147Z"},"links":{"citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:d0982bad7a7610ee4892dc47f453ba784893095fcbb610ed918fd3e4a5b9fd58","observation_id":"81f47936-4d82-4270-8276-134aa87531d0","resolution":{"observed_at":"2026-08-07T10:18:24.000147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-08-07T10:18:24.119456Z","title":"Hallo: Hierarchical audio-driven visual synthesis for portrait image animation.arXiv preprint arXiv:2406.08801, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:24.119456Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:38d5ad395b16d43e8f69333f37c583703c609513316137c56d6f4295f027f9f2","observation_id":"ddb92de9-fd10-43c3-beb7-8a690711cdf2","resolution":{"observed_at":"2026-08-07T10:18:24.119456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07718","last_updated":"2024-10-14T13:35:17Z","snapshot_observed_at":"2026-08-05T03:23:39.587839Z","submitted_at":"2024-10-10T08:34:41Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07718","snapshot_observed_at":"2026-08-07T10:18:24.230525Z","title":"Hallo2: Long-duration and high-resolution audio-driven portrait image animation.arXiv preprint arXiv:2410.07718, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:24.230525Z"},"links":{"cited_paper":"/paper/2410.07718","citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:bfc254704b915a39416dfd18531aae388e9486fff28846f0fcff948f2b6f863d","observation_id":"be5e88b4-c072-4605-8b1e-ab752b2d2f3e","resolution":{"observed_at":"2026-08-07T10:18:24.230525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00733","last_updated":"2025-03-13T08:23:27Z","snapshot_observed_at":"2026-07-06T19:59:37.692710Z","submitted_at":"2024-12-01T08:54:30Z","title":"Hallo3: Highly Dynamic and Realistic Portrait Image Animation with Video Diffusion Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00733","snapshot_observed_at":"2026-08-07T10:18:24.346992Z","title":"Hallo3: Highly dynamic and realistic portrait image animation with video diffusion transformer.arXiv preprint arXiv:2412.00733, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:24.346992Z"},"links":{"cited_paper":"/paper/2412.00733","citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:6e0c9da3e4d33e9d1320055cd1727ed669d6e7e6dc90dd1b91ee193b54012d63","observation_id":"e92e6c34-72c1-457f-94e0-37c71a4b7bc5","resolution":{"observed_at":"2026-08-07T10:18:24.346992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-08-07T10:18:24.450551Z","title":"Aniportrait: Audio-driven synthesis of photorealistic portrait animation.arXiv preprint arXiv:2403.17694, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:24.450551Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:963ce44915fdf9a4223b5908c4909f8443c06a1634003bb48ab0bf002a1c3d10","observation_id":"8dce6ce4-191d-456a-94f1-149be2ffcbab","resolution":{"observed_at":"2026-08-07T10:18:24.450551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01876","last_updated":"2025-04-05T05:31:38Z","snapshot_observed_at":"2026-07-06T19:09:46.147436Z","submitted_at":"2024-09-03T13:19:31Z","title":"CyberHost: Taming Audio-driven Avatar Diffusion Model with Region Codebook Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01876","snapshot_observed_at":"2026-08-07T10:18:24.579865Z","title":"Cyberhost: Taming audio-driven avatar diffusion model with region codebook attention.arXiv preprint arXiv:2409.01876, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:24.579865Z"},"links":{"cited_paper":"/paper/2409.01876","citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:98aa8dfa4cd25c42b121013d9872fcafd8db5b78d81d3acb54c21366e07c213f","observation_id":"4a76ebc3-cbf2-4246-8763-529b4b596b24","resolution":{"observed_at":"2026-08-07T10:18:24.579865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02634","last_updated":"2025-04-04T05:13:40Z","snapshot_observed_at":"2026-08-05T07:44:02.175955Z","submitted_at":"2024-09-04T11:55:14Z","title":"Loopy: Taming Audio-Driven Portrait Avatar with Long-Term Motion Dependency","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02634","snapshot_observed_at":"2026-08-07T10:18:24.712720Z","title":"Loopy: Taming audio- driven portrait avatar with long-term motion dependency.arXiv preprint arXiv:2409.02634, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:24.712720Z"},"links":{"cited_paper":"/paper/2409.02634","citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:253b2e9b46faed1330f05b5a6a0b5d963ceca22ab9e9450d3622258d153565ea","observation_id":"33133a8a-1ce5-4dcc-8d69-a991d324d416","resolution":{"observed_at":"2026-08-07T10:18:24.712720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:24.846533Z","title":"Consistency models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:24.846533Z"},"links":{"citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:7bad8358d78a90af551436b47abdf3dd7cbd56529c4baf06649df15905f13620","observation_id":"697f31a6-831e-4965-8661-c50adda35c8e","resolution":{"observed_at":"2026-08-07T10:18:24.846533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:24.944161Z","title":"Animate anyone: Consistent and controllable image-to-video synthesis for character animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:24.944161Z"},"links":{"citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:b0ba10dbed6e6fe927093f62664a0efffc2f6acedb90a32a282456052b323d6f","observation_id":"bc55c5a8-c0ba-4577-ae14-afadc0db8298","resolution":{"observed_at":"2026-08-07T10:18:24.944161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03168","last_updated":"2025-02-28T14:39:17Z","snapshot_observed_at":"2026-08-08T10:55:01.205999Z","submitted_at":"2024-07-03T14:41:39Z","title":"LivePortrait: Efficient Portrait Animation with Stitching and Retargeting Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03168","snapshot_observed_at":"2026-08-07T10:18:25.039278Z","title":"Liveportrait: Efficient portrait animation with stitching and retargeting control.arXiv preprint arXiv:2407.03168, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:25.039278Z"},"links":{"cited_paper":"/paper/2407.03168","citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:bfd8aebb5e4adc82e82774f72706651cf1d4943795d04b45d18c70f672d03c38","observation_id":"e5eaeb69-6529-43ee-972c-34fcf1bf1952","resolution":{"observed_at":"2026-08-07T10:18:25.039278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:29.128284Z","title":"X-portrait: Expressive portrait animation with hierarchical motion attention","venue":null,"work_id":"4be34f58-f0cf-4b6c-8065-1334c0d44bca","year":2024},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:25.147513Z"},"links":{"citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:a119e7115bacba187b104338bd6e489e8a6a73ea10672e7e20710ad9a9df2615","observation_id":"39e9e265-0112-47c7-9195-558aaf3c522d","resolution":{"observed_at":"2026-08-07T10:18:29.186798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-07-06T15:52:13.602170Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-07T10:18:25.256345Z","title":"Animatediff: Animate your personalized text-to-image diffusion models without specific tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:25.256345Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:0130a08349ff1a32c7337c81372a0f4904eefbaa18ea19aab6f037099de1d370","observation_id":"f43c7580-7b67-4ca7-ace9-e864facf826f","resolution":{"observed_at":"2026-08-07T10:18:25.256345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:25.377340Z","title":"First order motion model for image animation.Advances in neural information processing systems, 32, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:25.377340Z"},"links":{"citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:34fffae486cd21e90047248f3c350ceabbd7f063cd51357a9bf27b8153579c98","observation_id":"1dc0c154-2846-459b-86c5-c2fdb5b91be2","resolution":{"observed_at":"2026-08-07T10:18:25.377340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02433","last_updated":"2025-06-03T09:10:14Z","snapshot_observed_at":"2026-08-07T16:12:05.552932Z","submitted_at":"2025-04-03T09:48:13Z","title":"OmniTalker: One-shot Real-time Text-Driven Talking Audio-Video Generation With Multimodal Style Mimicking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02433","snapshot_observed_at":"2026-08-07T10:18:25.487102Z","title":"Omnitalker: Real-time text-driven talking head generation with in-context audio-visual style replication.arXiv preprint arXiv:2504.02433, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:25.487102Z"},"links":{"cited_paper":"/paper/2504.02433","citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:32b04101b257dcfda276186197dbbb5d0097fc75f57c280b7fb32f546c0a987c","observation_id":"8c23bccc-b356-4b6b-bf42-54674df3b85a","resolution":{"observed_at":"2026-08-07T10:18:25.487102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21144","last_updated":"2025-03-27T04:18:53Z","snapshot_observed_at":"2026-08-07T16:33:53.883380Z","submitted_at":"2025-03-27T04:18:53Z","title":"ChatAnyone: Stylized Real-time Portrait Video Generation with Hierarchical Motion Diffusion Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21144","snapshot_observed_at":"2026-08-07T10:18:25.637600Z","title":"Chatanyone: Stylized real-time portrait video generation with hierarchical motion diffusion model.arXiv preprint arXiv:2503.21144, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:25.637600Z"},"links":{"cited_paper":"/paper/2503.21144","citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:ea903b7b017bfd0f92032777b37f89b87a58201158406fa9a21d8b23c3a3301a","observation_id":"adf63a13-6dec-4a02-bbb7-b95d647a2d93","resolution":{"observed_at":"2026-08-07T10:18:25.637600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:25.735445Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:25.735445Z"},"links":{"citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:be0d52052f98523839c098c1e6d62708b51b600847be97382c5bacd0b323f19c","observation_id":"717ece2f-dd5b-439a-aad0-e5076817d8f4","resolution":{"observed_at":"2026-08-07T10:18:25.735445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T10:18:25.836802Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:25.836802Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:9a9bb436956a43af03ca8994f3b9d9783e889140ce3d9177d3fd59ba763ab12b","observation_id":"0717dae3-1cfa-4ab1-995d-90e61e9b060a","resolution":{"observed_at":"2026-08-07T10:18:25.836802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:25.969650Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations.Advances in neural information processing systems, 33:12449– 12460, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:25.969650Z"},"links":{"citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:3be78a760ea400496f3c0273c65de850b6b0a77cc7bf11dda7b1136c9b8b3ba4","observation_id":"968c5f37-a31d-4231-9f4e-a29f2ae3147a","resolution":{"observed_at":"2026-08-07T10:18:25.969650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-06T05:33:37.746688Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-08-07T10:18:26.115489Z","title":"wav2vec: Unsupervised pre-training for speech recognition.arXiv preprint arXiv:1904.05862, 2019","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:26.115489Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:7284968013bf77bd7525261758b6f5a9721e0423f4052a3d7cb93f700ff2cf24","observation_id":"fbf8f96b-d270-49c2-93b7-92681762c5ff","resolution":{"observed_at":"2026-08-07T10:18:26.115489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:28.937509Z","title":"chinese speech pretrain, 2022","venue":null,"work_id":"d23efee2-9558-4769-82f2-12eaa72e1dd5","year":2022},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:26.276961Z"},"links":{"citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:482626bb5c0079adf5c0facf71c00b6cb3a0a8a2e6a40bd583251a51ffde9fb3","observation_id":"5943c728-876a-4f5d-874f-dffb4ad6e053","resolution":{"observed_at":"2026-08-07T10:18:29.032142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:28.730536Z","title":"Hsemotion: High-speed emotion recognition library.Software Impacts, 14:100433, 2022","venue":null,"work_id":"f644d851-20a7-4f0a-a6ec-b1e376b21887","year":2022},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:26.409346Z"},"links":{"citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:88eb350d8d5dce183e84f9e8e5390bd398b6127eacb21d1498db8c3769fa3abf","observation_id":"2b9f9eef-7a4e-4e63-a5ac-b45a97da4f5b","resolution":{"observed_at":"2026-08-07T10:18:28.831253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12706","last_updated":"2024-03-19T13:08:54Z","snapshot_observed_at":"2026-07-06T17:46:58.758589Z","submitted_at":"2024-03-19T13:08:54Z","title":"AnimateDiff-Lightning: Cross-Model Diffusion Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12706","snapshot_observed_at":"2026-08-07T10:18:26.580353Z","title":"Animatediff-lightning: Cross-model diffusion distillation.arXiv preprint arXiv:2403.12706, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:26.580353Z"},"links":{"cited_paper":"/paper/2403.12706","citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:19c862dbdbc911e9179aaf501b8efd317c462b9aedbd44cb4e516617a246d300","observation_id":"a47c9991-4a64-4092-987f-714aa37a07b6","resolution":{"observed_at":"2026-08-07T10:18:26.580353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13929","last_updated":"2024-03-02T09:09:32Z","snapshot_observed_at":"2026-07-31T02:56:13.600400Z","submitted_at":"2024-02-21T16:51:05Z","title":"SDXL-Lightning: Progressive Adversarial Diffusion Distillation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13929","snapshot_observed_at":"2026-08-07T10:18:26.743525Z","title":"Sdxl-lightning: Progressive adversarial diffusion distillation.arXiv preprint arXiv:2402.13929, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:26.743525Z"},"links":{"cited_paper":"/paper/2402.13929","citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:2a4fb699a16cdd0b566ebde505cf748cadc15d3034fe8bc4fc7640e702e3a2f4","observation_id":"50b578e2-7349-4c67-9925-0e2ecbd5ec06","resolution":{"observed_at":"2026-08-07T10:18:26.743525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:26.967027Z","title":"Generative adversarial networks.Communications of the ACM, 63(11):139–144, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:26.967027Z"},"links":{"citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:686c805eb254ed57ac3c1465ba81096cd352e1721959df04195710ab19f23ab8","observation_id":"b2e01aa1-ed59-4949-a6f3-8843792ae7a4","resolution":{"observed_at":"2026-08-07T10:18:26.967027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:28.483517Z","title":"Animatelcm: Computation-efficient personalized style video generation without personalized video data","venue":null,"work_id":"d9f1454a-d11b-4af3-927b-eb04422bdecc","year":2024},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:27.146314Z"},"links":{"citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:c61938d4b6d22ede3196280d6fc1be8307f5c3130b5e9fc9f600520240bc6718","observation_id":"7dacbc6b-1c76-4e54-a9b1-191da6f89350","resolution":{"observed_at":"2026-08-07T10:18:28.603473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04378","last_updated":"2023-10-06T17:11:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-06T17:11:58Z","title":"Latent Consistency Models: Synthesizing High-Resolution Images with Few-Step Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04378","snapshot_observed_at":"2026-08-07T10:18:27.295219Z","title":"Latent consistency models: Synthesizing high-resolution images with few-step inference.arXiv preprint arXiv:2310.04378, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:27.295219Z"},"links":{"cited_paper":"/paper/2310.04378","citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:c0819d6d858bd89c7bffef07c41605614ed1307d125e9e93215055948d65f42a","observation_id":"e31a5c23-a23b-4ce4-9c00-b9aefb053ddf","resolution":{"observed_at":"2026-08-07T10:18:27.295219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:28.280428Z","title":"Mead: A large-scale audio-visual dataset for emotional talking-face generation","venue":null,"work_id":"ce8eee67-4a0b-46ae-8e2b-439657e80002","year":2020},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:27.412988Z"},"links":{"citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:188c34af5b1b32495eaafa75e31507fbaad4b354e702aad938f623d0a2f882d6","observation_id":"dac69101-cd27-46dd-8147-7781b68b1b9a","resolution":{"observed_at":"2026-08-07T10:18:28.369641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.05622","last_updated":"2018-06-27T01:49:17Z","snapshot_observed_at":"2026-08-08T04:36:13.309903Z","submitted_at":"2018-06-14T15:59:12Z","title":"VoxCeleb2: Deep Speaker Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.05622","snapshot_observed_at":"2026-08-07T10:18:27.509209Z","title":"V oxceleb2: Deep speaker recognition.arXiv preprint arXiv:1806.05622, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:27.509209Z"},"links":{"cited_paper":"/paper/1806.05622","citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:3862a8f2014fc7fe20785fcc2d2f61a9ea07101f84ef7e4f1fa37b6be62c946e","observation_id":"6fab25fc-0325-4226-9fef-b30f63d9c48c","resolution":{"observed_at":"2026-08-07T10:18:27.509209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:18:27.601101Z","title":"Celebv-hq: A large-scale video facial attributes dataset","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:27.601101Z"},"links":{"citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:3bbbf2136b8733d1402770a0ff99452d8b52f25c34ce145ed668adcf82e8ce7d","observation_id":"e97bcf03-adde-49d0-9043-b325031729a4","resolution":{"observed_at":"2026-08-07T10:18:27.601101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.05586","last_updated":"2023-01-13T14:46:46Z","snapshot_observed_at":"2026-07-06T14:41:06.148813Z","submitted_at":"2023-01-13T14:46:46Z","title":"YOLOv6 v3.0: A Full-Scale Reloading","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.05586","snapshot_observed_at":"2026-08-07T10:18:27.700080Z","title":"Yolov6 v3","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:27.700080Z"},"links":{"cited_paper":"/paper/2301.05586","citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:2067884344f5f50ff4fda8ff77ee432bff84e87acb587f0e48e288f5e6e9d970","observation_id":"548058e6-ad0b-41b6-8251-ab0ed6dd69a3","resolution":{"observed_at":"2026-08-07T10:18:27.700080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.08172","last_updated":"2019-06-14T05:49:22Z","snapshot_observed_at":"2026-08-05T19:15:35.517082Z","submitted_at":"2019-06-14T05:49:22Z","title":"MediaPipe: A Framework for Building Perception Pipelines","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.08172","snapshot_observed_at":"2026-08-07T10:18:27.810835Z","title":"Mediapipe: A framework for building perception pipelines.arXiv preprint arXiv:1906.08172, 2019","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:27.810835Z"},"links":{"cited_paper":"/paper/1906.08172","citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:c03c3a70abf4f29fa1fe49f433fea5484f4a282f970c018bb9c527f8354c1388","observation_id":"b2da14e8-311a-41ca-a8be-501cc43112c5","resolution":{"observed_at":"2026-08-07T10:18:27.810835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":0,"verified_fuzzy":7},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 3 inbound Pith citation observations for arXiv:2506.05806."}