{"as_of":"2026-08-10T08:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d0612c6b212699957a1704b2be6844d35940b2dda3e107fc6dac359eba3e00a1","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":58,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T21:11:25.341871Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T02:16:26.575398Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":"2403.17694","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-07-02T02:16:26.575398Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","venue":null,"work_id":"d41ca9c8-5720-452c-86ce-b4d81eaf7dee","year":2024},"citing_paper":{"arxiv_id":"2411.09209","last_updated":"2026-04-16T07:45:17Z","snapshot_observed_at":"2026-08-07T12:05:21.397143Z","submitted_at":"2024-11-14T06:13:05Z","title":"JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation","version":5},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-23T16:59:57.727035Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2411.09209"},"observation_digest":"sha256:844482ee526540d5c3f6fa6520e4a0a0282b1df4cea58b48591af3d0bdecb90a","observation_id":"01855afa-757d-419b-9cb5-40e207cc27d3","resolution":{"observed_at":"2026-05-23T17:03:12.558326Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":"2403.17694","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-07-02T02:16:26.575398Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","venue":null,"work_id":"d41ca9c8-5720-452c-86ce-b4d81eaf7dee","year":2024},"citing_paper":{"arxiv_id":"2411.16748","last_updated":"2026-05-08T09:16:59Z","snapshot_observed_at":"2026-08-04T02:06:42.093429Z","submitted_at":"2024-11-24T04:46:00Z","title":"Multimodal Diffusion Transformer with Memory Bank for Scalable Long-Duration Talking Video Generation","version":5},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-23T17:19:51.411937Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2411.16748"},"observation_digest":"sha256:86f6f7b6dd89e7f7e3fa110fe3f07b489806d0a075ce5a8cc0a195f82544d21f","observation_id":"a0475f1b-34d4-4481-a77b-500538431ca7","resolution":{"observed_at":"2026-05-23T17:23:15.361627Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-08-07T21:11:25.341871Z","title":"Aniportrait: Audio-driven synthesis of photorealistic portrait animation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.09533","last_updated":"2025-02-13T17:50:23Z","snapshot_observed_at":"2026-08-07T22:10:29.240376Z","submitted_at":"2025-02-13T17:50:23Z","title":"Long-Term TalkingFace Generation via Motion-Prior Conditional Diffusion Model","version":1},"reference_index":2004,"source":"pdf_text","source_observed_at":"2026-08-07T21:11:25.341871Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2502.09533"},"observation_digest":"sha256:88afa82781ea52944915c7897145abc6396993da535dc774a0246a090b03067c","observation_id":"88ec1c50-ff40-442b-8334-1dada8c4bcc6","resolution":{"observed_at":"2026-08-07T21:11:25.341871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-08-07T13:49:52.852981Z","title":"Aniportrait: Audio-driven synthesis of photorealistic portrait animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20861","last_updated":"2025-05-27T08:13:38Z","snapshot_observed_at":"2026-08-08T21:09:14.127086Z","submitted_at":"2025-05-27T08:13:38Z","title":"Exploring Timeline Control for Facial Motion Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:52.852981Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2505.20861"},"observation_digest":"sha256:ab0ef451219d63a556d51dc605e91493224d457fe41b440ebeb531c20033004b","observation_id":"1f0bcfd1-d675-4f87-ae55-6c336198b589","resolution":{"observed_at":"2026-08-07T13:49:52.852981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-08-07T13:21:46.497816Z","title":"Aniportrait: Audio-driven synthesis of photorealistic portrait animation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22141","last_updated":"2025-08-27T16:33:34Z","snapshot_observed_at":"2026-08-07T20:49:32.346427Z","submitted_at":"2025-05-28T09:04:00Z","title":"FaceEditTalker: Controllable Talking Head Generation with Facial Attribute Editing","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:46.497816Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2505.22141"},"observation_digest":"sha256:ec11e9223def77b56140121cc226fb77c1b6bdb8bed4e7c643cc4f8286c4a6f0","observation_id":"0d178024-8051-4ec1-a070-bf1c516af756","resolution":{"observed_at":"2026-08-07T13:21:46.497816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-08-07T13:07:34.059612Z","title":"Aniportrait: Audio-driven synthesis of photore- alistic portrait animation.arXiv preprint arXiv:2403.17694, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:07:34.059612Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2505.22647"},"observation_digest":"sha256:38656b6271c532a66005e5e058e1b473a34a0a268733fd2b5a8a12e4f42bdc05","observation_id":"b146ccef-7509-4d14-9277-f7205658eaec","resolution":{"observed_at":"2026-08-07T13:07:34.059612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-08-07T12:01:08.767656Z","title":"Aniportrait: Audio-driven synthesis of photore- alistic portrait animation.arXiv preprint arXiv:2403.17694, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-09T23:45:49.184514Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:08.767656Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:4eb33d89c050df1f232e4fcb614bf19478e2e54c000ff0d7288ceadbe6f28716","observation_id":"67cedca9-14dc-44f2-b242-aff70eb235b5","resolution":{"observed_at":"2026-08-07T12:01:08.767656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-08-07T13:17:56.065494Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05368","last_updated":"2025-05-28T09:13:41Z","snapshot_observed_at":"2026-08-07T20:52:22.030249Z","submitted_at":"2025-05-28T09:13:41Z","title":"Speaking images. A novel framework for the automated self-description of artworks","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T13:17:56.065494Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2506.05368"},"observation_digest":"sha256:8e197e96907e3b3075313ad1d4a2bd0a53db15e0183a998e9fb9298120b3d5aa","observation_id":"9ac92218-4b33-48cd-bef9-b7b07723083f","resolution":{"observed_at":"2026-08-07T13:17:56.065494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-08-07T10:18:24.450551Z","title":"Aniportrait: Audio-driven synthesis of photorealistic portrait animation.arXiv preprint arXiv:2403.17694, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-08-07T20:50:54.524255Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:24.450551Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2506.05806"},"observation_digest":"sha256:963ce44915fdf9a4223b5908c4909f8443c06a1634003bb48ab0bf002a1c3d10","observation_id":"8dce6ce4-191d-456a-94f1-149be2ffcbab","resolution":{"observed_at":"2026-08-07T10:18:24.450551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-08-07T05:24:30.408110Z","title":"AniPortrait: Audio-driven synthesis of photorealistic portrait animation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08003","last_updated":"2025-06-09T17:59:42Z","snapshot_observed_at":"2026-08-07T10:34:46.576486Z","submitted_at":"2025-06-09T17:59:42Z","title":"Audio-Sync Video Generation with Multi-Stream Temporal Control","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:24:30.408110Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2506.08003"},"observation_digest":"sha256:c1ea5bee8aaa75ce63493d53e7ef4b32392931bfd0d2c7435436d5dff731f091","observation_id":"c3a1929b-d64c-4a7e-b2a7-33342cbf61a2","resolution":{"observed_at":"2026-08-07T05:24:30.408110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-08-06T23:42:37.820190Z","title":"Aniportrait: Audio-driven synthesis of photorealistic portrait animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16852","last_updated":"2025-06-20T09:01:17Z","snapshot_observed_at":"2026-08-07T20:50:35.287232Z","submitted_at":"2025-06-20T09:01:17Z","title":"Controllable and Expressive One-Shot Video Head Swapping","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:37.820190Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2506.16852"},"observation_digest":"sha256:18a1627ebbe151c38732652b92ae813950a0e1f47e1f8e4e6a31ddbce1126d09","observation_id":"e7768a50-d62b-4394-bd18-c1521d85f809","resolution":{"observed_at":"2026-08-06T23:42:37.820190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":"2403.17694","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-07-02T02:16:26.575398Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","venue":null,"work_id":"d41ca9c8-5720-452c-86ce-b4d81eaf7dee","year":2024},"citing_paper":{"arxiv_id":"2506.23552","last_updated":"2026-05-15T04:47:28Z","snapshot_observed_at":"2026-07-06T21:49:33.849898Z","submitted_at":"2025-06-30T06:51:40Z","title":"JAM-Flow: Joint Audio-Motion Synthesis with Flow Matching","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-22T00:46:39.196042Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2506.23552"},"observation_digest":"sha256:aa58f62607f332453b1ac629523686899e57a0fabf34ef889249eebac4d64bfa","observation_id":"042642b1-40a0-4eb1-a81b-f1ab250bac94","resolution":{"observed_at":"2026-05-22T00:50:51.067493Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-08-06T20:58:30.336835Z","title":"Aniportrait: Audio-driven synthesis of photorealistic portrait animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-07T20:49:14.374372Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:30.336835Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:383f8f54e4a00ce13a723f98eae30d9a087c7e597b70e0e1ecd511937990dcce","observation_id":"b3eff734-9988-4b39-90e7-632f17a4d897","resolution":{"observed_at":"2026-08-06T20:58:30.336835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-08-06T19:38:20.556209Z","title":"Aniportrait: Audio-driven synthesis of photorealistic portrait animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-10T05:26:38.208823Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.556209Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:e3d314ad30236bab0aea8b1f8e3ec9865cde9039d69abd45ec2e9f5546b9c0d4","observation_id":"4654cc85-ca5c-4d2b-8181-5c1c68606216","resolution":{"observed_at":"2026-08-06T19:38:20.556209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-08-06T19:00:03.247582Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06812","last_updated":"2025-07-14T04:35:26Z","snapshot_observed_at":"2026-08-09T08:14:16.525087Z","submitted_at":"2025-07-09T13:02:12Z","title":"Democratizing High-Fidelity Co-Speech Gesture Video Generation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T19:00:03.247582Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2507.06812"},"observation_digest":"sha256:3362825de82767b10122e246ae206cb0ca66be2de8d87cc147a3e420b3ff1e1d","observation_id":"2b7a5166-c530-4d93-928f-bb09d9a70d22","resolution":{"observed_at":"2026-08-06T19:00:03.247582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-08-06T16:44:38.865416Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12758","last_updated":"2025-07-17T03:22:39Z","snapshot_observed_at":"2026-08-10T05:47:54.470165Z","submitted_at":"2025-07-17T03:22:39Z","title":"HairShifter: Consistent and High-Fidelity Video Hair Transfer via Anchor-Guided Animation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T16:44:38.865416Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2507.12758"},"observation_digest":"sha256:6362a7b6d1beb9b363c5a7902816a051cac7bb766a2f8dab6d17a760f00e7e14","observation_id":"8e5fc1b8-01d5-4dad-9028-01b91495ccec","resolution":{"observed_at":"2026-08-06T16:44:38.865416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-08-06T13:37:09.367614Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20368","last_updated":"2025-07-27T17:53:00Z","snapshot_observed_at":"2026-08-07T20:50:14.751272Z","submitted_at":"2025-07-27T17:53:00Z","title":"MagicAnime: A Hierarchically Annotated, Multimodal and Multitasking Dataset with Benchmarks for Cartoon Animation Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T13:37:09.367614Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2507.20368"},"observation_digest":"sha256:25fa361301fdb608bbd1280efbf1d5d9e3feaa20659c62720bf4232a07163451","observation_id":"451ecb1f-5204-42bb-bf13-a7b8433af352","resolution":{"observed_at":"2026-08-06T13:37:09.367614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-08-06T11:03:44.884845Z","title":"Aniportrait: Audio-driven synthesis of photorealistic portrait animation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.23143","last_updated":"2025-07-30T22:46:52Z","snapshot_observed_at":"2026-08-07T20:50:58.945663Z","submitted_at":"2025-07-30T22:46:52Z","title":"X-NeMo: Expressive Neural Motion Reenactment via Disentangled Latent Attention","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T11:03:44.884845Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2507.23143"},"observation_digest":"sha256:6d859fb1e59d3056d4e56131c1a072e0537b8961dcfc895e9baf243b768ffd36","observation_id":"57b2f6d9-df91-483c-b7ec-79d5c4258cc8","resolution":{"observed_at":"2026-08-06T11:03:44.884845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-08-06T05:05:49.133791Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02362","last_updated":"2025-08-04T12:50:22Z","snapshot_observed_at":"2026-08-07T08:30:16.261665Z","submitted_at":"2025-08-04T12:50:22Z","title":"Text2Lip: Progressive Lip-Synced Talking Face Generation from Text via Viseme-Guided Rendering","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T05:05:49.133791Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2508.02362"},"observation_digest":"sha256:f50dedcbdfe2b7f4a8ee10bdda4b8dbb995eab0a16685ec6fe1d7c90bc6c316a","observation_id":"247b5a6b-0495-44f0-bebb-21bf2c18ce6e","resolution":{"observed_at":"2026-08-06T05:05:49.133791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-08-06T05:02:04.490234Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02476","last_updated":"2025-08-04T14:42:20Z","snapshot_observed_at":"2026-08-08T05:05:20.743520Z","submitted_at":"2025-08-04T14:42:20Z","title":"PoseGuard: Pose-Guided Generation with Safety Guardrails","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T05:02:04.490234Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2508.02476"},"observation_digest":"sha256:ca86ca7b89139daa8e6882a32faf2cb51a2fd3f4c89a540d89b4d5c5bbe89fd2","observation_id":"f0271651-de71-42ed-baa9-1453bd3231fa","resolution":{"observed_at":"2026-08-06T05:02:04.490234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-08-06T12:43:23.684599Z","title":"Aniportrait: Audio-driven synthesis of photorealistic portrait animation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:23.684599Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:9beda31f46becc79c01c37a0f4ccd7df53b552b6fe5e809166ee7dbd1b5191fd","observation_id":"499289a0-6f66-421d-af3e-61575593d220","resolution":{"observed_at":"2026-08-06T12:43:23.684599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-08-05T22:04:35.670348Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07603","last_updated":"2025-08-11T04:13:32Z","snapshot_observed_at":"2026-08-09T19:22:11.032860Z","submitted_at":"2025-08-11T04:13:32Z","title":"LaVieID: Local Autoregressive Diffusion Transformers for Identity-Preserving Video Creation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T22:04:35.670348Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2508.07603"},"observation_digest":"sha256:51e1d4641327513ad5be5a38a7316eb5f7827182d0c6ed45f58a58d7db273e7c","observation_id":"b0f0a0fb-6853-4d42-82b3-bdd80fcd9c44","resolution":{"observed_at":"2026-08-05T22:04:35.670348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-08-05T20:06:49.448579Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11255","last_updated":"2025-08-15T06:43:46Z","snapshot_observed_at":"2026-08-08T07:02:19.422958Z","submitted_at":"2025-08-15T06:43:46Z","title":"FantasyTalking2: Timestep-Layer Adaptive Preference Optimization for Audio-Driven Portrait Animation","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-05T20:06:49.448579Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2508.11255"},"observation_digest":"sha256:9417ddad1c361c741e0b83b44f215196a7e4ea0c0641768a784257fc946fcbaa","observation_id":"e80c8543-d238-47bf-8d0b-1784c00321a0","resolution":{"observed_at":"2026-08-05T20:06:49.448579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-08-05T19:07:36.310450Z","title":"Aniportrait: Audio-driven synthesis of photorealistic portrait animation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13442","last_updated":"2025-08-19T01:55:25Z","snapshot_observed_at":"2026-08-07T21:53:25.249431Z","submitted_at":"2025-08-19T01:55:25Z","title":"EDTalk++: Full Disentanglement for Controllable Talking Head Synthesis","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T19:07:36.310450Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2508.13442"},"observation_digest":"sha256:5d50dc8f199ebb9bf039613a36318dece0e05ff400d4d0c9aa51c3628ea8e59a","observation_id":"4023f325-6310-4ae0-81b6-c88c7ac8add9","resolution":{"observed_at":"2026-08-05T19:07:36.310450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-08-05T18:50:16.290012Z","title":"Lavie: High-quality video generation with cascaded latent diffusion models, 2023a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.14033","last_updated":"2025-08-19T17:55:23Z","snapshot_observed_at":"2026-08-05T18:50:15.388089Z","submitted_at":"2025-08-19T17:55:23Z","title":"InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T18:50:16.290012Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2508.14033"},"observation_digest":"sha256:b5af2a2a9b41bab9512399fac42c7c70a5b027c29e740a77c3d32956d35d6a1a","observation_id":"579ea692-c4df-4f52-9229-a7b404e6c94e","resolution":{"observed_at":"2026-08-05T18:50:16.290012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-08-05T15:19:37.244894Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-09T16:12:19.928163Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.244894Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:2b3f8a639ab5dcb8b4d3e53d592435dc1bbb606d2dc76d8741f259cb93cedf91","observation_id":"2728a245-1ee2-4b8b-9c40-ab9ca16ade0a","resolution":{"observed_at":"2026-08-05T15:19:37.244894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-08-05T10:36:57.303214Z","title":"Aniportrait: Audio-driven synthesis of photorealistic portrait animation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":137,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:57.303214Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:b42272b5997e87cf9f9847e7c4719d26a93eb797199b324d53047fd2d43e2d84","observation_id":"d021f543-f425-431b-8fc4-9e227d662046","resolution":{"observed_at":"2026-08-05T10:36:57.303214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":"2403.17694","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-07-02T02:16:26.575398Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","venue":null,"work_id":"d41ca9c8-5720-452c-86ce-b4d81eaf7dee","year":2024},"citing_paper":{"arxiv_id":"2509.12052","last_updated":"2026-04-20T18:20:15Z","snapshot_observed_at":"2026-07-06T22:29:58.066459Z","submitted_at":"2025-09-15T15:34:02Z","title":"FluentAvatar: Flicker-Free Talking-Head Animation via Phoneme-Guided Autoregressive Modeling","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-18T16:42:25.803856Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2509.12052"},"observation_digest":"sha256:67a6972f2c39c76eca4bd8da1dd7d43b1bcfffd4c31b3d3b1143f213ba215584","observation_id":"e89d7844-db38-42da-8e1b-1700a9abf86a","resolution":{"observed_at":"2026-05-18T16:42:43.813294Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-08-03T16:30:39.321612Z","title":"Aniportrait: Audio-driven synthesis of photorealistic portrait animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.13247","last_updated":"2026-07-17T19:41:30Z","snapshot_observed_at":"2026-08-07T23:01:22.712955Z","submitted_at":"2025-12-15T11:59:01Z","title":"STARCaster: Spatio-Temporal AutoRegressive Video Diffusion for Identity- and View-Aware Talking Portraits","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-03T16:30:39.321612Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2512.13247"},"observation_digest":"sha256:3b9ccd3e1cfa11b440497b57ccaf09ac6690cd31c9cf78cc7ac2059b361c0964","observation_id":"ff743ba2-f1ba-4f2e-a92c-58fd02cb41be","resolution":{"observed_at":"2026-08-03T16:30:39.321612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":"2403.17694","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-07-02T02:16:26.575398Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","venue":null,"work_id":"d41ca9c8-5720-452c-86ce-b4d81eaf7dee","year":2024},"citing_paper":{"arxiv_id":"2512.14234","last_updated":"2026-04-14T19:54:15Z","snapshot_observed_at":"2026-07-06T22:39:08.850289Z","submitted_at":"2025-12-16T09:41:21Z","title":"ViBES: A Conversational Agent with Behaviorally-Intelligent 3D Virtual Body","version":2},"reference_index":113,"source":"pdf_text","source_observed_at":"2026-05-16T22:04:07.403410Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2512.14234"},"observation_digest":"sha256:a48a7da59be4a287068c5525ff89563d35a94839659581c9bdca692cfd8b3b6a","observation_id":"be3101ce-5b9a-497a-a0f2-5d72983df5a3","resolution":{"observed_at":"2026-05-16T22:08:36.327070Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-08-03T15:28:59.211811Z","title":"Aniportrait: Audio-driven synthesis of photorealistic portrait animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.16893","last_updated":"2026-06-26T16:02:20Z","snapshot_observed_at":"2026-08-09T14:59:21.358895Z","submitted_at":"2025-12-18T18:53:28Z","title":"Instant Expressive Gaussian Head Avatars at Over 100 FPS","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-03T15:28:59.211811Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2512.16893"},"observation_digest":"sha256:4b1959457aa20ae80f94d3fa2eb21cf3ee81434f80a41e36d62a2d935843bfb9","observation_id":"01552f3e-7d80-4027-934f-60e289d09be6","resolution":{"observed_at":"2026-08-03T15:28:59.211811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":"2403.17694","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-07-02T02:16:26.575398Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","venue":null,"work_id":"d41ca9c8-5720-452c-86ce-b4d81eaf7dee","year":2024},"citing_paper":{"arxiv_id":"2601.07603","last_updated":"2026-05-21T11:50:40Z","snapshot_observed_at":"2026-08-08T19:57:58.120715Z","submitted_at":"2026-01-12T14:53:56Z","title":"UIKA: Fast Universal Head Avatar from Pose-Free Images","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-22T12:02:27.828968Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2601.07603"},"observation_digest":"sha256:836b74947cde6756daafff4779def216e5c1e11e09b864616fe888dba9498a7d","observation_id":"75c95618-e92d-4942-898b-04cdcaf3db5c","resolution":{"observed_at":"2026-05-22T12:04:51.573998Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":"2403.17694","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-07-02T02:16:26.575398Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","venue":null,"work_id":"d41ca9c8-5720-452c-86ce-b4d81eaf7dee","year":2024},"citing_paper":{"arxiv_id":"2602.13669","last_updated":"2026-04-22T07:41:44Z","snapshot_observed_at":"2026-07-06T22:45:53.926021Z","submitted_at":"2026-02-14T08:32:38Z","title":"EchoTorrent: Towards Swift, Sustained, and Streaming Multi-Modal Video Generation","version":5},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-15T22:20:16.320171Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2602.13669"},"observation_digest":"sha256:02547b99f307c59545225157aa6b3ca128fe188acff6e40ee448f0dbae3bcc15","observation_id":"ef2d74b1-b261-492d-934c-d8f159487fab","resolution":{"observed_at":"2026-05-15T22:20:22.464159Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-07-13T22:49:03.259461Z","title":"arXiv preprint arXiv:2403.17694 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.17975","last_updated":"2026-06-28T11:09:46Z","snapshot_observed_at":"2026-08-09T19:20:25.467076Z","submitted_at":"2026-03-18T17:39:05Z","title":"AHOY! Animatable Humans under Occlusion from YouTube Videos with Gaussian Splatting and Video Diffusion Priors","version":2},"reference_index":129,"source":"pdf_text","source_observed_at":"2026-07-13T22:49:03.259461Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2603.17975"},"observation_digest":"sha256:e1e16e1fe17d6dbdc0b8bac6d720e42fcdc9d29c8938e6fd1b1b374dbf9b6dbe","observation_id":"1b11bd3d-be73-40cd-916d-4bf807868b56","resolution":{"observed_at":"2026-07-13T22:49:03.259461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":"2403.17694","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-07-02T02:16:26.575398Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","venue":null,"work_id":"d41ca9c8-5720-452c-86ce-b4d81eaf7dee","year":2024},"citing_paper":{"arxiv_id":"2604.04787","last_updated":"2026-04-20T16:19:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-06T15:56:50Z","title":"AvatarPointillist: AutoRegressive 4D Gaussian Avatarization","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-10T18:47:37.605996Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2604.04787"},"observation_digest":"sha256:3c81b031a220a585221a3ba408d2d2401ef234c29e857fe231807f32b1e15b14","observation_id":"6b77c536-6fe4-4752-b714-7494b8aa2b33","resolution":{"observed_at":"2026-05-10T23:55:51.059816Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":"2403.17694","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-07-02T02:16:26.575398Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","venue":null,"work_id":"d41ca9c8-5720-452c-86ce-b4d81eaf7dee","year":2024},"citing_paper":{"arxiv_id":"2604.08405","last_updated":"2026-07-30T09:16:54Z","snapshot_observed_at":"2026-08-03T01:34:12.626353Z","submitted_at":"2026-04-09T16:03:24Z","title":"SyncBreaker:Stage-Aware Multimodal Adversarial Attacks on Audio-Driven Talking Head Generation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-10T17:30:36.462567Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2604.08405"},"observation_digest":"sha256:147e28598fad154c40c383eb579741eb3bd61062803e87f8924c22436fdac998","observation_id":"869f6de3-8dd9-4338-8b44-166d6aa071da","resolution":{"observed_at":"2026-05-11T06:41:25.219400Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-08-02T16:38:16.290404Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.08405","last_updated":"2026-07-30T09:16:54Z","snapshot_observed_at":"2026-08-03T01:34:12.626353Z","submitted_at":"2026-04-09T16:03:24Z","title":"SyncBreaker:Stage-Aware Multimodal Adversarial Attacks on Audio-Driven Talking Head Generation","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T16:38:16.290404Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2604.08405"},"observation_digest":"sha256:5628ec4f840d63fc5492f17b72cc548d1b2281a78c6a6d7b0b2885ed864f61de","observation_id":"84eddbc5-c482-4812-a9d6-7c416a6dbf5b","resolution":{"observed_at":"2026-08-02T16:38:16.290404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":"2403.17694","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-07-02T02:16:26.575398Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","venue":null,"work_id":"d41ca9c8-5720-452c-86ce-b4d81eaf7dee","year":2024},"citing_paper":{"arxiv_id":"2604.12856","last_updated":"2026-04-15T03:58:33Z","snapshot_observed_at":"2026-07-06T23:01:00.830207Z","submitted_at":"2026-04-14T15:07:21Z","title":"PianoFlow: Music-Aware Streaming Piano Motion Generation with Bimanual Coordination","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-10T15:54:30.725820Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2604.12856"},"observation_digest":"sha256:27c68f0beab83bc91e390d21de406fa8801de14c104c245af3b96a0e4629b47e","observation_id":"c194592f-4807-4c2f-931d-091a5e279976","resolution":{"observed_at":"2026-05-11T09:41:00.065751Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":"2403.17694","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-07-02T02:16:26.575398Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","venue":null,"work_id":"d41ca9c8-5720-452c-86ce-b4d81eaf7dee","year":2024},"citing_paper":{"arxiv_id":"2604.14541","last_updated":"2026-04-16T02:16:36Z","snapshot_observed_at":"2026-08-03T11:44:21.453831Z","submitted_at":"2026-04-16T02:16:36Z","title":"Giving Faces Their Feelings Back: Explicit Emotion Control for Feedforward Single-Image 3D Head Avatars","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-05-10T11:47:42.039240Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2604.14541"},"observation_digest":"sha256:ad0fc10af08efca585f00cb16d008658b3095b4778b8ddcde5a53a456643b3c5","observation_id":"e4cc6ec4-2ecb-41f5-a7de-4b26bff0e8cf","resolution":{"observed_at":"2026-05-10T11:50:20.281786Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":"2403.17694","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-07-02T02:16:26.575398Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","venue":null,"work_id":"d41ca9c8-5720-452c-86ce-b4d81eaf7dee","year":2024},"citing_paper":{"arxiv_id":"2604.14580","last_updated":"2026-05-05T22:56:58Z","snapshot_observed_at":"2026-07-06T23:02:18.425249Z","submitted_at":"2026-04-16T03:19:29Z","title":"TurboTalk: Progressive Distillation for One-Step Audio-Driven Talking Avatar Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T11:13:27.689539Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2604.14580"},"observation_digest":"sha256:7b35455375d1ed1b091b3ae7bc25507fd1546ad5059f877f48e61de78f9eb919","observation_id":"edf47450-dea3-49f0-ac3b-54d3b7f004f0","resolution":{"observed_at":"2026-05-10T11:15:10.370873Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":"2403.17694","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-07-02T02:16:26.575398Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","venue":null,"work_id":"d41ca9c8-5720-452c-86ce-b4d81eaf7dee","year":2024},"citing_paper":{"arxiv_id":"2604.19129","last_updated":"2026-04-21T06:22:47Z","snapshot_observed_at":"2026-08-07T16:28:09.434053Z","submitted_at":"2026-04-21T06:22:47Z","title":"PortraitDirector: A Hierarchical Disentanglement Framework for Controllable and Real-time Facial Reenactment","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-10T03:30:18.645845Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2604.19129"},"observation_digest":"sha256:3c02b16feccd5f3ad9155a91cef0919c0692a7965b6436ec654c50e0240ac922","observation_id":"00aa68bb-6a1b-4202-a546-18bad7f72798","resolution":{"observed_at":"2026-05-11T12:31:04.133105Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":"2403.17694","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-07-02T02:16:26.575398Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","venue":null,"work_id":"d41ca9c8-5720-452c-86ce-b4d81eaf7dee","year":2024},"citing_paper":{"arxiv_id":"2604.19679","last_updated":"2026-06-29T16:38:23Z","snapshot_observed_at":"2026-07-06T23:06:16.972438Z","submitted_at":"2026-04-21T16:57:23Z","title":"MMControl: Unified Multi-Modal Control for Joint Audio-Video Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T02:55:09.008954Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2604.19679"},"observation_digest":"sha256:2ce0e74c81b78a4545bd8d8cdaf2539b4d208583794aa5c6b91a7ca8c8d16d61","observation_id":"9d3dab7b-01be-4261-b5db-b5f24d0e5bc0","resolution":{"observed_at":"2026-05-11T12:46:28.066848Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":"2403.17694","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-07-02T02:16:26.575398Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","venue":null,"work_id":"d41ca9c8-5720-452c-86ce-b4d81eaf7dee","year":2024},"citing_paper":{"arxiv_id":"2605.01638","last_updated":"2026-05-02T22:56:17Z","snapshot_observed_at":"2026-07-06T23:14:47.444386Z","submitted_at":"2026-05-02T22:56:17Z","title":"Omni-Fake: Benchmarking Unified Multimodal Social Media Deepfake Detection","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-09T14:04:52.065878Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2605.01638"},"observation_digest":"sha256:f8d9f585c3c512b80913e45f36fc7cb03d3a696f5ae570d1cdd30593e1671126","observation_id":"9f3a0d5e-ad8e-414e-bf73-ac6bf6b8856e","resolution":{"observed_at":"2026-05-11T17:06:04.288003Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":"2403.17694","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-07-02T02:16:26.575398Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","venue":null,"work_id":"d41ca9c8-5720-452c-86ce-b4d81eaf7dee","year":2024},"citing_paper":{"arxiv_id":"2605.02948","last_updated":"2026-05-11T03:04:55Z","snapshot_observed_at":"2026-08-08T22:18:14.048236Z","submitted_at":"2026-05-01T16:38:06Z","title":"AsymTalker: Identity-Consistent Long-Term Talking Head Generation via Asymmetric Distillation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-09T20:19:39.565157Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2605.02948"},"observation_digest":"sha256:f380cdab70e5da9a698ae880914384b6cd50b623c6a3f57a5dc7f531c26eea32","observation_id":"b429ade0-fbb9-496e-8c84-a4209b84db4a","resolution":{"observed_at":"2026-05-11T15:16:11.234958Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":"2403.17694","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-07-02T02:16:26.575398Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","venue":null,"work_id":"d41ca9c8-5720-452c-86ce-b4d81eaf7dee","year":2024},"citing_paper":{"arxiv_id":"2605.02948","last_updated":"2026-05-11T03:04:55Z","snapshot_observed_at":"2026-08-08T22:18:14.048236Z","submitted_at":"2026-05-01T16:38:06Z","title":"AsymTalker: Identity-Consistent Long-Term Talking Head Generation via Asymmetric Distillation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-11T02:18:58.996355Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2605.02948"},"observation_digest":"sha256:f3478b69f7f2539c2e1cc45245754d410f68ce9981d1eaa19f332608e62366be","observation_id":"8671e9e2-b04c-4b2b-89e0-90fa9bde142e","resolution":{"observed_at":"2026-05-11T03:45:57.546592Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":"2403.17694","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-07-02T02:16:26.575398Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","venue":null,"work_id":"d41ca9c8-5720-452c-86ce-b4d81eaf7dee","year":2024},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:417155b056139b664b695a13ed133a6f4dd88cfbc2b8ce8a6f7884f8f569f0d5","observation_id":"3c1edea4-37c8-4276-bb89-6a154abf2069","resolution":{"observed_at":"2026-05-20T15:08:24.949010Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":"2403.17694","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-07-02T02:16:26.575398Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","venue":null,"work_id":"d41ca9c8-5720-452c-86ce-b4d81eaf7dee","year":2024},"citing_paper":{"arxiv_id":"2605.24176","last_updated":"2026-05-22T19:54:37Z","snapshot_observed_at":"2026-08-02T13:05:06.490316Z","submitted_at":"2026-05-22T19:54:37Z","title":"Loki: Representation over Architecture for Diffusion-Based Portrait Animation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T15:23:48.899214Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2605.24176"},"observation_digest":"sha256:a80bbf728b64d10ca7d3422f12a0a0f3d1269ab37609eedd2cd7c2960582e56d","observation_id":"ebfd67df-04cf-4a8c-b3bc-87646700981d","resolution":{"observed_at":"2026-06-30T15:24:49.856815Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":"2403.17694","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-07-02T02:16:26.575398Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","venue":null,"work_id":"d41ca9c8-5720-452c-86ce-b4d81eaf7dee","year":2024},"citing_paper":{"arxiv_id":"2605.25488","last_updated":"2026-05-25T06:45:29Z","snapshot_observed_at":"2026-08-02T09:17:40.384654Z","submitted_at":"2026-05-25T06:45:29Z","title":"Test-Time Self-Adaptive Conditioning for Stable Audio-Driven Talking-Head Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T22:36:53.138354Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2605.25488"},"observation_digest":"sha256:cb66b2d83eae423eba730da1d20ee8661685597b776348a3df7eede816149ef8","observation_id":"4d174dec-3c35-407f-95c6-8f7806df1f53","resolution":{"observed_at":"2026-06-29T22:44:01.748177Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":"2403.17694","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-07-02T02:16:26.575398Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","venue":null,"work_id":"d41ca9c8-5720-452c-86ce-b4d81eaf7dee","year":2024},"citing_paper":{"arxiv_id":"2605.28056","last_updated":"2026-05-27T07:02:31Z","snapshot_observed_at":"2026-07-06T23:37:40.695655Z","submitted_at":"2026-05-27T07:02:31Z","title":"CogPortrait: Fine-Grained Eye-Region Control in Portrait Animation via Hierarchical Agent Planning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-29T13:03:27.312548Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2605.28056"},"observation_digest":"sha256:bf95e2d1be2cb572cf0e6151c4a909e0644a6af63fd12f752a5cd53d215a8177","observation_id":"190bd956-2db7-4ee8-a375-ab9eeb6c1bfa","resolution":{"observed_at":"2026-06-29T13:13:27.648129Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":"2403.17694","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-07-02T02:16:26.575398Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","venue":null,"work_id":"d41ca9c8-5720-452c-86ce-b4d81eaf7dee","year":2024},"citing_paper":{"arxiv_id":"2605.30230","last_updated":"2026-05-28T17:00:37Z","snapshot_observed_at":"2026-08-09T16:21:39.696026Z","submitted_at":"2026-05-28T17:00:37Z","title":"IP-Adapter Is All You Need: Towards Fine-Tuning-Free Diffusion-Based Talking Face Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-29T07:50:56.947671Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2605.30230"},"observation_digest":"sha256:906d4c509d942c3194dd12db595d3d7f2fc30718276c0bb77ede299c83383b0d","observation_id":"35c1c419-e08c-47c2-a075-f516d9e9a118","resolution":{"observed_at":"2026-06-29T07:53:13.369443Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":"2403.17694","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-07-02T02:16:26.575398Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","venue":null,"work_id":"d41ca9c8-5720-452c-86ce-b4d81eaf7dee","year":2024},"citing_paper":{"arxiv_id":"2605.30311","last_updated":"2026-05-28T17:53:27Z","snapshot_observed_at":"2026-07-06T23:39:38.845840Z","submitted_at":"2026-05-28T17:53:27Z","title":"Archon: A Unified Multimodal Model for Holistic Digital Human Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-29T08:03:04.294439Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2605.30311"},"observation_digest":"sha256:b08abf91081aefa89e132340c787fc57f28731e91e06d581ae9e3c9002137894","observation_id":"8294845f-7655-4acb-a80a-8ef13ad32a3b","resolution":{"observed_at":"2026-06-29T08:03:13.783826Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":"2403.17694","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-07-02T02:16:26.575398Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","venue":null,"work_id":"d41ca9c8-5720-452c-86ce-b4d81eaf7dee","year":2024},"citing_paper":{"arxiv_id":"2606.01031","last_updated":"2026-05-31T05:44:42Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T05:44:42Z","title":"Temporally-Aligned Evaluation for Audio-Driven Talking Head Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T16:19:55.048831Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2606.01031"},"observation_digest":"sha256:fd0878c46b3192f71c5b9cb9cfb0d17a0ac0731a382ab24cb555e0f490e5bf38","observation_id":"33df6ba3-c176-445b-8002-068b531b6d8c","resolution":{"observed_at":"2026-07-01T21:46:15.580499Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":"2403.17694","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-07-02T02:16:26.575398Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","venue":null,"work_id":"d41ca9c8-5720-452c-86ce-b4d81eaf7dee","year":2024},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-08-07T22:55:26.112965Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:5818385cecdc51796fc6e5b2c47c42d460c6f0cf46416f586f0254a666c3fd9d","observation_id":"679e79a2-4c15-4b52-8c6a-2414065c442f","resolution":{"observed_at":"2026-07-01T22:06:17.010720Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":"2403.17694","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-07-02T02:16:26.575398Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","venue":null,"work_id":"d41ca9c8-5720-452c-86ce-b4d81eaf7dee","year":2024},"citing_paper":{"arxiv_id":"2606.03402","last_updated":"2026-06-03T03:22:46Z","snapshot_observed_at":"2026-08-08T22:57:25.458210Z","submitted_at":"2026-06-02T09:43:55Z","title":"Mamba-Enhanced Implicit Motion Learning for Audio-Driven Portrait Animation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T11:07:20.577007Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2606.03402"},"observation_digest":"sha256:0b7426b388fa17980bcb0fdb95fec11911bb31958a2a16b5bf2c67d8dd5a7385","observation_id":"eba3d6fb-668c-474d-a03d-982536240543","resolution":{"observed_at":"2026-07-02T02:16:26.577129Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":"2403.17694","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-07-02T02:16:26.575398Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","venue":null,"work_id":"d41ca9c8-5720-452c-86ce-b4d81eaf7dee","year":2024},"citing_paper":{"arxiv_id":"2606.30849","last_updated":"2026-06-29T19:26:13Z","snapshot_observed_at":"2026-08-02T00:44:38.626792Z","submitted_at":"2026-06-29T19:26:13Z","title":"SyncCache: Exploiting Asymmetric Dynamics for Fast Audio-Driven Portrait Animation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-01T06:13:11.504526Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2606.30849"},"observation_digest":"sha256:cccfc81776eadcafa6718b2d7571348b473dff5bb5fca12f55db11c90ad210ac","observation_id":"f3d16bdd-0726-4ba9-91db-abde66eb85a1","resolution":{"observed_at":"2026-07-01T09:45:40.320788Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-07-31T23:01:31.435147Z","title":"Aniportrait: Audio-driven synthesis of photorealistic portrait animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-09T20:21:30.165455Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:31.435147Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:27d1d2f320b086b9a9e98112d5c0bc421fc45f0304e7a8c1b855ef5b4d986720","observation_id":"2656af68-61a0-4795-8024-6653e9887fee","resolution":{"observed_at":"2026-07-31T23:01:31.435147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-08-04T01:32:12.829607Z","title":"arXiv preprint arXiv:2403.17694 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00079","last_updated":"2026-07-29T14:44:57Z","snapshot_observed_at":"2026-08-07T16:05:36.413106Z","submitted_at":"2026-07-29T14:44:57Z","title":"LeapTalk: Breaking the Latency-Quality Trade-off in Talking Head Generation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T01:32:12.829607Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2608.00079"},"observation_digest":"sha256:9281e6d7413d01618332f32cead87965f69b59ff52ffe2349f2bd4c2e458f2bd","observation_id":"4f7baa9b-77d8-4a3e-8cf2-10a4f0f8b209","resolution":{"observed_at":"2026-08-04T01:32:12.829607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-08-04T01:03:12.618881Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00663","last_updated":"2026-08-01T13:33:38Z","snapshot_observed_at":"2026-08-09T14:14:53.900226Z","submitted_at":"2026-08-01T13:33:38Z","title":"Geometry-guided Emotion Modulation for Controllable and Photorealistic Emotional Talking Face Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T01:03:12.618881Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2608.00663"},"observation_digest":"sha256:9774811cb76a7fd161d8c1520ed4a7bfa3a84617d5860d151e7d086682944054","observation_id":"5056342d-4155-41e5-8f60-43ca33456263","resolution":{"observed_at":"2026-08-04T01:03:12.618881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2403.17694/citation-record","integrity":"/paper/2403.17694/integrity","json":"/paper/2403.17694/citation-record.json","paper":"/paper/2403.17694"},"outbound":[],"paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 58 inbound Pith citation observations for arXiv:2403.17694."}