{"as_of":"2026-08-07T08:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:417e935fc1210687f43a1e26a7c4a0de8086a6167a86a403e365a67314b94bbd","coverage":[{"denominator":100,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:58:32.804437Z","state":"measured"},{"denominator":103,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":103,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T19:07:29.217054Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T08:03:13.813124Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01390","snapshot_observed_at":"2026-08-05T19:07:29.217054Z","title":"Fixtalk: Taming identity leakage for high-quality talking head generation in extreme cases,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.13442","last_updated":"2025-08-19T01:55:25Z","snapshot_observed_at":"2026-08-05T19:07:24.374768Z","submitted_at":"2025-08-19T01:55:25Z","title":"EDTalk++: Full Disentanglement for Controllable Talking Head Synthesis","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T19:07:29.217054Z"},"links":{"cited_paper":"/paper/2507.01390","citing_paper":"/paper/2508.13442"},"observation_digest":"sha256:810662e045ff59e40bd8bd4d1abdd40ad749f2bf032ccb5a80adc84d6ed642a9","observation_id":"c52eddb4-771e-42d3-8b71-97be5006d837","resolution":{"observed_at":"2026-08-05T19:07:29.217054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"cited_work":{"arxiv_id":"2507.01390","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.01390","snapshot_observed_at":"2026-06-29T08:03:13.813124Z","title":"Fixtalk: Taming identity leakage for high-quality talking head generation in extreme cases.CoRR, abs/2507.01390","venue":null,"work_id":"2b65a158-d981-4cd1-b092-6d2e4f52ee48","year":2025},"citing_paper":{"arxiv_id":"2604.19129","last_updated":"2026-04-21T06:22:47Z","snapshot_observed_at":"2026-07-06T23:05:48.885141Z","submitted_at":"2026-04-21T06:22:47Z","title":"PortraitDirector: A Hierarchical Disentanglement Framework for Controllable and Real-time Facial Reenactment","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T03:30:18.645845Z"},"links":{"cited_paper":"/paper/2507.01390","citing_paper":"/paper/2604.19129"},"observation_digest":"sha256:ac7b8954eef8ac173719367299175a522da80e577fc052788a44820864fe36e1","observation_id":"d74195c8-79f0-493a-aa5d-bfeaa318aa64","resolution":{"observed_at":"2026-05-11T12:31:04.324918Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"cited_work":{"arxiv_id":"2507.01390","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.01390","snapshot_observed_at":"2026-06-29T08:03:13.813124Z","title":"Fixtalk: Taming identity leakage for high-quality talking head generation in extreme cases.CoRR, abs/2507.01390","venue":null,"work_id":"2b65a158-d981-4cd1-b092-6d2e4f52ee48","year":2025},"citing_paper":{"arxiv_id":"2605.30311","last_updated":"2026-05-28T17:53:27Z","snapshot_observed_at":"2026-07-06T23:39:38.845840Z","submitted_at":"2026-05-28T17:53:27Z","title":"Archon: A Unified Multimodal Model for Holistic Digital Human Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-29T08:03:04.294439Z"},"links":{"cited_paper":"/paper/2507.01390","citing_paper":"/paper/2605.30311"},"observation_digest":"sha256:5dd77c5ad8b5b954126ddc7392e05745044807fc4759f9f2fa31338f92e57d75","observation_id":"c47e529a-4b32-4ba9-bb48-a179bbb9cebd","resolution":{"observed_at":"2026-06-29T08:03:13.814718Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.01390/citation-record","integrity":"/paper/2507.01390/integrity","json":"/paper/2507.01390/citation-record.json","paper":"/paper/2507.01390"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.12052","last_updated":"2024-05-05T05:07:34Z","snapshot_observed_at":"2026-08-01T16:10:16.293275Z","submitted_at":"2023-11-18T10:22:44Z","title":"MagicPose: Realistic Human Poses and Facial Expressions Retargeting with Identity-aware Diffusion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12052","snapshot_observed_at":"2026-08-06T20:58:21.467931Z","title":"Magicdance: Realistic human dance video gen- eration with motions & facial expressions transfer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:21.467931Z"},"links":{"cited_paper":"/paper/2311.12052","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:285e04f6eaa3583d11428ebeb4216d084ad4449b35395fd4bc6b56d202ec30b7","observation_id":"5f833766-b682-420b-aad2-d79e16885251","resolution":{"observed_at":"2026-08-06T20:58:21.467931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13272","last_updated":"2024-12-02T12:18:12Z","snapshot_observed_at":"2026-07-06T18:33:28.511600Z","submitted_at":"2024-06-19T07:08:48Z","title":"AniFaceDiff: Animating Stylized Avatars via Parametric Conditioned Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13272","snapshot_observed_at":"2026-08-06T20:58:21.554078Z","title":"Anifacediff: High-fidelity face reenactment via fa- cial parametric conditioned diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:21.554078Z"},"links":{"cited_paper":"/paper/2406.13272","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:cccb5f0130c7f277e6d0ff5e7b5a002aa8e604c19602efb2ef3f38f053ab5326","observation_id":"9390c551-17ff-4675-80c0-b9b92e7aba57","resolution":{"observed_at":"2026-08-06T20:58:21.554078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:21.715441Z","title":"Lip movements generation at a glance","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:21.715441Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:7a00db27fdac27f8d305ef8bd1bd6483c5851cbe6918d1e7745cb41d1ac6e8c5","observation_id":"d8534d57-228d-4ed3-be0a-1c5f21ee91b5","resolution":{"observed_at":"2026-08-06T20:58:21.715441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:21.876831Z","title":"Hierarchical cross-modal talking face generation with dynamic pixel-wise loss","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:21.876831Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:d9bfae7cd96a6490634dd4ca4dc3a88579cf9ba4b00f65b44bc52084455eead5","observation_id":"09a1aa1f-f02a-48a6-aebd-cc71fddf10a2","resolution":{"observed_at":"2026-08-06T20:58:21.876831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:22.046172Z","title":"Talking-head generation with rhyth- mic head motion","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:22.046172Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:1028e4bf64079f06642d193cfcfc848ed319d21ff20f9fb7f5394730f83379f4","observation_id":"a0317fcc-ef60-484e-9aa4-418d68f9e562","resolution":{"observed_at":"2026-08-06T20:58:22.046172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:22.197475Z","title":"Vast: Vivify your talk- ing avatar via zero-shot expressive facial style transfer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:22.197475Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:71289bc575dc09da28e1ce4a87a817dc13689f1b1f596608d41c804bda9f98a4","observation_id":"8c8f1b63-48d9-40f5-b7b2-18fbb7008636","resolution":{"observed_at":"2026-08-06T20:58:22.197475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08136","last_updated":"2024-07-12T02:41:51Z","snapshot_observed_at":"2026-08-05T23:17:13.069591Z","submitted_at":"2024-07-11T02:26:51Z","title":"EchoMimic: Lifelike Audio-Driven Portrait Animations through Editable Landmark Conditions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08136","snapshot_observed_at":"2026-08-06T20:58:22.315210Z","title":"Echomimic: Lifelike audio-driven por- trait animations through editable landmark conditions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:22.315210Z"},"links":{"cited_paper":"/paper/2407.08136","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:cacdbc3b467d2043aaa8e96be41b43fd65ff36886f15b4bb7c597189d1c21881","observation_id":"d2afcd9e-6efc-48d3-97ef-7e7d6fc4ee67","resolution":{"observed_at":"2026-08-06T20:58:22.315210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:22.475622Z","title":"Out of time: auto- mated lip sync in the wild","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:22.475622Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:b474acd60bcbbe390f9ca24073dee013cf05322c606705669ca278f47726bd4b","observation_id":"3365c6d2-17ee-4693-9e3e-29929e1b7240","resolution":{"observed_at":"2026-08-06T20:58:22.475622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07718","last_updated":"2024-10-14T13:35:17Z","snapshot_observed_at":"2026-08-05T03:23:39.587839Z","submitted_at":"2024-10-10T08:34:41Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07718","snapshot_observed_at":"2026-08-06T20:58:22.630703Z","title":"Hallo2: Long-duration and high-resolution audio-driven portrait im- age animation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:22.630703Z"},"links":{"cited_paper":"/paper/2410.07718","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:037740b406685da9700ee1e1cc82f60716c5d4fcb98f55138b03afbb3850c4a1","observation_id":"5c6c34f5-2787-48e5-ad04-0801b8d182cd","resolution":{"observed_at":"2026-08-06T20:58:22.630703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00733","last_updated":"2025-03-13T08:23:27Z","snapshot_observed_at":"2026-07-06T19:59:37.692710Z","submitted_at":"2024-12-01T08:54:30Z","title":"Hallo3: Highly Dynamic and Realistic Portrait Image Animation with Video Diffusion Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00733","snapshot_observed_at":"2026-08-06T20:58:22.787467Z","title":"Hallo3: Highly dynamic and realistic portrait image an- imation with diffusion transformer networks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:22.787467Z"},"links":{"cited_paper":"/paper/2412.00733","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:5d67860ae58a9583535c30aefef47cce7caa874df530e9439b91fc36d56f49bd","observation_id":"02d17b77-7cb3-43cf-9141-75f12639f65e","resolution":{"observed_at":"2026-08-06T20:58:22.787467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:22.904616Z","title":"Speech-driven facial animation using cas- caded gans for learning of motion and texture","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:22.904616Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:db37433ae107187eab83e21167e49fa6459b05ac824b6aa9cf81c1325be588a1","observation_id":"5f6892af-eed6-4aee-9b20-49d12c35b591","resolution":{"observed_at":"2026-08-06T20:58:22.904616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:23.039770Z","title":"Megaportraits: One-shot megapixel neural head avatars","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:23.039770Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:9e0a4e498966e1a25e64f5cdb9a4ab3c396f9f18fa355cd209a014f573d3075a","observation_id":"91569752-12db-4caf-b3d0-41df5f9b889a","resolution":{"observed_at":"2026-08-06T20:58:23.039770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:23.160720Z","title":"Emoportraits: Emotion-enhanced multimodal one-shot head avatars","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:23.160720Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:890c2e4cde46a180ab18efe4d2dfde5b7227cbeb58c76d2f17f53e18e3adc38a","observation_id":"36621e5f-53a4-4240-b2f7-c99f68f6bf17","resolution":{"observed_at":"2026-08-06T20:58:23.160720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:23.309161Z","title":"Efficient emotional adaptation for audio-driven talking-head generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:23.309161Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:df869ef42c459fabcfebe666c91bbf7689e71c35c0178b87ab4dae13ea37f169","observation_id":"1bed86f5-5460-43ba-8d8b-9c8e43a036c8","resolution":{"observed_at":"2026-08-06T20:58:23.309161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:23.444115Z","title":"Generative adversarial networks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:23.444115Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:ed465bca1d1401ed4ee81d3f87d6dd3a8412046e54b02fac9690d36e4b977d4f","observation_id":"1b6ca795-ca90-4898-856c-05c71a67acdb","resolution":{"observed_at":"2026-08-06T20:58:23.444115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:23.599505Z","title":"Stylesync: High-fidelity generalized and personalized lip sync in style-based genera- tor","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:23.599505Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:2ece27c7aeb979bd2782bf7ed3cc95545bc6cf3f3724dd3c0a6ee87a4c864d80","observation_id":"8d5f2a63-e22f-40d2-8c4d-1f49d785d6f3","resolution":{"observed_at":"2026-08-06T20:58:23.599505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03284","last_updated":"2024-08-06T16:31:45Z","snapshot_observed_at":"2026-07-06T18:57:31.323769Z","submitted_at":"2024-08-06T16:31:45Z","title":"ReSyncer: Rewiring Style-based Generator for Unified Audio-Visually Synced Facial Performer","version":1},"cited_work":{"arxiv_id":"2408.03284","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.03284","snapshot_observed_at":"2026-08-06T20:58:33.962984Z","title":"ReSyncer: Rewiring Style-based Generator for Unified Audio-Visually Synced Facial Performer","venue":"cs.CV","work_id":"68587a73-845d-4a93-9ebb-3822002eecf9","year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:23.782875Z"},"links":{"cited_paper":"/paper/2408.03284","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:75efd7aca725d69475dc5f46f7d7cfc6f4f468a120083aee216f4056d33f49ef","observation_id":"326d3489-574c-4c39-b447-d864d5888c40","resolution":{"observed_at":"2026-08-06T20:58:34.043456Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03168","last_updated":"2025-02-28T14:39:17Z","snapshot_observed_at":"2026-07-06T18:40:57.362549Z","submitted_at":"2024-07-03T14:41:39Z","title":"LivePortrait: Efficient Portrait Animation with Stitching and Retargeting Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03168","snapshot_observed_at":"2026-08-06T20:58:23.941280Z","title":"Livepor- trait: Efficient portrait animation with stitching and retarget- ing control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:23.941280Z"},"links":{"cited_paper":"/paper/2407.03168","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:6b462d06c32d0b9810bf537a209f21b4d1ade572adbb6b0b8a778ad8027b4660","observation_id":"53726732-687d-45fc-80d2-701344beac12","resolution":{"observed_at":"2026-08-06T20:58:23.941280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15179","last_updated":"2024-09-23T16:33:53Z","snapshot_observed_at":"2026-07-06T19:20:32.349889Z","submitted_at":"2024-09-23T16:33:53Z","title":"MIMAFace: Face Animation via Motion-Identity Modulated Appearance Feature Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15179","snapshot_observed_at":"2026-08-06T20:58:24.056864Z","title":"Mimaface: Face animation via motion-identity modulated appearance feature learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:24.056864Z"},"links":{"cited_paper":"/paper/2409.15179","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:f2afc704114d69b801a7ea96dd01754c7984314ad4b351dd298ce3d1863e4353","observation_id":"49a37c06-cd84-4cc2-bf49-df0975b38007","resolution":{"observed_at":"2026-08-06T20:58:24.056864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:24.222486Z","title":"Depth-aware generative adversarial network for talking head video generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:24.222486Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:08c86cbfb2e0711b3c82f19f997031de3a8638842ae977117263774407ed222d","observation_id":"bff06acf-b371-42f8-9b8f-5f3d863c157d","resolution":{"observed_at":"2026-08-06T20:58:24.222486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:24.412644Z","title":"Image quality metrics: Psnr vs","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:24.412644Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:7597b199f056e40f617dc232b0b9cfbf21d6a1ff065ee42ccba3854cdeef5d08","observation_id":"87f4bb73-c48b-4ebf-8415-3c952b96d92f","resolution":{"observed_at":"2026-08-06T20:58:24.412644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17117","last_updated":"2024-06-13T06:37:20Z","snapshot_observed_at":"2026-07-06T16:54:02.725142Z","submitted_at":"2023-11-28T12:27:15Z","title":"Animate Anyone: Consistent and Controllable Image-to-Video Synthesis for Character Animation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17117","snapshot_observed_at":"2026-08-06T20:58:24.581586Z","title":"Animate anyone: Consistent and controllable image-to-video synthesis for character animation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:24.581586Z"},"links":{"cited_paper":"/paper/2311.17117","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:bc0d30158f23727d48745a9002faf08b4786cb83d97ef95aecc0b011dd96622c","observation_id":"54de9502-8151-4291-abb5-d848315272c2","resolution":{"observed_at":"2026-08-06T20:58:24.581586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:24.716893Z","title":"You said that?: Synthesising talking faces from audio","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:24.716893Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:b59279cd5920692da00886fe0b7a594c9457ce64dfb09d9893a44537e03939b2","observation_id":"53f342e7-3c36-4954-9794-7317db3a2a97","resolution":{"observed_at":"2026-08-06T20:58:24.716893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:24.913012Z","title":"Stylevr: Stylizing character animations with normal- izing flows","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:24.913012Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:a35d7c8bde5a78ae994018bdc18c3e3ea0a6a1030f6fa5d9836f3b0ce8f60c39","observation_id":"b95e8d46-d00e-40ed-b3c9-720002ddcd98","resolution":{"observed_at":"2026-08-06T20:58:24.913012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:25.124693Z","title":"Sport: From zero-shot prompts to real-time motion gener- ation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:25.124693Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:cd247529d3cc3578268f19c4af5b24df5e2fd88acda0ab27585d9fe2c9e61be2","observation_id":"6329ee8a-5a73-4019-8d8c-8d79c8b3a4cf","resolution":{"observed_at":"2026-08-06T20:58:25.124693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:25.339089Z","title":"Eamm: One-shot emotional talking face via audio-based emotion-aware motion model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:25.339089Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:0b72124ae757019d939fa88f84bf195fe8a2422bfa57b8e01cf694663257122b","observation_id":"0e998991-59a5-4f91-b10b-e24aa973e0c1","resolution":{"observed_at":"2026-08-06T20:58:25.339089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02634","last_updated":"2025-04-04T05:13:40Z","snapshot_observed_at":"2026-08-05T07:44:02.175955Z","submitted_at":"2024-09-04T11:55:14Z","title":"Loopy: Taming Audio-Driven Portrait Avatar with Long-Term Motion Dependency","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02634","snapshot_observed_at":"2026-08-06T20:58:25.497728Z","title":"Loopy: Taming audio-driven portrait avatar with long-term motion dependency","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:25.497728Z"},"links":{"cited_paper":"/paper/2409.02634","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:f057723f588a64b57482d0f10b8f2aeaa4b818107787171e5556d184d4f656bc","observation_id":"a8f7659b-237e-432f-b8f1-d8c16d291a53","resolution":{"observed_at":"2026-08-06T20:58:25.497728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:25.704083Z","title":"Percep- tual losses for real-time style transfer and super-resolution","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:25.704083Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:d8a8a8da2e40a89a9d7b7106e5def04b80db93ceb08af4134b78bb1444f97e79","observation_id":"9838acb1-9a47-452f-9d4e-646f031f3948","resolution":{"observed_at":"2026-08-06T20:58:25.704083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:25.793774Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:25.793774Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:c5d581a02a516c8b6caf074a2ec9948586dfafd2a0e5c59ff0312cb6882bffe6","observation_id":"ab19e5d0-2d8a-4875-9fd6-131475d75aee","resolution":{"observed_at":"2026-08-06T20:58:25.793774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:25.880766Z","title":"Intergen: Diffusion-based multi-human motion genera- tion under complex interactions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:25.880766Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:49447d6d8c890c310b2a17717c3f2b96314c4b8966649bf6664a1c3b996f52a2","observation_id":"7597572e-a216-4343-be70-88d0ed1b0ef1","resolution":{"observed_at":"2026-08-06T20:58:25.880766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01876","last_updated":"2025-04-05T05:31:38Z","snapshot_observed_at":"2026-07-06T19:09:46.147436Z","submitted_at":"2024-09-03T13:19:31Z","title":"CyberHost: Taming Audio-driven Avatar Diffusion Model with Region Codebook Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01876","snapshot_observed_at":"2026-08-06T20:58:25.954676Z","title":"Cyberhost: Taming audio- driven avatar diffusion model with region codebook atten- tion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:25.954676Z"},"links":{"cited_paper":"/paper/2409.01876","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:117b3eef4bdd23857fe2ccba33a12e0030f76a82f49e7a565fc8e4ea224ef7f1","observation_id":"116419c8-75ac-4a35-a5cc-d9c71e95eac8","resolution":{"observed_at":"2026-08-06T20:58:25.954676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03121","last_updated":"2024-05-06T02:32:41Z","snapshot_observed_at":"2026-07-06T18:10:08.416524Z","submitted_at":"2024-05-06T02:32:41Z","title":"AniTalker: Animate Vivid and Diverse Talking Faces through Identity-Decoupled Facial Motion Encoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03121","snapshot_observed_at":"2026-08-06T20:58:26.077777Z","title":"Anitalker: Animate vivid and di- verse talking faces through identity-decoupled facial motion encoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:26.077777Z"},"links":{"cited_paper":"/paper/2405.03121","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:10650b49fda766da900a4ad59c2d46c49dd82cdce4100891e79d6dab285e1646","observation_id":"42b51f07-8418-4ce0-b1a8-65fce0b9a4fc","resolution":{"observed_at":"2026-08-06T20:58:26.077777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09892","last_updated":"2024-12-18T11:12:49Z","snapshot_observed_at":"2026-08-06T07:23:30.943192Z","submitted_at":"2024-12-13T06:14:57Z","title":"VQTalker: Towards Multilingual Talking Avatars through Facial Motion Tokenization","version":2},"cited_work":{"arxiv_id":"2412.09892","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.09892","snapshot_observed_at":"2026-08-06T20:58:33.603497Z","title":"VQTalker: Towards Multilingual Talking Avatars through Facial Motion Tokenization","venue":"cs.CV","work_id":"ca795b04-2a7c-4d24-9085-1b35e0116875","year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:26.163505Z"},"links":{"cited_paper":"/paper/2412.09892","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:b770669b137d08c96bf948b052fdf28ba1d8fc2d85316d98801bb7a2a901f5a0","observation_id":"8970cea0-eb16-4c25-beb7-0ad61023ec35","resolution":{"observed_at":"2026-08-06T20:58:33.668649Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:43.576088Z","title":"Cvthead: One-shot controllable head avatar with vertex-feature transformer","venue":null,"work_id":"6ede0369-ee4b-43f3-8af8-65ebf29e4afd","year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:26.248215Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:c49599514352cce85d6274b57be37a0178fc1cd34ed942b60f6d0c234bfde792","observation_id":"1f82563c-333c-4f26-a612-7f79f2b70c6b","resolution":{"observed_at":"2026-08-06T20:58:43.696425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01900","last_updated":"2024-06-07T02:57:36Z","snapshot_observed_at":"2026-07-06T18:24:52.604412Z","submitted_at":"2024-06-04T02:05:57Z","title":"Follow-Your-Emoji: Fine-Controllable and Expressive Freestyle Portrait Animation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01900","snapshot_observed_at":"2026-08-06T20:58:26.335483Z","title":"Follow-your-emoji: Fine-controllable and expressive freestyle portrait animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:26.335483Z"},"links":{"cited_paper":"/paper/2406.01900","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:9994612afafec25efa54b36235801dd2d40f8ac757639179fd173b2c8446addd","observation_id":"abad82ae-21ab-4e66-b392-e5c7026b074a","resolution":{"observed_at":"2026-08-06T20:58:26.335483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:26.442215Z","title":"Echomimicv2: Towards striking, simplified, and semi-body human animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:26.442215Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:7dca3c98f7e5645789ebc6a79decee73cf9fe034da7b28d000f07d225e9f9770","observation_id":"b234cd9c-b898-4562-9e7a-7fba56894c4e","resolution":{"observed_at":"2026-08-06T20:58:26.442215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:43.399324Z","title":"completely blind","venue":null,"work_id":"ea7a56b0-33ac-49d9-9dd9-94462bd64fee","year":2012},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:26.527565Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:9ade08798c6a76ad389d3c5cf3185996f687210305dda1dd76b145fe07f8e748","observation_id":"7a79d737-fc3b-41dd-95e6-1234db06ff9d","resolution":{"observed_at":"2026-08-06T20:58:43.488774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:43.106230Z","title":"Emotional voice puppetry","venue":null,"work_id":"52b8521d-1f98-4a5c-9ea4-a8bfe76bc69a","year":2023},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:26.629143Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:2bbe4c3ef28bae6e510b64f5a0324caa5eebfd4bedda9a4b58c3071ebfa40618","observation_id":"ba1c3d46-a838-436d-aeee-c88931d91d78","resolution":{"observed_at":"2026-08-06T20:58:43.237797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:42.868030Z","title":"Expressive talking avatars","venue":null,"work_id":"a996d4ec-9967-4fb5-a642-194672c757ff","year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:26.756376Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:dd6d805b9fdd993bd8a904394dce069a5cb16f5a5d6a161aa2fb86e8db6d8dca","observation_id":"1c104941-3f65-4724-a74b-2f4a1d345243","resolution":{"observed_at":"2026-08-06T20:58:42.991292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:42.577552Z","title":"Vasa-rig: Audio-driven 3d facial animation with ‘live’mood dynamics in virtual reality","venue":null,"work_id":"c2d31de9-e072-43e4-a8f8-dd098de044ac","year":2025},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:26.888357Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:0cdaaa825430350f630bc98c06a86358c09db97cdf153785e9359c691b023065","observation_id":"30be8b83-68b0-4b8f-97f5-1f1721d796b3","resolution":{"observed_at":"2026-08-06T20:58:42.710067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:26.983504Z","title":"Dpe: Dis- entanglement of pose and expression for general video por- trait editing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:26.983504Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:d467d07f60b823e07847ca76c3900d247f8bd2299b98f8f800690c74acbc7e05","observation_id":"2d8a285e-3a8e-4328-86fa-56318be32cfd","resolution":{"observed_at":"2026-08-06T20:58:26.983504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06070","last_updated":"2025-03-08T08:43:03Z","snapshot_observed_at":"2026-07-06T18:59:34.520274Z","submitted_at":"2024-08-12T11:41:18Z","title":"ControlNeXt: Powerful and Efficient Control for Image and Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06070","snapshot_observed_at":"2026-08-06T20:58:27.059131Z","title":"Controlnext: Powerful and effi- cient control for image and video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:27.059131Z"},"links":{"cited_paper":"/paper/2408.06070","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:0a15bd306b166cfdbfd739cc3f0319edceab8c0229539cc33dfc637f0cde9cdc","observation_id":"1eb63fe8-f14d-43ae-b645-876b9c74348e","resolution":{"observed_at":"2026-08-06T20:58:27.059131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:27.157855Z","title":"High-resolution image syn- thesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:27.157855Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:1b1ec6fc26d671ea9dc26644108a7837ae3b2ee893ed75dc7153f0625d35d438","observation_id":"f5c24d2f-8b78-498e-be3e-7f1b7b1ef125","resolution":{"observed_at":"2026-08-06T20:58:27.157855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:27.225742Z","title":"pytorch-fid: FID Score for PyTorch","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:27.225742Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:7d979569f134eccb415cc8380ded97dcf6037f6914e915c5bd6abaae9d346476","observation_id":"ff5085ea-8f6d-46b7-9e9d-8e1ef0ac780a","resolution":{"observed_at":"2026-08-06T20:58:27.225742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:42.215472Z","title":"Learning dynamic facial radiance fields for few-shot talking head synthesis","venue":null,"work_id":"b1a2c390-7573-43a8-accb-b412a408fb14","year":2022},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:27.322184Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:67fabc7444ba5ec8680e67ee5ebbd28e4849b40fd1e869945027fc0cadaf91fa","observation_id":"fa30d92d-fc59-4934-b54a-4f122da70942","resolution":{"observed_at":"2026-08-06T20:58:42.404195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:42.033662Z","title":"Difftalk: Crafting diffusion models for generalized audio-driven portraits animation","venue":null,"work_id":"ce8ef73b-a9cf-427b-a20f-caedf00c9592","year":1982},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:27.450182Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:30d8865021f983bc777f4cee03c567f513f4de67c435c128396fa3a80098742b","observation_id":"31b7320f-a108-4da5-8791-cbc5278595ff","resolution":{"observed_at":"2026-08-06T20:58:42.107540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:41.758774Z","title":"Motionstone: Decoupled motion in- tensity modulation with diffusion transformer for image-to- video generation","venue":null,"work_id":"8c8e230a-3e3b-4b5f-97ab-c8e649d91b94","year":2025},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:27.540019Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:ed3ba7afc4c89eddee20935651d8b8a7a8c31c25727d5b90140ff232a7c8e0e8","observation_id":"fa16f019-5c28-4429-be99-0d3731a603fc","resolution":{"observed_at":"2026-08-06T20:58:41.912248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1556","last_updated":"2015-04-10T16:25:04Z","snapshot_observed_at":"2026-07-06T03:53:32.549552Z","submitted_at":"2014-09-04T19:48:04Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.1556","snapshot_observed_at":"2026-08-06T20:58:27.622630Z","title":"Very deep convo- lutional networks for large-scale image recognition","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:27.622630Z"},"links":{"cited_paper":"/paper/1409.1556","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:065e1c096e00fa50a6b8bc0cfb85f12d6e95b9eac7ded720b245e12e3472342f","observation_id":"531ad2a9-b71f-4779-9e82-c793ee3b63dc","resolution":{"observed_at":"2026-08-06T20:58:27.622630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:41.585008Z","title":"Talking face generation by conditional recurrent adversarial network","venue":null,"work_id":"c69442ef-9295-46a0-aa39-ad49cbc5510e","year":2019},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:27.746743Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:47d334e4065bc8d77d58c6d12ef8c024c577729101e4f6582bc333cc482be6b8","observation_id":"dcd1f923-e9d2-415d-82a3-217aa1d593fd","resolution":{"observed_at":"2026-08-06T20:58:41.638652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:41.440905Z","title":"Emmn: Emotional motion memory network for audio-driven emotional talking face generation","venue":null,"work_id":"c3b32898-ab37-4d4c-9afc-4c10a48eb0f6","year":2023},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:27.872142Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:4e89d6c4a824e9655c269c7f0b4b3f368076e1c107d6975b3e61e779a732e98a","observation_id":"b1ec8c6e-db41-485d-8036-33705b0dd78f","resolution":{"observed_at":"2026-08-06T20:58:41.522224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:41.148596Z","title":"Say anything with any style","venue":null,"work_id":"586089b6-5080-448a-a233-449e79a4c1dc","year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:27.963148Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:e61e47c0b318ead7ce36d115d8e487984e5b9542b001183a7f839b135ba16974","observation_id":"2421377a-b90b-4b9c-9c20-e6245e05c527","resolution":{"observed_at":"2026-08-06T20:58:41.280602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:40.971428Z","title":"Flowvqtalker: High-quality emotional talking face generation through normalizing flow and quantization","venue":null,"work_id":"a6580171-7e6e-48f7-8df1-4bb78ec41f69","year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:28.079877Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:dfad154a293f2c03ec26c8f646e89f04cbd556ade777b3dcab6651a690068484","observation_id":"fb7f0277-3747-4a2b-b88d-1a002a64eed9","resolution":{"observed_at":"2026-08-06T20:58:41.040401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:28.159722Z","title":"Style2talker: High-resolution talking head generation with emotion style and art style","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:28.159722Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:b1aaafc7bf0d676940fe26accb7d973bad03591497a25308bbe8f240f61437f1","observation_id":"3d9b1bc7-0dde-44ad-81b4-13337c1db04c","resolution":{"observed_at":"2026-08-06T20:58:28.159722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:40.836120Z","title":"Mimir: Improving video diffusion models for precise text understanding","venue":null,"work_id":"7cc05193-e025-4041-952d-2b02796ed161","year":2025},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:28.204641Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:20b3d203b942ebcc396b07ec10d88da2a028ed957237b2752f8f54f94d83af7e","observation_id":"4a987c1c-7873-44d4-9077-67d2aaf5b470","resolution":{"observed_at":"2026-08-06T20:58:40.896869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:40.600271Z","title":"Animate-x: Universal character image ani- mation with enhanced motion representation","venue":null,"work_id":"66967612-bdc8-4c99-8c91-20ade3f6f788","year":2025},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:28.330893Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:b98aecb4958fa3b645a1aa22bc8a91f12f173baea1f146e757523e0c8b17dd33","observation_id":"b58591a4-7f66-41c4-9dc1-707728e03e4c","resolution":{"observed_at":"2026-08-06T20:58:40.753289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23690","last_updated":"2026-04-28T09:27:09Z","snapshot_observed_at":"2026-07-06T21:49:38.384518Z","submitted_at":"2025-06-30T10:09:32Z","title":"SynMotion: Semantic-Visual Adaptation for Motion Customized Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23690","snapshot_observed_at":"2026-08-06T20:58:28.474259Z","title":"Synmotion: Semantic-visual adaptation for motion customized video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:28.474259Z"},"links":{"cited_paper":"/paper/2506.23690","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:a3e80d600fc588755aa5ee583a5e6e97213b94a69a4800d5d9f32291c994c7af","observation_id":"20fd1b1f-af0c-452d-94b4-116723df07bb","resolution":{"observed_at":"2026-08-06T20:58:28.474259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:40.467488Z","title":"Edtalk: Effi- cient disentanglement for emotional talking head synthesis","venue":null,"work_id":"4c513e68-8c48-48fe-b901-ad0c4045635f","year":null},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:28.553399Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:925d0c8b038039c3bf0770aeae3dc4ac3ee1179f518a8ca0b1864fec76242f12","observation_id":"887adebb-fad8-453c-9328-086947d0e3ea","resolution":{"observed_at":"2026-08-06T20:58:40.538330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03270","last_updated":"2024-11-28T09:53:01Z","snapshot_observed_at":"2026-07-06T19:10:48.519252Z","submitted_at":"2024-09-05T06:27:32Z","title":"SVP: Style-Enhanced Vivid Portrait Talking Head Diffusion Model","version":2},"cited_work":{"arxiv_id":"2409.03270","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.03270","snapshot_observed_at":"2026-08-06T20:58:33.231158Z","title":"SVP: Style-Enhanced Vivid Portrait Talking Head Diffusion Model","venue":"cs.CV","work_id":"ced40590-3500-4698-b1a9-a584e52666f6","year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:28.791946Z"},"links":{"cited_paper":"/paper/2409.03270","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:529d0c0989a755364d527d0d4633b48c653381f76f0f1b9b63a9307f4ecf8551","observation_id":"9cedcbad-b5c4-4e9b-8b1f-7f14712dbb82","resolution":{"observed_at":"2026-08-06T20:58:33.273982Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:39.994610Z","title":"Neural voice puppetry: Audio-driven facial reenactment","venue":null,"work_id":"ff8e5c45-a88f-4ebf-b929-c013142a3680","year":2020},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:28.914132Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:bb4a36eb313e9f9c03f7b82d8b35d4da33502cf39d89d07d09965ed74c117e0e","observation_id":"dbca7167-10d2-4387-bd09-2df7452ec0cd","resolution":{"observed_at":"2026-08-06T20:58:40.154927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17485","last_updated":"2024-08-08T03:48:38Z","snapshot_observed_at":"2026-07-06T17:36:11.854303Z","submitted_at":"2024-02-27T13:10:11Z","title":"EMO: Emote Portrait Alive -- Generating Expressive Portrait Videos with Audio2Video Diffusion Model under Weak Conditions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17485","snapshot_observed_at":"2026-08-06T20:58:29.031658Z","title":"Emo: Emote portrait alive-generating expressive portrait videos with audio2video diffusion model under weak conditions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:29.031658Z"},"links":{"cited_paper":"/paper/2402.17485","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:06570a9ab90cb5b43778f0e73afc32eb6eff4cae8a87b4de7b332dc67da3ac0c","observation_id":"befc3a51-deff-4126-a597-9c3651d1d961","resolution":{"observed_at":"2026-08-06T20:58:29.031658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:39.711743Z","title":"Musepose: a pose-driven image-to-video framework for virtual human generation","venue":null,"work_id":"a138a99e-992a-4584-b1b0-1ef315f6d506","year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:29.114798Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:809e8672a9060ff0d4e38960b8d2fd3d797e51c5130636a13ed369fc61f937b2","observation_id":"e66f2708-d428-452b-896a-08f7ebeccf12","resolution":{"observed_at":"2026-08-06T20:58:39.852794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:39.406483Z","title":"Nonlinear 3d face morphable model","venue":null,"work_id":"33f8bab0-b542-4f69-9926-d49cbb7464fc","year":2018},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:29.194819Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:08b270532ff527926d3a06f1c827b50ded8ef9aacc4e67b1e007a5649b29d311","observation_id":"98d04961-ce78-42d9-b84f-7ae201428550","resolution":{"observed_at":"2026-08-06T20:58:39.600375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02511","last_updated":"2024-06-04T17:32:52Z","snapshot_observed_at":"2026-07-06T18:25:18.469656Z","submitted_at":"2024-06-04T17:32:52Z","title":"V-Express: Conditional Dropout for Progressive Training of Portrait Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02511","snapshot_observed_at":"2026-08-06T20:58:29.324951Z","title":"V-express: Conditional dropout for progres- sive training of portrait video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:29.324951Z"},"links":{"cited_paper":"/paper/2406.02511","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:a21ec76a9435710eaa444950e5f5960b535072920538c0b58a281a326a846b76","observation_id":"ee190d78-90bf-4f79-ad74-d0c88e692da8","resolution":{"observed_at":"2026-08-06T20:58:29.324951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:39.138768Z","title":"Progressive disentangled representation learning for fine-grained controllable talking head synthesis","venue":null,"work_id":"a48cd323-813b-4aa1-b436-5e36499dd825","year":2023},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:29.435927Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:cbbfae12f8db2dbba8ce1cb3fa9250c498c77b849bb7ac03c2e081c55e4513cb","observation_id":"99ffb67b-0bda-43c0-9d6e-2bf9cf544c0b","resolution":{"observed_at":"2026-08-06T20:58:39.318871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:38.928686Z","title":"Seeing what you said: Talking face gen- eration guided by a lip reading expert","venue":null,"work_id":"e8b42bf3-79ce-4115-8794-67a079a05393","year":2023},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:29.543486Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:c0fc4a8ab58b4eeaadbb0acd894611ba27a607818aa0892886749ff2c2b194df","observation_id":"1fbeee6a-3035-4a17-8af4-1c4f00409678","resolution":{"observed_at":"2026-08-06T20:58:39.034756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:29.636580Z","title":"Lipformer: High- fidelity and generalizable talking face generation with a pre- learned facial codebook","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:29.636580Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:7ef480b976487e40bcdbf4d06c974cda0aa0bd5fa3bf8b1294aeb860614b2a15","observation_id":"72634791-17c9-42a2-9019-621edc2e9e4a","resolution":{"observed_at":"2026-08-06T20:58:29.636580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:38.734080Z","title":"Mead: A large-scale audio-visual dataset for emo- tional talking-face generation","venue":null,"work_id":"928f5a7b-e387-4f64-9abe-90c334ce05a7","year":2020},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:29.727310Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:fdf6f37fe37ab8c8aa4ee07394ea9e2eb97debcbba14bacbeff9593de3a40bad","observation_id":"0bc4fbf0-f1fc-477e-840d-fd165aedb2dd","resolution":{"observed_at":"2026-08-06T20:58:38.816675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:38.489972Z","title":"Audio2head: Audio-driven one-shot talking-head generation with natural head motion","venue":null,"work_id":"120987e6-3245-40fe-bc69-02cd2a063a12","year":2021},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:29.805414Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:30b4af2bfb7db1597ac7e4b72818f225b000783a83ff98eb8654c19634b30918","observation_id":"3ed927c6-e97b-4e08-a417-6a6429683fed","resolution":{"observed_at":"2026-08-06T20:58:38.598452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:38.233241Z","title":"Disco: Disentangled control for referring human dance generation in real world","venue":null,"work_id":"52022666-7215-4fba-adcf-529828cc6116","year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:29.893763Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:a5ef841697c2ff1f3bc59a315ef3ce9206c8d5948a8407c0f37c50b066c23cc1","observation_id":"aea350c2-958e-4a8a-a74a-5b4f0822ec4c","resolution":{"observed_at":"2026-08-06T20:58:38.406625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01188","last_updated":"2024-06-03T10:51:10Z","snapshot_observed_at":"2026-07-06T18:24:17.711867Z","submitted_at":"2024-06-03T10:51:10Z","title":"UniAnimate: Taming Unified Video Diffusion Models for Consistent Human Image Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01188","snapshot_observed_at":"2026-08-06T20:58:29.969998Z","title":"Unianimate: Taming unified video diffusion mod- els for consistent human image animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:29.969998Z"},"links":{"cited_paper":"/paper/2406.01188","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:ab3d888e9ae76b5d89ab67a4dafdf6fa2269a5d76f3f0311ce3c4fd4ef76bf84","observation_id":"bab25467-5366-4cad-b580-e8b49db5d21d","resolution":{"observed_at":"2026-08-06T20:58:29.969998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:38.038096Z","title":"Latent image animator: Learning to animate im- ages via latent space navigation","venue":null,"work_id":"e89d7d9e-c6db-4b22-8bb0-d281bd672015","year":2021},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:30.051799Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:4e115055c348ca6b07e18550daa1924aa45210fb2c32d98772c0af81d03ae3bf","observation_id":"f1f2911d-d7fd-45f2-aa6a-753bfd1a4426","resolution":{"observed_at":"2026-08-06T20:58:38.138612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:37.833053Z","title":"Image quality assessment: from error visibility to structural similarity","venue":null,"work_id":"dd2080b6-9783-488d-b4f4-794512038ac0","year":2004},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:30.141214Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:f061375935ef6fc3246673e283b680c50c316933b276444499cd7517547fcdcc","observation_id":"d2d91d2a-a9aa-4d63-aa86-94125651dfc8","resolution":{"observed_at":"2026-08-06T20:58:37.928749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:37.599055Z","title":"Restoreformer: High-quality blind face restoration from undegraded key-value pairs","venue":null,"work_id":"64e515f6-d449-497e-90cb-281d8c81e110","year":2022},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:30.228433Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:084f3f0e9f08286815fc527ce466bafc503bcc77f6e7e66b43439fac9a789e1e","observation_id":"534c2f23-5cda-436d-a0eb-70529f971d27","resolution":{"observed_at":"2026-08-06T20:58:37.684026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-06T01:54:50.445862Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-08-06T20:58:30.336835Z","title":"Aniportrait: Audio-driven synthesis of photorealistic portrait animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:30.336835Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:eff0c2372a235829826739067c8f05c39de27bcc05cd6ef91070afa36b2e4ac2","observation_id":"b3eff734-9988-4b39-90e7-632f17a4d897","resolution":{"observed_at":"2026-08-06T20:58:30.336835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:37.332175Z","title":"F 3a-gan: Facial flow for face animation with generative adversarial networks","venue":null,"work_id":"1b77a76c-9d57-42cb-a214-b0d994249b0e","year":null},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:30.397592Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:83463bfba1b793e145b3a30f8791bbef8b00442aa9f600ef1e60b6351a59875e","observation_id":"5e8cc5b2-7334-4f99-86d0-90d1ae5c7bfd","resolution":{"observed_at":"2026-08-06T20:58:37.408365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:37.143876Z","title":"Vfhq: A high-quality dataset and bench- mark for video face super-resolution","venue":null,"work_id":"21991051-f18f-42e6-9852-2cb5ef4b6a99","year":2022},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:30.500524Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:628b343e1cafc3c7767e7224b25c6dbe88a189c745bf439303490efa3121f738","observation_id":"1fe8539c-6dd0-497f-878e-44a5c2e4a2e4","resolution":{"observed_at":"2026-08-06T20:58:37.235525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:36.947672Z","title":"X-portrait: Expressive portrait anima- tion with hierarchical motion attention","venue":null,"work_id":"70048fff-a4f5-4b81-bef4-451901f6da3f","year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:30.587424Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:66a589780c9a98cd8dd036de5ac05174d67a6e10bedd8368659f0dd620fa1c7e","observation_id":"cb433dee-9d90-4745-9793-0096570269d7","resolution":{"observed_at":"2026-08-06T20:58:37.023590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-08-06T20:58:30.681138Z","title":"Hallo: Hierarchical audio-driven vi- sual synthesis for portrait image animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:30.681138Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:b7503ac9ad118d7b1dd5ced6ad04ca4628a88d279245e2acd03ed1ed81ab59d5","observation_id":"7ee5b291-450d-4725-a774-594001b100eb","resolution":{"observed_at":"2026-08-06T20:58:30.681138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10667","last_updated":"2024-10-31T07:43:14Z","snapshot_observed_at":"2026-07-06T18:01:01.206270Z","submitted_at":"2024-04-16T15:43:22Z","title":"VASA-1: Lifelike Audio-Driven Talking Faces Generated in Real Time","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10667","snapshot_observed_at":"2026-08-06T20:58:30.797463Z","title":"Vasa-1: Lifelike audio-driven talking faces generated in real time","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:30.797463Z"},"links":{"cited_paper":"/paper/2404.10667","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:0cd36a33b2915a482caa02f11311ba816fdfc342ac999b14eecf765e0b7b6938","observation_id":"bd6d5c86-2636-4b16-af03-b15bd429c157","resolution":{"observed_at":"2026-08-06T20:58:30.797463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16498","last_updated":"2023-11-27T18:32:31Z","snapshot_observed_at":"2026-07-06T16:53:35.776613Z","submitted_at":"2023-11-27T18:32:31Z","title":"MagicAnimate: Temporally Consistent Human Image Animation using Diffusion Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16498","snapshot_observed_at":"2026-08-06T20:58:30.864897Z","title":"Magicanimate: Temporally consistent human im- age animation using diffusion model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:30.864897Z"},"links":{"cited_paper":"/paper/2311.16498","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:f78ebe5bdbbec037dc3227f104ba0a73bddd520362b3b4fe0b9a829476d8cf1e","observation_id":"f358ffa3-3f07-4dfb-8b15-1b8a457cd832","resolution":{"observed_at":"2026-08-06T20:58:30.864897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16216","last_updated":"2024-11-25T09:25:53Z","snapshot_observed_at":"2026-08-06T13:32:58.001876Z","submitted_at":"2024-11-25T09:25:53Z","title":"SMGDiff: Soccer Motion Generation using diffusion probabilistic models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16216","snapshot_observed_at":"2026-08-06T20:58:30.937663Z","title":"Smgdiff: Soccer motion generation using diffusion probabilistic mod- els","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:30.937663Z"},"links":{"cited_paper":"/paper/2411.16216","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:7acb4e2cb9e2c164a67651e58266042abb3f28f85f8ecdaef9f00b7e192e6b3a","observation_id":"c888266b-5d39-424b-896a-7a7db9673c9f","resolution":{"observed_at":"2026-08-06T20:58:30.937663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:36.759496Z","title":"Face2face ρ: Real- time high-resolution one-shot face reenactment","venue":null,"work_id":"2b764471-8f0d-45a3-beef-783e7970e82e","year":2022},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:30.986982Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:3e55104e039f091f858109607d1a52a1fb10fb3927550e8521235bf3307cab69","observation_id":"041d4b38-36c0-4eb5-8e61-a2cfbd792a98","resolution":{"observed_at":"2026-08-06T20:58:36.844445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20851","last_updated":"2024-06-18T05:36:11Z","snapshot_observed_at":"2026-07-06T18:23:19.450809Z","submitted_at":"2024-05-31T14:33:13Z","title":"MegActor: Harness the Power of Raw Video for Vivid Portrait Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20851","snapshot_observed_at":"2026-08-06T20:58:31.076359Z","title":"Megactor: Harness the power of raw video for vivid portrait animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:31.076359Z"},"links":{"cited_paper":"/paper/2405.20851","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:05398852d76f64fa5bdfb0c27ed83fd3f27545454101a804840189621aee7199","observation_id":"734c68aa-587f-4c4e-bccf-543d181d8d9d","resolution":{"observed_at":"2026-08-06T20:58:31.076359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.01051","last_updated":"2021-10-15T22:04:39Z","snapshot_observed_at":"2026-07-06T11:05:55.984799Z","submitted_at":"2021-05-03T17:51:09Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.01051","snapshot_observed_at":"2026-08-06T20:58:31.169287Z","title":"Superb: Speech processing universal performance benchmark.arXiv preprint arXiv:2105.01051, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:31.169287Z"},"links":{"cited_paper":"/paper/2105.01051","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:f057f7211cad3d8770e06ecd0dcf59a0a973762220e48069af4df7b679c66029","observation_id":"f4a97ade-ec12-49e6-9a14-2af222fe9663","resolution":{"observed_at":"2026-08-06T20:58:31.169287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:36.489216Z","title":"Mesh guided one-shot face reenactment using graph convo- lutional networks","venue":null,"work_id":"874e540b-a287-410b-97bb-305c981bbd17","year":2020},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:31.258555Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:07820af75c46a22b5c28eecebdfee9d53b691072fa314329d3b78bcdeff548d9","observation_id":"97a29b95-7c82-4e85-89e8-27cabbab07b9","resolution":{"observed_at":"2026-08-06T20:58:36.622982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:36.280392Z","title":"Few-shot adversarial learning of realistic neural talking head models","venue":null,"work_id":"aecca9f4-4dbb-48c7-b4f3-e66e03d06f8e","year":2019},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:31.345409Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:5224d8f006e6cd70edd58da2263d9359bbce8ea5325021fc77330ddd805d6aeb","observation_id":"37c67c33-680e-4964-81aa-b5805b6574a1","resolution":{"observed_at":"2026-08-06T20:58:36.392325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:36.093538Z","title":"Metaportrait: Identity-preserving talking head gener- ation with fast personalized adaptation","venue":null,"work_id":"77577243-87ca-4951-8bdb-03e2d1f4d4a2","year":2023},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:31.484833Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:1504560024f1e0e4d45460844e45f6c7928ec5ba3e0f4b7828bb7ec71478b563","observation_id":"edf1eeea-1cc9-45bf-ab9c-3cbf164a06af","resolution":{"observed_at":"2026-08-06T20:58:36.149735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:31.622546Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:31.622546Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:37a777865fb826754c395d9d7d0696f6e25fa782d23a59ede74f360541a670d1","observation_id":"c9d21c2c-a648-4d50-a1e3-2baaddcab1f5","resolution":{"observed_at":"2026-08-06T20:58:31.622546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:35.873368Z","title":"Sadtalker: Learning realistic 3d motion coefficients for stylized audio- driven single image talking face animation","venue":null,"work_id":"ffb5c883-63f3-4576-b375-2cc054fb3fd7","year":2023},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:31.714314Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:9720c1f222ba18c445c5e033db4f6d34cfd6d4dafdf9c044f9e21bead91715c0","observation_id":"23998122-e4a8-459c-9bd5-0cb71faf8c0b","resolution":{"observed_at":"2026-08-06T20:58:35.941143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19680","last_updated":"2025-06-27T10:06:13Z","snapshot_observed_at":"2026-08-04T16:03:06.733403Z","submitted_at":"2024-06-28T06:40:53Z","title":"MimicMotion: High-Quality Human Motion Video Generation with Confidence-aware Pose Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19680","snapshot_observed_at":"2026-08-06T20:58:31.799959Z","title":"Mim- icmotion: High-quality human motion video generation with confidence-aware pose guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:31.799959Z"},"links":{"cited_paper":"/paper/2406.19680","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:e18bd2f797e98c2e6365bf5c3b9bdbc13639b2ca17e047bcd75b608a1c05b868","observation_id":"b74cd972-0564-48eb-9b7e-586f0ba90e56","resolution":{"observed_at":"2026-08-06T20:58:31.799959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:35.658743Z","title":"Flow-guided one-shot talking face generation with a high-resolution audio-visual dataset","venue":null,"work_id":"f3c74f8d-f827-461b-b248-716aae7f74c7","year":2021},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:31.955970Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:3abf6542b23a7f6e7855498b28f37189471f33dac38adf9b5b8eec664a1677ae","observation_id":"0a96a28b-9d1f-46aa-9e78-fca47e338a99","resolution":{"observed_at":"2026-08-06T20:58:35.781103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:35.461823Z","title":"Thin-plate spline motion model for image animation","venue":null,"work_id":"be774fda-1cb1-46a0-9662-044f37cb43b9","year":2022},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:32.047722Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:ae60d17ec33284ae9ffbdac3c84b64748ad065cb1021f0ed4829ce95d90ea213","observation_id":"ae71de02-63db-4621-828b-e57a83df5ead","resolution":{"observed_at":"2026-08-06T20:58:35.564029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:35.236725Z","title":"Media2face: Co-speech facial animation gen- eration with multi-modality guidance","venue":null,"work_id":"d2ca108d-ace5-4107-8d21-361871f4c856","year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:32.154806Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:c560f2ab918a6437020154ba31fa5aa1ffbc9f52fa85d0fb07c3254501739c6b","observation_id":"248fe8b6-4486-4b99-b8a6-eebe0ce884ef","resolution":{"observed_at":"2026-08-06T20:58:35.326278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:35.026589Z","title":"Sparse to dense motion transfer for face image animation","venue":null,"work_id":"1177f48e-8207-4714-b865-c340a22bd9e0","year":1991},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:32.254370Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:762290f0c08e3f0f88963aae9c28ba6e9b8ee45c079961b6d4d263e4f85dbf48","observation_id":"e2e0994e-c849-4a23-8191-a65b98914173","resolution":{"observed_at":"2026-08-06T20:58:35.136674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:34.792010Z","title":"Identity- preserving talking face generation with landmark and ap- pearance priors","venue":null,"work_id":"12162123-1dcf-4d6a-80d5-90e38aed2652","year":2023},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:32.378472Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:46ab81371e003abd73280b38565a1dc072f52e253124c0da207752cb27bd67cf","observation_id":"24b38b98-b672-4f55-8dc5-ff3dc8e3f219","resolution":{"observed_at":"2026-08-06T20:58:34.913685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:34.583155Z","title":"Talking face generation by adversarially disentangled audio-visual representation","venue":null,"work_id":"1d428b3c-c0c1-4402-86fa-d54723b8f5c3","year":2019},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:32.469746Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:5ff78e44316209722a16e8a0f09481a15a44f15598dd7d11fe63fd9904bacf96","observation_id":"86d62245-8607-43dd-98f6-9a6d06df0322","resolution":{"observed_at":"2026-08-06T20:58:34.662889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:34.413669Z","title":"Makelttalk: speaker-aware talking-head animation","venue":null,"work_id":"064bd32f-ad30-4f39-a829-f2ca78108fc7","year":2020},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:32.571705Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:63978b3b0a7bd8a1018f7c586f0b4f1edf6c2d61d28f71aaaf3d8fbbc9717497","observation_id":"65decd62-8445-40e4-8255-57cb9076e37d","resolution":{"observed_at":"2026-08-06T20:58:34.488488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:32.668949Z","title":"Champ: Controllable and consistent human image animation with 3d parametric guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:32.668949Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:f347c8ced0ec88af3830942762ff1f1d880b78f539cb84c21096a54bc4fa3a13","observation_id":"da599dc7-6007-4580-9dc4-642d3dbee57a","resolution":{"observed_at":"2026-08-06T20:58:32.668949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:34.232175Z","title":"Face alignment in full pose range: A 3d total solution.IEEE trans- actions on pattern analysis and machine intelligence, 41(1): 78–92, 2017","venue":null,"work_id":"e29be6c7-2141-4d32-b35a-1da075c89d81","year":2017},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:32.804437Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:fe0054b3d5f2a0fd43d2cc3bdd5ab13cd4afe04a52132ae58f75aadb5b9d567c","observation_id":"492f786e-81f3-44a5-afbd-1a0c0165079b","resolution":{"observed_at":"2026-08-06T20:58:34.307232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:58:40.216069Z","title":null,"venue":null,"work_id":"ab3c66d3-db78-4fa5-b157-33836b91c8ad","year":2025},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":416,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:28.665882Z"},"links":{"citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:68895e4daf8a231787952a87471179548a491220023fa0d7d6f6f41eb129270b","observation_id":"5b9376e4-dd8a-4112-9744-5df75b1e02ee","resolution":{"observed_at":"2026-08-06T20:58:40.322472Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":54,"verified_exact":3,"verified_fuzzy":42},"total_outbound_references":100},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 100 of 100 outbound references and 3 inbound Pith citation observations for arXiv:2507.01390."}