{"as_of":"2026-08-07T10:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b6fcd7425e818ef4c901799b535ffdb2dd8f3ce29c047d95941b75d37dbbaef3","coverage":[{"denominator":112,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T13:10:19.735725Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.20953/citation-record","integrity":"/paper/2507.20953/integrity","json":"/paper/2507.20953/citation-record.json","paper":"/paper/2507.20953"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:18.321025Z","title":"Deep audio-visual speech recognition","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:18.321025Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:629eb2dc86317733d4d431b23d01ab7631c9c2d898624c2f643ed167b0e3d235","observation_id":"c9836d1c-40de-4247-93fa-1901ad46d875","resolution":{"observed_at":"2026-08-06T13:10:18.321025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:18.394341Z","title":"Self-supervised learning of audio- visual objects from video","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:18.394341Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:994a16bb0f0c7b7762e07cd181ff6a0e76fba4b9f247669018087f8e56986992","observation_id":"e44250eb-0e52-4ba4-9828-3f35e7705e3a","resolution":{"observed_at":"2026-08-06T13:10:18.394341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:18.435036Z","title":"A morphable model for the synthesis of 3d faces","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:18.435036Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:21813675d46a107056ca61dd90b9bcb6910b83eaf05850cd01c5350a25eb97f0","observation_id":"a26a3b85-3e13-4604-9d4e-300a40fe3a18","resolution":{"observed_at":"2026-08-06T13:10:18.435036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:18.457608Z","title":"Large scale 3d mor- phable models","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:18.457608Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:57149155205fb6a629fb036d6e82bafa8457e307cb5b53aadec7b074c62da70b","observation_id":"47cec664-b9c1-47b1-8ea0-2516f105dff5","resolution":{"observed_at":"2026-08-06T13:10:18.457608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:18.673658Z","title":"V oice puppetry","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:18.673658Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:9ede0c1bc7fea4c1b6369cce5901a769e318e812d8bab02cca1c2c0d9adbdf51","observation_id":"aa7ec033-a8cd-4eb7-9a73-a9b8dc04ff0c","resolution":{"observed_at":"2026-08-06T13:10:18.673658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:18.825656Z","title":"How far are we from solving the 2d & 3d face alignment problem? (and a dataset of 230,000 3d facial landmarks)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:18.825656Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:a69e1eaf7921ef4fbe1cf1aced5e8a6a8325a2fe061c3234b3bd5bfb75f31052","observation_id":"1247365f-f787-4d8f-ad42-c20fb3f75153","resolution":{"observed_at":"2026-08-06T13:10:18.825656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12156","last_updated":"2024-09-18T17:18:13Z","snapshot_observed_at":"2026-07-06T19:17:41.512834Z","submitted_at":"2024-09-18T17:18:13Z","title":"JEAN: Joint Expression and Audio-guided NeRF-based Talking Face Generation","version":1},"cited_work":{"arxiv_id":"2409.12156","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.12156","snapshot_observed_at":"2026-08-06T13:10:19.963454Z","title":"JEAN: Joint Expression and Audio-guided NeRF-based Talking Face Generation","venue":"cs.CV","work_id":"e5fad298-9863-40ae-981f-5680a6443447","year":2024},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:18.912385Z"},"links":{"cited_paper":"/paper/2409.12156","citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:a0b010dd36a1ebe5cac3f71df14b5e11bfdf84c835a87094e726a163a6362a52","observation_id":"48638b90-8a57-4852-ad8b-26736454c962","resolution":{"observed_at":"2026-08-06T13:10:19.966755Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16666","last_updated":"2024-09-25T06:51:57Z","snapshot_observed_at":"2026-08-01T11:28:38.974141Z","submitted_at":"2024-09-25T06:51:57Z","title":"TalkinNeRF: Animatable Neural Fields for Full-Body Talking Humans","version":1},"cited_work":{"arxiv_id":"2409.16666","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.16666","snapshot_observed_at":"2026-08-06T13:10:19.951384Z","title":"TalkinNeRF: Animatable Neural Fields for Full-Body Talking Humans","venue":"cs.CV","work_id":"1671b17f-b1d6-4ff5-9880-74500014b415","year":2024},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:18.981498Z"},"links":{"cited_paper":"/paper/2409.16666","citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:832bcb72a06748f9e88feb23d62b43f598fc6bc1d856bba800c40927c15f8ab9","observation_id":"a2f7b28a-1a6f-4e2e-a351-f81ad5ff73ed","resolution":{"observed_at":"2026-08-06T13:10:19.954691Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.010196Z","title":"Implicit neural head synthesis via controllable lo- cal deformation fields","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.010196Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:0035889e362d7a95c4830ec02f8a1aac813757e8ab078a786922851950c1197f","observation_id":"2295c8f3-91b3-4243-955b-983ef24f91a1","resolution":{"observed_at":"2026-08-06T13:10:19.010196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04432","last_updated":"2021-12-08T17:50:26Z","snapshot_observed_at":"2026-07-06T12:16:41.817858Z","submitted_at":"2021-12-08T17:50:26Z","title":"Audio-Visual Synchronisation in the wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.04432","snapshot_observed_at":"2026-08-06T13:10:19.013378Z","title":"Audio-visual synchronisation in the wild","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.013378Z"},"links":{"cited_paper":"/paper/2112.04432","citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:d9b3e4e6583b7304bf48a4842e1636e6f7357e7eecb9580d7086113257b5ddf5","observation_id":"73213bc5-db62-49a3-96f6-7311a9ae1884","resolution":{"observed_at":"2026-08-06T13:10:19.013378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.016638Z","title":"Hierarchical cross-modal talking face generation with dynamic pixel-wise loss","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.016638Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:a56b8fc466ff1091dc8cd6320d8371cd2f16bf3e8cf0e38edb5b5b9e871c62ae","observation_id":"3a41c1df-a95c-4af2-b709-2002971afbc2","resolution":{"observed_at":"2026-08-06T13:10:19.016638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.039371Z","title":"Videoretalking: Audio-based lip synchronization for talking head video editing in the wild","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.039371Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:3543c66a283b769f35c5b414c477e73d009eeea93be42b28cc2a072dee65a6b3","observation_id":"64367a9b-4d71-4470-8663-8f071082d597","resolution":{"observed_at":"2026-08-06T13:10:19.039371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10215","last_updated":"2024-01-18T18:56:34Z","snapshot_observed_at":"2026-07-06T17:17:31.008185Z","submitted_at":"2024-01-18T18:56:34Z","title":"GPAvatar: Generalizable and Precise Head Avatar from Image(s)","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10215","snapshot_observed_at":"2026-08-06T13:10:19.117914Z","title":"Gpavatar: Generaliz- able and precise head avatar from image (s)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.117914Z"},"links":{"cited_paper":"/paper/2401.10215","citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:6a3bd4ed32d4135eb4eaf8bb22cb1ad81f257a02b2ebe876129a434be30dbe71","observation_id":"bff3e6aa-a911-44ba-a68b-1396f64f1d27","resolution":{"observed_at":"2026-08-06T13:10:19.117914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.197057Z","title":"Lip reading in the wild","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.197057Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:8ffa4653044bc2ba05c079a825555130c49a8f84f9982616ca29c06d80bb7db3","observation_id":"ee007793-6166-4ab5-9bfc-17b23c410ea5","resolution":{"observed_at":"2026-08-06T13:10:19.197057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.251086Z","title":"Out of time: auto- mated lip sync in the wild","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.251086Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:a651a34a1fbb0f4bec1f085cedc5a8bce0f31eb6b1848abc4424a1d2f4b9d4ba","observation_id":"de5759f6-daf1-4d47-ba93-af9702d9fe3b","resolution":{"observed_at":"2026-08-06T13:10:19.251086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.326692Z","title":"Perfect match: Improved cross-modal embeddings for audio-visual synchronisation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.326692Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:da74d567e33a93a25f4159afaa30364ef35bf23ce6df97e1c039ba0a0e9b4cd4","observation_id":"d7077656-b694-4b0e-a0b6-485bdf88205b","resolution":{"observed_at":"2026-08-06T13:10:19.326692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.385049Z","title":"Speech-driven facial animation us- ing cascaded gans for learning of motion and texture","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.385049Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:2dafac5c1cded5586e28db07a74b1ec7387a408f0676864125d21a3ac0b4068c","observation_id":"7e629fbd-0271-4e8c-b7ea-2228696613d8","resolution":{"observed_at":"2026-08-06T13:10:19.385049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.459990Z","title":"Imagenet: A large-scale hierarchical im- age database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.459990Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:2b2f95b86e8f73557a18fd7068c578683f7729bbe3e27543b62d0541092cb33d","observation_id":"c63e7167-c726-4d70-b92c-2039a471566e","resolution":{"observed_at":"2026-08-06T13:10:19.459990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.502108Z","title":"Arcface: Additive angular margin loss for deep face recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.502108Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:0a25b9b2011005b3ecdd04373a44aa2054d1b9d88eb50483007a6c3d2e8c6fd2","observation_id":"947f87c2-5421-482a-8e89-119d03e4e5b5","resolution":{"observed_at":"2026-08-06T13:10:19.502108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.508637Z","title":"End-to-end generation of talking faces from noisy speech","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.508637Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:bd111534c4244ec39188876a56b28d56ef1bf085d2418d383367c7ea33675190","observation_id":"8c0b5163-0e1f-4848-9af1-704a4430b9f4","resolution":{"observed_at":"2026-08-06T13:10:19.508637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.511638Z","title":"Efficient emotional adaptation for audio- driven talking-head generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.511638Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:2ed94c2af9370fbdf64065e91678b1dcd9d01fba64743b92ae16d059a70f83ee","observation_id":"b4dce184-be8c-4a22-89d1-ff2bb1490e0d","resolution":{"observed_at":"2026-08-06T13:10:19.511638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.514379Z","title":"Generative adversarial nets","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.514379Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:d66480c7cfbf6bce8555a1c90784ac4a6b7527ee395cdbaab29f306076fe1dbf","observation_id":"1b9b07f6-4d3c-4ce0-859b-12423c898c07","resolution":{"observed_at":"2026-08-06T13:10:19.514379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.517398Z","title":"Stylesync: High-fidelity generalized and personalized lip sync in style-based gener- ator","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.517398Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:c15a59af25b34dd90b65d143c02d9622def20285329fe0253f285b2f44d252a5","observation_id":"9595d764-85bd-42be-9a1e-da5ec0d9a827","resolution":{"observed_at":"2026-08-06T13:10:19.517398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.520614Z","title":"Ad-nerf: Audio driven neural radiance fields for talking head synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.520614Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:5743f140d33a07808adfb8978d40203fb4fd3ddd8bff0e22c93c44ecd185c06a","observation_id":"7908e6e8-4050-4c77-9977-7b8a4c4f7175","resolution":{"observed_at":"2026-08-06T13:10:19.520614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.523372Z","title":"Audio vision: Using 9 audio-visual synchrony to locate sounds","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.523372Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:4c6c1e922a9d15a5a898ab9a3b51ddae7347ad1a0cf81ebb2444216c412d698e","observation_id":"93ac78b8-73f8-4c80-b831-ffbf666981d6","resolution":{"observed_at":"2026-08-06T13:10:19.523372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.525963Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.525963Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:aa459f0e6caa0df18bc89ef879df183e67389a357a664da71c3ae1472f3c857f","observation_id":"7b289745-c745-4903-9d2d-1fbc51f4e216","resolution":{"observed_at":"2026-08-06T13:10:19.525963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.528609Z","title":"Diffted: One-shot audio-driven ted talk video generation with diffusion-based co-speech gestures","venue":null,"work_id":null,"year":1922},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.528609Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:796542959111abb8d361a00b2de337d73fac349f9cf359640d9a5adf196ca69d","observation_id":"d8848ea0-459e-4dc8-b06b-cf5cf66b28ee","resolution":{"observed_at":"2026-08-06T13:10:19.528609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.531664Z","title":"Arbitrary style transfer in real-time with adaptive instance normalization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.531664Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:62f0f48e3daa6e6e1ea2665eabf99fe6bc1c618c4d2288cb510be51c5eed7f51","observation_id":"c59b91eb-fd0a-40c5-abaf-ef8fbfac12ae","resolution":{"observed_at":"2026-08-06T13:10:19.531664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.534433Z","title":"Discohead: audio-and- video-driven talking head generation by disentangled con- trol of head pose and facial expressions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.534433Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:8443820ff4929d767c89f51fc5ba27f50f3d075bede81d5d5537176ac615b7dd","observation_id":"04ca43ee-d2a3-4adf-b2d8-13e0320596ca","resolution":{"observed_at":"2026-08-06T13:10:19.534433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07055","last_updated":"2022-10-13T14:25:37Z","snapshot_observed_at":"2026-08-05T15:11:32.774834Z","submitted_at":"2022-10-13T14:25:37Z","title":"Sparse in Space and Time: Audio-visual Synchronisation with Trainable Selectors","version":1},"cited_work":{"arxiv_id":"2210.07055","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.07055","snapshot_observed_at":"2026-08-06T13:10:19.923901Z","title":"Sparse in Space and Time: Audio-visual Synchronisation with Trainable Selectors","venue":"cs.CV","work_id":"a44fabcb-6844-4ce6-ad10-1c6d647c49fe","year":2022},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.536817Z"},"links":{"cited_paper":"/paper/2210.07055","citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:74e9d76e7bb13392eb725371beff9dad6c034d55902abacd97279464095a34f2","observation_id":"96076c35-38b5-4dcd-b088-ec50f6f83c1c","resolution":{"observed_at":"2026-08-06T13:10:19.927064Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.539510Z","title":"Batch normalization: Accelerating deep network training by reducing internal co- variate shift","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.539510Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:aee298bad1d6d707843ba60aaafcdf341f15dc2f8357bc657217ca37542bd525","observation_id":"2ac0bac6-07cc-42c9-b2b6-78c4779ac027","resolution":{"observed_at":"2026-08-06T13:10:19.539510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.542094Z","title":"You said that?: Synthesising talking faces from audio","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.542094Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:98efd6adf5135f737e5ef8e1ab8e1b1852842a8c69a6674576db4389dfa4611c","observation_id":"bf1738ef-787b-4d2b-9561-0d3ae75af01b","resolution":{"observed_at":"2026-08-06T13:10:19.542094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.544758Z","title":"Audio-driven emotional video portraits","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.544758Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:b0fd23095e58df2730c1902de9581163781491a63ecf1f9b4e1b7a28384f4455","observation_id":"f0bb7da1-c2ff-4dd5-afa3-d1d15ebcb4ea","resolution":{"observed_at":"2026-08-06T13:10:19.544758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.547228Z","title":"Eamm: One-shot emotional talking face via audio-based emotion-aware motion model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.547228Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:132308fbac7159b0434b905b65cadb2d8eaac2b3687842055b066522b05773a8","observation_id":"54b7fb74-5b2d-4f1e-bdc7-1389719fc14a","resolution":{"observed_at":"2026-08-06T13:10:19.547228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.549789Z","title":"Audio-driven facial an- imation with deep learning: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.549789Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:5b87c568fe7e4baf0f944b7f3f5a020b2310497299b27628948ab8847b4f2ada","observation_id":"50611682-95c7-4edc-a162-fca7cf7d985a","resolution":{"observed_at":"2026-08-06T13:10:19.549789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.552282Z","title":"Percep- tual losses for real-time style transfer and super-resolution","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.552282Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:3a8d09adb6d5cd0c949b73fb0de96d8f2805bf14d6dbc46034259bc8aa64c9b4","observation_id":"74a4bae3-77ca-42db-85e4-5f3bc5a3a944","resolution":{"observed_at":"2026-08-06T13:10:19.552282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02090","last_updated":"2022-06-30T11:46:24Z","snapshot_observed_at":"2026-08-05T02:02:03.307058Z","submitted_at":"2022-04-05T10:02:39Z","title":"VocaLiST: An Audio-Visual Synchronisation Model for Lips and Voices","version":2},"cited_work":{"arxiv_id":"2204.02090","doi":null,"metadata_source":"pith","pith_arxiv_id":"2204.02090","snapshot_observed_at":"2026-08-06T13:10:19.912830Z","title":"VocaLiST: An Audio-Visual Synchronisation Model for Lips and Voices","venue":"cs.CV","work_id":"66a461b0-ef0b-4831-8fda-1d773cc01e71","year":2022},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.554988Z"},"links":{"cited_paper":"/paper/2204.02090","citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:5b613078d4c8db72277eb5a461fdc2c10a12aeaf623f172c50cac6ae4876e7ce","observation_id":"603d623b-998b-49fd-91cd-1f36294bb2f4","resolution":{"observed_at":"2026-08-06T13:10:19.916020Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05749","last_updated":"2024-05-10T14:13:10Z","snapshot_observed_at":"2026-07-06T18:12:05.439027Z","submitted_at":"2024-05-09T13:14:06Z","title":"NeRFFaceSpeech: One-shot Audio-driven 3D Talking Head Synthesis via Generative Prior","version":2},"cited_work":{"arxiv_id":"2405.05749","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.05749","snapshot_observed_at":"2026-08-06T13:10:19.901497Z","title":"NeRFFaceSpeech: One-shot Audio-driven 3D Talking Head Synthesis via Generative Prior","venue":"cs.CV","work_id":"d31b7141-8378-4495-a83e-abfdb4b9cdf7","year":2024},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.557924Z"},"links":{"cited_paper":"/paper/2405.05749","citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:97fcbae1bd84acc897c97c564b4d0f98c2a72219a3b34a5d79c057434d0bfd22","observation_id":"63d3afe6-400e-415d-9453-343bf0cd2f9c","resolution":{"observed_at":"2026-08-06T13:10:19.904549Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.561409Z","title":"End-to-end lip synchronisation based on pattern classification","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.561409Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:357b3af1ad120fbcd4f9358c8de8dba02bf51567f2190b13b8f3d1b49844b71c","observation_id":"7d5ff702-a208-41f0-982e-a75fda6385cf","resolution":{"observed_at":"2026-08-06T13:10:19.561409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.458183Z","title":"Towards automatic face-to-face translation","venue":null,"work_id":"3a95aad4-79a6-45ca-a550-dcd5e5fce5a6","year":2019},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.564369Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:c41efb560e166e8ecb4730560788efb682deaa3fc181063205f032f0b980efa3","observation_id":"4fda48fa-ff56-435a-8872-805a678b6d6b","resolution":{"observed_at":"2026-08-06T13:10:20.461263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.450567Z","title":"Imagenet classification with deep convolutional neural net- works","venue":null,"work_id":"c02b520f-d745-4a08-b548-a05c7ce1383e","year":2012},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.566904Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:9fa66a3ae62ed1a314ec787a9cc5c40e5bdacb6ad88b7c6e1d1a744b309aa595","observation_id":"13883951-8b0d-44a1-9327-244bf9e0391e","resolution":{"observed_at":"2026-08-06T13:10:20.453293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.442300Z","title":"Layer normalization","venue":null,"work_id":"7b0f5476-ea4e-442d-8a9d-2797014fca78","year":null},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.569647Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:9df90ccd90d3cf8fbb75d17259b9eabb69653771898d98eb16c0aeef0654789a","observation_id":"1d741386-e3a3-445c-960f-b667e71f8da9","resolution":{"observed_at":"2026-08-06T13:10:20.445443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.434453Z","title":"Efficient region-aware neural radiance fields for high- fidelity talking portrait synthesis","venue":null,"work_id":"7012091d-e6d7-4e77-af92-0b328cf98f4e","year":2023},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.572738Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:f1abe2fce37343fffe1c239c981f260944cf746e565056229a5e43d0256a7ea2","observation_id":"707b5b6f-89ec-46c4-8d69-dea8ab395aed","resolution":{"observed_at":"2026-08-06T13:10:20.437092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.426300Z","title":"One-shot high- fidelity talking-head synthesis with deformable neural ra- diance field","venue":null,"work_id":"778e5c55-1f7c-42ad-a9bd-5f2867a19898","year":2023},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.575782Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:a9d69948d3079ef092f769d54b3a728efc0787351f5216a5aea429de71e5c76b","observation_id":"cadf50fa-9c70-4cc5-a319-565e6e90dc60","resolution":{"observed_at":"2026-08-06T13:10:20.429530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.418078Z","title":"Expressive talking head generation with granular audio-visual control","venue":null,"work_id":"7b54f40b-ab1a-45d4-996d-be858d6a310d","year":2022},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.578661Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:5dd54305af011002ebb89bbc0b9651e86184f019aa8913a94948ac84ccee85bf","observation_id":"b0690c38-67e4-4175-99a8-2eb20b746046","resolution":{"observed_at":"2026-08-06T13:10:20.420942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.409978Z","title":"Font: Flow-guided one-shot talking head generation with natural head motions","venue":null,"work_id":"04c7d752-b2c3-47a7-8438-1a42a645ab7f","year":2023},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.581524Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:59dc5b205faf4de997f363297832fabc1ad4a10f7dc07dda05d96413f12f40d6","observation_id":"54f85be3-39e3-498a-930b-e85474827d81","resolution":{"observed_at":"2026-08-06T13:10:20.412736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.401460Z","title":"Opt: One-shot pose- controllable talking head generation","venue":null,"work_id":"e5cc651c-985f-49d8-969d-ea45065b1b94","year":2023},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.585066Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:0405b352b7395373bb49daf506223b861c353c97459779294c74fcd506a88afa","observation_id":"9320ef49-2fa4-4e36-a7b6-dfa1cd2b1997","resolution":{"observed_at":"2026-08-06T13:10:20.404441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.393759Z","title":"Semantic-aware implicit neural audio- driven video portrait generation","venue":null,"work_id":"f1c1e81b-779f-4be7-8d5f-4484998adff4","year":2022},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.587601Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:cb796a8b4e33821c6205e13216e2bc547ac6ce88f1a72f46ae7c4766b28f31cd","observation_id":"34290a6a-be79-4b19-ac6f-e795ca15481a","resolution":{"observed_at":"2026-08-06T13:10:20.396341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.385864Z","title":"Moda: Mapping-once audio-driven portrait animation with dual attentions","venue":null,"work_id":"9b4c6d2e-89e9-40d7-9708-e304a12ed912","year":2023},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.590321Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:f69beceda8c9846b456f22125889749ef76976e550ab56cee5e986050d574725","observation_id":"926e99f2-d6c7-4f41-81ca-136480043d3d","resolution":{"observed_at":"2026-08-06T13:10:20.389007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.08172","last_updated":"2019-06-14T05:49:22Z","snapshot_observed_at":"2026-08-05T19:15:35.517082Z","submitted_at":"2019-06-14T05:49:22Z","title":"MediaPipe: A Framework for Building Perception Pipelines","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.08172","snapshot_observed_at":"2026-08-06T13:10:19.592928Z","title":"Me- diapipe: A framework for building perception pipelines","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.592928Z"},"links":{"cited_paper":"/paper/1906.08172","citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:0ed89c7bacf6178b053e7375e67cd15b18cb3ac8de03c787e876ba072ed65f11","observation_id":"94b78c77-e869-430a-a66f-388a4e2f3f1d","resolution":{"observed_at":"2026-08-06T13:10:19.592928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.377345Z","title":"Cvthead: One-shot controllable head avatar with vertex-feature transformer","venue":null,"work_id":"41ce1f34-aaa3-448f-a7cc-52eaee47fe0a","year":2024},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.596067Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:3170f6acc045f84a4bb40143fb01f2923f1836f4503d6b5da92d74ee04c5308a","observation_id":"884beea5-1ed5-4ba5-8f21-4e6dd446f871","resolution":{"observed_at":"2026-08-06T13:10:20.380403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.368636Z","title":"Styletalk: One-shot talking head generation with controllable speak- ing styles","venue":null,"work_id":"6147bd2b-0bec-41c0-9992-36d9554ef64f","year":1904},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.598971Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:a0e2fbce44c49281549521495519b35a5cb99aad15cd1fb5715bfb97143ac5fd","observation_id":"ba0a46d6-2ca8-4a44-85cf-0847073d3a51","resolution":{"observed_at":"2026-08-06T13:10:20.372221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09767","last_updated":"2024-08-10T09:37:55Z","snapshot_observed_at":"2026-07-06T17:02:37.841641Z","submitted_at":"2023-12-15T13:15:42Z","title":"DreamTalk: When Emotional Talking Head Generation Meets Diffusion Probabilistic Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09767","snapshot_observed_at":"2026-08-06T13:10:19.601406Z","title":"Dreamtalk: When ex- pressive talking head generation meets diffusion probabilis- tic models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.601406Z"},"links":{"cited_paper":"/paper/2312.09767","citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:a67107040282d78b750c2d43a31aaf0741ce2f0032d5c1adf85e78b2aba7e52a","observation_id":"288b8791-b9ae-48dd-b171-d59d1f9503f7","resolution":{"observed_at":"2026-08-06T13:10:19.601406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.360266Z","title":"Otavatar: One-shot talking face avatar with control- lable tri-plane rendering","venue":null,"work_id":"564633ed-1d63-47e2-bd3b-9a8de4f7fa8b","year":2023},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.604026Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:c0ea28c220ea9134714415de1baad29d0dbb604230f234ef5d9bcbceb98d4837","observation_id":"523113b3-b116-4e6e-9da3-443bf7f20502","resolution":{"observed_at":"2026-08-06T13:10:20.363238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.352472Z","title":"Sidgan: High-resolution dubbed video generation via shift-invariant learning","venue":null,"work_id":"6fce83f8-b0ac-4800-8692-b70cf5e90aae","year":2023},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.607458Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:b87ca76dcd49c1794127ca54e20e273a01597e53ba56586675f4af540b1d6d7c","observation_id":"f4e159a3-aadf-4dd3-8212-a8334a1fd1c0","resolution":{"observed_at":"2026-08-06T13:10:20.355365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.344956Z","title":"Diff2lip: Audio conditioned dif- fusion models for lip-synchronization","venue":null,"work_id":"e725e65c-5c33-4e9c-8be0-46604b8949d3","year":2024},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.609925Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:311eff9b709216b5b49ca76522a5acf1f14a334450f0a82aef71c288ab38dbba","observation_id":"97f21d94-2da1-4794-be23-23bb058d756f","resolution":{"observed_at":"2026-08-06T13:10:20.347539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.336786Z","title":"Rectified linear units improve restricted boltzmann machines","venue":null,"work_id":"0bac3777-04dc-4515-a191-4e479404283f","year":2010},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.612889Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:1df98f65ae08c25ab4a2d118dc874222ec958dffd43f3f2fbce3167f8fea7fcd","observation_id":"e2764bf5-eb83-40be-88ca-e845cc200340","resolution":{"observed_at":"2026-08-06T13:10:20.339828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.329216Z","title":"Audio-visual scene analysis with self-supervised multisensory features","venue":null,"work_id":"0ca3c0d9-9489-4e9e-8fb6-ef4bd68b9e0d","year":2018},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.615652Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:a15e059d5dc6885e154b3e1570298857307255d9ccddfead2d9531119e9fcd97","observation_id":"dd662cb7-fed5-4e7c-a4bf-d28150096b28","resolution":{"observed_at":"2026-08-06T13:10:20.332060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.321350Z","title":"in-the-wild","venue":null,"work_id":"e0a83c97-caa9-4a70-a80d-94cef6ecde4e","year":2022},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.619193Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:8c88a212fa59949d4999f291b1ba3ded1fe175d8163edf44aa90c0b1fe37a909","observation_id":"ef00998f-538b-4937-add0-0ec3cf2e446e","resolution":{"observed_at":"2026-08-06T13:10:20.324159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.313360Z","title":"Synctalkface: Talking face generation with precise lip-syncing via audio-lip memory","venue":null,"work_id":"9fcfd8c8-49c4-4003-9882-a4eab94b4ac0","year":2022},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.621947Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:f9c5cb00b1055bfda89edb938f12c9e8a00da51c3f176e7cb0146faac983916b","observation_id":"2f85de8b-b5c0-4c33-9255-2a73ed77ca1d","resolution":{"observed_at":"2026-08-06T13:10:20.315937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.305686Z","title":"Semantic image synthesis with spatially-adaptive normalization","venue":null,"work_id":"acadd36c-609e-42d6-b310-78052ae1947f","year":2019},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.624656Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:8e3b26319923362e8503d5725856bd9b97d67ea10d747df5f2273391bfbe0bba","observation_id":"fd35efd7-792e-44ca-9eba-57fd936d6b3b","resolution":{"observed_at":"2026-08-06T13:10:20.308577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.297733Z","title":"Synctalk: The devil is in the synchronization for talking head synthesis","venue":null,"work_id":"d9fbc3cb-db25-4a02-b2c7-dcf4516ec804","year":2024},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.627651Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:d8e07a4c4a0e1c671d54de21902fb91080bbf960c6142eb4c36f4ab276194043","observation_id":"ade94ba0-b672-461c-b057-199276a2257f","resolution":{"observed_at":"2026-08-06T13:10:20.300514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.289082Z","title":"A lip sync expert is all you need for speech to lip generation in the wild","venue":null,"work_id":"871b4fb1-9137-4600-83f4-aa2c0d5ea9ea","year":2020},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.630189Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:971a91c9294832b18d78391ae0e2a926465a03c790040fea94c40b4602ce9a0c","observation_id":"9cadb96b-feec-4e4b-b72f-224f52d8bfae","resolution":{"observed_at":"2026-08-06T13:10:20.292496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.281337Z","title":"U- net: Convolutional networks for biomedical image seg- mentation","venue":null,"work_id":"e9e80097-ae77-4002-8da5-6bfa8bf87318","year":2015},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.632941Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:fee727bd23aabac22b6a06f3a85d7cb353537d3a3b5c106e3f41663aed86ec34","observation_id":"2da4e927-122b-47b4-b155-b6c22f891c9b","resolution":{"observed_at":"2026-08-06T13:10:20.284326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.273376Z","title":"Learning dynamic facial radiance fields for few-shot talking head synthesis","venue":null,"work_id":"b6f8b7d2-505e-4440-829d-a5050858c273","year":2022},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.635850Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:0cfa5eb8afbd177391e8fc03663bbe57f52184bf6609ce86c32c6aefcea775ca","observation_id":"ad693093-af0d-40a4-bfb5-f85717dbeadc","resolution":{"observed_at":"2026-08-06T13:10:20.275948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.265579Z","title":"Difftalk: Crafting dif- fusion models for generalized audio-driven portraits anima- tion","venue":null,"work_id":"5b3007d6-0594-48ce-8983-18cbab95bebc","year":1982},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.639035Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:02c9a43ee3223a1b111150759c1d2b18e2f2f390bee9d86518e3020c0fb54b66","observation_id":"a28a1ad9-22f4-44ef-8aae-b48360df52ce","resolution":{"observed_at":"2026-08-06T13:10:20.268356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.257611Z","title":"Real-time single image and video super-resolution using an efficient sub-pixel convolutional neural network","venue":null,"work_id":"73557a24-916f-4c75-ab4c-36ff1d66e260","year":2016},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.642120Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:7fdd73da3241a160fce2e3c7dab3c935f8700d00da3365995dace32cb79b191b","observation_id":"31a4aa87-2b76-4f62-ae70-d3c3653e449b","resolution":{"observed_at":"2026-08-06T13:10:20.260481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1556","last_updated":"2015-04-10T16:25:04Z","snapshot_observed_at":"2026-07-06T03:53:32.549552Z","submitted_at":"2014-09-04T19:48:04Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.1556","snapshot_observed_at":"2026-08-06T13:10:19.645004Z","title":"Very deep convo- lutional networks for large-scale image recognition","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.645004Z"},"links":{"cited_paper":"/paper/1409.1556","citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:8b8aea8e018ab4a7e1168d05d8f2295ef1709085ea43a744cf694d2fc40d2d4d","observation_id":"fcc24d0e-7f31-4adc-8fb3-e90e3d0b7940","resolution":{"observed_at":"2026-08-06T13:10:19.645004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.249400Z","title":"Facesync: A linear operator for measuring synchronization of video facial im- ages and audio tracks","venue":null,"work_id":"173baf2a-5649-4c1c-b94b-6c68c3632b54","year":2000},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.647521Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:39a389e1efe03f6c6c49f5f843c3c03887f2e85ad53f836f6f7363cbf7aa7d3f","observation_id":"4f7efac3-601e-40f6-be5a-1d29a0daefba","resolution":{"observed_at":"2026-08-06T13:10:20.252056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.241487Z","title":"Audio-driven dubbing for user generated contents via style-aware semi-parametric synthesis","venue":null,"work_id":"436eaefc-0ed8-4f33-ab85-4ee2dc51aafc","year":2022},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.650253Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:b48053e715ffa6675ad4b840e4ce0540aae1a6c47d99dd497f18adaaf8216060","observation_id":"56d1ce50-6a9a-4143-9da0-33072d0e0c4e","resolution":{"observed_at":"2026-08-06T13:10:20.244244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.232924Z","title":"Everybody’s talkin’: Let me talk as you want","venue":null,"work_id":"73985ee6-c412-4d0f-80dd-d50546e0a11a","year":2022},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.653102Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:175c990e8fc7849d25d8b9c723bc7f93e9928727dc7cbcd0c8e7c7c85ce3fceb","observation_id":"13db41f6-5ae3-4c5c-986f-d5b61442860f","resolution":{"observed_at":"2026-08-06T13:10:20.236266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.04786","last_updated":"2019-07-25T20:40:22Z","snapshot_observed_at":"2026-07-06T06:33:13.437664Z","submitted_at":"2018-04-13T04:19:52Z","title":"Talking Face Generation by Conditional Recurrent Adversarial Network","version":3},"cited_work":{"arxiv_id":"1804.04786","doi":null,"metadata_source":"pith","pith_arxiv_id":"1804.04786","snapshot_observed_at":"2026-08-06T13:10:19.865644Z","title":"Talking Face Generation by Conditional Recurrent Adversarial Network","venue":"cs.CV","work_id":"ec38b856-edaf-4944-b151-1f76a4b16fc8","year":2018},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.656203Z"},"links":{"cited_paper":"/paper/1804.04786","citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:97115767c45ed4baf817b74b77e0dd4cfa50a9194160aedba30613c64364678f","observation_id":"3a95139c-8a27-4893-82b8-0682e13e607a","resolution":{"observed_at":"2026-08-06T13:10:19.869488Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.224571Z","title":"Diffused 11 heads: Diffusion models beat gans on talking-face gen- eration","venue":null,"work_id":"62ea2e97-4685-48c7-873a-d3ba9563088f","year":2024},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.659807Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:7bffd89c7638b2d12b9ad703ee88d86922a5e25bad419c550db9ce97d2e281cd","observation_id":"9c298006-4cc7-430b-9dd0-4d3cf4ff1767","resolution":{"observed_at":"2026-08-06T13:10:20.227469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01841","last_updated":"2023-12-07T03:14:22Z","snapshot_observed_at":"2026-07-30T10:55:21.867087Z","submitted_at":"2023-12-04T12:25:37Z","title":"VividTalk: One-Shot Audio-Driven Talking Head Generation Based on 3D Hybrid Prior","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.01841","snapshot_observed_at":"2026-08-06T13:10:19.662786Z","title":"Vividtalk: One-shot audio-driven talking head generation based on 3d hybrid prior","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.662786Z"},"links":{"cited_paper":"/paper/2312.01841","citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:9f765e5248d57132ce2d534e158f0c7229014de9bf03c80ee3b93f304c94c1fa","observation_id":"fa57b284-95aa-4720-8122-48f2245aff9c","resolution":{"observed_at":"2026-08-06T13:10:19.662786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.215881Z","title":"Masked lip-sync predic- tion by audio-visual contextual exploitation in transform- ers","venue":null,"work_id":"2f70db96-b869-47b4-bccf-247fdddb58c5","year":2022},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.666211Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:3fc0015680bc3fd7dca04e8bc2ca60e5fc7f6b16575546e88ef8b390a68261a2","observation_id":"0af2d784-07f0-4183-afb5-af0fa7269a19","resolution":{"observed_at":"2026-08-06T13:10:20.218728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.206626Z","title":"Synthesizing obama: learning lip sync from audio","venue":null,"work_id":"0b977010-57c6-469b-8018-6b2ef3c4fc40","year":2017},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.668698Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:d82de58623f34882f288b45f69a4b662d8e37f66ba367e0fe1bc12017e6a6783","observation_id":"71220db6-5298-4d11-b709-face2ee95da0","resolution":{"observed_at":"2026-08-06T13:10:20.210090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.197808Z","title":"Rethinking the inception architecture for computer vision","venue":null,"work_id":"ad7a4105-ffbc-479f-a7c1-a27eff75c3b0","year":2016},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.671548Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:81b3717e734181af410391ea2f1347d6164b96f9004b12e2bca0aa10961fc86d","observation_id":"89baec36-0a0d-465a-9ae3-b5a4fbc037db","resolution":{"observed_at":"2026-08-06T13:10:20.200831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.189658Z","title":"Emmn: Emotional mo- tion memory network for audio-driven emotional talking face generation","venue":null,"work_id":"17dbd5b0-3769-4b2d-ba8d-9e1e998bed46","year":2023},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.674028Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:ebf683b50dbd84153c34e3f6c635f41f8f83bffcdad2169c6f45cd4539317559","observation_id":"43a03a3b-b351-4e10-a744-7273bc44ee51","resolution":{"observed_at":"2026-08-06T13:10:20.192518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.12368","last_updated":"2022-11-22T16:03:11Z","snapshot_observed_at":"2026-08-01T10:41:24.348491Z","submitted_at":"2022-11-22T16:03:11Z","title":"Real-time Neural Radiance Talking Portrait Synthesis via Audio-spatial Decomposition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.12368","snapshot_observed_at":"2026-08-06T13:10:19.676863Z","title":"Real-time neural radiance talking portrait synthesis via audio-spatial decomposition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.676863Z"},"links":{"cited_paper":"/paper/2211.12368","citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:5d04ffdd787ce8dc2e84b4596b4cf8cc8c6b0a63fc3ac88549dc540d1cc6378b","observation_id":"77cbb8cc-050a-41ed-9803-552063712921","resolution":{"observed_at":"2026-08-06T13:10:19.676863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.181328Z","title":"Neural voice puppetry: Audio-driven facial reenactment","venue":null,"work_id":"0fa31c08-25c8-400b-80e8-2ceae8d97c4d","year":2020},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.679847Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:7c23663ca9f5a8b2c94ba1ad589fc3ac6440063daf31141baf59682eab1c60fe","observation_id":"ce345719-f4e4-4368-ab1e-eaafe44a5c34","resolution":{"observed_at":"2026-08-06T13:10:20.184100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17485","last_updated":"2024-08-08T03:48:38Z","snapshot_observed_at":"2026-07-06T17:36:11.854303Z","submitted_at":"2024-02-27T13:10:11Z","title":"EMO: Emote Portrait Alive -- Generating Expressive Portrait Videos with Audio2Video Diffusion Model under Weak Conditions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17485","snapshot_observed_at":"2026-08-06T13:10:19.683024Z","title":"Emo: Emote portrait alive-generating expressive portrait videos with audio2video diffusion model under weak conditions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.683024Z"},"links":{"cited_paper":"/paper/2402.17485","citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:9434f343ef1842474dc02e1629e4e5a77bfbe309d3597d37efc70b028f45bc3f","observation_id":"ffec64f7-ca81-4640-bf4b-13c69139ce6f","resolution":{"observed_at":"2026-08-06T13:10:19.683024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.686259Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.686259Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:168b481e407e42df4187c3ff7bedc3044dddc7547d9efbfc9b3cb594d2a85a8a","observation_id":"5390878b-824a-4c0a-9588-953d1edbec11","resolution":{"observed_at":"2026-08-06T13:10:19.686259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.167670Z","title":"Realistic speech-driven facial animation with gans","venue":null,"work_id":"99ff3cad-d267-4232-b5d8-f7939659e2b2","year":2020},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.688989Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:98334e961fb59bee59e15f32b437e48e0735ce5d3cfa5c90bb97389922212690","observation_id":"2c1cdc65-6158-44dc-8663-cc88fc4c5d81","resolution":{"observed_at":"2026-08-06T13:10:20.170908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.159678Z","title":"Progressive disentangled representa- tion learning for fine-grained controllable talking head syn- thesis","venue":null,"work_id":"dea92ec1-16c3-4315-ad1b-7913941cadd8","year":2023},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.691728Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:f2000773ced96b7bb056a6e4633681244c00c62e5d4f2854d76a5bc531f9f3d8","observation_id":"67bbe2e9-9fd3-4856-b015-21f45598c9ab","resolution":{"observed_at":"2026-08-06T13:10:20.162335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.151570Z","title":"Seeing what you said: Talking face gen- eration guided by a lip reading expert","venue":null,"work_id":"edf849a0-d090-4fc5-8073-255c019a8527","year":2023},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.694660Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:daabc41f7e737e8ad3dd9c528dcfd0ee97708d792c5f62673dfb258e84289623","observation_id":"e85864e7-bb3a-437a-8389-fef662dabc56","resolution":{"observed_at":"2026-08-06T13:10:20.154256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.143372Z","title":"Lipformer: High- fidelity and generalizable talking face generation with a pre- learned facial codebook","venue":null,"work_id":"a7e8df4a-06f4-4946-9367-9d11d887d903","year":2023},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.697320Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:7bfc177bc14253d9b0aa8183a6bbd141ae6dc06ecf7eca79806374ea5626612f","observation_id":"65ea565c-68cf-404b-a3ef-15deae8292cb","resolution":{"observed_at":"2026-08-06T13:10:20.146253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.136112Z","title":"Styletalk++: A unified framework for controlling the speaking styles of talking heads","venue":null,"work_id":"adb0ed4a-5080-421c-9344-9b5e5d87475e","year":2024},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.699987Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:2fc0ef25c98edbf5c0c232649784d93e1f46d17d1a9e03c8304d9df935b1bac6","observation_id":"8bdd2035-f607-4f0a-a3be-173ac2636cab","resolution":{"observed_at":"2026-08-06T13:10:20.138768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.128385Z","title":"High-resolution image synthesis and semantic manipulation with conditional gans","venue":null,"work_id":"a451a6c8-a761-4e2b-bbb5-e1f67f98ac78","year":2018},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.702818Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:2981c036f628e119cb36632c58904bf2c18839057749a08b8941e9a38ab153da","observation_id":"0a3835a7-da50-4a24-8ade-78355e5da511","resolution":{"observed_at":"2026-08-06T13:10:20.131528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.120736Z","title":"Image quality assessment: from error visibility to structural similarity","venue":null,"work_id":"24358c0a-11a0-4961-a17e-d1f45f0326dd","year":2004},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.706016Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:6d2dc231af69d1aea11e2051ebaf9caae4641c7d2a109e5699dc108fb00cba47","observation_id":"4aba5721-85e4-468a-b946-2292b91a0e6b","resolution":{"observed_at":"2026-08-06T13:10:20.123405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.112869Z","title":"Imitating arbitrary talking style for realistic audio-driven talking face synthesis","venue":null,"work_id":"59a54085-4f45-4443-adb8-c9f3fc111f01","year":2021},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.708385Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:93d002ac82dfe8cec6e3b77c69783132cbbe6c5e1cbac1ddb6b327e0ccf87fca","observation_id":"5c688292-ed0f-45b3-8365-a39e22ecab81","resolution":{"observed_at":"2026-08-06T13:10:20.115487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.104301Z","title":"Ganhead: Towards generative animatable neural head avatars","venue":null,"work_id":"fe618e6d-8b0b-4c48-9ec8-8552e5f9b924","year":2023},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.711283Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:9e75894d57672cc92ca153420ea86fb84b0509ddbd165bfee217e1974928d93c","observation_id":"e2f6bcc4-c996-4de0-894e-64a8dfd382c9","resolution":{"observed_at":"2026-08-06T13:10:20.107368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.096951Z","title":"High-fidelity generalized emotional talking face generation with multi-modal emotion space learning","venue":null,"work_id":"4bc1dd08-359e-4653-a2bb-bdf173747b25","year":2023},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.713845Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:1d9d07f4c604c4ccda2cbd46a17c3a37c36a68dd4424dcd35c73a32d76755b08","observation_id":"29b07864-bf89-421b-b1bb-15f1d78bcb0d","resolution":{"observed_at":"2026-08-06T13:10:20.099524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.089007Z","title":"Audio-visual speech representation expert for enhanced talking face video generation and evaluation","venue":null,"work_id":"0005ec4b-d321-45b0-a945-c87318cdf6f2","year":2024},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.716184Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:1cb90bcdd211c8ed003d234999d041e8592163cefe61262c98fbb1866f31440d","observation_id":"ad5563d8-07ce-40b8-a753-308cf54b5653","resolution":{"observed_at":"2026-08-06T13:10:20.092115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09368","last_updated":"2024-07-18T10:51:27Z","snapshot_observed_at":"2026-07-06T15:55:25.218006Z","submitted_at":"2023-07-18T15:50:04Z","title":"Audio-driven Talking Face Generation with Stabilized Synchronization Loss","version":3},"cited_work":{"arxiv_id":"2307.09368","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.09368","snapshot_observed_at":"2026-08-06T13:10:19.827627Z","title":"Audio-driven Talking Face Generation with Stabilized Synchronization Loss","venue":"cs.CV","work_id":"8f400035-b104-44c7-b7fb-4ea7225a9611","year":2023},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.718719Z"},"links":{"cited_paper":"/paper/2307.09368","citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:a78866ee988df721dde8106bcdae243a883aab3fd4a6ef49fc5832feeb76841f","observation_id":"2342329e-7e22-4ced-8090-c566a2e7bfde","resolution":{"observed_at":"2026-08-06T13:10:19.832891Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.00791","last_updated":"2022-01-03T18:23:38Z","snapshot_observed_at":"2026-07-06T12:24:25.416929Z","submitted_at":"2022-01-03T18:23:38Z","title":"DFA-NeRF: Personalized Talking Head Generation via Disentangled Face Attributes Neural Rendering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.00791","snapshot_observed_at":"2026-08-06T13:10:19.721450Z","title":"Dfa-nerf: Personalized talking head generation via disentangled face attributes neural rendering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.721450Z"},"links":{"cited_paper":"/paper/2201.00791","citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:548a67ca4fb19f7181a16e5f7265612929bb53b63f1ded10dd7e6445eb7c4df0","observation_id":"354d3f85-f09d-4b74-8eef-cf5b8850e70e","resolution":{"observed_at":"2026-08-06T13:10:19.721450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.13430","last_updated":"2023-01-31T05:56:06Z","snapshot_observed_at":"2026-07-06T14:46:26.697969Z","submitted_at":"2023-01-31T05:56:06Z","title":"GeneFace: Generalized and High-Fidelity Audio-Driven 3D Talking Face Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.13430","snapshot_observed_at":"2026-08-06T13:10:19.724040Z","title":"Geneface: Generalized and high-fidelity audio-driven 3d talking face synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.724040Z"},"links":{"cited_paper":"/paper/2301.13430","citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:2587f5e6d8200285c4838880fd2931342bff54416ffb3c10877ad5fb4358570b","observation_id":"47656887-e25c-4bb2-be3e-a6f50dc87109","resolution":{"observed_at":"2026-08-06T13:10:19.724040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08503","last_updated":"2024-03-23T06:40:22Z","snapshot_observed_at":"2026-07-06T17:16:17.240820Z","submitted_at":"2024-01-16T17:04:30Z","title":"Real3D-Portrait: One-shot Realistic 3D Talking Portrait Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08503","snapshot_observed_at":"2026-08-06T13:10:19.726995Z","title":"Real3d-portrait: One- shot realistic 3d talking portrait synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.726995Z"},"links":{"cited_paper":"/paper/2401.08503","citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:4d9d3c61b957c55198b1db8b7cc065642b09d592681059111ea9fc2dfb9314a8","observation_id":"06b9f2ff-c777-4e0c-b011-a9a0bec6255e","resolution":{"observed_at":"2026-08-06T13:10:19.726995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.081262Z","title":"Quantitative association of vocal-tract and facial behavior","venue":null,"work_id":"4f29f906-dde7-42a2-95d6-5e4011b0f19b","year":1998},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.729858Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:177af4ce1dd788689f00dccd25219de22277768d3cfd7287a37cbd984c3bb801","observation_id":"d27549de-85a5-4933-be4e-b151ba5d8dcd","resolution":{"observed_at":"2026-08-06T13:10:20.083847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.073190Z","title":"Styleheat: One-shot high-resolution editable talking face generation via pre-trained stylegan","venue":null,"work_id":"72092cb3-2622-44bc-8846-2e063b894ee1","year":2022},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.732934Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:dc4f7cc3834f54d4d68447c189b25484712580687953187b745485c7eed78d51","observation_id":"16907925-7056-447c-990a-e7fc25da1dee","resolution":{"observed_at":"2026-08-06T13:10:20.076042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.065697Z","title":"Multimodal image synthesis and editing: A survey and taxonomy","venue":null,"work_id":"1c8b6e79-4df3-4611-a4ea-a2149959dde1","year":2023},"citing_paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.735725Z"},"links":{"citing_paper":"/paper/2507.20953"},"observation_digest":"sha256:125b1368ffa9c6c60c81abe1d325a1a23cb7931fb1c7e17e314af606bc1f6298","observation_id":"cdd47e1d-af3e-44e5-bc7b-6df6cbaf5e97","resolution":{"observed_at":"2026-08-06T13:10:20.068461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.20953","last_updated":"2025-07-28T16:03:36Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T13:10:17.257723Z","submitted_at":"2025-07-28T16:03:36Z","title":"Mask-Free Audio-driven Talking Face Generation for Enhanced Visual Quality and Identity Preservation"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":7,"verified_fuzzy":49},"total_outbound_references":112},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 100 of 112 outbound references and 0 inbound Pith citation observations for arXiv:2507.20953."}