{"as_of":"2026-08-08T21:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:331f443f46bbd53fa50c96ec8091b499c8471bcc7c5a5b691adb1c18b58779e6","coverage":[{"denominator":86,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":86,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T13:39:36.267401Z","state":"measured"},{"denominator":86,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":86,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.20452/citation-record","integrity":"/paper/2507.20452/integrity","json":"/paper/2507.20452/citation-record.json","paper":"/paper/2507.20452"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:27.844754Z","title":"Facewarehouse: A 3d facial expression database for visual computing.IEEE Transactions on Visualization and Computer Graphics, 20(3):413–425, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:27.844754Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:4389368140067d70850b7b5641ee3fdbbd6f332212184a416d94c6d7450e06bb","observation_id":"b5c61b92-42de-440b-8864-c2c13d694652","resolution":{"observed_at":"2026-08-06T13:39:27.844754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:27.988641Z","title":"Hiface: High-fidelity 3d face reconstruction by learning static and dynamic details","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:27.988641Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:23118f1458e82fa39a3f3b97da8e7155cdd9d560d83774b5815d8b27abf3dccf","observation_id":"e53ddc25-af8d-4e39-a107-3f167b852de0","resolution":{"observed_at":"2026-08-06T13:39:27.988641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:28.098360Z","title":"IQA-PyTorch: Pytorch toolbox for image qual- ity assessment","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:28.098360Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:d49c4450df1bd5fced54f490739a374a67c6d06f3824d5b3e9ec44fb46f44a5c","observation_id":"9ccc7da9-a064-4f53-b334-f8df148f8e21","resolution":{"observed_at":"2026-08-06T13:39:28.098360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:28.199572Z","title":"Topiq: A top-down approach from semantics to distortions for image quality assessment.IEEE Transactions on Image Processing, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:28.199572Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:d4aa864389549e78deafaf784d7174cc83449e9bdaf03b8dabaaf0d15495a3bc","observation_id":"036fa333-8e8a-48f0-b837-092eeda73bf4","resolution":{"observed_at":"2026-08-06T13:39:28.199572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.05622","last_updated":"2018-06-27T01:49:17Z","snapshot_observed_at":"2026-08-08T04:36:13.309903Z","submitted_at":"2018-06-14T15:59:12Z","title":"VoxCeleb2: Deep Speaker Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.05622","snapshot_observed_at":"2026-08-06T13:39:28.325314Z","title":"V oxceleb2: Deep speaker recognition.arXiv preprint arXiv:1806.05622, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:28.325314Z"},"links":{"cited_paper":"/paper/1806.05622","citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:96575d54df93ca5062ba6e08ca6e21fe218d8da9115cb698ab5a5678d592dd47","observation_id":"2b8a60f2-fb4c-42f6-9e76-3f61b8d69fcc","resolution":{"observed_at":"2026-08-06T13:39:28.325314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:28.419724Z","title":"Emoca: Emotion driven monoc- ular face capture and animation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:28.419724Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:1e87a93b10d852a791f1ecc5b15d1219e6cb51f45aa1216c0bb6c79d48587e7d","observation_id":"64300e98-df5e-45d8-a1ff-9ed4a51d992d","resolution":{"observed_at":"2026-08-06T13:39:28.419724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:28.554745Z","title":"Arcface: Additive angular margin loss for deep face recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:28.554745Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:466fd28d5ac0c3c9aa97bdd553e4a763ee32d7fd8c48274f8df8116987fb63ff","observation_id":"5e8311fb-0280-47f4-8c02-596ffa3c3ea7","resolution":{"observed_at":"2026-08-06T13:39:28.554745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:51.984892Z","title":"Ac- curate 3d face reconstruction with weakly-supervised learning: From single image to image set","venue":null,"work_id":"5dab2931-8196-473a-8ca5-477736fb7c29","year":2019},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:28.634750Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:3f67ce2683ed4fcb0bde38304810421d17094484f78744dc22711c93a17126a0","observation_id":"a8416907-96b5-4a95-ad01-e07d2f657584","resolution":{"observed_at":"2026-08-06T13:39:52.154750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:51.504754Z","title":"Headgan: One-shot neural head synthesis and editing","venue":null,"work_id":"038f4504-b00a-42df-95db-330b37c4961e","year":2021},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:28.779920Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:e0c72be078e7adaf503672c8817f529a6806e0b27404751997335c66c791abda","observation_id":"b6826680-cb5a-4022-be23-c926fbddc557","resolution":{"observed_at":"2026-08-06T13:39:51.704889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:51.207220Z","title":"Free-headgan: Neural talking head synthesis with explicit gaze control","venue":null,"work_id":"7e171d15-8c50-47aa-9118-244c2dd43694","year":2023},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:28.914742Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:522ce9dd66411a9023d7ba99298abb4e1c311c2a328a06f8adda672e410b43a7","observation_id":"9594e41b-880b-42f0-a799-2e44e584cdbe","resolution":{"observed_at":"2026-08-06T13:39:51.294070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:50.948768Z","title":"Megaportraits: One-shot megapixel neural head avatars","venue":null,"work_id":"91e732c9-d9cb-4d38-a31d-5c840e55add2","year":2022},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:29.098001Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:82a29279073516aa14b5988210cf2ae06d584e18699eb619b6aa5d8ad0230f1a","observation_id":"40b383c9-873e-45b6-b18e-906817f839bd","resolution":{"observed_at":"2026-08-06T13:39:51.035436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:50.595446Z","title":"Emoportraits: Emotion-enhanced multimodal one-shot head avatars","venue":null,"work_id":"352218e2-680b-4867-9116-54b977c1c775","year":2024},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:29.252262Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:c6c06f22a46248dbc9cc0f7a34d7211cd39c598fc6709b070311f1c6880f6ccb","observation_id":"35fb1ffb-7c72-4aa9-95bd-33bc82142019","resolution":{"observed_at":"2026-08-06T13:39:50.747678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:50.234748Z","title":"3d morphable face models—past, present, and future.ACM Transactions on Graphics (ToG), 39(5):1–38, 2020","venue":null,"work_id":"bf6cbee1-cd6c-4932-a1b5-cbb330f1b387","year":2020},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:29.340935Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:432d5c99c7de5e3b35cf5c9a77afa9387c6f1cafb07f91f3e49b6ea646836a31","observation_id":"aa420262-44c8-4865-bc32-8fc217c28963","resolution":{"observed_at":"2026-08-06T13:39:50.434842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:49.862180Z","title":"Facial action coding system.Environmental Psy- chology & Nonverbal Behavior, 1978","venue":null,"work_id":"aaf8d411-70f7-462d-8bcf-b08114228a31","year":1978},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:29.438106Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:81198d8eedc2f468d6525c26bbc19d1ba9a853643415c5f48e7417cd2ad3eb8c","observation_id":"2f75bd06-e7b8-4aa1-9fc2-b4d209e1fabb","resolution":{"observed_at":"2026-08-06T13:39:50.028325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.03619","last_updated":"2018-08-09T21:22:37Z","snapshot_observed_at":"2026-08-06T20:20:05.725909Z","submitted_at":"2018-04-10T16:28:59Z","title":"Looking to Listen at the Cocktail Party: A Speaker-Independent Audio-Visual Model for Speech Separation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.03619","snapshot_observed_at":"2026-08-06T13:39:29.510807Z","title":"Looking to listen at the cocktail party: A speaker-independent audio-visual model for speech separation.arXiv preprint arXiv:1804.03619, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:29.510807Z"},"links":{"cited_paper":"/paper/1804.03619","citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:0b532490d8e3c4cc6e0d403893542b89c020247be101cef97f841675954d1e64","observation_id":"e23e40ce-d579-4825-974c-0d672e3df384","resolution":{"observed_at":"2026-08-06T13:39:29.510807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:29.590290Z","title":"Learning an animatable detailed 3d face model from in-the-wild images.ACM Transactions on Graphics (ToG), 40(4):1–13, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:29.590290Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:30891c069dc054a7d5bb01d92d7b8adb507395432675ee7a87551b6117d1aa62","observation_id":"5c86ad74-8e25-477c-aeab-aef5108e5339","resolution":{"observed_at":"2026-08-06T13:39:29.590290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:49.494141Z","title":"Surface simplification using quadric error met- rics","venue":null,"work_id":"a8b633a6-2354-4dd7-b181-81fc46da6bdc","year":1997},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:29.646577Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:d581fb150911afcacd62632c30aab8168ed7ce8b9ef526e1714bab75280bab38","observation_id":"833d90c2-3484-425f-a387-38cb244c7af6","resolution":{"observed_at":"2026-08-06T13:39:49.634750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:49.181617Z","title":"Morphable face models-an open frame- work","venue":null,"work_id":"43bdbd10-4b97-4fb9-823c-314ddf1838b3","year":2018},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:29.710651Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:f95b264b9f93cabfedd9291fab2ad813c7817425cea05bdb791b495a53258260","observation_id":"2d03d31e-d535-4d28-a03a-7c05d0886086","resolution":{"observed_at":"2026-08-06T13:39:49.325837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.10962","last_updated":"2020-06-19T05:07:38Z","snapshot_observed_at":"2026-07-06T09:30:38.493338Z","submitted_at":"2020-06-19T05:07:38Z","title":"Attention Mesh: High-fidelity Face Mesh Prediction in Real-time","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.10962","snapshot_observed_at":"2026-08-06T13:39:29.799219Z","title":"Attention mesh: High-fidelity face mesh prediction in real-time","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:29.799219Z"},"links":{"cited_paper":"/paper/2006.10962","citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:b9693dcf6e5eab361631dba4f1783e3c57f22876f5b23d58670ac9bb5e1c9250","observation_id":"23d37766-fe89-4821-89f4-32a86b935009","resolution":{"observed_at":"2026-08-06T13:39:29.799219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03168","last_updated":"2025-02-28T14:39:17Z","snapshot_observed_at":"2026-08-08T10:55:01.205999Z","submitted_at":"2024-07-03T14:41:39Z","title":"LivePortrait: Efficient Portrait Animation with Stitching and Retargeting Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03168","snapshot_observed_at":"2026-08-06T13:39:29.907882Z","title":"Liveportrait: Efficient portrait animation with stitching and retar- geting control.arXiv preprint arXiv:2407.03168, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:29.907882Z"},"links":{"cited_paper":"/paper/2407.03168","citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:36f437eebdc0a1c27c7c5988e4bd0b752e013891f1dd69c0451f89e6af71b755","observation_id":"5ceb2151-0041-4694-aa51-e82987f7f473","resolution":{"observed_at":"2026-08-06T13:39:29.907882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:29.997607Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:29.997607Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:534b6fbd1a448e7ec98d104708802db0868c4a44b5285dab67edc30f60adca9b","observation_id":"5aaf2052-996d-4143-a032-daeb9c554c38","resolution":{"observed_at":"2026-08-06T13:39:29.997607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:30.129703Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:30.129703Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:ae44bf7e33ff071236c96c50a89e1584e0167b7f2a9f96437cf39677a22e4015","observation_id":"10ebb122-024f-4579-a734-e317f77588ec","resolution":{"observed_at":"2026-08-06T13:39:30.129703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-06T13:39:30.197962Z","title":"Classifier-free diffusion guidance.arXiv preprint arXiv:2207.12598, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:30.197962Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:3f251892bd095a4d68634b5e25518978949c99f2c6472fbde1170a26fd7e88fd","observation_id":"2f9c5b4b-a39c-4015-8bad-19eb3343bda5","resolution":{"observed_at":"2026-08-06T13:39:30.197962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:30.313052Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:30.313052Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:d353877f00e8a600d12badb2cc489ab6357937f3b61a0d2d9a855093f2b1d517","observation_id":"dc607002-be97-4dde-8835-1fdd06b0a10f","resolution":{"observed_at":"2026-08-06T13:39:30.313052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:48.609784Z","title":"Image-to-image trans- lation with conditional adversarial networks","venue":null,"work_id":"26ce96c5-425f-4a28-ae46-075c9809842b","year":2017},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:30.376358Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:261c6c29db804762db65e72e7d797bd0c2d380c0297d4f72cbed41445d868876","observation_id":"aa1f875f-e376-4ce1-a937-d31e3f6860e3","resolution":{"observed_at":"2026-08-06T13:39:48.769236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18284","last_updated":"2024-08-08T12:18:30Z","snapshot_observed_at":"2026-07-06T18:37:17.280637Z","submitted_at":"2024-06-26T12:09:59Z","title":"RealTalk: Real-time and Realistic Audio-driven Face Generation with 3D Facial Prior-guided Identity Alignment Network","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18284","snapshot_observed_at":"2026-08-06T13:39:30.454868Z","title":"Realtalk: Real-time and realistic audio-driven face generation with 3d facial prior-guided identity alignment network","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:30.454868Z"},"links":{"cited_paper":"/paper/2406.18284","citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:adb5771c03581f6fb8d93303a6be9820643e452c6d681153ce63d175a81f3195","observation_id":"91a3f7c3-d4f3-4483-990a-bb19a66d338a","resolution":{"observed_at":"2026-08-06T13:39:30.454868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:48.370383Z","title":"Eamm: One-shot emotional talking face via audio-based emotion-aware motion model","venue":null,"work_id":"1ec24209-b98a-4708-afb9-49cbbd9b282b","year":2022},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:30.530150Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:dfd74f1c1fc4b946b49f9c29c4fb46d0fb5ccf7d7b5cce78053c761895b0545f","observation_id":"d28459ac-b837-43cc-bd0a-d8b7408469c6","resolution":{"observed_at":"2026-08-06T13:39:48.466735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:48.014769Z","title":"Loopy: Taming audio-driven portrait avatar with long-term motion dependency","venue":null,"work_id":"7c6d78db-c4ce-4fda-8d25-23a33925f623","year":2024},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:30.643230Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:4cf22ac0313a62e4914ac3198113f69bbd9b2734762283e86553adf2844fd449","observation_id":"8c28182c-38c5-4419-ae04-ebc6fc929316","resolution":{"observed_at":"2026-08-06T13:39:48.172525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-06T13:39:30.716088Z","title":"Adam: A method for stochastic optimization.arXiv preprint arXiv:1412.6980, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:30.716088Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:da32cf30c9181483a93389fda1e3f58dd6c2ad389d5e9ba13fc95ab95ff77352","observation_id":"56aeb3b4-4077-4ecc-9755-50f082108855","resolution":{"observed_at":"2026-08-06T13:39:30.716088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:47.740017Z","title":"Photo-realistic single image super-resolution using a generative adversarial network","venue":null,"work_id":"1dfced39-c31d-4b95-8623-c2b4ddbd58d0","year":2017},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:30.809494Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:604c1828d4e69347aa00173ce32336b829714e5549ba4ca9514eb0044dc7e56d","observation_id":"97bd352f-9815-4354-8069-726945ac47f2","resolution":{"observed_at":"2026-08-06T13:39:47.884757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-08-07T20:59:22.905615Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-08-06T13:39:30.957571Z","title":"Latentsync: Audio conditioned latent diffusion models for lip sync","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:30.957571Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:04a2557a9798de0d037967e89668730d332eea5dbdf6fb796275df3498f3790a","observation_id":"3299ad7a-593c-4076-8a1e-68af829e8e84","resolution":{"observed_at":"2026-08-06T13:39:30.957571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:47.411952Z","title":"Learning formation of physically-based face attributes","venue":null,"work_id":"0a1f593b-3b35-4afd-99a9-b177b4329308","year":2020},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:31.057220Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:4bfd6a6d3c7b5c7060e64809a311efa9a48427626329a1f5bb4316089f312312","observation_id":"09d231e1-49f5-4228-b14c-a788cc1481c1","resolution":{"observed_at":"2026-08-06T13:39:47.487963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.02894","last_updated":"2017-05-09T01:12:28Z","snapshot_observed_at":"2026-07-06T05:41:43.164281Z","submitted_at":"2017-05-08T14:32:33Z","title":"Geometric GAN","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.02894","snapshot_observed_at":"2026-08-06T13:39:31.123805Z","title":"Geometric gan.arXiv preprint arXiv:1705.02894, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:31.123805Z"},"links":{"cited_paper":"/paper/1705.02894","citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:819482944b852c15977033d679520b9b7672a5b408a799aeb3380f6018486cc8","observation_id":"ed54530d-224a-4b51-8051-7b4468aa05e2","resolution":{"observed_at":"2026-08-06T13:39:31.123805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:47.136050Z","title":"Robust high- resolution video matting with temporal guidance","venue":null,"work_id":"bdc0a4eb-e847-4a0d-8b22-4c56b52ef86a","year":2022},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:31.204493Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:7345035de85c15c4ad77902c2d1278ea2b1386117926864906706777694f2705","observation_id":"5abfb1b5-46c5-4e93-be8e-d653e54737b1","resolution":{"observed_at":"2026-08-06T13:39:47.275043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:46.864758Z","title":"Anitalker: animate vivid and diverse talking faces through identity-decoupled facial motion encoding","venue":null,"work_id":"4b530bbd-5a7a-4415-a4c0-eb221ffa9c22","year":2024},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:31.283100Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:d463441b9dfc67319cea8223b8f423e83c1f41794aa76ad3b92308c1801202f9","observation_id":"447359e1-4e18-4db1-b8b2-17496f8b76da","resolution":{"observed_at":"2026-08-06T13:39:46.944757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T13:39:31.347974Z","title":"Decoupled weight decay regularization.arXiv preprint arXiv:1711.05101, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:31.347974Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:13d34517531438bb84cc70f9e0fd115098193b31c3bfca161640293841ae9163","observation_id":"916803fc-2b96-480e-86f2-02362b0caadb","resolution":{"observed_at":"2026-08-06T13:39:31.347974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:31.456523Z","title":"Repaint: Inpainting using denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:31.456523Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:799615f15952002d3069e3e8c3f18e277eed4efab884e6a0ff903623ae4d5c81","observation_id":"6d010939-c2c8-4da8-be34-77c14a988298","resolution":{"observed_at":"2026-08-06T13:39:31.456523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:46.367317Z","title":"Implicit warping for animation with image sets.Advances in Neural Information Processing Systems, 35:22438–22450, 2022","venue":null,"work_id":"807875dc-b621-4d21-a349-de26de70df74","year":2022},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:31.554628Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:422e48b147f8fbf0c4705868347d2989d3b028e95039ed6922fc65a95cb2d8a8","observation_id":"59ece410-6f95-4a26-8001-f29fb2306383","resolution":{"observed_at":"2026-08-06T13:39:46.564761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:46.151015Z","title":"Sidgan: High-resolution dubbed video generation via shift-invariant learning","venue":null,"work_id":"dae1557b-efd7-4766-b1c7-8b11fcd4e971","year":2023},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:31.616512Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:155a7d1dac3d3ca4af6d28c34267d4f401e34570ef4d143ccad3d10d751382b9","observation_id":"629c79a5-ad66-474c-8235-c0b5df06a66b","resolution":{"observed_at":"2026-08-06T13:39:46.209299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08655","last_updated":"2024-01-25T02:29:00Z","snapshot_observed_at":"2026-07-06T17:16:21.764128Z","submitted_at":"2023-12-25T04:40:32Z","title":"SAiD: Speech-driven Blendshape Facial Animation with Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08655","snapshot_observed_at":"2026-08-06T13:39:31.735563Z","title":"Said: Speech-driven blendshape facial animation with diffusion.arXiv preprint arXiv:2401.08655, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:31.735563Z"},"links":{"cited_paper":"/paper/2401.08655","citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:eddbb724b3b3d3769fa256ba1aa9e3c508ebcfcb6c095a839fb6c6dd0300b0f7","observation_id":"78b3d442-d2a7-46ec-8f74-827b8593fadd","resolution":{"observed_at":"2026-08-06T13:39:31.735563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:45.671469Z","title":"Synctalk- face: Talking face generation with precise lip-syncing via audio-lip memory","venue":null,"work_id":"f4f38fb1-41ca-4b94-912b-787371070ce5","year":2022},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:31.837154Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:44de908a714d7ea635a0d41aaa56d9b482123b1443f5e845094f1d8ec33535d9","observation_id":"e12a04d5-9e4c-4f95-bbd4-fa6df4d89496","resolution":{"observed_at":"2026-08-06T13:39:45.930393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00971","last_updated":"2024-09-02T06:26:48Z","snapshot_observed_at":"2026-08-06T21:30:41.557936Z","submitted_at":"2024-09-02T06:26:48Z","title":"Interpretable Convolutional SyncNet","version":1},"cited_work":{"arxiv_id":"2409.00971","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00971","snapshot_observed_at":"2026-08-06T13:39:37.231709Z","title":"Interpretable Convolutional SyncNet","venue":"cs.CV","work_id":"e813c5e4-3ebc-4c82-861d-784a85cd8ad0","year":2024},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:31.975485Z"},"links":{"cited_paper":"/paper/2409.00971","citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:0ee59b156c0657d374518c59fa243c7d4b5d33c91eec4076251cfc0a60ab7a12","observation_id":"18b4a7fe-d2cd-440b-9152-21e9f6e1907d","resolution":{"observed_at":"2026-08-06T13:39:37.325379Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:45.424748Z","title":"Semantic image synthesis with spatially-adaptive normalization","venue":null,"work_id":"71fbb4b9-ebbb-4834-a9ea-0bfccfc6c3e1","year":2019},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:32.077299Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:0c69d0de4293bd54edb88e2e6595545127230f3376f3df5a6e132af1395a9808","observation_id":"9b9c38e4-9715-443e-b3cd-74df5d3d15ed","resolution":{"observed_at":"2026-08-06T13:39:45.534830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:45.091841Z","title":"A 3d face model for pose and illumination invariant face recognition","venue":null,"work_id":"a40fdda0-da02-4aa6-b13c-d484dac74fbb","year":2009},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:32.253438Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:273d0a2bea52e8c8164d1457994d615e11fcc4a663c0fe2171ca592af40ddb52","observation_id":"7a8cfbf9-506e-4a66-a661-6413bbe2ba9e","resolution":{"observed_at":"2026-08-06T13:39:45.197617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:32.384741Z","title":"A lip sync expert is all you need for speech to lip generation in the wild","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:32.384741Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:0ead33bb9f610bf7c4157f312a96aa03df53f7f3dad220070ee2ba4bb760af26","observation_id":"43871328-a0f3-4e5d-a8e3-3299a07bf0da","resolution":{"observed_at":"2026-08-06T13:39:32.384741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.08501","last_updated":"2020-07-16T17:53:02Z","snapshot_observed_at":"2026-07-06T09:38:53.228850Z","submitted_at":"2020-07-16T17:53:02Z","title":"Accelerating 3D Deep Learning with PyTorch3D","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.08501","snapshot_observed_at":"2026-08-06T13:39:32.431687Z","title":"Accelerating 3d deep learning with pytorch3d","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:32.431687Z"},"links":{"cited_paper":"/paper/2007.08501","citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:3a80073729e2a039ecb5b5dc604e92f75bcabafd50cb7bbcc16f6fe247b4984e","observation_id":"13cc7b11-b53d-476c-adfe-efcb38840494","resolution":{"observed_at":"2026-08-06T13:39:32.431687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:44.754741Z","title":"Pirenderer: Control- lable portrait image generation via semantic neural rendering","venue":null,"work_id":"3a387650-4dbe-49e9-95d1-792adf3c5a8b","year":2021},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:32.553045Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:799305553c26329f82745ef3a2ea41b791ca52dc03a44cd20fa2f4241d2637c9","observation_id":"04e3ab69-bc01-496f-805c-c7c2f6fad83c","resolution":{"observed_at":"2026-08-06T13:39:44.816217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:32.603221Z","title":"U-net: Convolutional net- works for biomedical image segmentation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:32.603221Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:0ee0bb2e22a1ef89784653693569472d77790e8339892815d036bc69dc6671cc","observation_id":"f03f55cd-d0b9-40a6-9506-02867c514aad","resolution":{"observed_at":"2026-08-06T13:39:32.603221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:44.354741Z","title":"Palette: Image-to-image diffusion mod- els","venue":null,"work_id":"6d3150a4-e47b-463f-b40b-1003198bf1bf","year":2022},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:32.656474Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:4b2c5e5c1a0d50da0e5f70554718f2822904427dcdb6771716ff5d2a4f4dbc80","observation_id":"15b40bc3-5270-416b-8f8f-306d813fd4f6","resolution":{"observed_at":"2026-08-06T13:39:44.479606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:32.802566Z","title":"Improved techniques for training gans.Advances in neural information processing systems, 29, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:32.802566Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:4097e24f306a706c60bc4716adec06fffa273b47b00f9ae198a018f4491cefaf","observation_id":"a5e4fb18-61d8-4aa4-9951-19e4c71d618d","resolution":{"observed_at":"2026-08-06T13:39:32.802566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:43.924754Z","title":"pytorch-fid: FID Score for PyTorch.https://github.com/ mseitzer/pytorch-fid, August 2020","venue":null,"work_id":"9022b612-723e-466b-bef5-06280f75501c","year":2020},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:32.952752Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:1c025225ad3216b55292d4ded6a174499549a0b17bf22fae2ffa46541f3ae62d","observation_id":"d96f5c64-a23c-48f1-b7d9-a8dcc8fa3ca1","resolution":{"observed_at":"2026-08-06T13:39:44.054773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:43.564883Z","title":"First order motion model for image animation.Advances in neural informa- tion processing systems, 32, 2019","venue":null,"work_id":"a3f4ffe1-47db-4f77-8242-b5c9494a7268","year":2019},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:33.025935Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:2ac1e068495e94b8a91bb15c124c9cae356737a1e6bd3a2072fad1dac4d9a56a","observation_id":"207ed7f0-e8c4-4a9a-a9ab-e46f2171d204","resolution":{"observed_at":"2026-08-06T13:39:43.721816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1556","last_updated":"2015-04-10T16:25:04Z","snapshot_observed_at":"2026-07-06T03:53:32.549552Z","submitted_at":"2014-09-04T19:48:04Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.1556","snapshot_observed_at":"2026-08-06T13:39:33.146640Z","title":"Very deep convolutional networks for large- scale image recognition.arXiv preprint arXiv:1409.1556, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:33.146640Z"},"links":{"cited_paper":"/paper/1409.1556","citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:e022a1f27fc27793c1d509b885035c2900b2efdb1d6a83c7fca23ca7d0397272","observation_id":"634d6d80-3e21-434b-87c3-1a12f1065992","resolution":{"observed_at":"2026-08-06T13:39:33.146640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:33.258476Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:33.258476Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:5e9661030afe483377fb6030d5c1643b83394c968d078ea957808f1afd520e25","observation_id":"f6285648-cc33-4b02-8ec7-0d7bc345be58","resolution":{"observed_at":"2026-08-06T13:39:33.258476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-06T13:39:33.344753Z","title":"Score-based generative modeling through stochastic differential equations.arXiv preprint arXiv:2011.13456, 2020","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:33.344753Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:f49475242b9504e3482f4982c50feb3c0615ee1a6e8ccae8908f4975aa1682b6","observation_id":"8a61772a-7f49-4d2c-b904-cb72350e8f88","resolution":{"observed_at":"2026-08-06T13:39:33.344753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19860","last_updated":"2024-12-26T07:39:08Z","snapshot_observed_at":"2026-07-06T20:13:54.305272Z","submitted_at":"2024-12-26T07:39:08Z","title":"UniAvatar: Taming Lifelike Audio-Driven Talking Head Generation with Comprehensive Motion and Lighting Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19860","snapshot_observed_at":"2026-08-06T13:39:33.440194Z","title":"Uniavatar: Taming lifelike audio-driven talking head generation with comprehensive motion and lighting control.arXiv preprint arXiv:2412.19860, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:33.440194Z"},"links":{"cited_paper":"/paper/2412.19860","citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:29ebae7309bb89feb984b1335d2c4c6eb4f3fdc85a8c4ff5bb94a3840a97f671","observation_id":"4d5a9aed-d76c-4689-9b42-cb70207d4d25","resolution":{"observed_at":"2026-08-06T13:39:33.440194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:43.215745Z","title":"Diffposetalk: Speech-driven stylistic 3d facial animation and head pose generation via diffusion models.ACM Transactions on Graphics (TOG), 43(4): 1–9, 2024","venue":null,"work_id":"f5592e6d-e37f-4782-8ecb-b00ed1621a41","year":2024},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:33.563374Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:7666fe05def73585f56f8c1df9dc91cc45006242ddb949489e0bb92accabe98b","observation_id":"e030ceec-abb6-462c-bf73-a8f6a3641bd0","resolution":{"observed_at":"2026-08-06T13:39:43.329796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:42.914747Z","title":"Mofa: Model-based deep convolutional face autoencoder for unsupervised monocular reconstruction","venue":null,"work_id":"d9f88521-2439-4c2a-9d23-f51c343f197f","year":2017},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:33.671556Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:370d53a9a7d1e4f27fdf978f64cef965b2c23f31ae052b8fa457ef40e328c49f","observation_id":"c74ae494-b109-4b0d-ada8-38ea9c7732ed","resolution":{"observed_at":"2026-08-06T13:39:43.026476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1607.08022","last_updated":"2017-11-06T14:21:43Z","snapshot_observed_at":"2026-08-05T08:35:49.218794Z","submitted_at":"2016-07-27T10:23:00Z","title":"Instance Normalization: The Missing Ingredient for Fast Stylization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.08022","snapshot_observed_at":"2026-08-06T13:39:33.789332Z","title":"Instance normalization: The missing ingredient for fast stylization.arXiv preprint arXiv:1607.08022, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:33.789332Z"},"links":{"cited_paper":"/paper/1607.08022","citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:1400c330f342839f6009120b4bcc4e621fb8b38192e6f67ddaac266e2f6e17f7","observation_id":"4c3ffe1a-c906-4fa6-b52a-69d3472ea9fd","resolution":{"observed_at":"2026-08-06T13:39:33.789332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:42.634451Z","title":"Seeing what you said: Talking face generation guided by a lip reading expert","venue":null,"work_id":"69f91352-1f08-4e42-afd0-c475e54c7eb0","year":2023},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:33.915452Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:34248dc72a2cfe6c069c57919053a7aebcaf56e0acf26aa332c5234993ca7530","observation_id":"e95bcd4b-54e0-4c99-8704-59a1955c660f","resolution":{"observed_at":"2026-08-06T13:39:42.762236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01798","last_updated":"2025-01-03T13:14:52Z","snapshot_observed_at":"2026-07-06T20:16:13.411201Z","submitted_at":"2025-01-03T13:14:52Z","title":"JoyGen: Audio-Driven 3D Depth-Aware Talking-Face Video Editing","version":1},"cited_work":{"arxiv_id":"2501.01798","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.01798","snapshot_observed_at":"2026-08-06T13:39:36.810890Z","title":"JoyGen: Audio-Driven 3D Depth-Aware Talking-Face Video Editing","venue":"cs.CV","work_id":"6eda6200-92ee-4323-9088-d195af64a6a2","year":2025},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:34.035222Z"},"links":{"cited_paper":"/paper/2501.01798","citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:55c183a404d5fd9cef0d69c33da17600da734070268fa05a709564cd776c49aa","observation_id":"cca0aa83-f00d-42b8-a2ec-60bf1bb2b0d0","resolution":{"observed_at":"2026-08-06T13:39:36.934732Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:42.314745Z","title":"One-shot free-view neural talking- head synthesis for video conferencing","venue":null,"work_id":"5466ac6f-0f0f-44a3-8981-b897eba9e72f","year":2021},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:34.095342Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:5e1e656276a03c6ed36ed8b037d68180d39b0b6b77cb0223d5a98a2555ce8428","observation_id":"b0910bb9-7e8e-4faf-8ca2-8bc1a6c9c04c","resolution":{"observed_at":"2026-08-06T13:39:42.524760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:42.113114Z","title":"Im- itating arbitrary talking style for realistic audio-driven talking face synthesis","venue":null,"work_id":"6e4f12d6-67b5-43e0-8657-bc687e991165","year":2021},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:34.191233Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:d667fca578583bbddfc962e1e6afb66970a8b0c400230235c1cb76445b20afb3","observation_id":"800e569a-8dc8-44f6-a940-de396405586b","resolution":{"observed_at":"2026-08-06T13:39:42.177100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:34.321999Z","title":"Group normalization","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:34.321999Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:ac85597a39763e72dea354ea3227c362b8cbf7ce05e6165979777dbfbc55a806","observation_id":"e1cd2faa-24b2-4e10-b08b-b60d51c27c4d","resolution":{"observed_at":"2026-08-06T13:39:34.321999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:41.804948Z","title":"Vfhq: A high-quality dataset and benchmark for video face super-resolution","venue":null,"work_id":"80e2ffc0-e561-4b44-90a8-4d58dd605a71","year":2022},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:34.448317Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:ffdbbc94fb7dfa4fc827621e39c176923d90bd18f406b9d90ca3d20d8800bdfa","observation_id":"3a0fb7a7-b975-4c4c-82b1-a21a80bac6a8","resolution":{"observed_at":"2026-08-06T13:39:41.956369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:41.605939Z","title":"High-fidelity generalized emotional talking face generation with multi-modal emotion space learning","venue":null,"work_id":"dc06e7dd-10b0-42cb-945b-0863f0bc52fa","year":2023},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:34.547704Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:7345ab3a8fe8293d5f38dca0ee065afe4b44af1eaa489ba658978d577f616d31","observation_id":"5c7f96f4-0f53-472a-9c71-5ff53db2c77b","resolution":{"observed_at":"2026-08-06T13:39:41.706446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-08-06T13:39:34.642522Z","title":"Hallo: Hierarchical audio-driven visual synthesis for portrait image animation.arXiv preprint arXiv:2406.08801, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:34.642522Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:92f18aae3413b6364f390ef4c1f0087661665f828c9f38ce8a3d9850be893bc1","observation_id":"776c542c-0ebf-4ce1-8283-319b259dc0f0","resolution":{"observed_at":"2026-08-06T13:39:34.642522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:41.364830Z","title":"Vasa-1: Lifelike audio-driven talking faces generated in real time.Advances in Neural Information Processing Systems, 37: 660–684, 2025","venue":null,"work_id":"44792990-ec19-44b0-8d40-ee4a92149349","year":2025},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:34.736629Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:b7cc454a2a49ffd73aa29917fdca6a123fa335452b9e9a6134c8e52672e3dadd","observation_id":"664cfe33-f7d2-48b7-8b67-823303c094aa","resolution":{"observed_at":"2026-08-06T13:39:41.478297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08503","last_updated":"2024-03-23T06:40:22Z","snapshot_observed_at":"2026-08-07T23:03:26.266685Z","submitted_at":"2024-01-16T17:04:30Z","title":"Real3D-Portrait: One-shot Realistic 3D Talking Portrait Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08503","snapshot_observed_at":"2026-08-06T13:39:34.794532Z","title":"Real3d-portrait: One-shot real- istic 3d talking portrait synthesis.arXiv preprint arXiv:2401.08503, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:34.794532Z"},"links":{"cited_paper":"/paper/2401.08503","citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:bc6e7882021d4fd90ee50e4b4437afcef6b2868a034292ae40b7e11736957998","observation_id":"a621fd21-2307-4fea-94fe-f4f451b6878f","resolution":{"observed_at":"2026-08-06T13:39:34.794532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06180","last_updated":"2022-04-13T05:56:12Z","snapshot_observed_at":"2026-08-08T16:57:08.435859Z","submitted_at":"2022-04-13T05:56:12Z","title":"Dynamic Neural Textures: Generating Talking-Face Videos with Continuously Controllable Expressions","version":1},"cited_work":{"arxiv_id":"2204.06180","doi":null,"metadata_source":"pith","pith_arxiv_id":"2204.06180","snapshot_observed_at":"2026-08-06T13:39:36.456184Z","title":"Dynamic Neural Textures: Generating Talking-Face Videos with Continuously Controllable Expressions","venue":"cs.CV","work_id":"d62cdfa3-f824-4155-9df1-226edabe256a","year":2022},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:34.839399Z"},"links":{"cited_paper":"/paper/2204.06180","citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:dcfcdadc9be0a8bdccde31ad89ef30d709fdfe6f05a24edf2d8d32e344a08289","observation_id":"d52bddd0-e699-4fc2-a245-258d573e19b4","resolution":{"observed_at":"2026-08-06T13:39:36.594730Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.10137","last_updated":"2020-03-05T10:06:22Z","snapshot_observed_at":"2026-08-07T18:31:09.562414Z","submitted_at":"2020-02-24T10:02:10Z","title":"Audio-driven Talking Face Video Generation with Learning-based Personalized Head Pose","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.10137","snapshot_observed_at":"2026-08-06T13:39:34.940981Z","title":"Audio-driven talk- ing face video generation with learning-based personalized head pose.arXiv preprint arXiv:2002.10137, 2020","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:34.940981Z"},"links":{"cited_paper":"/paper/2002.10137","citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:b2184dddd32385ac191f16fccaa2ab40145d74a01998e05aa88e9df5d7e0c67b","observation_id":"63ba9994-1cfe-4f93-b806-b72b859aa270","resolution":{"observed_at":"2026-08-06T13:39:34.940981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:41.155021Z","title":"Face animation with an attribute-guided diffusion model","venue":null,"work_id":"e4732b19-17d0-4b75-a62a-a77b4605336f","year":2023},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:35.033457Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:428e4262e27c6a98b5c6393d1231f972c6c8232d182d993c09b87789e43b9ec4","observation_id":"4157b59f-bfa4-4588-9252-5a8b327f1495","resolution":{"observed_at":"2026-08-06T13:39:41.262334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:40.858509Z","title":"Facial: Synthesizing dynamic talking face with implicit attribute learning","venue":null,"work_id":"c54581b2-09ca-4b43-9683-8e5f5bd668f4","year":2021},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:35.108427Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:8e5a3bbad4a696dd5bbf45c7d36ae4e886eeea244079b5daf14c7c6259d57302","observation_id":"9bac0f53-df88-4098-a062-d3d80a038363","resolution":{"observed_at":"2026-08-06T13:39:41.002242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:40.510328Z","title":"Refa: Real-time egocentric facial animations for virtual reality","venue":null,"work_id":"533d5290-5309-41ff-9a71-7c6b6bb4773a","year":2024},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:35.202295Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:67ef58753ec6cd6645f623643907f3c0e83371be25a66df277e7f7183fb137a0","observation_id":"0422318c-2edd-4c9b-a99b-19dd9e1bdd53","resolution":{"observed_at":"2026-08-06T13:39:40.674745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:40.200653Z","title":"Sadtalker: Learning realistic 3d motion coefficients for stylized audio-driven single image talking face animation","venue":null,"work_id":"c05d94a5-cf2c-43e5-9b9c-41b6f71e9890","year":2023},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:35.285388Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:951ea9844634bc70fafb5451704eb6b406fe2ef792e440187b65b4d2cf371dd9","observation_id":"879dae3c-ae67-4888-b272-598b973b81a8","resolution":{"observed_at":"2026-08-06T13:39:40.308738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10122","last_updated":"2025-03-26T10:48:17Z","snapshot_observed_at":"2026-07-06T19:32:46.742766Z","submitted_at":"2024-10-14T03:22:26Z","title":"MuseTalk: Real-Time High-Fidelity Video Dubbing via Spatio-Temporal Sampling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10122","snapshot_observed_at":"2026-08-06T13:39:35.346930Z","title":"Musetalk: Real-time high quality lip synchro- nization with latent space inpainting.arXiv preprint arXiv:2410.10122, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:35.346930Z"},"links":{"cited_paper":"/paper/2410.10122","citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:133ed1b7faa5b3f654c5442f02e488c65fdd5998ac8b77bd2cce566738cba521","observation_id":"9811c709-e290-485d-8a75-120a73b6c8ff","resolution":{"observed_at":"2026-08-06T13:39:35.346930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:39.949232Z","title":"Flow-guided one-shot talking face generation with a high-resolution audio-visual dataset","venue":null,"work_id":"5e939350-d8aa-4bf3-8371-8d081b1a5378","year":2021},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:35.424448Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:0b02f070236dc03aefccef9aa94cf817757ae8354c5e91c0d17d6b10ace4558b","observation_id":"8b9d950b-6414-4087-a251-91625d824470","resolution":{"observed_at":"2026-08-06T13:39:40.054748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:39.704759Z","title":"Dinet: Deformation inpainting network for realistic face visually dubbing on high res- olution video","venue":null,"work_id":"faa27e75-157c-4b1a-8454-49174db839c0","year":2023},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:35.481510Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:8c9b9ee1d57a40b63f82fca1708fb33f97ec090fe28742ce18bb59e875e77932","observation_id":"c020f487-236e-43b8-a64f-a0949742b08c","resolution":{"observed_at":"2026-08-06T13:39:39.824124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:39.492149Z","title":"Avid: Any-length video inpainting with diffusion model","venue":null,"work_id":"6c7f13ca-ce56-42fd-9deb-d1d37d6b8d97","year":2024},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:35.584749Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:782f20eaa3b759ce3a0cce3896e3c045803551a0278783c3de10ab3f550d2d15","observation_id":"b6829569-aedf-4c87-bd57-1b7fd6d8b006","resolution":{"observed_at":"2026-08-06T13:39:39.579572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:39.247800Z","title":"General facial representation learn- ing in a visual-linguistic manner","venue":null,"work_id":"f6e75922-82b4-4915-b6a6-d37680636d54","year":2022},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:35.672562Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:83dd9c947c06de48366d484b4f30a6b1f892905966789c32df4328e2c0e968fd","observation_id":"b4b5f0c6-1f7b-416b-a740-3c14836a54bc","resolution":{"observed_at":"2026-08-06T13:39:39.366507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:39.026519Z","title":"Identity-preserving talking face generation with landmark and appearance priors","venue":null,"work_id":"3206bfc4-2d57-49b7-8c64-5020cbebc890","year":2023},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:35.695632Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:1401abbacc979b47ed9fb0dedbde95816e51275c547a7c7686ceb1c346b93d24","observation_id":"db3a4d5b-bec0-4ead-afda-b9904fdd7efc","resolution":{"observed_at":"2026-08-06T13:39:39.125796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:38.813709Z","title":"On the continuity of rotation representations in neural networks","venue":null,"work_id":"8ee43d66-2b80-4b6a-a2c2-d537edc7fb2b","year":2019},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:35.804750Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:ae7a3b7bce3d0af28a005b44fa501d7d71ef7c1fdde65fe52d39398097d79bb6","observation_id":"30928c61-73dd-4168-b5f1-80bb44a3e58a","resolution":{"observed_at":"2026-08-06T13:39:38.914745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:35.884744Z","title":"Celebv-hq: A large-scale video facial attributes dataset","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:35.884744Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:8e3e42a9f4ab92635110aecd364e38b6c6be1d3e5e0bf61502b9da23c0447418","observation_id":"16350022-bbee-41f7-8a26-41640f31ec27","resolution":{"observed_at":"2026-08-06T13:39:35.884744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:38.544757Z","title":"Face alignment across large poses: A 3d solution","venue":null,"work_id":"9fc5c584-c4d8-4e81-b79a-c2e84706d605","year":2016},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:35.995606Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:82917eb8413b8bf00873ee93494fefb0c3e0ca19b1879417621ce513a0dad053","observation_id":"6ddcae72-4a54-4602-addd-1572a4f83b33","resolution":{"observed_at":"2026-08-06T13:39:38.679177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:38.204750Z","title":"We also include identity consistency lossL id =∥α 1 −α 2∥2 2, where 1 and 2 indicate identity param- eters extracted from the same video but from different frames","venue":null,"work_id":"77ab281a-97d2-4b5d-81a0-f101684e069e","year":null},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:36.109562Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:ebb04e4565d3f51d600351886d1a4557de9f27315ad226a588621d195976ed27","observation_id":"fa695015-4b98-413e-adea-91038e6223b8","resolution":{"observed_at":"2026-08-06T13:39:38.329313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:39:37.928828Z","title":"Recall from Sec","venue":null,"work_id":"602e5fca-1f75-4100-8a05-db98470b4fe0","year":null},"citing_paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T13:39:36.267401Z"},"links":{"citing_paper":"/paper/2507.20452"},"observation_digest":"sha256:b21a1a67a649a3d75ac246d20f23bd4f1045abe0fe266c2101c874ad7f40ab02","observation_id":"3b55c148-1b18-4996-b193-375f349ce86a","resolution":{"observed_at":"2026-08-06T13:39:38.046610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.20452","last_updated":"2025-07-28T01:00:59Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T05:24:51.105479Z","submitted_at":"2025-07-28T01:00:59Z","title":"JOLT3D: Joint Learning of Talking Heads and 3DMM Parameters with Application to Lip-Sync"},"reference_resolution":{"displayed":86,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":3,"verified_fuzzy":46},"total_outbound_references":86},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 86 of 86 outbound references and 0 inbound Pith citation observations for arXiv:2507.20452."}