{"as_of":"2026-08-21T09:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bacf29d402362e429284c1617ae2d3a09e061db29a5eb3f141a9fa0f1f8c3276","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T21:56:37.923184Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-16T05:49:15.734418Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-16T05:50:40.230857Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.04000","last_updated":"2024-12-10T07:43:08Z","snapshot_observed_at":"2026-08-18T16:09:52.913103Z","submitted_at":"2024-12-05T09:20:48Z","title":"IF-MDM: Implicit Face Motion Diffusion Model for High-Fidelity Realtime Talking Head Generation","version":2},"cited_work":{"arxiv_id":"2412.04000","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04000","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"If-mdm: Implicit face motion diffu- sion model for high-fidelity realtime talking head generation.arXiv preprint arXiv:2412.04000","venue":null,"work_id":"75d9c76a-498e-4cfe-8022-a84a360e01e0","year":null},"citing_paper":{"arxiv_id":"2602.09534","last_updated":"2026-05-10T13:50:44Z","snapshot_observed_at":"2026-08-09T23:39:03.326127Z","submitted_at":"2026-02-10T08:45:51Z","title":"AUHead: Realistic Emotional Talking Head Generation via Action Units Control","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-16T05:49:15.734418Z"},"links":{"cited_paper":"/paper/2412.04000","citing_paper":"/paper/2602.09534"},"observation_digest":"sha256:9d62f97fb22ba772e8dca1e020b156fbf1f421fbd04976718a5e15e55773b0b8","observation_id":"4d2c65ff-9e45-40b2-9f54-8ff4fc9843e3","resolution":{"observed_at":"2026-05-16T05:50:40.233550Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.04000/citation-record","integrity":"/paper/2412.04000/integrity","json":"/paper/2412.04000/citation-record.json","paper":"/paper/2412.04000"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:56:38.231036Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations","venue":null,"work_id":"e012eea0-cc32-4d08-9d76-ca15a78eba59","year":null},"citing_paper":{"arxiv_id":"2412.04000","last_updated":"2024-12-10T07:43:08Z","snapshot_observed_at":"2026-08-18T16:09:52.913103Z","submitted_at":"2024-12-05T09:20:48Z","title":"IF-MDM: Implicit Face Motion Diffusion Model for High-Fidelity Realtime Talking Head Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T21:56:37.818741Z"},"links":{"citing_paper":"/paper/2412.04000"},"observation_digest":"sha256:387d838cae57a0f6bf2b1770e01f6297b302b794229103b76ee95db8436163c6","observation_id":"3aa083e6-4d2e-47a9-b816-deb52fa40c94","resolution":{"observed_at":"2026-08-11T21:56:38.234204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16012","last_updated":"2024-04-25T10:25:11Z","snapshot_observed_at":"2026-08-18T20:21:31.447072Z","submitted_at":"2024-04-24T17:45:24Z","title":"GaussianTalker: Real-Time High-Fidelity Talking Head Synthesis with Audio-Driven 3D Gaussian Splatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16012","snapshot_observed_at":"2026-08-11T21:56:37.822966Z","title":"Gaus- siantalker: Real-time high-fidelity talking head synthesis with audio-driven 3d gaussian splatting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04000","last_updated":"2024-12-10T07:43:08Z","snapshot_observed_at":"2026-08-18T16:09:52.913103Z","submitted_at":"2024-12-05T09:20:48Z","title":"IF-MDM: Implicit Face Motion Diffusion Model for High-Fidelity Realtime Talking Head Generation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T21:56:37.822966Z"},"links":{"cited_paper":"/paper/2404.16012","citing_paper":"/paper/2412.04000"},"observation_digest":"sha256:719dac760c1c12b9a75db15a5b5de05971d043b4d665bc48bad45e9e000bebd4","observation_id":"091ba906-27d9-4350-a6b5-1d5f400b42ab","resolution":{"observed_at":"2026-08-11T21:56:37.822966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:56:38.222572Z","title":"Out of time: auto- mated lip sync in the wild","venue":null,"work_id":"c06f1418-3f9c-4569-9b71-a78b2da36a1d","year":null},"citing_paper":{"arxiv_id":"2412.04000","last_updated":"2024-12-10T07:43:08Z","snapshot_observed_at":"2026-08-18T16:09:52.913103Z","submitted_at":"2024-12-05T09:20:48Z","title":"IF-MDM: Implicit Face Motion Diffusion Model for High-Fidelity Realtime Talking Head Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T21:56:37.826768Z"},"links":{"citing_paper":"/paper/2412.04000"},"observation_digest":"sha256:8c12c873887f50d36c5fa797188606ed4dba4b7603cff3e09960fbe27d9bb48e","observation_id":"78974796-cca8-41df-bdd9-dd699c48cdda","resolution":{"observed_at":"2026-08-11T21:56:38.225807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:56:38.214674Z","title":"Generative adversarial nets","venue":null,"work_id":"d160ae23-65d6-4f87-8cb2-80ad6e6182fa","year":2014},"citing_paper":{"arxiv_id":"2412.04000","last_updated":"2024-12-10T07:43:08Z","snapshot_observed_at":"2026-08-18T16:09:52.913103Z","submitted_at":"2024-12-05T09:20:48Z","title":"IF-MDM: Implicit Face Motion Diffusion Model for High-Fidelity Realtime Talking Head Generation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T21:56:37.829862Z"},"links":{"citing_paper":"/paper/2412.04000"},"observation_digest":"sha256:cad4e0bf00b9f69d02471d66982c0b0378c6a83e765fff861a93e81d3358b1ba","observation_id":"c86f51b3-3ab9-4a23-8856-763ca8b2191a","resolution":{"observed_at":"2026-08-11T21:56:38.217522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:56:38.206091Z","title":"Ad-nerf: Audio driven neural ra- diance fields for talking head synthesis","venue":null,"work_id":"7de2058d-1c2f-42db-88c2-be372b9189b5","year":2021},"citing_paper":{"arxiv_id":"2412.04000","last_updated":"2024-12-10T07:43:08Z","snapshot_observed_at":"2026-08-18T16:09:52.913103Z","submitted_at":"2024-12-05T09:20:48Z","title":"IF-MDM: Implicit Face Motion Diffusion Model for High-Fidelity Realtime Talking Head Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T21:56:37.833125Z"},"links":{"citing_paper":"/paper/2412.04000"},"observation_digest":"sha256:8031b4b964b33a4d4f980bf3976c052073f5f69d19ce8882a4e77110a3e1e2e9","observation_id":"fa9af13a-1f38-40eb-849b-9cea89625792","resolution":{"observed_at":"2026-08-11T21:56:38.209415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:56:38.197452Z","title":"Classifier-free diffusion guidance","venue":null,"work_id":"56163b9e-a301-4b53-a128-669e4bf41ee2","year":2021},"citing_paper":{"arxiv_id":"2412.04000","last_updated":"2024-12-10T07:43:08Z","snapshot_observed_at":"2026-08-18T16:09:52.913103Z","submitted_at":"2024-12-05T09:20:48Z","title":"IF-MDM: Implicit Face Motion Diffusion Model for High-Fidelity Realtime Talking Head Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T21:56:37.836412Z"},"links":{"citing_paper":"/paper/2412.04000"},"observation_digest":"sha256:e795d7a186c5ce88d8810be41870717364bffee99b10d5c55b9c295dac1b11f0","observation_id":"b3a96426-e34f-48bc-8c49-b342f302fe8f","resolution":{"observed_at":"2026-08-11T21:56:38.200626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:56:38.189068Z","title":"Classifier-free diffusion guidance","venue":null,"work_id":"1dde2ec2-2884-4b28-a8ce-c36484a0a619","year":2022},"citing_paper":{"arxiv_id":"2412.04000","last_updated":"2024-12-10T07:43:08Z","snapshot_observed_at":"2026-08-18T16:09:52.913103Z","submitted_at":"2024-12-05T09:20:48Z","title":"IF-MDM: Implicit Face Motion Diffusion Model for High-Fidelity Realtime Talking Head Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T21:56:37.839593Z"},"links":{"citing_paper":"/paper/2412.04000"},"observation_digest":"sha256:9666a86e2e4f5dbc41efd8477192498acad293abe88e2c450790a999fbf5d9e2","observation_id":"4c8d9176-e5e8-4437-bf21-7a367b16b1c1","resolution":{"observed_at":"2026-08-11T21:56:38.192147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:56:38.180538Z","title":"Denoising diffu- sion probabilistic models","venue":null,"work_id":"97f4f809-4c6c-4420-937f-2a369f7a4878","year":2020},"citing_paper":{"arxiv_id":"2412.04000","last_updated":"2024-12-10T07:43:08Z","snapshot_observed_at":"2026-08-18T16:09:52.913103Z","submitted_at":"2024-12-05T09:20:48Z","title":"IF-MDM: Implicit Face Motion Diffusion Model for High-Fidelity Realtime Talking Head Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T21:56:37.842605Z"},"links":{"citing_paper":"/paper/2412.04000"},"observation_digest":"sha256:93f44f10b50828c23b4421663a0ba7266cbf4b10d8256aa4eb24b6d4fc4fae72","observation_id":"b4ace09e-40bc-424d-ae9c-059da88b7fbf","resolution":{"observed_at":"2026-08-11T21:56:38.183671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:56:38.171733Z","title":"Cross-identity motion transfer for arbitrary objects through pose-attentive video reassembling","venue":null,"work_id":"fbf5dd3e-2793-465e-a6c4-ac0ca3d40771","year":2020},"citing_paper":{"arxiv_id":"2412.04000","last_updated":"2024-12-10T07:43:08Z","snapshot_observed_at":"2026-08-18T16:09:52.913103Z","submitted_at":"2024-12-05T09:20:48Z","title":"IF-MDM: Implicit Face Motion Diffusion Model for High-Fidelity Realtime Talking Head Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T21:56:37.845906Z"},"links":{"citing_paper":"/paper/2412.04000"},"observation_digest":"sha256:1b0cbdbf24f678b51a901dc44b590342efb10a76cac1c1803ff2cc73300cf096","observation_id":"0e60464b-d5f4-4e56-9fce-d352111803aa","resolution":{"observed_at":"2026-08-11T21:56:38.175156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:56:38.163454Z","title":"Auto-encoding variational bayes","venue":null,"work_id":"e1e78c8f-74fc-4eb6-99a2-96c0a8f66d40","year":null},"citing_paper":{"arxiv_id":"2412.04000","last_updated":"2024-12-10T07:43:08Z","snapshot_observed_at":"2026-08-18T16:09:52.913103Z","submitted_at":"2024-12-05T09:20:48Z","title":"IF-MDM: Implicit Face Motion Diffusion Model for High-Fidelity Realtime Talking Head Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T21:56:37.848834Z"},"links":{"citing_paper":"/paper/2412.04000"},"observation_digest":"sha256:14be045e734c93e4768f452e92b343840ab56121572af00c1886b560c22f3e87","observation_id":"4ede256f-f6a2-44b9-92d0-47e460de8b4a","resolution":{"observed_at":"2026-08-11T21:56:38.166565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:56:38.154041Z","title":"Neural human performer: Learning generalizable ra- diance fields for human performance rendering","venue":null,"work_id":"979c50bb-24e0-4fba-9a84-74d47b0e7b77","year":2021},"citing_paper":{"arxiv_id":"2412.04000","last_updated":"2024-12-10T07:43:08Z","snapshot_observed_at":"2026-08-18T16:09:52.913103Z","submitted_at":"2024-12-05T09:20:48Z","title":"IF-MDM: Implicit Face Motion Diffusion Model for High-Fidelity Realtime Talking Head Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T21:56:37.852119Z"},"links":{"citing_paper":"/paper/2412.04000"},"observation_digest":"sha256:8afdf10cbd5f6f0425cd6807d18a37d0cd626cdaa53ba989a41898a15b791126","observation_id":"46e9d11b-c793-4d70-945e-c913fea231c5","resolution":{"observed_at":"2026-08-11T21:56:38.157551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:56:38.144793Z","title":"Expressive talking head generation with granular audio-visual control","venue":null,"work_id":"ddb22e30-3f65-4bb3-9cf7-f26c971eb19f","year":2022},"citing_paper":{"arxiv_id":"2412.04000","last_updated":"2024-12-10T07:43:08Z","snapshot_observed_at":"2026-08-18T16:09:52.913103Z","submitted_at":"2024-12-05T09:20:48Z","title":"IF-MDM: Implicit Face Motion Diffusion Model for High-Fidelity Realtime Talking Head Generation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T21:56:37.855394Z"},"links":{"citing_paper":"/paper/2412.04000"},"observation_digest":"sha256:eb2c69b5064814b4819d7d46e0ca77b7347e8b10e49b4279639876efa984dcfa","observation_id":"8834c76f-de8d-4a6a-a5bb-6425c9befbb8","resolution":{"observed_at":"2026-08-11T21:56:38.148033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:56:38.136080Z","title":"Semantic-aware implicit neural audio- driven video portrait generation","venue":null,"work_id":"2e91ebe1-bd92-4c31-b6b9-d7a9b5461a45","year":2022},"citing_paper":{"arxiv_id":"2412.04000","last_updated":"2024-12-10T07:43:08Z","snapshot_observed_at":"2026-08-18T16:09:52.913103Z","submitted_at":"2024-12-05T09:20:48Z","title":"IF-MDM: Implicit Face Motion Diffusion Model for High-Fidelity Realtime Talking Head Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T21:56:37.858480Z"},"links":{"citing_paper":"/paper/2412.04000"},"observation_digest":"sha256:76ff16b4e3c5d96b40c5b901c0b321b96d72f82db44455075104c6133075d095","observation_id":"36ab4432-8d87-40c6-a3a0-027a6231e474","resolution":{"observed_at":"2026-08-11T21:56:38.139368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:56:38.127273Z","title":"Scalable diffusion mod- els with transformers","venue":null,"work_id":"bfad2233-f033-4fc7-8ce5-0894609d5fe4","year":2023},"citing_paper":{"arxiv_id":"2412.04000","last_updated":"2024-12-10T07:43:08Z","snapshot_observed_at":"2026-08-18T16:09:52.913103Z","submitted_at":"2024-12-05T09:20:48Z","title":"IF-MDM: Implicit Face Motion Diffusion Model for High-Fidelity Realtime Talking Head Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T21:56:37.861443Z"},"links":{"citing_paper":"/paper/2412.04000"},"observation_digest":"sha256:5eeb189b126a5560e5c0509f3e757c05c6445bfabbf83898b167dba8ec86b224","observation_id":"9437722e-c063-45be-81b6-276bb5f87f0e","resolution":{"observed_at":"2026-08-11T21:56:38.130513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:56:38.118634Z","title":"A lip sync expert is all you need for speech to lip generation in the wild","venue":null,"work_id":"20cca75e-97dc-4e49-9c6f-211023a68e47","year":2020},"citing_paper":{"arxiv_id":"2412.04000","last_updated":"2024-12-10T07:43:08Z","snapshot_observed_at":"2026-08-18T16:09:52.913103Z","submitted_at":"2024-12-05T09:20:48Z","title":"IF-MDM: Implicit Face Motion Diffusion Model for High-Fidelity Realtime Talking Head Generation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T21:56:37.864403Z"},"links":{"citing_paper":"/paper/2412.04000"},"observation_digest":"sha256:86319e8f65487d26a3587a8fead0dd37ffbbf791584e435a40ebccd661351123","observation_id":"7e093641-6cb1-45bd-9b3c-ed3561df91db","resolution":{"observed_at":"2026-08-11T21:56:38.121792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:56:38.109830Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"271823d4-d253-43c5-9411-4024a9db68b3","year":2022},"citing_paper":{"arxiv_id":"2412.04000","last_updated":"2024-12-10T07:43:08Z","snapshot_observed_at":"2026-08-18T16:09:52.913103Z","submitted_at":"2024-12-05T09:20:48Z","title":"IF-MDM: Implicit Face Motion Diffusion Model for High-Fidelity Realtime Talking Head Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T21:56:37.867222Z"},"links":{"citing_paper":"/paper/2412.04000"},"observation_digest":"sha256:fc6924902c16cab6ef8bbdd0ee02651f83d1ebd5a8d0e61ffe47b9a66e941215","observation_id":"06b1c74f-0ab0-4e5b-9c8b-93e1097f0e16","resolution":{"observed_at":"2026-08-11T21:56:38.113142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:56:37.870016Z","title":"Relightable gaussian codec avatars","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04000","last_updated":"2024-12-10T07:43:08Z","snapshot_observed_at":"2026-08-18T16:09:52.913103Z","submitted_at":"2024-12-05T09:20:48Z","title":"IF-MDM: Implicit Face Motion Diffusion Model for High-Fidelity Realtime Talking Head Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T21:56:37.870016Z"},"links":{"citing_paper":"/paper/2412.04000"},"observation_digest":"sha256:e4c82d48bd779eb37a0903cbf284d52924a36896a22b6ff5e84e277259109d0a","observation_id":"5fc231e7-2084-4b5a-ba31-dbbeff8618e0","resolution":{"observed_at":"2026-08-11T21:56:37.870016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:56:38.097450Z","title":"Difftalk: Crafting diffusion models for generalized audio-driven portraits animation","venue":null,"work_id":"96cd6fab-9dcd-4bc3-8d4f-bfbd9852f44b","year":2023},"citing_paper":{"arxiv_id":"2412.04000","last_updated":"2024-12-10T07:43:08Z","snapshot_observed_at":"2026-08-18T16:09:52.913103Z","submitted_at":"2024-12-05T09:20:48Z","title":"IF-MDM: Implicit Face Motion Diffusion Model for High-Fidelity Realtime Talking Head Generation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T21:56:37.872886Z"},"links":{"citing_paper":"/paper/2412.04000"},"observation_digest":"sha256:a7ed3e1695e1a281de856d52ff451047183cd7455e1a5e2151ec3fb52abab45c","observation_id":"5ad3ba03-bcc5-4ef7-9f99-dd542ae403a7","resolution":{"observed_at":"2026-08-11T21:56:38.100297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:56:38.088971Z","title":"First order motion model for im- age animation","venue":null,"work_id":"bb3c9788-c478-41ba-8c12-1f2d4d3ebe11","year":2019},"citing_paper":{"arxiv_id":"2412.04000","last_updated":"2024-12-10T07:43:08Z","snapshot_observed_at":"2026-08-18T16:09:52.913103Z","submitted_at":"2024-12-05T09:20:48Z","title":"IF-MDM: Implicit Face Motion Diffusion Model for High-Fidelity Realtime Talking Head Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T21:56:37.875768Z"},"links":{"citing_paper":"/paper/2412.04000"},"observation_digest":"sha256:44cf05ca6154d8bf016ee7305294d654a10820b5712f289aa50f00d93c179d3b","observation_id":"0a64fdc1-e04d-4410-a0b0-90de685840c4","resolution":{"observed_at":"2026-08-11T21:56:38.092029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:56:38.080854Z","title":"Animating arbitrary objects via deep motion transfer","venue":null,"work_id":"b8d40578-72c1-400a-9ed9-408262208394","year":2019},"citing_paper":{"arxiv_id":"2412.04000","last_updated":"2024-12-10T07:43:08Z","snapshot_observed_at":"2026-08-18T16:09:52.913103Z","submitted_at":"2024-12-05T09:20:48Z","title":"IF-MDM: Implicit Face Motion Diffusion Model for High-Fidelity Realtime Talking Head Generation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T21:56:37.878677Z"},"links":{"citing_paper":"/paper/2412.04000"},"observation_digest":"sha256:307c29309cf69ddfbdb159721987c234540230e7a0b9ef05c69b1b30403a82d1","observation_id":"782ed79e-c29c-4cc6-8df4-49676a580c83","resolution":{"observed_at":"2026-08-11T21:56:38.083959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:56:38.072666Z","title":"Motion representations for artic- ulated animation","venue":null,"work_id":"ce6ba342-2085-4980-8fe6-439e35c0512e","year":2021},"citing_paper":{"arxiv_id":"2412.04000","last_updated":"2024-12-10T07:43:08Z","snapshot_observed_at":"2026-08-18T16:09:52.913103Z","submitted_at":"2024-12-05T09:20:48Z","title":"IF-MDM: Implicit Face Motion Diffusion Model for High-Fidelity Realtime Talking Head Generation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T21:56:37.881728Z"},"links":{"citing_paper":"/paper/2412.04000"},"observation_digest":"sha256:3567f3be1638a4e16e551732d1c16673a6a4911856413a9718d7fb3d69377cca","observation_id":"07ca2891-f80c-4609-8908-e3288c98a99d","resolution":{"observed_at":"2026-08-11T21:56:38.075917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:56:38.064372Z","title":"Diffused heads: Diffusion models beat gans on talking-face genera- tion","venue":null,"work_id":"b864b529-7ae9-4b5e-8075-247672d34ab0","year":2024},"citing_paper":{"arxiv_id":"2412.04000","last_updated":"2024-12-10T07:43:08Z","snapshot_observed_at":"2026-08-18T16:09:52.913103Z","submitted_at":"2024-12-05T09:20:48Z","title":"IF-MDM: Implicit Face Motion Diffusion Model for High-Fidelity Realtime Talking Head Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T21:56:37.884698Z"},"links":{"citing_paper":"/paper/2412.04000"},"observation_digest":"sha256:10d57f99d9fcc286c2648005dc723d930c2af7eb872fd7c650711b83045037fa","observation_id":"e9412581-ef5d-4f26-a2e5-32e8a1d516f2","resolution":{"observed_at":"2026-08-11T21:56:38.067559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:56:38.055924Z","title":"A-nerf: Articulated neural radiance fields for learn- ing human shape, appearance, and pose","venue":null,"work_id":"3032cb6b-31c6-4d22-a7e1-703f001c1de6","year":null},"citing_paper":{"arxiv_id":"2412.04000","last_updated":"2024-12-10T07:43:08Z","snapshot_observed_at":"2026-08-18T16:09:52.913103Z","submitted_at":"2024-12-05T09:20:48Z","title":"IF-MDM: Implicit Face Motion Diffusion Model for High-Fidelity Realtime Talking Head Generation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T21:56:37.887528Z"},"links":{"citing_paper":"/paper/2412.04000"},"observation_digest":"sha256:79c2884ce3ef1b88f21b29faa8c8145c8f02fa18bef973c9d11c5e43b26b5de5","observation_id":"8ac202cb-25e8-45fe-ad1f-c09749ba7a37","resolution":{"observed_at":"2026-08-11T21:56:38.059197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.12368","last_updated":"2022-11-22T16:03:11Z","snapshot_observed_at":"2026-08-19T11:13:23.284476Z","submitted_at":"2022-11-22T16:03:11Z","title":"Real-time Neural Radiance Talking Portrait Synthesis via Audio-spatial Decomposition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.12368","snapshot_observed_at":"2026-08-11T21:56:37.890561Z","title":"Real-time neural radiance talking portrait synthesis via audio-spatial decomposition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04000","last_updated":"2024-12-10T07:43:08Z","snapshot_observed_at":"2026-08-18T16:09:52.913103Z","submitted_at":"2024-12-05T09:20:48Z","title":"IF-MDM: Implicit Face Motion Diffusion Model for High-Fidelity Realtime Talking Head Generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T21:56:37.890561Z"},"links":{"cited_paper":"/paper/2211.12368","citing_paper":"/paper/2412.04000"},"observation_digest":"sha256:b159fbadfc613e9fa824c227af006af3a9529ab9ba5b2d97a214041b99928a32","observation_id":"591c00d3-6347-4016-a473-159aeb1bdb68","resolution":{"observed_at":"2026-08-11T21:56:37.890561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:56:38.046958Z","title":"To- wards real-world blind face restoration with generative facial 10 prior","venue":null,"work_id":"f87fd3cd-d332-4f67-8e18-0dc6805d9e97","year":2021},"citing_paper":{"arxiv_id":"2412.04000","last_updated":"2024-12-10T07:43:08Z","snapshot_observed_at":"2026-08-18T16:09:52.913103Z","submitted_at":"2024-12-05T09:20:48Z","title":"IF-MDM: Implicit Face Motion Diffusion Model for High-Fidelity Realtime Talking Head Generation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T21:56:37.893501Z"},"links":{"citing_paper":"/paper/2412.04000"},"observation_digest":"sha256:550132ceaa9d7e2302fa9549241d55e3508255cdd4434b9eac71ec4717fcb16a","observation_id":"f0dbf02e-871c-400e-a97a-4a17bf030e5b","resolution":{"observed_at":"2026-08-11T21:56:38.050210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:56:38.038247Z","title":"Latent image animator: Learning to animate im- ages via latent space navigation","venue":null,"work_id":"c6ee359e-d454-4653-aee6-e28a7398649c","year":2022},"citing_paper":{"arxiv_id":"2412.04000","last_updated":"2024-12-10T07:43:08Z","snapshot_observed_at":"2026-08-18T16:09:52.913103Z","submitted_at":"2024-12-05T09:20:48Z","title":"IF-MDM: Implicit Face Motion Diffusion Model for High-Fidelity Realtime Talking Head Generation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T21:56:37.896525Z"},"links":{"citing_paper":"/paper/2412.04000"},"observation_digest":"sha256:34732610297902473ddabfa0f9bdf067c7b8d5160789f4fcad950845bf579010","observation_id":"78a408e0-b0b3-4952-af21-d6d12933e5b5","resolution":{"observed_at":"2026-08-11T21:56:38.041470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-18T10:29:36.587877Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-08-11T21:56:37.899547Z","title":"Aniportrait: Audio-driven synthesis of photorealistic portrait animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04000","last_updated":"2024-12-10T07:43:08Z","snapshot_observed_at":"2026-08-18T16:09:52.913103Z","submitted_at":"2024-12-05T09:20:48Z","title":"IF-MDM: Implicit Face Motion Diffusion Model for High-Fidelity Realtime Talking Head Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T21:56:37.899547Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2412.04000"},"observation_digest":"sha256:1b8426926f6dc2ab55442b173ec37725a8b82d2b5298a0122a01f50ff9ee4901","observation_id":"4c6f8ae8-a1dc-4bed-ab43-503ab91a9a37","resolution":{"observed_at":"2026-08-11T21:56:37.899547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:56:38.029922Z","title":"Deep 3d portrait from a single image","venue":null,"work_id":"5c31a8c7-ada9-46ff-a504-529600944526","year":2020},"citing_paper":{"arxiv_id":"2412.04000","last_updated":"2024-12-10T07:43:08Z","snapshot_observed_at":"2026-08-18T16:09:52.913103Z","submitted_at":"2024-12-05T09:20:48Z","title":"IF-MDM: Implicit Face Motion Diffusion Model for High-Fidelity Realtime Talking Head Generation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T21:56:37.902788Z"},"links":{"citing_paper":"/paper/2412.04000"},"observation_digest":"sha256:d0f90c5667a55bcf06aff78e0577e710ba2363e096ae2c292fef1abe7614b976","observation_id":"7ddaf46a-a97b-4975-896c-cbc0c680587d","resolution":{"observed_at":"2026-08-11T21:56:38.033066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:56:38.021029Z","title":"Geneface: Generalized and high-fidelity audio-driven 3d talking face synthesis","venue":null,"work_id":"f9a1fa9c-2c8b-4968-bf7a-d25149581490","year":2023},"citing_paper":{"arxiv_id":"2412.04000","last_updated":"2024-12-10T07:43:08Z","snapshot_observed_at":"2026-08-18T16:09:52.913103Z","submitted_at":"2024-12-05T09:20:48Z","title":"IF-MDM: Implicit Face Motion Diffusion Model for High-Fidelity Realtime Talking Head Generation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T21:56:37.906014Z"},"links":{"citing_paper":"/paper/2412.04000"},"observation_digest":"sha256:f91612f964718981ee1aacca1d04c074306cf1c78ac955a4dc887e74eb378dac","observation_id":"cd05079b-8afd-4829-b235-322147cd3f56","resolution":{"observed_at":"2026-08-11T21:56:38.024435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:56:38.012193Z","title":"Real3d-portrait: One-shot realistic 3d talk- ing portrait synthesis","venue":null,"work_id":"16af5b31-93b7-4a03-aac3-b32f82e30f7c","year":2024},"citing_paper":{"arxiv_id":"2412.04000","last_updated":"2024-12-10T07:43:08Z","snapshot_observed_at":"2026-08-18T16:09:52.913103Z","submitted_at":"2024-12-05T09:20:48Z","title":"IF-MDM: Implicit Face Motion Diffusion Model for High-Fidelity Realtime Talking Head Generation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T21:56:37.908880Z"},"links":{"citing_paper":"/paper/2412.04000"},"observation_digest":"sha256:2c52c619e25b1d8468287d55769632ba170e4626820ea1a40786d8bacfc64461","observation_id":"41f48f1a-931e-4c09-8c69-2f49e0d97505","resolution":{"observed_at":"2026-08-11T21:56:38.015415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:56:38.002998Z","title":"CelebV-Text: A large-scale facial text-video dataset","venue":null,"work_id":"ee2a9756-ba7a-487f-bf0b-14b0172e8fd8","year":null},"citing_paper":{"arxiv_id":"2412.04000","last_updated":"2024-12-10T07:43:08Z","snapshot_observed_at":"2026-08-18T16:09:52.913103Z","submitted_at":"2024-12-05T09:20:48Z","title":"IF-MDM: Implicit Face Motion Diffusion Model for High-Fidelity Realtime Talking Head Generation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T21:56:37.911488Z"},"links":{"citing_paper":"/paper/2412.04000"},"observation_digest":"sha256:fae0bc3884f19e556767ad8ed3aceba4a749cde5baae970e3c3a881b3c853d36","observation_id":"bfdef39d-5b28-4d75-b964-5100000e94d6","resolution":{"observed_at":"2026-08-11T21:56:38.006201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:56:37.994051Z","title":"Flow-guided one-shot talking face generation with a high-resolution audio-visual dataset","venue":null,"work_id":"78e2dcc6-8953-4cbb-a74b-3a6fd00b4a39","year":2021},"citing_paper":{"arxiv_id":"2412.04000","last_updated":"2024-12-10T07:43:08Z","snapshot_observed_at":"2026-08-18T16:09:52.913103Z","submitted_at":"2024-12-05T09:20:48Z","title":"IF-MDM: Implicit Face Motion Diffusion Model for High-Fidelity Realtime Talking Head Generation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T21:56:37.914556Z"},"links":{"citing_paper":"/paper/2412.04000"},"observation_digest":"sha256:d01c11395bee34dd2838ebe56813586b335150ca0e3eae575786a3a3002ee288","observation_id":"300a07d9-5620-4fa4-a776-2a1c61cc206a","resolution":{"observed_at":"2026-08-11T21:56:37.997443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:56:37.985011Z","title":"Identity- preserving talking face generation with landmark and ap- pearance priors","venue":null,"work_id":"db06e3c8-3300-4a58-a200-19c2682d2170","year":2023},"citing_paper":{"arxiv_id":"2412.04000","last_updated":"2024-12-10T07:43:08Z","snapshot_observed_at":"2026-08-18T16:09:52.913103Z","submitted_at":"2024-12-05T09:20:48Z","title":"IF-MDM: Implicit Face Motion Diffusion Model for High-Fidelity Realtime Talking Head Generation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T21:56:37.917461Z"},"links":{"citing_paper":"/paper/2412.04000"},"observation_digest":"sha256:a8c493cf1646efec0aeb34630440dce410d9705ba5037b6bd4c7aa24648d0fba","observation_id":"c210d77b-c829-4c75-99d4-0106f94670f9","resolution":{"observed_at":"2026-08-11T21:56:37.988353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:56:37.975575Z","title":"Pose-controllable talking face generation by implicitly modularized audio-visual rep- resentation","venue":null,"work_id":"3cda7c2b-3e36-4af5-adeb-a55e04054075","year":2021},"citing_paper":{"arxiv_id":"2412.04000","last_updated":"2024-12-10T07:43:08Z","snapshot_observed_at":"2026-08-18T16:09:52.913103Z","submitted_at":"2024-12-05T09:20:48Z","title":"IF-MDM: Implicit Face Motion Diffusion Model for High-Fidelity Realtime Talking Head Generation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T21:56:37.920338Z"},"links":{"citing_paper":"/paper/2412.04000"},"observation_digest":"sha256:e6e6c4df836852e5d084162a34797161c043f4c9b49f0e18ac3887ae59e5a2db","observation_id":"d0806a75-1cf7-49a6-b2c5-e5cd64d4fd8f","resolution":{"observed_at":"2026-08-11T21:56:37.979059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:56:37.964489Z","title":"Makelttalk: speaker-aware talking-head animation","venue":null,"work_id":"2a512d85-989e-4726-b092-8824ddadbf27","year":2020},"citing_paper":{"arxiv_id":"2412.04000","last_updated":"2024-12-10T07:43:08Z","snapshot_observed_at":"2026-08-18T16:09:52.913103Z","submitted_at":"2024-12-05T09:20:48Z","title":"IF-MDM: Implicit Face Motion Diffusion Model for High-Fidelity Realtime Talking Head Generation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T21:56:37.923184Z"},"links":{"citing_paper":"/paper/2412.04000"},"observation_digest":"sha256:c2e6730db4ed0d4e73c0eb389c5e94b0d52fba604793c30de69d63b5f687b5a1","observation_id":"b11f9394-a518-492e-8694-5451da122961","resolution":{"observed_at":"2026-08-11T21:56:37.969509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.04000","last_updated":"2024-12-10T07:43:08Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T16:09:52.913103Z","submitted_at":"2024-12-05T09:20:48Z","title":"IF-MDM: Implicit Face Motion Diffusion Model for High-Fidelity Realtime Talking Head Generation"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":4,"verified_exact":0,"verified_fuzzy":31},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 1 inbound Pith citation observation for arXiv:2412.04000."}