{"as_of":"2026-08-07T12:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4581a020d2c4dfee7f270da90e12b295a780106aa490b2ab76244507fd0c3f72","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:38:20.590974Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.05092/citation-record","integrity":"/paper/2507.05092/integrity","json":"/paper/2507.05092/citation-record.json","paper":"/paper/2507.05092"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:30.652663Z","title":"A morphable model for the synthesis of 3d faces","venue":null,"work_id":"c6f07369-d0db-4810-a2cc-cacdca6ed1df","year":1999},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-06T19:30:12.159425Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.430133Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:91f3dd13d33e2ef8dc198bda904ae9167f34558c814a8f4d2f5682a56f23c923","observation_id":"8cee1c3d-4d3b-4c04-bcf2-587a78f80c85","resolution":{"observed_at":"2026-08-06T19:38:30.736538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:30.367809Z","title":"Hierarchical cross-modal talking face generation with dynamic pixel-wise loss","venue":null,"work_id":"166a3bcf-929d-4d84-af15-25cd1fe121ff","year":2019},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-06T19:30:12.159425Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.433575Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:4da8704a26a0856fbbe0d324b90599fc24bd829c46af4657356050dc74b07d3e","observation_id":"b4f8edd8-0cc6-47df-afb1-b065500818bb","resolution":{"observed_at":"2026-08-06T19:38:30.513004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.02966","last_updated":"2017-07-18T14:58:55Z","snapshot_observed_at":"2026-07-06T05:41:45.343378Z","submitted_at":"2017-05-08T16:44:46Z","title":"You said that?","version":2},"cited_work":{"arxiv_id":"1705.02966","doi":null,"metadata_source":"pith","pith_arxiv_id":"1705.02966","snapshot_observed_at":"2026-08-06T19:38:20.977522Z","title":"You said that?","venue":"cs.CV","work_id":"20187ab4-81f5-46b1-b028-f5075d1c015e","year":2017},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-06T19:30:12.159425Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.437079Z"},"links":{"cited_paper":"/paper/1705.02966","citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:2f28c375b13b76f4876f9ededf0445362fa1cd4d4e737890e5377b862d42f0d3","observation_id":"fc95a1b9-b64f-41a4-bf41-efd907fe8f5c","resolution":{"observed_at":"2026-08-06T19:38:21.116132Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:30.084309Z","title":"Lip reading sentences in the wild","venue":null,"work_id":"5a4a7784-21e4-474b-89e8-5270f9065aa8","year":null},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-06T19:30:12.159425Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.440540Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:7ef9e88873bf6c14de03b2079ececb5d6044651a76bcb7c5cc90a14292ebf533","observation_id":"b4d553b6-7fa0-4490-9a37-b2ebf5c3621f","resolution":{"observed_at":"2026-08-06T19:38:30.189584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:29.712645Z","title":"Accurate 3d face reconstruction with weakly-supervised learning: From single image to image set","venue":null,"work_id":"bd006516-16d8-4f8f-9b52-31810f0efb11","year":2019},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-06T19:30:12.159425Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.443919Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:b46c1e852bbf4d20efb5948f9a0a88ee89f822f538a810cd731d4eb2843f49b6","observation_id":"23f4c44d-469a-4e9a-879e-8adeea596953","resolution":{"observed_at":"2026-08-06T19:38:29.858375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:29.420310Z","title":"Dae-talker: High fidelity speech-driven talking face generation with diffusion autoen- coder","venue":null,"work_id":"b61b62bb-4a57-4b13-8e6e-84cd59bd8495","year":2023},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-06T19:30:12.159425Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.446762Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:2c5847f8ca9de9cb08ac5f1ef9f87072df62f722ffa20efdcfb6faefd7e1ff60","observation_id":"1d9fa577-2ed1-4238-a56d-6653311e1b01","resolution":{"observed_at":"2026-08-06T19:38:29.574230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:20.449788Z","title":"Generative adversarial networks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-06T19:30:12.159425Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.449788Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:738e2fb344a02e70854d51264cfc62733eebc548b138406a4a92bea7718bcdf2","observation_id":"d3848b8e-6786-49dc-92a1-bafbcdb3aedf","resolution":{"observed_at":"2026-08-06T19:38:20.449788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:29.039527Z","title":"Ad-nerf: Audio driven neural radi- ance fields for talking head synthesis","venue":null,"work_id":"66bbfd2a-abe4-4b59-bc08-c25d322db97d","year":2021},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-06T19:30:12.159425Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.452970Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:a396076ce5804016401bf5b532c860fdeb7a428a9db8ccd005696c669d14b9a3","observation_id":"5fe11f5c-a2a4-4837-a253-a6c786e08c48","resolution":{"observed_at":"2026-08-06T19:38:29.242496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:28.771897Z","title":"Facexhubert: Text-less speech-driven e (x) pressive 3d facial animation synthesis using self-supervised speech representation learn- ing","venue":null,"work_id":"49d81b4d-453a-458d-adb0-7bb77ed47d7e","year":2023},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-06T19:30:12.159425Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.455770Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:6c3c50b6ca29e672575a60ffa4a41507ffcc2e9950aa643c3debeb0129ac845a","observation_id":"03a3c0e8-84a5-4ecf-810d-a754cbdf8bd8","resolution":{"observed_at":"2026-08-06T19:38:28.887210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15230","last_updated":"2024-03-14T11:49:40Z","snapshot_observed_at":"2026-07-06T16:52:27.457437Z","submitted_at":"2023-11-26T08:04:43Z","title":"GAIA: Zero-shot Talking Avatar Generation","version":2},"cited_work":{"arxiv_id":"2311.15230","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.15230","snapshot_observed_at":"2026-08-06T19:38:20.780009Z","title":"GAIA: Zero-shot Talking Avatar Generation","venue":"cs.CV","work_id":"99e511e9-a851-4144-b1db-75ef1b65f18c","year":2023},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-06T19:30:12.159425Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.458871Z"},"links":{"cited_paper":"/paper/2311.15230","citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:cbfd922f2b4f0dcff527da0860899ac9b948c1337a3a693dccea8a3cddf333ce","observation_id":"7c1bd97c-5501-4a64-aa92-1ca5b3f01f88","resolution":{"observed_at":"2026-08-06T19:38:20.866922Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:28.427212Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium","venue":null,"work_id":"ed2bc213-0880-4df7-b572-ba956e010c94","year":2017},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-06T19:30:12.159425Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.462422Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:5684ca8277e9333de3065fb12542fc2039de5edbfc189bc1a8b4b31b571f6bf1","observation_id":"f1a09b4b-2371-44f8-b2bc-3d9669cd06b6","resolution":{"observed_at":"2026-08-06T19:38:28.593769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:28.152471Z","title":"Implicit identity representation conditioned memory compensation network for talking head video generation","venue":null,"work_id":"1506dff5-2897-462c-b9f6-8dbdc348b721","year":2023},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-06T19:30:12.159425Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.465191Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:b0b6aac8788b48ab381a7819848588c3479c22d11b1263a86ca9bf55797b8688","observation_id":"0328e1ad-3b23-491a-b9fe-563c3d8b4f84","resolution":{"observed_at":"2026-08-06T19:38:28.281921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06225","last_updated":"2023-12-10T05:20:24Z","snapshot_observed_at":"2026-08-06T16:46:46.844238Z","submitted_at":"2023-05-10T14:58:33Z","title":"DaGAN++: Depth-Aware Generative Adversarial Network for Talking Head Video Generation","version":2},"cited_work":{"arxiv_id":"2305.06225","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.06225","snapshot_observed_at":"2026-08-06T19:38:20.735193Z","title":"DaGAN++: Depth-Aware Generative Adversarial Network for Talking Head Video Generation","venue":"cs.CV","work_id":"7659fcd5-5e11-4d14-8e1a-0c14ecdc53e5","year":2023},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-06T19:30:12.159425Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.467907Z"},"links":{"cited_paper":"/paper/2305.06225","citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:06c9cc801dee59bd0492f2d64399034483f0dc64e9eac11d067a7b9fd6e83e95","observation_id":"fe1ef8fa-8c66-4cda-a6bb-dd4350f8f3f8","resolution":{"observed_at":"2026-08-06T19:38:20.756341Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:27.883100Z","title":"Depth-aware generative adversarial network for talking head video generation","venue":null,"work_id":"b5ed1411-2d30-4765-9d6a-7c1a1f738d76","year":2023},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-06T19:30:12.159425Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.471010Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:61434c6c020a5511902f4ffa31169783a4787bcc65faa8f41f7c5dab6bf7e079","observation_id":"167f1b13-1462-49b2-9c92-1bc5f0dac928","resolution":{"observed_at":"2026-08-06T19:38:28.009063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02542","last_updated":"2025-04-07T09:32:46Z","snapshot_observed_at":"2026-08-04T14:52:43.496327Z","submitted_at":"2025-04-03T12:44:41Z","title":"Audio-visual Controlled Video Diffusion with Masked Selective State Spaces Modeling for Natural Talking Head Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02542","snapshot_observed_at":"2026-08-06T19:38:20.474478Z","title":"Audio-visual con- trolled video diffusion with masked selective state spaces modeling for natural talking head generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-06T19:30:12.159425Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.474478Z"},"links":{"cited_paper":"/paper/2504.02542","citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:a96081bb8dcab2557e3e8eba784db299bf73088a26d9cdc7fc11d6e09d7429cf","observation_id":"aa640803-062e-4a2a-9704-f5eec816209f","resolution":{"observed_at":"2026-08-06T19:38:20.474478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:27.671004Z","title":"Audio-driven emotional video portraits","venue":null,"work_id":"6480d04a-73e0-433f-8d9e-336f43e27a96","year":2021},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-06T19:30:12.159425Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.481151Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:713f1f491795742f2795dc3320e5809ed2613e7613745ae78031ebd6bcfb64e4","observation_id":"84f58e79-35e0-4779-a77f-f2f8913b2b09","resolution":{"observed_at":"2026-08-06T19:38:27.781678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:27.415801Z","title":"Transformers in vision: A survey","venue":null,"work_id":"f1295e97-9d58-41d9-a667-ab54d84847b4","year":2021},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-06T19:30:12.159425Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.484001Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:59f7a79291e30aff4ba8091b1b8cbc6e1f43b9880916b1e664103ea933f43920","observation_id":"8243d0ef-8a90-4b24-a7cf-e347d3ca4fa7","resolution":{"observed_at":"2026-08-06T19:38:27.506549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:27.132955Z","title":"Deep video portraits","venue":null,"work_id":"cea08fe4-30b0-486c-997e-1c9b1304bab5","year":2018},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-06T19:30:12.159425Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.486816Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:c6e2796f248585867928be9d1c5b8b2d6daf443ec4ab513a56bf50c19b68e993","observation_id":"d4d0c738-bfa5-4595-a262-3ad63505262d","resolution":{"observed_at":"2026-08-06T19:38:27.275743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-06T19:38:20.489513Z","title":"Auto-encoding varia- tional bayes","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-06T19:30:12.159425Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.489513Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:d891672536e604548683dc958a4eac472705a4535fe8cf9fca4f6c7e0064fad3","observation_id":"b6204282-38eb-45d7-8ddf-72ca548fb991","resolution":{"observed_at":"2026-08-06T19:38:20.489513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03121","last_updated":"2024-05-06T02:32:41Z","snapshot_observed_at":"2026-07-06T18:10:08.416524Z","submitted_at":"2024-05-06T02:32:41Z","title":"AniTalker: Animate Vivid and Diverse Talking Faces through Identity-Decoupled Facial Motion Encoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03121","snapshot_observed_at":"2026-08-06T19:38:20.492669Z","title":"Anitalker: Animate vivid and di- verse talking faces through identity-decoupled facial motion encoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-06T19:30:12.159425Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.492669Z"},"links":{"cited_paper":"/paper/2405.03121","citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:1bcc8cf0776d11a9086ce93045b0a576f55a642e7e1d7375984acc03d5208acd","observation_id":"e7716d64-440d-4cf7-8da5-33d4e7156fef","resolution":{"observed_at":"2026-08-06T19:38:20.492669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:26.903023Z","title":"Moda: Mapping-once audio-driven portrait animation with dual attentions","venue":null,"work_id":"da273209-df96-4525-a861-f8479cf55ac8","year":2023},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-06T19:30:12.159425Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.496048Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:2e38078a9e08ca3633dce6b5c2153cee0320d62344df33381694dc7d55e2ff51","observation_id":"6230e1cb-f0f8-44d4-910c-4e30cc395eec","resolution":{"observed_at":"2026-08-06T19:38:26.994177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:26.648822Z","title":"Live speech por- traits: real-time photorealistic talking-head animation","venue":null,"work_id":"12653d2b-1c1b-4351-bc5b-2239255cd940","year":null},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-06T19:30:12.159425Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.498870Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:69114ba9fe69cd0829ffc16e696e661e112ad119640d596988fa8285f3c02ab6","observation_id":"cc2d224c-570b-4ae8-9600-2000bb2cc771","resolution":{"observed_at":"2026-08-06T19:38:26.776730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:26.345121Z","title":"Training strategies for improved lip- reading","venue":null,"work_id":"1c799fd8-39d0-4020-8a8f-fb8502151447","year":2022},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-06T19:30:12.159425Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.501957Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:1fc041684c839428daad0f0251358d895a0fd1986a25c74e4ea17dc495978317","observation_id":"602d3749-d771-43e3-9f6e-6b43b772e56d","resolution":{"observed_at":"2026-08-06T19:38:26.437494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09767","last_updated":"2024-08-10T09:37:55Z","snapshot_observed_at":"2026-07-06T17:02:37.841641Z","submitted_at":"2023-12-15T13:15:42Z","title":"DreamTalk: When Emotional Talking Head Generation Meets Diffusion Probabilistic Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09767","snapshot_observed_at":"2026-08-06T19:38:20.504641Z","title":"Dreamtalk: When expressive talking head generation meets diffusion probabilistic models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-06T19:30:12.159425Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.504641Z"},"links":{"cited_paper":"/paper/2312.09767","citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:daf1ef62232e60214426baa521266619c320568ccb8c4d88c427a1218e64c352","observation_id":"3d446572-f400-4b64-92f0-d6db6a9cd57a","resolution":{"observed_at":"2026-08-06T19:38:20.504641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05712","last_updated":"2024-02-08T14:39:16Z","snapshot_observed_at":"2026-08-04T13:02:13.622096Z","submitted_at":"2024-02-08T14:39:16Z","title":"DiffSpeaker: Speech-Driven 3D Facial Animation with Diffusion Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05712","snapshot_observed_at":"2026-08-06T19:38:20.507706Z","title":"Diffspeaker: Speech-driven 3d facial animation with diffusion transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-06T19:30:12.159425Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.507706Z"},"links":{"cited_paper":"/paper/2402.05712","citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:eafca5b76a28808f55ef9d0623cac4e12dc9d1a2a41f178dede2e11e3afd644e","observation_id":"9c2e43db-8b8a-431b-b31b-810aef76b4fc","resolution":{"observed_at":"2026-08-06T19:38:20.507706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:26.011003Z","title":"Librispeech: An asr corpus based on public do- main audio books","venue":null,"work_id":"362df8b4-2ae1-491b-ae7b-f617d1eb63a3","year":2015},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-06T19:30:12.159425Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.510785Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:7c41f985ccae38243cbdc0c0db6c3e724901bee0193c40a9a7bf3f96e8a9080d","observation_id":"0049d14a-a49a-4224-91ae-ef785403e837","resolution":{"observed_at":"2026-08-06T19:38:26.182893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:25.789829Z","title":"A lip sync expert is all you need for speech to lip generation in the wild","venue":null,"work_id":"4bcceff9-c077-4d25-9da9-0d26f56faeaf","year":2020},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-06T19:30:12.159425Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.513555Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:c7dbdbef56cb544313e7a726366df80edd63e1e1c038951c6d0b1e8b97028fe4","observation_id":"66454920-a701-4407-b670-4873c58a61a8","resolution":{"observed_at":"2026-08-06T19:38:25.916830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:25.481996Z","title":"High-resolution image syn- thesis with latent diffusion models","venue":null,"work_id":"7c5160f0-b702-4e85-a780-0c1dd7536bb7","year":2022},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-06T19:30:12.159425Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.516395Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:3b60067a77646f532d9dabb7c9ed053b040c0556b93dc4349afb13efa83a535e","observation_id":"4d84c517-e4cb-4281-bbe7-e67d57a618de","resolution":{"observed_at":"2026-08-06T19:38:25.657706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:20.519303Z","title":"pytorch-fid: FID Score for PyTorch","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-06T19:30:12.159425Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.519303Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:6b120b4c80d0008b75e3faf62a802e6108f94c5e526ebdf6c95c454f17d1cc91","observation_id":"90859342-df51-45a5-affb-1005a4294afc","resolution":{"observed_at":"2026-08-06T19:38:20.519303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:25.164412Z","title":"Difftalk: Crafting diffusion models for generalized audio-driven portraits animation","venue":null,"work_id":"df52dc54-2a97-4732-92b2-6efd59b1db6f","year":2023},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-06T19:30:12.159425Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.522395Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:e2bdcbaf4baaa2cefb5c53f19402c7b873b5df451a423d87e7b4059abb512932","observation_id":"182a4583-fc6d-40a7-98af-a6d4a49ca6cb","resolution":{"observed_at":"2026-08-06T19:38:25.321835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:24.883624Z","title":"First order motion model for image animation","venue":null,"work_id":"cc44ac62-7382-47dc-8bff-25febc7054d2","year":2019},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-06T19:30:12.159425Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.525008Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:ceb1d189bfee1d69fb5e77e52767f426d82aac6d533e679d9c29c9a2520b002f","observation_id":"eab7c841-fa7b-4c58-96b0-e37a38906e01","resolution":{"observed_at":"2026-08-06T19:38:25.005868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-06T19:38:20.527573Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-06T19:30:12.159425Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.527573Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:d1703bc6d83c92f682fec8bac36139c379c1e366481089335b29dd5fb1572733","observation_id":"6b328f7e-e45c-473a-b45c-e6a49c2fb524","resolution":{"observed_at":"2026-08-06T19:38:20.527573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.04786","last_updated":"2019-07-25T20:40:22Z","snapshot_observed_at":"2026-07-06T06:33:13.437664Z","submitted_at":"2018-04-13T04:19:52Z","title":"Talking Face Generation by Conditional Recurrent Adversarial Network","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.04786","snapshot_observed_at":"2026-08-06T19:38:20.530316Z","title":"Talking face generation by conditional recur- rent adversarial network","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-06T19:30:12.159425Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.530316Z"},"links":{"cited_paper":"/paper/1804.04786","citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:e8aefc8b64c0861324c417c1f1713dadb425bbcaeb904733a9b9c328b6b59baa","observation_id":"db8b93ee-57c1-445e-8a74-f7e50d88e5a7","resolution":{"observed_at":"2026-08-06T19:38:20.530316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:24.672900Z","title":"Diffused heads: Diffusion models beat gans on talking-face genera- tion","venue":null,"work_id":"ce92c869-8185-4af3-b07b-ea05dd889222","year":2024},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-06T19:30:12.159425Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.533486Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:156c2ea8f29f5488db5262ab490e135b0533233d1887c246a83ad7e7139031af","observation_id":"5e5556e3-48c2-4283-9fd3-23c6d9d927bd","resolution":{"observed_at":"2026-08-06T19:38:24.766718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01841","last_updated":"2023-12-07T03:14:22Z","snapshot_observed_at":"2026-07-30T10:55:21.867087Z","submitted_at":"2023-12-04T12:25:37Z","title":"VividTalk: One-Shot Audio-Driven Talking Head Generation Based on 3D Hybrid Prior","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.01841","snapshot_observed_at":"2026-08-06T19:38:20.536182Z","title":"Vividtalk: One-shot audio-driven talk- ing head generation based on 3d hybrid prior","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-06T19:30:12.159425Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.536182Z"},"links":{"cited_paper":"/paper/2312.01841","citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:7fd6d1b598111d9fcdee0dda3831b640dfd61850d6ec08d29b8d726179c56ec9","observation_id":"d31bcbb6-b8f8-42cb-b8a4-c4d34335d420","resolution":{"observed_at":"2026-08-06T19:38:20.536182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:24.496902Z","title":"Masked lip-sync prediction by audio-visual contextual exploitation in transformers","venue":null,"work_id":"5448fa49-b52f-403d-ac7b-33ed948b7ff5","year":2022},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-06T19:30:12.159425Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.539264Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:50b72c39e7ae6436689e38cb2f7b02c692d48761239c7f0b52fa1994a67807eb","observation_id":"3c3df29d-292f-4f0d-a801-1f09a062b89d","resolution":{"observed_at":"2026-08-06T19:38:24.596939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:24.303830Z","title":"Synthesizing obama: learn- ing lip sync from audio","venue":null,"work_id":"323ef4fd-906c-460b-95f7-5395cf3d6912","year":2017},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-06T19:30:12.159425Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.542272Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:ccd344421949d7e508f90623d355189285e62de548b2bc638c15d01401167edb","observation_id":"3d2b0f69-728b-419e-8371-57b07ec3b469","resolution":{"observed_at":"2026-08-06T19:38:24.416179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:24.045628Z","title":"Human-centric founda- tion models: Perception, generation and agentic modeling","venue":null,"work_id":"00797161-cfb1-4be3-8cdc-c6e57452ddd2","year":2025},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-06T19:30:12.159425Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.545160Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:98af7e551b21a6d7fa502c77c26c30cfc8e15dc1cb4020365add6cba853c9b85","observation_id":"e12a29a5-f076-4969-97b5-4afc1ff8e784","resolution":{"observed_at":"2026-08-06T19:38:24.155157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:23.828000Z","title":"Neural voice puppetry: Audio-driven facial reenactment","venue":null,"work_id":"65fa0a35-9e78-4619-a8ef-908a78054642","year":2020},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-06T19:30:12.159425Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.547678Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:ddd4a020c4628825897e90754ee080919b7a5019bea88227627a0b25dc264245","observation_id":"595754d1-34d3-431e-bb73-9d6e071cbc06","resolution":{"observed_at":"2026-08-06T19:38:23.933754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17485","last_updated":"2024-08-08T03:48:38Z","snapshot_observed_at":"2026-07-06T17:36:11.854303Z","submitted_at":"2024-02-27T13:10:11Z","title":"EMO: Emote Portrait Alive -- Generating Expressive Portrait Videos with Audio2Video Diffusion Model under Weak Conditions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17485","snapshot_observed_at":"2026-08-06T19:38:20.550356Z","title":"Emo: Emote portrait alive-generating expressive portrait videos with audio2video diffusion model under weak conditions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-06T19:30:12.159425Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.550356Z"},"links":{"cited_paper":"/paper/2402.17485","citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:61424598257f787669da0cf904eaf2ed99ee3f53da718a1b5740b80775fdbab9","observation_id":"4a77f82c-db0b-40b5-b1ce-92998ccadec3","resolution":{"observed_at":"2026-08-06T19:38:20.550356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:23.641279Z","title":"Xintao Wang, Honglun Zhang, Chao Dong, and Ying Shan","venue":null,"work_id":"d89a0ee9-de18-4505-8c84-3e0ad840d74c","year":2022},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-06T19:30:12.159425Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.553474Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:29523cc665d57b4c1b2a4a421359f8de70dad1b5625e7730b2185d0034ab660f","observation_id":"19dcfa08-89cb-4ef2-88dc-3f3cc904297e","resolution":{"observed_at":"2026-08-06T19:38:23.698180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-06T01:54:50.445862Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-08-06T19:38:20.556209Z","title":"Aniportrait: Audio-driven synthesis of photorealistic portrait animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-06T19:30:12.159425Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.556209Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:747e57470c63710ddf48e185428c0c2b81ae1fd06370050c0e6d5398ae2a9c9e","observation_id":"4654cc85-ca5c-4d2b-8181-5c1c68606216","resolution":{"observed_at":"2026-08-06T19:38:20.556209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:23.368225Z","title":"Photorealistic audio-driven video portraits","venue":null,"work_id":"f6e947b3-1ed4-4503-b875-36df140bc230","year":2020},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-06T19:30:12.159425Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.559258Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:635a5b5482436eef14150a4fa2d304c397c32d4c2fa2dffd20bf0f52090083ab","observation_id":"507c5c7c-e994-4ad0-91d6-a0c91649c2de","resolution":{"observed_at":"2026-08-06T19:38:23.520340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:23.156926Z","title":"Monocular depth estimation using multi-scale continuous crfs as sequential deep networks","venue":null,"work_id":"54eb61f9-4e87-46c3-9e9b-6b1698cdd415","year":2018},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-06T19:30:12.159425Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.562097Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:e1e7d3cecee1a62c00427c16e4ac82855c481ba57ec17fc79c49706124fce936","observation_id":"bc2f2c89-b3ef-4d21-8fc4-bdd1eb374986","resolution":{"observed_at":"2026-08-06T19:38:23.248574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-08-06T19:38:20.565284Z","title":"Hallo: Hierarchical audio-driven visual synthesis for portrait image animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-06T19:30:12.159425Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.565284Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:e35517532502825ae9d60065c6f678ccaabbb5c8f0d99e2a687e43085bc22531","observation_id":"4f8d4c40-5d73-4182-855e-64329f5e6bcd","resolution":{"observed_at":"2026-08-06T19:38:20.565284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:22.942981Z","title":"Jointly attentive spatial-temporal pooling networks for video-based person re-identification","venue":null,"work_id":"ed631246-fcdb-4b65-b15a-0e8436f0ff22","year":2017},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-06T19:30:12.159425Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.568145Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:41d5ffaa882975af5f9dc05cdfe6fae9002b708d2aba39f577a5d2aa62d2df9d","observation_id":"d12e33c3-f04c-447c-9d90-d17c40df500b","resolution":{"observed_at":"2026-08-06T19:38:23.054479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10667","last_updated":"2024-10-31T07:43:14Z","snapshot_observed_at":"2026-07-06T18:01:01.206270Z","submitted_at":"2024-04-16T15:43:22Z","title":"VASA-1: Lifelike Audio-Driven Talking Faces Generated in Real Time","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10667","snapshot_observed_at":"2026-08-06T19:38:20.570734Z","title":"Vasa-1: Lifelike audio-driven talking faces generated in real time","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-06T19:30:12.159425Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.570734Z"},"links":{"cited_paper":"/paper/2404.10667","citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:5b9c4285c45fb5dff868374f591d4fb398f13899a01886555d713e9f328d7588","observation_id":"dca78684-f3f4-463c-bd87-e6cd7a31d531","resolution":{"observed_at":"2026-08-06T19:38:20.570734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:22.680317Z","title":"Sadtalker: Learning realistic 3d motion coefficients for stylized audio- driven single image talking face animation","venue":null,"work_id":"d18e0e6d-9d07-420a-b429-b25f13882e8e","year":2023},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-06T19:30:12.159425Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.573841Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:54ddecf12831bc3cf2b4bf190bc942696a1f27496344be0b638d72380dbbcada","observation_id":"dff6ae6e-ce79-4f35-a1a7-bbd36534cfdc","resolution":{"observed_at":"2026-08-06T19:38:22.788464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:22.419915Z","title":"Flow-guided one-shot talking face generation with a high- resolution audio-visual dataset","venue":null,"work_id":"7249a67d-e1f0-4dbb-89eb-eb754b808322","year":2021},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-06T19:30:12.159425Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.576418Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:a7684f038d5bc872a1cc00d7c7130981343911fdcf0422de136ade1feec2a008","observation_id":"75e3770d-6dcf-4c39-a418-8e21e67f5dbd","resolution":{"observed_at":"2026-08-06T19:38:22.536446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:22.170346Z","title":"Thin-plate spline motion model for image animation","venue":null,"work_id":"e6f13730-4dcc-453b-a51c-80c12d9f6ac6","year":2022},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-06T19:30:12.159425Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.579388Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:a137bfa40cccc335118d955a4b5ded70d65dda162c4d3eeb61423d5f00e196e6","observation_id":"5b552dea-6b52-4284-a90d-f2bb8f8158d8","resolution":{"observed_at":"2026-08-06T19:38:22.300827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:21.949350Z","title":"Synergizing motion and appearance: Multi-scale com- pensatory codebooks for talking head video generation","venue":null,"work_id":"6fba8f26-6aa8-4846-88bc-317fc7d6b9a6","year":2025},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-06T19:30:12.159425Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.582069Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:5d86c7e44f2addff3da92c3663bd5056fb27e8b73025448b4f670bdc4faa3f6b","observation_id":"be9364e6-806f-4294-96bd-d1152f147fb2","resolution":{"observed_at":"2026-08-06T19:38:22.071391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:21.712592Z","title":"Talking face generation by adversarially disentangled audio-visual representation","venue":null,"work_id":"ebda7fe2-eeba-4b99-938d-8da8396b6eb3","year":2019},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-06T19:30:12.159425Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.585041Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:438206696a52fad2f14518ca483d05a409bc7474c1b1154d775848bd014db606","observation_id":"8869ee41-c585-4503-9ad9-5b28eb0f11cc","resolution":{"observed_at":"2026-08-06T19:38:21.866644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:21.512471Z","title":"Pose-controllable talking face generation by implicitly modularized audio-visual rep- resentation","venue":null,"work_id":"4efc1016-189a-4af1-a4e5-0f9d0c732b87","year":2021},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-06T19:30:12.159425Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.588203Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:5f475a972da87a64b355d03d0a3307b2421334ae96becad2e61180299d792699","observation_id":"689b50cd-62c7-4faf-8a0e-6f3f39699a20","resolution":{"observed_at":"2026-08-06T19:38:21.588387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:38:21.241434Z","title":"Makelttalk: speaker-aware talking-head animation","venue":null,"work_id":"db47cba6-c056-44d0-a3d5-73d58a966524","year":2020},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-06T19:30:12.159425Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.590974Z"},"links":{"citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:9717ac1d0233f156be06f1444ddff436a3d19d53c1715ed84fab8a8306754802","observation_id":"16ce3c0d-c8d6-4417-98a8-ce28ee3543ca","resolution":{"observed_at":"2026-08-06T19:38:21.405568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T19:30:12.159425Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":3,"verified_fuzzy":37},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 0 inbound Pith citation observations for arXiv:2507.05092."}