{"as_of":"2026-08-09T12:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:987878f4b95194f06f67eb6d0a19ba226aca615840fb9b073c0b6e56bb3cc29b","coverage":[{"denominator":71,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":71,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T12:43:27.553611Z","state":"measured"},{"denominator":73,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":73,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T01:01:54.160626Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T13:13:27.684326Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"cited_work":{"arxiv_id":"2508.06511","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.06511","snapshot_observed_at":"2026-06-29T13:13:27.684326Z","title":null,"venue":null,"work_id":"5621056b-1037-4398-bdd8-33367b7f6978","year":2025},"citing_paper":{"arxiv_id":"2605.28056","last_updated":"2026-05-27T07:02:31Z","snapshot_observed_at":"2026-07-06T23:37:40.695655Z","submitted_at":"2026-05-27T07:02:31Z","title":"CogPortrait: Fine-Grained Eye-Region Control in Portrait Animation via Hierarchical Agent Planning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T13:03:27.312548Z"},"links":{"cited_paper":"/paper/2508.06511","citing_paper":"/paper/2605.28056"},"observation_digest":"sha256:5ed71c77fc7800160d2e71e1396d65f6d4d5eb6ab0dd40cdb1025e0b7aaea147","observation_id":"d773345f-2744-4f8c-a9d3-c70dc31562d1","resolution":{"observed_at":"2026-06-29T13:13:27.685726Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.06511","snapshot_observed_at":"2026-08-02T01:01:54.160626Z","title":"arXiv preprint arXiv:2508.06511 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16339","last_updated":"2026-07-22T03:14:53Z","snapshot_observed_at":"2026-08-07T14:33:06.187105Z","submitted_at":"2026-07-16T10:49:15Z","title":"LaCache: Exact Caching and Precision-Adaptive Inference for Diffusion Large Language Models","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-02T01:01:54.160626Z"},"links":{"cited_paper":"/paper/2508.06511","citing_paper":"/paper/2607.16339"},"observation_digest":"sha256:c1f46ffdfff56a1677288f68e49502a905702265f084a5624a567e57331e3123","observation_id":"be47e19f-0ab2-41bd-8864-6cb4b794748e","resolution":{"observed_at":"2026-08-02T01:01:54.160626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.06511/citation-record","integrity":"/paper/2508.06511/integrity","json":"/paper/2508.06511/citation-record.json","paper":"/paper/2508.06511"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:38.672923Z","title":"Spatio- temporal energy-guided diffusion model for zero-shot video synthesis and editing,","venue":null,"work_id":"794507b9-cdfc-4257-b9c2-05a4dace91dd","year":2025},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:20.438409Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:afc487d630c1595f48c0100b704a72a481ed9371732b5e4e5413254daa8a8b5f","observation_id":"23e7f1ae-2355-4938-bc93-9c8cc521c53c","resolution":{"observed_at":"2026-08-06T12:43:38.779195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:38.469945Z","title":"Tvg: A training-free transition video generation method with diffusion models,","venue":null,"work_id":"0b89b8f2-5cc2-4b64-a15f-fa596826cd64","year":2025},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:20.607686Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:55c8ca4e71f9e383d01a57af9671375c7df49dd927806129c9975699d42ec6f1","observation_id":"61d0c4ad-4374-47cc-be30-e068769bfe9b","resolution":{"observed_at":"2026-08-06T12:43:38.565940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-06T12:43:20.763128Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:20.763128Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:b5dfd072cd8fba561e659d3182beebfa595f5c424b812c06c9139985aa1fa717","observation_id":"0d1cd090-bf90-4703-a118-f3a4e125a3dc","resolution":{"observed_at":"2026-08-06T12:43:20.763128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:38.289446Z","title":"Corrtalk: Correlation between hierarchical speech and facial activity variances for 3d animation,","venue":null,"work_id":"a1e657ae-cfe1-4c5a-99b0-44b83270499b","year":2024},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:20.872571Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:0d295abb632ae53eb2cb85bb64189855c11765f3a8613ee59c0750d488ada3b0","observation_id":"76b08039-2173-4305-a945-c8532ab21bea","resolution":{"observed_at":"2026-08-06T12:43:38.365671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:38.103807Z","title":"Wonderjourney: Going from anywhere to everywhere,","venue":null,"work_id":"cc247f20-38a0-4173-9aad-73decadbee67","year":2024},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:20.959506Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:89ac5b01ef8f39e4cab84dccd5ec6ed235dd06567e5e23949944511e6376c39d","observation_id":"15db9d35-dc96-49b4-b9bb-608b5e91ebef","resolution":{"observed_at":"2026-08-06T12:43:38.228910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:37.900775Z","title":"Omnihuman-1: Rethinking the scaling-up of one-stage conditioned human animation models,","venue":null,"work_id":"86db5732-9777-42c5-810c-3da367b9d707","year":2025},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:21.076719Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:cf7cb71add7b897a232dc1b3d79756ae25d811945f3889b5a49ecf883e57bfee","observation_id":"ac4c71df-2336-42b2-87ca-4dfcb924d932","resolution":{"observed_at":"2026-08-06T12:43:37.998274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:37.715367Z","title":"Audio-semantic enhanced pose-driven talking head generation,","venue":null,"work_id":"c4bdd63a-42d2-40a7-bccc-d6bcf41c8853","year":2024},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:21.154548Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:d3a992e64d4e32103b534be4ce0198ffe6f7314edef650b327e79374bb85a3fe","observation_id":"a84b4c09-8d90-4c46-b4de-15bb8d934705","resolution":{"observed_at":"2026-08-06T12:43:37.769317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:37.516685Z","title":"Alleviating one- to-many mapping in talking head synthesis with dynamic adaptation context and style adapter,","venue":null,"work_id":"a53783de-2dce-480a-8435-5935faed5608","year":2025},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:21.325531Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:203341fe449f921c6e60cc3af2501c169d56bcebdcde71c5944106b6a920cc58","observation_id":"b29b8937-4508-40fc-9517-030d68a8c97b","resolution":{"observed_at":"2026-08-06T12:43:37.587619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:37.350250Z","title":"Stochastic latent talking face generation toward emotional expressions and head poses,","venue":null,"work_id":"62c3d28d-7fce-473f-8436-0c8bb0e1608e","year":2024},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:21.435507Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:3d5a5c6783e890439e40d7122e881ef2169c84cc2c352e12ac8d4985dd2942c1","observation_id":"76152d6b-50ad-45db-a1ca-01b56ee10fb1","resolution":{"observed_at":"2026-08-06T12:43:37.403599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:37.158797Z","title":"Hallo2: Long-duration and high-resolution audio-driven portrait image animation,","venue":null,"work_id":"220e6a6b-dcbf-4c05-ae38-ee9a28aa1253","year":2025},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:21.543133Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:12a7a96ee037a792211de4165919f4048f6106384ac6e7d93f26ac6e62f9cae0","observation_id":"d19d0b5e-9631-4218-a31d-96a41128f5e8","resolution":{"observed_at":"2026-08-06T12:43:37.249313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:36.995490Z","title":"Out of time: automated lip sync in the wild,","venue":null,"work_id":"6890ddab-a6cd-4d3c-8198-6c3fbb9e9618","year":2017},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:21.646913Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:db5b62adac9c26bc1b269aca5a7e696f9bf59f6a0a6b4ff53f467050ed2bcce8","observation_id":"452e0136-51ca-4206-a242-b16880eb494e","resolution":{"observed_at":"2026-08-06T12:43:37.073999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:36.748616Z","title":"Styletalk++: A unified framework for controlling the speaking styles of talking heads,","venue":null,"work_id":"3192da88-a96c-4c9c-bfef-e4ae91438090","year":2024},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:21.773061Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:66ee7638045bd045bf9c56d1d96231ad73c5bf77ed5f5426c65ba2a67625b4dc","observation_id":"d97cfdfd-9130-4f64-aa87-18fec9500e84","resolution":{"observed_at":"2026-08-06T12:43:36.881020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:36.556547Z","title":"Multimodal inputs driven talking face generation with spatial–temporal dependency,","venue":null,"work_id":"ebbe7261-2d58-4fa5-b28d-229ece3ea19e","year":2021},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:21.885332Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:00d8aa33885572ca51df470d6116b4447082c5c8b9ff2e9c75a9d9944b8a5ac1","observation_id":"1788aa76-1a4c-4014-80e0-d6f57b38682f","resolution":{"observed_at":"2026-08-06T12:43:36.666264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:36.350856Z","title":"A lip sync expert is all you need for speech to lip generation in the wild,","venue":null,"work_id":"d9a4d4c0-0f2b-4d61-8dd2-cfab5316a341","year":2020},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:22.054746Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:778cf8e4a8202d758014377fff383564775a1ed27d2103b35b8ffda5fa7ee047","observation_id":"6d903a5b-71d8-4679-b2f9-6a477f61c1e7","resolution":{"observed_at":"2026-08-06T12:43:36.466007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:36.166030Z","title":"Difftalk: Crafting diffusion models for generalized audio-driven portraits anima- tion,","venue":null,"work_id":"adf84aa3-7816-43e6-979a-d69ace23f849","year":2023},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:22.113727Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:9727f509135c9e81c96c61d17f17b4851b38ec4b0a9bea489c5bb9dd34d84715","observation_id":"6d23a5b6-e5de-4f06-b5a4-c1ed4db6f079","resolution":{"observed_at":"2026-08-06T12:43:36.226831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15758","last_updated":"2024-05-24T17:53:54Z","snapshot_observed_at":"2026-07-06T18:19:29.996982Z","submitted_at":"2024-05-24T17:53:54Z","title":"InstructAvatar: Text-Guided Emotion and Motion Control for Avatar Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15758","snapshot_observed_at":"2026-08-06T12:43:22.208132Z","title":"Instructavatar: Text-guided emotion and motion control for avatar generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:22.208132Z"},"links":{"cited_paper":"/paper/2405.15758","citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:92b6ffefc55a7d80947fc18541afb2a98bf2bee19d9ac846e90a6555fe56871b","observation_id":"717e74f8-781b-4d37-8072-472b6c6aad71","resolution":{"observed_at":"2026-08-06T12:43:22.208132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:35.965075Z","title":"Moee: Mixture of emotion experts for audio-driven portrait animation,","venue":null,"work_id":"685413c0-309d-44e2-b4b4-79f9219d27f4","year":2025},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:22.291883Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:35abd4856544174deaa3be657ac83cf5a62d360f2b50708ec0395901356fd822","observation_id":"88dafea1-90d0-4a4f-91e9-b5bf13a1187e","resolution":{"observed_at":"2026-08-06T12:43:36.088689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:35.763514Z","title":"Face recognition based on fitting a 3d mor- phable model,","venue":null,"work_id":"c16703e9-7a0c-412b-9df6-278be55a23e6","year":2003},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:22.352937Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:596f859d9c39fe25f6bc8de7fe6deed607788fb0a7c5997f6611fabc19414a91","observation_id":"d38c91a5-5f69-4b5b-a381-49458102688f","resolution":{"observed_at":"2026-08-06T12:43:35.845916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:35.590377Z","title":"Echomimic: Lifelike audio-driven portrait animations through editable landmark conditioning,","venue":null,"work_id":"283224d9-6c7d-40db-9a8c-2d0a621f301f","year":2025},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:22.461146Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:5adf21ada0648b9338b5be8f65ebb180092d7a36824c2d4f65803f5df63ba4f7","observation_id":"35c75f7c-e5a3-489b-8dce-e3561e78b74a","resolution":{"observed_at":"2026-08-06T12:43:35.645001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:35.376602Z","title":"Hallo3: Highly dynamic and realistic portrait image animation with diffusion transformer networks,","venue":null,"work_id":"4b964074-3f79-4b38-b0a1-0fff816bb48a","year":2025},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:22.572249Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:fecac00af27211549a5b0cc35713f54449514e8ec55d5f120988100eeaaf6362","observation_id":"b95cff9c-01c3-4fe1-92c9-21f702ab2b5e","resolution":{"observed_at":"2026-08-06T12:43:35.470591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:35.204457Z","title":"Styletalk: One-shot talking head generation with controllable speaking styles,","venue":null,"work_id":"4a6f3513-b734-43ca-87aa-0de94d320d31","year":2023},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:22.625988Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:a182d750ee6c949241ee30dea5384043fe0754b34eeebf466dd34ab68d61b9e1","observation_id":"791123d2-719c-4b7b-9375-4d5aab3d8325","resolution":{"observed_at":"2026-08-06T12:43:35.296235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:34.957060Z","title":"Style2talker: High-resolution talking head generation with emotion style and art style,","venue":null,"work_id":"1465bc4f-9e28-4c55-b9a0-75e0db7de13e","year":2024},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:22.709334Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:735805b473c970d94e85c73375d660436100c46caeb7dce5a57df2d96e1a9145","observation_id":"d8ebe8a7-1bc3-4514-86e7-30e255eb9b84","resolution":{"observed_at":"2026-08-06T12:43:35.101665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:34.771198Z","title":"Edtalk: Efficient disentanglement for emotional talking head synthesis,","venue":null,"work_id":"fe80ef9e-41dd-43b3-a731-00751fc4a2d0","year":2025},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:22.797427Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:1cb3289f336bef5bfc2afbb1cdfe8860e923a48e52c47ed5c43bc20250d3ecba","observation_id":"0dbb7566-bc70-4c97-a2e8-b83e276edda7","resolution":{"observed_at":"2026-08-06T12:43:34.858085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:34.573128Z","title":"Say anything with any style,","venue":null,"work_id":"9f2f20fe-97c6-45b4-a7e3-92df703822a5","year":2024},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:22.909984Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:65a2ca78b8bf3b21cde0ac57f3211f9ba35b7558d737f91723a4a62b60710745","observation_id":"c14acd06-90e2-43af-a9dc-f3c400550026","resolution":{"observed_at":"2026-08-06T12:43:34.701760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:34.402617Z","title":"Emo: Emote portrait alive generating expressive portrait videos with audio2video diffusion model under weak conditions,","venue":null,"work_id":"733a6e86-d454-4e68-bd03-bf3892e9ed9c","year":2025},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:22.942861Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:b0da2c172fdbac1a325dc4533e9c52a8230bb056a96db84059bbeec3375019d5","observation_id":"0d175107-6644-4bba-96a0-2bc4906775bd","resolution":{"observed_at":"2026-08-06T12:43:34.476957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:34.247879Z","title":"Sadtalker: Learning realistic 3d motion coefficients for stylized audio-driven single image talking face animation,","venue":null,"work_id":"a35bab86-e0e4-41fe-bf07-c60856b225fc","year":2023},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:23.033694Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:5835475c0174c79d0866c945e662bd92c8c524a7bf68a12ed9c2561320483790","observation_id":"b24e3996-28ca-44c3-81fa-d4db7c263a02","resolution":{"observed_at":"2026-08-06T12:43:34.307021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:33.991979Z","title":"Real3d-portrait: One-shot realistic 3d talking portrait synthesis,","venue":null,"work_id":"c189b3ed-9274-4836-8f3c-f1fbe9c6cbe7","year":2024},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:23.090722Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:40cb5529197910280494f1ffbc22a2fcf795d12afb3af2995f2cd618427a8b4b","observation_id":"46cb5150-1c18-4cd5-a097-6fe6d9085ed0","resolution":{"observed_at":"2026-08-06T12:43:34.138099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:33.811005Z","title":"Scalable diffusion models with transformers,","venue":null,"work_id":"d53adcc7-847a-4207-ba80-29964190db55","year":2023},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:23.147505Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:3cb10b0e4df065d198fdb47c6e6a053d5e94ff3fe85f781cc82ce248ae6cf775","observation_id":"7c348509-6106-48d2-b11a-2e557bc8570f","resolution":{"observed_at":"2026-08-06T12:43:33.907031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:33.662234Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer,","venue":null,"work_id":"e4fdb611-14d3-4e12-a421-9bc288b3a189","year":2025},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:23.241228Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:9c8f3a5b85cdffdb0c2b3942ae377665df887ce6cc53b4e2bd97cf20561b1057","observation_id":"6c8df61a-d7fe-40cd-9420-e1bc79c41d92","resolution":{"observed_at":"2026-08-06T12:43:33.727718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:23.332696Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:23.332696Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:49dc01166659d5df0e926f000ea2a179fe5db1e421568237e9f982c91d30d40d","observation_id":"fd53d714-bd38-4778-b867-a7e1fb121158","resolution":{"observed_at":"2026-08-06T12:43:23.332696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:33.492075Z","title":"Efficient emotional adaptation for audio-driven talking-head generation,","venue":null,"work_id":"c3d96f45-1acf-4ca4-a955-2de539a2d707","year":2023},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:23.427386Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:01094cc593308169c9dd834416a0b19d5486db80cd01404e9cbe7ae3ba82aadc","observation_id":"64874710-1360-4236-96b1-bf5fe39e4031","resolution":{"observed_at":"2026-08-06T12:43:33.566500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:33.313537Z","title":"Talkclip: Talking head generation with text-guided expressive speaking styles,","venue":null,"work_id":"4287843c-1c0c-4ea1-a13b-08304e942f0c","year":2025},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:23.500353Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:c744a9bbfc71bc5be91f633c7c5940b4a7659da7f518a420e82597156129acea","observation_id":"86f3dfd8-79ed-4ef6-b804-61215e02fe25","resolution":{"observed_at":"2026-08-06T12:43:33.404635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:23.589831Z","title":"Whisperx: Time-accurate speech transcription of long-form audio,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:23.589831Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:4e80a367297355ccab164a54618b6891f146e1a6ec63e0dbf4aa439ec16e0c6d","observation_id":"9faeff50-dbcb-4bb2-8b88-134aec1e951d","resolution":{"observed_at":"2026-08-06T12:43:23.589831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-08-06T12:43:23.684599Z","title":"Aniportrait: Audio-driven synthesis of photorealistic portrait animation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:23.684599Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:9beda31f46becc79c01c37a0f4ccd7df53b552b6fe5e809166ee7dbd1b5191fd","observation_id":"499289a0-6f66-421d-af3e-61575593d220","resolution":{"observed_at":"2026-08-06T12:43:23.684599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-08-06T12:43:23.782760Z","title":"Hallo: Hierarchical audio-driven visual synthesis for portrait image animation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:23.782760Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:dbfa4ff351dc9bb5b23ab55be89e977277b06be9d57ea024db14f64e5ac745cc","observation_id":"9da71d78-ef20-4e73-bb0d-8d84202ec70f","resolution":{"observed_at":"2026-08-06T12:43:23.782760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:33.180753Z","title":"Rep- resentation alignment for generation: Training diffusion transformers is easier than you think,","venue":null,"work_id":"1578e0c0-d735-4b54-9c58-c86d8ed9b974","year":2025},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:23.845045Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:ed7ca695930673ef92ec13e2f53edb0c909a49155c8aca51b5f073b362f37cc7","observation_id":"85e08829-a9c3-4242-8017-f0cb3d426677","resolution":{"observed_at":"2026-08-06T12:43:33.244426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:32.955335Z","title":"Dinov2: Learning robust visual features without supervision,","venue":null,"work_id":"3fcd38a9-536d-43d5-9627-0ccb097f9081","year":2023},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:23.915048Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:ec8a0df4f3569fb27b077ee79d09deeca8360cda364882275bca57df2ba37f90","observation_id":"73f9ec82-391c-47bf-95dd-a89513ed5f6a","resolution":{"observed_at":"2026-08-06T12:43:33.038179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:32.726797Z","title":"Flow-guided one-shot talking face generation with a high-resolution audio-visual dataset,","venue":null,"work_id":"44ee20c4-cb4f-45f1-9873-55ee74ae2214","year":2021},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:23.985124Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:8b4cb618ce862659d292e9cfb8e753a1b03bf6de747d78077a7bbda092f71220","observation_id":"0c8471b9-20c6-470d-bb11-dddd135e1d93","resolution":{"observed_at":"2026-08-06T12:43:32.847464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:32.528512Z","title":"CelebV-HQ: A large-scale video facial attributes dataset,","venue":null,"work_id":"fc7862c3-0742-47cd-b1a0-e8e1334496d5","year":2022},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:24.080905Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:4a65ba101e8647799c6cb4fedf3e39137cb6242f147ccd2c6d9bfc12627971ed","observation_id":"8be51ba6-c19e-4c1e-a37d-b2156889883f","resolution":{"observed_at":"2026-08-06T12:43:32.636580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:32.362496Z","title":"Hierarchical feature warping and blending for talking head animation,","venue":null,"work_id":"1dc59289-2aae-4cd1-bbc4-9cdb0fd2f445","year":2024},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:24.238790Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:7d4f555010d18fc96dc705716ea55b534d598943b99018e1f26c668cd8f063a8","observation_id":"fe30ef19-9d24-4883-be37-144cd3bed17a","resolution":{"observed_at":"2026-08-06T12:43:32.433129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:24.356376Z","title":"Denoising diffusion probabilistic models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:24.356376Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:6ccbb62bd58239696cd2779af148973139a689850c565c9482d0f5879fa2b712","observation_id":"75d24d69-e53d-4113-a87b-be33cd9f0c26","resolution":{"observed_at":"2026-08-06T12:43:24.356376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:32.184565Z","title":"Diffused heads: Diffusion models beat gans on talking-face generation,","venue":null,"work_id":"84060b86-513e-409d-bdef-de426b3539b2","year":2024},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:24.523648Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:bdd6fac30e058b7f1991a667e8c14b56682dc8e640025975293270a733b31935","observation_id":"7a07d779-5799-4c25-bbcc-a72fdf3677c9","resolution":{"observed_at":"2026-08-06T12:43:32.261330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:32.008911Z","title":"Loopy: Taming audio-driven portrait avatar with long-term motion dependency,","venue":null,"work_id":"d1caf9bc-ede8-46b9-9877-f866b38874a6","year":2025},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:24.615081Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:1a935b6d3ee04e34deb99c4b8986d86f8aa8efa1a30723baf5dac325e1d09d8e","observation_id":"e1da9b9c-3384-4687-9fd7-cb1f31ca2b0f","resolution":{"observed_at":"2026-08-06T12:43:32.085060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:24.682758Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:24.682758Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:82dc4937ceeec6635a3437902be37732306fff9c0f2afbac5f1e9e24525d1048","observation_id":"977c85de-1616-4d4b-978d-883bfa9f98d4","resolution":{"observed_at":"2026-08-06T12:43:24.682758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:31.764701Z","title":"Efficient emotional adaptation for audio-driven talking-head generation,","venue":null,"work_id":"516896d3-4a85-4439-84d6-36fa5528da80","year":2023},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:24.780806Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:213cf9b0d923c63ecb1fdf199e18c830c0c910d66f64ab69092867ef650d2e90","observation_id":"ca2ad9aa-9256-48cc-b7c2-f94119409e40","resolution":{"observed_at":"2026-08-06T12:43:31.863138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:31.570352Z","title":"Emmn: Emotional motion memory network for audio-driven emotional talking face generation,","venue":null,"work_id":"fe04dc10-a71f-4095-8437-8e43abc17dd6","year":2023},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:24.877887Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:41ae62e255b97b5b22605afaebba0175a83a29d7a98a29f754d5976c059c4d68","observation_id":"bbde5224-6056-47f0-aa05-f09de5ef64a0","resolution":{"observed_at":"2026-08-06T12:43:31.669046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:31.357574Z","title":"Talking face gener- ation with audio-deduced emotional landmarks,","venue":null,"work_id":"388f0bbe-2211-49f4-892d-002f3f5322ff","year":2023},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:24.940996Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:89ee4bdc33c7374cfa18bf6b3c08b1c9a1277067ec57cbce67b9ca8a45b9dcb8","observation_id":"001f16cd-4748-4652-a42f-0e9d09616507","resolution":{"observed_at":"2026-08-06T12:43:31.452342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:31.213163Z","title":"Eamm: One-shot emotional talking face via audio-based emotion-aware motion model,","venue":null,"work_id":"11e90fae-38d4-469f-bf5a-721f913d2d60","year":2022},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:25.046119Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:25f9a8bb358de3c704e557f7f51800964e02a604fbdf9e4423bb66171c432f25","observation_id":"82de0386-a1b7-4c06-8e82-c8e3a89ccabe","resolution":{"observed_at":"2026-08-06T12:43:31.294588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:30.988268Z","title":"Neural discrete representation learning,","venue":null,"work_id":"c02bd96b-9b62-4361-b09f-d588dd2fdc68","year":2017},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:25.180962Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:81cf2da80c5162e7c02f02c4149f320810f24d22fa65c48fae0560648c857b28","observation_id":"e06e0b86-af4b-4930-8ac4-68a5f866dc0d","resolution":{"observed_at":"2026-08-06T12:43:31.103654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:30.795741Z","title":"Progressive disentangled representation learning for fine-grained controllable talking head synthesis,","venue":null,"work_id":"3000b81c-d0ee-41a0-abc6-531292df24a1","year":2023},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:25.288675Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:a0089dd28d0669e7bf593dcb5d43fe3e64a89ec85a2a038bc2e171dab1d83f01","observation_id":"1df25f53-5755-424b-b07b-c463d8e2d844","resolution":{"observed_at":"2026-08-06T12:43:30.839573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-08-06T12:43:25.371332Z","title":"Pllava: Parameter-free llava extension from images to videos for video dense captioning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:25.371332Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:9193cf2f70c15173fc11fedd31b246a5396185388256b5a9cee4567e687dd1e1","observation_id":"4841976a-bf37-4262-a744-c86f37d48914","resolution":{"observed_at":"2026-08-06T12:43:25.371332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:30.585772Z","title":"Animate anyone: Consistent and controllable image-to-video synthesis for character animation,","venue":null,"work_id":"f5009405-8a32-48ae-92b3-753f093e2643","year":2024},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:25.473087Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:dd3b3697c353b725fb884922b7e88204f875928b2d49e335342cdbb109b5b9fb","observation_id":"12e53d0b-d73e-49f8-9cd5-eaf8efb3e117","resolution":{"observed_at":"2026-08-06T12:43:30.685967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:30.370238Z","title":"Megactor- σ: Unlocking flexible mixed-modal control in portrait animation with diffusion transformer,","venue":null,"work_id":"53212c32-2594-4ced-82bd-b55574e34b01","year":2025},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:25.616433Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:32dececf30be08fc76c580ccbb7f679dc14e42e0e7c27c8ee11fdd47b1287e0e","observation_id":"d8204951-6415-48ad-8c77-e803742d4b90","resolution":{"observed_at":"2026-08-06T12:43:30.479263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:30.179334Z","title":"Vasa-1: Lifelike audio-driven talking faces generated in real time,","venue":null,"work_id":"079b8a70-6a14-4b9f-8d1b-17018c4b6633","year":2024},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:25.797404Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:fa834f4f1caf4a236538a6c6ea1c001a516c6e4c81eb250c30c514a311b60ac9","observation_id":"fedecec2-efc7-46d6-9efa-406140d0c4be","resolution":{"observed_at":"2026-08-06T12:43:30.267860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:25.877250Z","title":"High- resolution image synthesis with latent diffusion models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:25.877250Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:e3be7f82ed2c740be3a21ca95e2359b10cd2c06d584702718a8d9e9564fac493","observation_id":"d810176f-352f-4331-9db9-d1a337d234a0","resolution":{"observed_at":"2026-08-06T12:43:25.877250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:25.953112Z","title":"Easyanimate: A high-performance long video gen- eration method based on transformer architecture,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:25.953112Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:1debee24398dac6bf8649a6c60e43d6dea76d5fc99d3f280ad45557754860c65","observation_id":"1395334b-d60f-4ab7-82ed-0b771d9c44b9","resolution":{"observed_at":"2026-08-06T12:43:25.953112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17177","last_updated":"2024-04-17T18:41:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-27T03:30:58Z","title":"Sora: A Review on Background, Technology, Limitations, and Opportunities of Large Vision Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17177","snapshot_observed_at":"2026-08-06T12:43:26.010676Z","title":"Sora: A review on background, technology, limitations, and opportunities of large vision models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:26.010676Z"},"links":{"cited_paper":"/paper/2402.17177","citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:d8042f299f81061869577a0e34d51c9fd3b02ba5719437c47eb78a2c67ed2d60","observation_id":"c4f017e6-91b8-4be8-aa3d-ed68e2a76e37","resolution":{"observed_at":"2026-08-06T12:43:26.010676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:29.995147Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":"599b4913-6743-41b7-99ac-64edd2218958","year":2020},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:26.094954Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:170f05f1950acb982f358317923b26e44143f06141988eb5dc4535bb44b9a875","observation_id":"99c38c09-4ff1-48b9-b933-742b6633e492","resolution":{"observed_at":"2026-08-06T12:43:30.081629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:29.787215Z","title":"Effective whole-body pose estimation with two-stages distillation,","venue":null,"work_id":"9cd1c0b7-236b-4b45-b419-85ca0b7605b5","year":2023},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:26.179445Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:9b43156fa56bdb89e2b8020e591d75d7e09425d5876183898f7735065da34969","observation_id":"07ce0a9e-4aa9-42c5-9f5c-51fbb3c3124a","resolution":{"observed_at":"2026-08-06T12:43:29.879551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:29.598366Z","title":"Stylecrafter: Enhancing stylized text-to-video generation with style adapter,","venue":null,"work_id":"7092c0ba-afa7-4765-a4e6-a6171ca4658b","year":2024},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:26.283689Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:566e257a0f71ff1148026dde471db3c03b0c7008e950adb191999177e9c330d9","observation_id":"97dc7f49-0224-44b6-967f-5e19fca39027","resolution":{"observed_at":"2026-08-06T12:43:29.655657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:29.416103Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"60199ea8-285a-4c13-bd08-b2e8767ce049","year":2021},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:26.373131Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:36cc931d14a7e2434e29b420df19106eee61d6d4fe2de3c4d5f991132813bba3","observation_id":"b0e833b1-9f78-4b4d-97ba-b86315713c97","resolution":{"observed_at":"2026-08-06T12:43:29.491485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:29.237160Z","title":"Vision transformer with quad- rangle attention,","venue":null,"work_id":"45d17fae-bd43-4054-92fe-b0be78f3370b","year":2024},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:26.457543Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:f5807bc26bbf81f3291cf1bcfe41b8ea7ce84ce1269b827c6fe4f1f84d603074","observation_id":"0bc9ccad-1c30-45bf-bf48-2b8db2da1e75","resolution":{"observed_at":"2026-08-06T12:43:29.346309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:29.060940Z","title":"Celebv-text: A large-scale facial text-video dataset,","venue":null,"work_id":"c3accdf0-68f3-46c8-b70c-c3f5ed519d10","year":2023},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:26.612613Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:3676ac366e268a173a62c05371b067bbe6a2ebc903500b3245b93bf45b794522","observation_id":"10ac8c89-d956-4722-8868-8d3baa0e54ed","resolution":{"observed_at":"2026-08-06T12:43:29.150137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07151","last_updated":"2025-07-13T07:52:42Z","snapshot_observed_at":"2026-08-07T19:16:56.416404Z","submitted_at":"2024-09-23T07:27:02Z","title":"DH-FaceVid-1K: A Large-Scale High-Quality Dataset for Face Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07151","snapshot_observed_at":"2026-08-06T12:43:26.732825Z","title":"Facevid-1k: A large-scale high-quality multiracial human face video dataset,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:26.732825Z"},"links":{"cited_paper":"/paper/2410.07151","citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:0cd71d24840e8c15ea6488066f5de880464c7d8625df04eb0867cd65fa43e681","observation_id":"eb870c7b-82ee-490b-9c7b-310cc136010f","resolution":{"observed_at":"2026-08-06T12:43:26.732825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:28.850722Z","title":"Mead: A large-scale audio-visual dataset for emotional talking-face generation,","venue":null,"work_id":"d5c5bd19-fa1b-436f-b085-9f602eedfed9","year":2020},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:26.853076Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:a1ecf10045e0a64a9f3d74cda1787158cb653baac3abcddf021be88dbed2907a","observation_id":"cfad3b58-5566-457a-8896-b88f521e39f0","resolution":{"observed_at":"2026-08-06T12:43:28.940438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-08-07T20:59:22.905615Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-08-06T12:43:27.004117Z","title":"Latentsync: Taming audio-conditioned latent diffusion models for lip sync with syncnet supervision,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:27.004117Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:6c561fd0180335ac26270c3df597706030e425be4bc048bab80d32f1598ca21b","observation_id":"74c75899-b98c-4529-acdf-2cdec7496d4e","resolution":{"observed_at":"2026-08-06T12:43:27.004117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:28.654812Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium,","venue":null,"work_id":"bb2bda06-6b00-4e00-abff-a736392f828e","year":2017},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:27.132662Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:c73063c7a66ab1d73b7d7de30fa52ea5d9256d337a2a3b7647aab3b3bcf208b8","observation_id":"6d984e16-3249-45e2-a821-dcc5d65678b2","resolution":{"observed_at":"2026-08-06T12:43:28.758591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:28.447982Z","title":"Video-to-video synthesis,","venue":null,"work_id":"95c93e27-83d7-49c2-b166-8a0ba715b3f0","year":2018},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:27.290711Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:b601b2cc69fc49959c9e0d42f70f2e57c6775de58bdf8dc6e9cc1ddb25541eb1","observation_id":"d756d998-225c-4e56-8b4b-280b72fec00a","resolution":{"observed_at":"2026-08-06T12:43:28.559570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:28.254147Z","title":"Ani- mating arbitrary objects via deep motion transfer,","venue":null,"work_id":"53781c95-2bd7-48fd-8128-c63efb991854","year":2019},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:27.374229Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:a2ccf521043350def5f5648f8766343e392014908b77e6179bd802504f0ec0ed","observation_id":"7db45693-961c-4dc3-afe1-336b58182499","resolution":{"observed_at":"2026-08-06T12:43:28.352098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:28.018422Z","title":"Seeing what you said: Talking face generation guided by a lip reading expert,","venue":null,"work_id":"f4f7f47f-b174-424f-a83d-761e9b18a072","year":2023},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:27.454581Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:23aa4a12408f14ebf683863dd33b09ff28b74660631b68b255f057651777ee36","observation_id":"fb8e6625-bf93-43b8-9a23-5b65c68f696c","resolution":{"observed_at":"2026-08-06T12:43:28.145129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T12:43:27.808480Z","title":"Towards robust blind face restoration with codebook lookup transformer,","venue":null,"work_id":"b35a21fc-1835-4c3a-8cf8-f6bee12db6ed","year":2022},"citing_paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T12:43:27.553611Z"},"links":{"citing_paper":"/paper/2508.06511"},"observation_digest":"sha256:15fcec3b84588e714bec184dac2d20c7c3dd53df84f3060fadceed3d73324873","observation_id":"64953955-4a54-4cc1-a894-2bdbaeebdd65","resolution":{"observed_at":"2026-08-06T12:43:27.914596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.06511","last_updated":"2025-07-29T08:23:56Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T20:51:47.886994Z","submitted_at":"2025-07-29T08:23:56Z","title":"DiTalker: A Unified DiT-based Framework for High-Quality and Speaking Styles Controllable Portrait Animation"},"reference_resolution":{"displayed":71,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":0,"verified_fuzzy":57},"total_outbound_references":71},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 71 of 71 outbound references and 2 inbound Pith citation observations for arXiv:2508.06511."}