{"as_of":"2026-08-08T03:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6cf5951c8003d41cea7834668753ece3d668de2adfa59ac4f160fdc9cc3dfe1b","coverage":[{"denominator":83,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":83,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:01:09.561127Z","state":"measured"},{"denominator":85,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":85,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T23:16:52.478464Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T18:50:16.683799Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":"2506.00830","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.00830","snapshot_observed_at":"2026-08-05T18:50:16.683799Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","venue":"cs.CV","work_id":"536e56d9-0b2c-4cda-87d3-96be03358761","year":2025},"citing_paper":{"arxiv_id":"2508.14033","last_updated":"2025-08-19T17:55:23Z","snapshot_observed_at":"2026-08-05T18:50:15.388089Z","submitted_at":"2025-08-19T17:55:23Z","title":"InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T18:50:16.222228Z"},"links":{"cited_paper":"/paper/2506.00830","citing_paper":"/paper/2508.14033"},"observation_digest":"sha256:2287eca3c80fb6473f41f5c43d886599d9bc6e28deecbec822581817e8ab563c","observation_id":"ab09bcec-d3a2-40f7-9f11-4c6229fdc586","resolution":{"observed_at":"2026-08-05T18:50:16.689954Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00830","snapshot_observed_at":"2026-08-07T23:16:52.478464Z","title":"Zhengcong Fei, Hao Jiang, Di Qiu, Baoxuan Gu, Youqiang Zhang, Jiahua Wang, Jialin Bai, Debang Li, Mingyuan Fan, Guibin Chen, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05803","last_updated":"2026-08-06T09:38:30Z","snapshot_observed_at":"2026-08-08T03:15:46.185669Z","submitted_at":"2026-08-06T09:38:30Z","title":"Vorch-Omni: Multi-Task Orchestration of Sight and Sound","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T23:16:52.478464Z"},"links":{"cited_paper":"/paper/2506.00830","citing_paper":"/paper/2608.05803"},"observation_digest":"sha256:8e4ee63cfa15626837c07296e2d6ca4a7475a122ab2669016c58d135229984ea","observation_id":"085f7559-aa81-4101-b8b4-4d893902df8a","resolution":{"observed_at":"2026-08-07T23:16:52.478464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.00830/citation-record","integrity":"/paper/2506.00830/integrity","json":"/paper/2506.00830/citation-record.json","paper":"/paper/2506.00830"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:04.255827Z","title":"https://www.prnewswire.com/news-releases/deepbrain-ai-delivers-ai-avatar-to empower-people-with-disabilities-302026965.html","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:04.255827Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:2c1d89a0cd8d4e510738dfc7e48a2ed511ca85a97d80b67b8033f7db7863ca0e","observation_id":"2df14923-be37-4abe-ac00-5d3e78b821e4","resolution":{"observed_at":"2026-08-07T12:01:04.255827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:04.296619Z","title":"Efficient 3d implicit head avatar with mesh-anchored hash table blendshapes","venue":null,"work_id":null,"year":1975},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:04.296619Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:3b96c42cc329f015faa36b3737166f907cf7d96cc8ec32c0c596207b65a919cb","observation_id":"135e397a-f7e2-49ce-9051-87c42fd9b728","resolution":{"observed_at":"2026-08-07T12:01:04.296619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-07T12:01:04.358842Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets.arXiv preprint arXiv:2311.15127, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:04.358842Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:b4bbc8d767c49b14f795f13dbcfa8872bbbe0f2fa65f9a32cfded7ee0e96e7de","observation_id":"ea566ae7-4703-4d94-9f1b-107b32f69767","resolution":{"observed_at":"2026-08-07T12:01:04.358842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:04.454450Z","title":"Lipnerf: What is the right feature space to lip-sync a nerf","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:04.454450Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:eeaff9cba0183d6f2be4b478656965a0b8fd42363b650bc25f2db785a05945d3","observation_id":"f662ac27-511f-4fe5-a720-da09c6b99c49","resolution":{"observed_at":"2026-08-07T12:01:04.454450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19040","last_updated":"2024-04-29T18:28:36Z","snapshot_observed_at":"2026-07-06T18:07:19.073337Z","submitted_at":"2024-04-29T18:28:36Z","title":"GSTalker: Real-time Audio-Driven Talking Face Generation via Deformable Gaussian Splatting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19040","snapshot_observed_at":"2026-08-07T12:01:04.496571Z","title":"Gstalker: Real-time audio-driven talking face generation via deformable gaussian splatting.arXiv preprint arXiv:2404.19040, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:04.496571Z"},"links":{"cited_paper":"/paper/2404.19040","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:1b7e18e618ab8dd89b9cad28b57a256a256a1901e9ab41d0d7511e5f0f470bb5","observation_id":"1dc9ce03-21bb-42dd-b406-8b9551be6ea4","resolution":{"observed_at":"2026-08-07T12:01:04.496571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13074","last_updated":"2025-04-21T10:34:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-17T16:37:27Z","title":"SkyReels-V2: Infinite-length Film Generative Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13074","snapshot_observed_at":"2026-08-07T12:01:04.582389Z","title":"Skyreels-v2: Infinite-length film generative model.arXiv preprint arXiv:2504.13074, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:04.582389Z"},"links":{"cited_paper":"/paper/2504.13074","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:6e4768305df901263f29b1142885853ce06cf459a34d042422a31fe76b63bb05","observation_id":"0ce23d57-43e9-458b-aca8-e89518896901","resolution":{"observed_at":"2026-08-07T12:01:04.582389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-07T12:01:04.662450Z","title":"Pixart-alpha: Fast training of diffusion transformer for photorealistic text-to-image synthesis.arXiv preprint arXiv:2310.00426, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:04.662450Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:8e18a19d553c99e3416b713f1908bfe1e4d81ef0ebabe2bba19bc8dc5ef0da81","observation_id":"82d2b146-147b-456e-ab9c-c15ede9407d4","resolution":{"observed_at":"2026-08-07T12:01:04.662450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08136","last_updated":"2024-07-12T02:41:51Z","snapshot_observed_at":"2026-08-05T23:17:13.069591Z","submitted_at":"2024-07-11T02:26:51Z","title":"EchoMimic: Lifelike Audio-Driven Portrait Animations through Editable Landmark Conditions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08136","snapshot_observed_at":"2026-08-07T12:01:04.758873Z","title":"Echomimic: Lifelike audio-driven portrait animations through editable landmark conditions.arXiv preprint arXiv:2407.08136, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:04.758873Z"},"links":{"cited_paper":"/paper/2407.08136","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:bde5690c433bb013437495c0e3ca57f810383c0ebe0ff66df62fc330adb507db","observation_id":"088bdfa4-1de9-482d-9b3e-bce0028c595a","resolution":{"observed_at":"2026-08-07T12:01:04.758873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:15.074225Z","title":"Yolo-world: Real-time open-vocabulary object detection","venue":null,"work_id":"49dc368c-dad8-4291-8ae8-cf711d9c99c6","year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:04.843546Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:97ae3a29bad6cad365b2123a0638de3c1b61df005cdf27e58219c1a9724b539c","observation_id":"e395d580-5434-479f-ade6-c58c3185fddf","resolution":{"observed_at":"2026-08-07T12:01:15.136306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16012","last_updated":"2024-04-25T10:25:11Z","snapshot_observed_at":"2026-07-06T18:05:03.284784Z","submitted_at":"2024-04-24T17:45:24Z","title":"GaussianTalker: Real-Time High-Fidelity Talking Head Synthesis with Audio-Driven 3D Gaussian Splatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16012","snapshot_observed_at":"2026-08-07T12:01:04.901517Z","title":"Gaussiantalker: Real-time high-fidelity talking head synthesis with audio-driven 3d gaussian splatting.arXiv preprint arXiv:2404.16012, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:04.901517Z"},"links":{"cited_paper":"/paper/2404.16012","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:3c348c4e5ee328faccd715d733423d63116d2894b29e7f6d6a81d33a0031c1e1","observation_id":"7807034e-597f-4eee-ade7-54a915c1d5b0","resolution":{"observed_at":"2026-08-07T12:01:04.901517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:04.988523Z","title":"Out of time: automated lip sync in the wild","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:04.988523Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:37801ea708895c8794875085340ab4e3ad0afa17afc19f934cd991f92846461f","observation_id":"38667ac5-dbeb-451d-8e18-efaa6597b4ef","resolution":{"observed_at":"2026-08-07T12:01:04.988523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00733","last_updated":"2025-03-13T08:23:27Z","snapshot_observed_at":"2026-07-06T19:59:37.692710Z","submitted_at":"2024-12-01T08:54:30Z","title":"Hallo3: Highly Dynamic and Realistic Portrait Image Animation with Video Diffusion Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00733","snapshot_observed_at":"2026-08-07T12:01:05.049606Z","title":"Hallo3: Highly dynamic and realistic portrait image animation with diffusion transformer networks.arXiv preprint arXiv:2412.00733, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:05.049606Z"},"links":{"cited_paper":"/paper/2412.00733","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:5ff69bbcb6e1c7f7bf0c7bc3c60dffeecf6c5585d154d078c957b7870ad9c730","observation_id":"c430a401-a2e7-4075-9517-77f260d9c4df","resolution":{"observed_at":"2026-08-07T12:01:05.049606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:05.131395Z","title":"Adam: A method for stochastic optimization.(No Title), 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:05.131395Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:5a791154b51a2aa97542308e55a80bda546bb53031211f00008f66b8f115afe6","observation_id":"64299477-3f87-489c-8ad7-41a7079f339a","resolution":{"observed_at":"2026-08-07T12:01:05.131395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:05.180625Z","title":"Scaling rectified flow transform- ers for high-resolution image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:05.180625Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:15089c791fb48cbf9983c8df54ee5213c7372cc75d9077024f8680ee4f443e69","observation_id":"a9673042-2025-4f01-b54d-8f8ab5cee2ef","resolution":{"observed_at":"2026-08-07T12:01:05.180625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:05.262820Z","title":"Motioncharacter: Identity- preserving and motion controllable human video generation.arXiv preprint arXiv:2411.18281, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:05.262820Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:69749ded73d2482c765455e3aedd3bcc0835d70fbc33cf0cef3c127396971fab","observation_id":"5292dd83-0062-4f74-ad13-1b1c5d45a7cb","resolution":{"observed_at":"2026-08-07T12:01:05.262820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07719","last_updated":"2024-07-02T09:03:26Z","snapshot_observed_at":"2026-07-06T18:13:29.693360Z","submitted_at":"2024-05-13T13:08:02Z","title":"USP: A Unified Sequence Parallelism Approach for Long Context Generative AI","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07719","snapshot_observed_at":"2026-08-07T12:01:05.332091Z","title":"A unified sequence parallelism approach for long context generative ai.arXiv preprint arXiv:2405.07719, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:05.332091Z"},"links":{"cited_paper":"/paper/2405.07719","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:3691cf3010e3c20705608f076e2435c7a66543a2dda34c420da87c9f5874fcfa","observation_id":"a7a0ba40-9daf-45c9-82b3-89ca956fac7d","resolution":{"observed_at":"2026-08-07T12:01:05.332091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05608","last_updated":"2024-03-28T08:28:44Z","snapshot_observed_at":"2026-07-06T17:27:24.955378Z","submitted_at":"2024-02-08T12:08:42Z","title":"Scalable Diffusion Models with State Space Backbone","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05608","snapshot_observed_at":"2026-08-07T12:01:05.394751Z","title":"Scalable diffusion models with state space backbone.arXiv preprint arXiv:2402.05608, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:05.394751Z"},"links":{"cited_paper":"/paper/2402.05608","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:ae45e961790bc01caf6029f55baa2efb34d486d09a47ddfb7f2eee4512bfc815","observation_id":"4a16b846-7325-46de-8529-136300117e68","resolution":{"observed_at":"2026-08-07T12:01:05.394751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04478","last_updated":"2024-04-06T02:54:35Z","snapshot_observed_at":"2026-08-07T08:36:52.565708Z","submitted_at":"2024-04-06T02:54:35Z","title":"Diffusion-RWKV: Scaling RWKV-Like Architectures for Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04478","snapshot_observed_at":"2026-08-07T12:01:05.470046Z","title":"Diffusion-rwkv: Scaling rwkv-like architectures for diffusion models.arXiv preprint arXiv:2404.04478, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:05.470046Z"},"links":{"cited_paper":"/paper/2404.04478","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:738d35dce54cf181122e5bdf8c858c3ea2e676273ee77ac7255f0f3da6003469","observation_id":"e3b93b7c-1e8c-476d-8216-53b62b7e32aa","resolution":{"observed_at":"2026-08-07T12:01:05.470046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02436","last_updated":"2025-04-03T09:50:50Z","snapshot_observed_at":"2026-08-07T16:12:03.138083Z","submitted_at":"2025-04-03T09:50:50Z","title":"SkyReels-A2: Compose Anything in Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02436","snapshot_observed_at":"2026-08-07T12:01:05.579680Z","title":"Skyreels-a2: Compose anything in video diffusion transform- ers.arXiv preprint arXiv:2504.02436, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:05.579680Z"},"links":{"cited_paper":"/paper/2504.02436","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:41723f7efd4a472dbc0e1177af6b91e276e18145147935abbae1144cab3a55ee","observation_id":"ab65c0ea-f8a6-4c34-b126-694ca2bb456c","resolution":{"observed_at":"2026-08-07T12:01:05.579680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01790","last_updated":"2025-03-18T10:47:27Z","snapshot_observed_at":"2026-07-06T20:16:09.014564Z","submitted_at":"2025-01-03T12:45:22Z","title":"Ingredients: Blending Custom Photos with Video Diffusion Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01790","snapshot_observed_at":"2026-08-07T12:01:05.662040Z","title":"Ingredients: Blending custom photos with video diffusion transformers.arXiv preprint arXiv:2501.01790, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:05.662040Z"},"links":{"cited_paper":"/paper/2501.01790","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:1d4bea2fd5c12d74547685920111345b5395537d8978f6545ba1823e5f38f963","observation_id":"297cb0a0-1f64-46ef-a439-4906f905835b","resolution":{"observed_at":"2026-08-07T12:01:05.662040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:05.733194Z","title":"Generative adversarial networks.Communications of the ACM, 63(11):139–144, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:05.733194Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:45ff47c2994da5c9d6130d8250fe99720f671561b8dbb3ab206106e7eb1b1aa0","observation_id":"b804ddc7-a3e7-4ade-96e2-4494385e97c7","resolution":{"observed_at":"2026-08-07T12:01:05.733194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:14.912822Z","title":"Stylesync: High-fidelity generalized and personalized lip sync in style-based generator","venue":null,"work_id":"7e8a4e4a-dea4-497c-a7d5-be5e57c09f1c","year":2023},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:05.836728Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:8caf2ce58823290fb119c41c02a8a4434f9009e1a6f66c962b80bab253c5b2bb","observation_id":"e19b237a-6533-420b-9d9b-0649773bb5ee","resolution":{"observed_at":"2026-08-07T12:01:14.966252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-07-06T15:52:13.602170Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-07T12:01:05.900408Z","title":"Animatediff: Animate your personalized text-to-image diffusion models without specific tuning.arXiv preprint arXiv:2307.04725, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:05.900408Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:002ecd1b305997739c42acf6ac7ecc286620db1771fb9ad9ad7befdb0bc95ed8","observation_id":"d2f9ac78-4775-44dd-8155-7965204d2f2a","resolution":{"observed_at":"2026-08-07T12:01:05.900408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:06.008788Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:06.008788Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:e7a0b978576317dea0a25ba610e6ab56ff93c6cb386b742995b4503be53ccd69","observation_id":"905819a1-f1e7-4e62-b054-d4b53bc336ae","resolution":{"observed_at":"2026-08-07T12:01:06.008788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16331","last_updated":"2025-06-05T11:49:59Z","snapshot_observed_at":"2026-07-06T19:56:30.344759Z","submitted_at":"2024-11-25T12:24:52Z","title":"Sonic: Shifting Focus to Global Audio Perception in Portrait Animation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16331","snapshot_observed_at":"2026-08-07T12:01:06.053086Z","title":"Sonic: Shifting focus to global audio perception in portrait animation.arXiv preprint arXiv:2411.16331, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:06.053086Z"},"links":{"cited_paper":"/paper/2411.16331","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:5f49eaa40a8dab9591d2cc7b848a9f3758a13fb8ba25fbc7093b9291ff966d09","observation_id":"a4796f77-70ec-4dae-b235-7a8b14eb59a0","resolution":{"observed_at":"2026-08-07T12:01:06.053086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:06.134499Z","title":"Audio-driven emotional video portraits","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:06.134499Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:e008f6fc14243f210a3e6d2e855d0daa55eb2b87103c60453f188a6dce95e974","observation_id":"66b01852-f46e-48d8-a37a-77f2ae21e8a8","resolution":{"observed_at":"2026-08-07T12:01:06.134499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02634","last_updated":"2025-04-04T05:13:40Z","snapshot_observed_at":"2026-08-05T07:44:02.175955Z","submitted_at":"2024-09-04T11:55:14Z","title":"Loopy: Taming Audio-Driven Portrait Avatar with Long-Term Motion Dependency","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02634","snapshot_observed_at":"2026-08-07T12:01:06.223848Z","title":"Loopy: Taming audio-driven portrait avatar with long-term motion dependency.arXiv preprint arXiv:2409.02634, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:06.223848Z"},"links":{"cited_paper":"/paper/2409.02634","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:4742641a184405c8d9003eb60fe58b8de395910847deb929c11d1b5cf9a4dad1","observation_id":"e5ab0ec4-5864-45ea-a4f2-1c29fda9eda8","resolution":{"observed_at":"2026-08-07T12:01:06.223848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:14.744529Z","title":"Assessing empathy and managing emotions through interactions with an affective avatar.Health informatics journal, 24(2):182–193, 2018","venue":null,"work_id":"eb0fea9b-dde4-48ca-aac3-51cf08ef39de","year":2018},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:06.343672Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:7954fb969298b8e6abac6681e1834668a7cb26a1431650d3d6d19e5e7072a676","observation_id":"bc4f37c4-a317-4b99-8a35-2d9277195d7b","resolution":{"observed_at":"2026-08-07T12:01:14.818039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:14.596281Z","title":"Educational virtual reality game design for film and animation","venue":null,"work_id":"3c71a459-6cf2-4996-b0f2-6344fe219003","year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:06.410579Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:f7de234f4448f459a27ade0db42d7e05b33781243e694016e787808938fc7926","observation_id":"0413af8e-d553-412d-bdd7-1a50bdef7b88","resolution":{"observed_at":"2026-08-07T12:01:14.669546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:06.487818Z","title":"3d gaussian splatting for real-time radiance field rendering.ACM Trans","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:06.487818Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:ac36e85105a03834103b22146c03777ea49d012394e9227d84892ce13c4e626d","observation_id":"f5c80228-bd0d-453a-ae91-4cb97050f5f4","resolution":{"observed_at":"2026-08-07T12:01:06.487818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-07T12:01:06.530018Z","title":"Auto-encoding variational bayes.arXiv preprint arXiv:1312.6114, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:06.530018Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:8acbf988752c0083d7ccc35637dc4b5c7fdc73fdb1fe84f20c7a36423186d7aa","observation_id":"d26bead3-9f11-4848-96f9-3026309ff20f","resolution":{"observed_at":"2026-08-07T12:01:06.530018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-07T12:01:06.596226Z","title":"Hunyuanvideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:06.596226Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:b44b9c9bda3aa659dce0c9f9e82e1c545b158a86c72a7b4d90345fcb081c823e","observation_id":"ddb1a76e-3e1e-411e-afe9-2ac66e000fd0","resolution":{"observed_at":"2026-08-07T12:01:06.596226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-08-07T20:59:22.905615Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-08-07T12:01:06.693590Z","title":"Latentsync: Audio conditioned latent diffusion models for lip sync.arXiv preprint arXiv:2412.09262, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:06.693590Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:ca2a9e9f163808006da41b609f2ce4897fa0622d008659811a82b8fda98335e1","observation_id":"b0ba2e37-e88a-4c9f-adc8-9341d5a5b77a","resolution":{"observed_at":"2026-08-07T12:01:06.693590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:14.437833Z","title":"Ae- nerf: Audio enhanced neural radiance field for few shot talking head synthesis","venue":null,"work_id":"fa643cfa-7262-4b27-b2b1-1e6c41853e80","year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:06.754688Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:8bd39cb97a2b19e8bd5431b6ab18c86b42dac519d2a7a9117f419e21a027b644","observation_id":"bfcec5b4-063a-40e0-8512-198b8c24f05c","resolution":{"observed_at":"2026-08-07T12:01:14.546838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00115","last_updated":"2025-01-04T06:16:56Z","snapshot_observed_at":"2026-07-06T19:59:11.046948Z","submitted_at":"2024-11-28T07:01:06Z","title":"OpenHumanVid: A Large-Scale High-Quality Dataset for Enhancing Human-Centric Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00115","snapshot_observed_at":"2026-08-07T12:01:06.821951Z","title":"Openhumanvid: A large-scale high-quality dataset for enhancing human-centric video generation.arXiv preprint arXiv:2412.00115, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:06.821951Z"},"links":{"cited_paper":"/paper/2412.00115","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:f3582a1fac33bd5e8c90e42aefe493e6346c3215a6f80b3d872b5b18949dc2cc","observation_id":"c73b9690-e4ec-40d0-9335-48afd3d47c78","resolution":{"observed_at":"2026-08-07T12:01:06.821951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15264","last_updated":"2024-07-05T04:09:46Z","snapshot_observed_at":"2026-07-06T18:04:30.291363Z","submitted_at":"2024-04-23T17:55:07Z","title":"TalkingGaussian: Structure-Persistent 3D Talking Head Synthesis via Gaussian Splatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.15264","snapshot_observed_at":"2026-08-07T12:01:06.890022Z","title":"Talkinggaus- sian: Structure-persistent 3d talking head synthesis via gaussian splatting.arXiv preprint arXiv:2404.15264, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:06.890022Z"},"links":{"cited_paper":"/paper/2404.15264","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:0d8dd2599883afd529ec6de613cf1fd7f8ff1a42cc1f532889a47ca3d5fba4be","observation_id":"e7811ccb-b8bc-4c31-9af8-acce66108131","resolution":{"observed_at":"2026-08-07T12:01:06.890022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:06.956820Z","title":"Learning a model of facial shape and expression from 4d scans.ACM Trans","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:06.956820Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:471b701916318fbd5add0327c9465f22f446aadf775a936d40f00fe9f06f2277","observation_id":"1b47b76c-b73d-4402-87bb-2eea3da8d6cf","resolution":{"observed_at":"2026-08-07T12:01:06.956820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:14.283795Z","title":"Omnihuman-1: Rethinking the scaling-up of one-stage conditioned human animation models, 2025","venue":null,"work_id":"1f8e716e-6861-4fc1-96fe-312323bbf55c","year":2025},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:07.042283Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:7096cc58c2f4955d201a8940477eaa7c0895a6789171e5cd8dce11b0d558df4f","observation_id":"14975a58-5155-44b6-901d-3338eb87cc2e","resolution":{"observed_at":"2026-08-07T12:01:14.360029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-07T12:01:07.094496Z","title":"Flow matching for generative modeling.arXiv preprint arXiv:2210.02747, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:07.094496Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:739e9606a813f13c709acf35dd2781048057a8a9e3990674ff8b1e761de55a26","observation_id":"fe03e516-e660-49f5-b0ab-28728adcb9ac","resolution":{"observed_at":"2026-08-07T12:01:07.094496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19108","last_updated":"2025-03-18T04:49:23Z","snapshot_observed_at":"2026-07-06T19:58:31.184255Z","submitted_at":"2024-11-28T12:50:05Z","title":"Timestep Embedding Tells: It's Time to Cache for Video Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19108","snapshot_observed_at":"2026-08-07T12:01:07.173781Z","title":"Timestep embedding tells: It’s time to cache for video diffusion model.arXiv preprint arXiv:2411.19108, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:07.173781Z"},"links":{"cited_paper":"/paper/2411.19108","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:b6e8fb36d7328365d214ec96947fe5cdc3b879253e14a084ad77b51c1186411f","observation_id":"800eea90-808a-45e7-b61e-bcd224ae6bfd","resolution":{"observed_at":"2026-08-07T12:01:07.173781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:14.077970Z","title":"Moda: Mapping-once audio- driven portrait animation with dual attentions","venue":null,"work_id":"ea80b366-dcbf-4e95-a16a-bbdbeb8fe343","year":2023},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:07.249929Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:741e22a5d833060f5cfafc88460dd78bb7d3fefdc8498de687db6847e0f7bb78","observation_id":"3a80e1e8-b2fc-4b43-aa6f-13d79eb19bff","resolution":{"observed_at":"2026-08-07T12:01:14.190565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:13.836702Z","title":"Live speech portraits: real-time photorealistic talking-head animation.ACM Transactions on Graphics (ToG), 40(6):1–17, 2021","venue":null,"work_id":"ee33e9fe-17aa-48f1-b58e-aa576b50805b","year":2021},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:07.331183Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:a35ec168cbcfd1d44a7735b20a94519a9195b587e51eb2af597b5f644659d2d4","observation_id":"74a95d57-eb40-48c1-8976-88b356343155","resolution":{"observed_at":"2026-08-07T12:01:13.952818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:13.579307Z","title":"Pixel codec avatars","venue":null,"work_id":"60c750b0-f5bc-43db-8a6a-009422840fa9","year":2021},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:07.418254Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:08d5a0f1c0f980f77a03fc81c76287d2b78a6f62ee1afe8c26286834e28c7e6d","observation_id":"df620f67-8d1b-4205-98dc-3ddcfe928ae3","resolution":{"observed_at":"2026-08-07T12:01:13.722317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:13.364652Z","title":"Styletalk: One-shot talking head generation with controllable speaking styles","venue":null,"work_id":"218e23c7-c68b-42a9-ad8e-6d9b6a511107","year":1904},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:07.475665Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:35f57d648eae07bd3c2ed37c7fe1b14773a51d210e0fbb7693c6edc89cf5a71c","observation_id":"7cbe88cb-eafd-47a0-82a9-be069f4087ca","resolution":{"observed_at":"2026-08-07T12:01:13.445427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09767","last_updated":"2024-08-10T09:37:55Z","snapshot_observed_at":"2026-07-06T17:02:37.841641Z","submitted_at":"2023-12-15T13:15:42Z","title":"DreamTalk: When Emotional Talking Head Generation Meets Diffusion Probabilistic Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09767","snapshot_observed_at":"2026-08-07T12:01:07.552280Z","title":"Dreamtalk: When expressive talking head generation meets diffusion probabilistic models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:07.552280Z"},"links":{"cited_paper":"/paper/2312.09767","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:5bd74ff882772aabdb384ce915985e358eb4338a72258d1dc6cd6f479abd574d","observation_id":"5b524bad-e05e-4c5b-82cf-4f52c311a11b","resolution":{"observed_at":"2026-08-07T12:01:07.552280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:07.669803Z","title":"Nerf: Representing scenes as neural radiance fields for view synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:07.669803Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:0ccc4b049fb6f176b13f430ea89c8445d21fa92dbfc1ee049fdddb5653720b75","observation_id":"b491905f-e470-4cb2-a8d4-ab33c83b2819","resolution":{"observed_at":"2026-08-07T12:01:07.669803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:13.123843Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":"3ca15927-9752-4d80-abac-c29067b235c6","year":2023},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:07.720769Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:bd61cd736672a9c3784d22a8601aceef0e2887340affe4835d75e14b8c820c53","observation_id":"89d54c32-20a1-4d3f-8165-98039b15531d","resolution":{"observed_at":"2026-08-07T12:01:13.233371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:12.978955Z","title":"Synctalk: The devil is in the synchronization for talking head synthesis","venue":null,"work_id":"8eb2c994-408f-4c35-b4c7-51b16a46400c","year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:07.764696Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:79cf1635988eea8c01a88b35170c98de92572a7341f89414bb9e78456d391de1","observation_id":"038adc5b-50c4-4171-a42a-02f6a61dfaf7","resolution":{"observed_at":"2026-08-07T12:01:13.042259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:12.790225Z","title":"Emotalk: Speech-driven emotional disentanglement for 3d face animation","venue":null,"work_id":"03dc4847-d32c-4b5e-9c6f-df12e363fbf1","year":2023},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:07.812253Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:1366cadc6bee3ac4799f454de56ffab80af4448d74e1d9c387a52da00dbed83a","observation_id":"47f55df0-4e7f-40be-b0c3-5216353557df","resolution":{"observed_at":"2026-08-07T12:01:12.895509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-07T12:01:07.866515Z","title":"Movie gen: A cast of media foundation models.arXiv preprint arXiv:2410.13720, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:07.866515Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:7cb9693f8b8634ff0c771a75dfce6c597e21d58f3b1acce09684b7d53cc61455","observation_id":"16317c3c-7c29-483a-ab92-48d8f5d94aa1","resolution":{"observed_at":"2026-08-07T12:01:07.866515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20974","last_updated":"2025-01-13T05:06:17Z","snapshot_observed_at":"2026-07-06T19:40:44.012201Z","submitted_at":"2024-10-28T12:46:05Z","title":"MovieCharacter: A Tuning-Free Framework for Controllable Character Video Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20974","snapshot_observed_at":"2026-08-07T12:01:07.916907Z","title":"Moviecharacter: A tuning-free framework for controllable character video synthesis.arXiv preprint arXiv:2410.20974, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:07.916907Z"},"links":{"cited_paper":"/paper/2410.20974","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:d96724315f4bb1021bcfba64440beb0a9e317a811d5569d3f9c1aa961dd1187b","observation_id":"480e6963-8300-4990-b826-fe3a48def1ac","resolution":{"observed_at":"2026-08-07T12:01:07.916907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10841","last_updated":"2025-02-15T16:08:40Z","snapshot_observed_at":"2026-08-07T18:15:43.122539Z","submitted_at":"2025-02-15T16:08:40Z","title":"SkyReels-A1: Expressive Portrait Animation in Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10841","snapshot_observed_at":"2026-08-07T12:01:07.948041Z","title":"Skyreels-a1: Expressive portrait animation in video diffusion transformers.arXiv preprint arXiv:2502.10841, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:07.948041Z"},"links":{"cited_paper":"/paper/2502.10841","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:213de0f36e20103e0d911651e88128b3109b51c8ab3df50a58c79719898dbf00","observation_id":"8697d019-ad12-4a05-8c31-75557fe4b10d","resolution":{"observed_at":"2026-08-07T12:01:07.948041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:08.022078Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:08.022078Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:69331db94576168e58a5cab6b1e1a87a70816d1195ec3273119ad06a3d4edd8e","observation_id":"564fe11f-0334-4575-9643-06fef90f614d","resolution":{"observed_at":"2026-08-07T12:01:08.022078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:12.566526Z","title":"What role can avatars play in e-mental health interventions? exploring new models of client–therapist interaction.Frontiers in Psychiatry, 7:186, 2016","venue":null,"work_id":"3b80121a-d37d-41e8-9111-9e03756c7107","year":2016},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:08.066203Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:8afc91836a95e4f3fb24f9841c1b0d2c3b354feb1a11611a7ebe03dd0a3c5b71","observation_id":"67cddcfa-9b75-43f7-81b9-640aa62b749e","resolution":{"observed_at":"2026-08-07T12:01:12.658036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:08.118208Z","title":"High- resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:08.118208Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:71560f1d14558b6c433571cfd82169a8323c8bea3716984cceeeaa237870093c","observation_id":"83bc4b14-d6cc-472d-932e-9acd5622bbec","resolution":{"observed_at":"2026-08-07T12:01:08.118208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:12.271318Z","title":"Audio-driven dubbing for user generated contents via style-aware semi-parametric synthesis.IEEE Transactions on Circuits and Systems for Video Technology, 33(3):1247–1261, 2022","venue":null,"work_id":"a60fccb8-651b-429c-ad03-e7bc97686e33","year":2022},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:08.178368Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:f0a54d86df3e08d9fa3f770dd7ade08cb7966649a48c4789ba4ca9d8b225dd4f","observation_id":"4e4907f8-4b5e-4997-9001-5d198d5a6821","resolution":{"observed_at":"2026-08-07T12:01:12.413991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05577","last_updated":"2024-07-08T03:17:10Z","snapshot_observed_at":"2026-07-06T18:42:43.011995Z","submitted_at":"2024-07-08T03:17:10Z","title":"Audio-driven High-resolution Seamless Talking Head Video Editing via StyleGAN","version":1},"cited_work":{"arxiv_id":"2407.05577","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.05577","snapshot_observed_at":"2026-08-07T12:01:10.070915Z","title":"Audio-driven High-resolution Seamless Talking Head Video Editing via StyleGAN","venue":"cs.CV","work_id":"43f87724-3917-4af0-9280-77a12918b013","year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:08.213996Z"},"links":{"cited_paper":"/paper/2407.05577","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:d1430eacf45ac67b264c8a7719c9ed9d8fc8ac91c92a38ada96ff7cbbaa52e8a","observation_id":"35f01443-daac-45b5-8b08-a7dc58d68c7f","resolution":{"observed_at":"2026-08-07T12:01:10.171923Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:08.261036Z","title":"Roformer: Enhanced transformer with rotary position embedding.Neurocomputing, 568:127063, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:08.261036Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:ba9e405329a21ded3d25c7cc646d59375b3e961a6c177d1668b62226b5418c47","observation_id":"64137b0e-2f89-4712-8445-429e7625541b","resolution":{"observed_at":"2026-08-07T12:01:08.261036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17485","last_updated":"2024-08-08T03:48:38Z","snapshot_observed_at":"2026-07-06T17:36:11.854303Z","submitted_at":"2024-02-27T13:10:11Z","title":"EMO: Emote Portrait Alive -- Generating Expressive Portrait Videos with Audio2Video Diffusion Model under Weak Conditions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17485","snapshot_observed_at":"2026-08-07T12:01:08.319003Z","title":"Emo: Emote portrait alive-generating expressive portrait videos with audio2video diffusion model under weak conditions.arXiv preprint arXiv:2402.17485, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:08.319003Z"},"links":{"cited_paper":"/paper/2402.17485","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:1cf7354289fdd7ed83fef0659da68ffc82aebb3e8b9524b59328e8550ba0707b","observation_id":"da075765-8bee-4534-a681-bf727410007c","resolution":{"observed_at":"2026-08-07T12:01:08.319003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:11.854758Z","title":"Nonlinear 3d face morphable model","venue":null,"work_id":"948084d3-59aa-41d2-b2ea-c659aaaea4c3","year":2018},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:08.365172Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:d68c20892569a6c9ced08ebd21440aba01dcac835f6d8734b117f74b84c2fde4","observation_id":"506bcbd1-e816-4aa5-b6b7-125fb1d175d8","resolution":{"observed_at":"2026-08-07T12:01:12.052762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:11.544642Z","title":"Fvd: A new metric for video generation","venue":null,"work_id":"9bcd3860-82c4-4c7d-85e1-b41d7784d5cd","year":2019},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:08.427473Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:466e870e45ce47426cb98cc348c5ad1754fd2a092806a3cc34b9b4cf4463583e","observation_id":"2d1ebd9a-f3b2-4fd0-abeb-7ed6dcd73987","resolution":{"observed_at":"2026-08-07T12:01:11.720900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-07T12:01:08.462691Z","title":"Wan: Open and advanced large-scale video generative models.arXiv preprint arXiv:2503.20314, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:08.462691Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:ad3c3ee15c2a5cdeca7f8eac18359bdefa4757194fe527ad63be012aa6395d98","observation_id":"789024b5-367d-4b6b-ac4d-5409abc2e1e7","resolution":{"observed_at":"2026-08-07T12:01:08.462691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02511","last_updated":"2024-06-04T17:32:52Z","snapshot_observed_at":"2026-07-06T18:25:18.469656Z","submitted_at":"2024-06-04T17:32:52Z","title":"V-Express: Conditional Dropout for Progressive Training of Portrait Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02511","snapshot_observed_at":"2026-08-07T12:01:08.482037Z","title":"V-express: Conditional dropout for progressive training of portrait video generation.arXiv preprint arXiv:2406.02511, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:08.482037Z"},"links":{"cited_paper":"/paper/2406.02511","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:e5db955795856c81195432101396b380ba8b6d1bf77b065ecd19b56442cffa08","observation_id":"d072b7de-f82f-4ae4-b929-62e7ced42bc0","resolution":{"observed_at":"2026-08-07T12:01:08.482037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:11.190543Z","title":"Seeing what you said: Talking face generation guided by a lip reading expert","venue":null,"work_id":"8671ba5d-a1f0-44a3-903b-b48bebdb1ab5","year":2023},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:08.513318Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:5bca2842a0308b12620acb808f791464202140e3d6f9a4c0ca7eb2d753d3a220","observation_id":"046874be-8b90-4980-bbf8-202b867cb7a3","resolution":{"observed_at":"2026-08-07T12:01:11.391506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04842","last_updated":"2025-04-07T08:56:01Z","snapshot_observed_at":"2026-08-07T16:08:04.554747Z","submitted_at":"2025-04-07T08:56:01Z","title":"FantasyTalking: Realistic Talking Portrait Generation via Coherent Motion Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04842","snapshot_observed_at":"2026-08-07T12:01:08.579080Z","title":"Fantasytalking: Realistic talking portrait generation via coherent motion synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:08.579080Z"},"links":{"cited_paper":"/paper/2504.04842","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:965afb7a7240b3601f6c8b9124047504df9aa31aafdb4dfb6eabab9af3ebb1e3","observation_id":"005dad01-d72c-4c8f-a3ec-0c0f2d47335a","resolution":{"observed_at":"2026-08-07T12:01:08.579080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:08.629999Z","title":"One-shot free-view neural talking-head synthesis for video conferencing","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:08.629999Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:a1ce1a91112e3320c2c4263ffc8018d51b971f19edb1fdf306eb5d272698c3d1","observation_id":"45a057ed-6cca-4212-b8c6-a5f4821867dc","resolution":{"observed_at":"2026-08-07T12:01:08.629999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04468","last_updated":"2024-01-09T10:12:52Z","snapshot_observed_at":"2026-08-04T07:28:33.714480Z","submitted_at":"2024-01-09T10:12:52Z","title":"MagicVideo-V2: Multi-Stage High-Aesthetic Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04468","snapshot_observed_at":"2026-08-07T12:01:08.685760Z","title":"Magicvideo-v2: Multi-stage high-aesthetic video generation.arXiv preprint arXiv:2401.04468, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:08.685760Z"},"links":{"cited_paper":"/paper/2401.04468","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:32d76f04a7f24f41bc47296045948a234c76c9f9b8cfbd36c341c4abefb23b43","observation_id":"0465191f-b30f-46b5-aa31-73b4e528087b","resolution":{"observed_at":"2026-08-07T12:01:08.685760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:10.866942Z","title":"Panda: A gigapixel-level human-centric video dataset","venue":null,"work_id":"0498946a-fdaf-4d19-a5ab-d64d1ce2b5e9","year":2020},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:08.738549Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:0ea4918779459a14298b60b1c09632306d0da02a46828504a58824561fcfa1e3","observation_id":"fb09a09f-5380-400b-b2e2-df521df8918a","resolution":{"observed_at":"2026-08-07T12:01:11.058377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-07T20:48:39.175359Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-08-07T12:01:08.767656Z","title":"Aniportrait: Audio-driven synthesis of photore- alistic portrait animation.arXiv preprint arXiv:2403.17694, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:08.767656Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:e1c96ac5ae99277143ab6996791b89035bb5645c4e244c90f5c5580956c5430c","observation_id":"67cedca9-14dc-44f2-b242-aff70eb235b5","resolution":{"observed_at":"2026-08-07T12:01:08.767656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17090","last_updated":"2023-12-28T16:10:25Z","snapshot_observed_at":"2026-08-02T07:14:02.308302Z","submitted_at":"2023-12-28T16:10:25Z","title":"Q-Align: Teaching LMMs for Visual Scoring via Discrete Text-Defined Levels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17090","snapshot_observed_at":"2026-08-07T12:01:08.824060Z","title":"Q-align: Teaching lmms for visual scoring via discrete text-defined levels.arXiv preprint arXiv:2312.17090, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:08.824060Z"},"links":{"cited_paper":"/paper/2312.17090","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:021c3aa5f2a6fed78eee6fb593e862ad312f29cdd6c59fa28d2bc59b450abcdd","observation_id":"b0558abf-a37e-4cfd-bcad-e2474b2d8609","resolution":{"observed_at":"2026-08-07T12:01:08.824060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:08.881537Z","title":"Codetalker: Speech-driven 3d facial animation with discrete motion prior","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:08.881537Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:b51e67dc25eafb63cce76433b63b68fef040a8b3235590ac987ddfe1605468d5","observation_id":"4b103765-461f-4928-83fb-877d4d0092b0","resolution":{"observed_at":"2026-08-07T12:01:08.881537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:08.918756Z","title":"Easyanimate: A high-performance long video generation method based on transformer architecture.arXiv preprint arXiv:2405.18991, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:08.918756Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:41cd5c6c98f994bf67c6af55d0efff59915b619027c179e08e9be8ffa1bea3cc","observation_id":"baffbf9b-c211-4082-9dd4-470662f66343","resolution":{"observed_at":"2026-08-07T12:01:08.918756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14975","last_updated":"2024-08-27T11:31:47Z","snapshot_observed_at":"2026-07-06T19:06:33.176704Z","submitted_at":"2024-08-27T11:31:47Z","title":"MegActor-$\\Sigma$: Unlocking Flexible Mixed-Modal Control in Portrait Animation with Diffusion Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14975","snapshot_observed_at":"2026-08-07T12:01:08.976755Z","title":"Megactor-sigma: Unlocking flexible mixed-modal control in portrait animation with diffusion transformer.arXiv preprint arXiv:2408.14975, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:08.976755Z"},"links":{"cited_paper":"/paper/2408.14975","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:ec943bd3b2055e7982e69486228d56d7c83a202de8332d41bc67ff763df4c601","observation_id":"8d643f5b-4a3d-4e4a-aa01-157731aff9db","resolution":{"observed_at":"2026-08-07T12:01:08.976755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:09.030034Z","title":"Effective whole-body pose estimation with two-stages distillation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:09.030034Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:91cea208f6f0a6726032d9dda744a30a0ab9a4725328688196f128862bb53ef4","observation_id":"23f9d9b7-859d-4575-9660-e8b056d0648d","resolution":{"observed_at":"2026-08-07T12:01:09.030034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-07T12:01:09.064934Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer.arXiv preprint arXiv:2408.06072, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:09.064934Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:400236033002a650736e878d3a254b4de4cafb07455028eb884df79fcb67778c","observation_id":"a472f972-a72d-429c-813d-7718562ddb21","resolution":{"observed_at":"2026-08-07T12:01:09.064934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08503","last_updated":"2024-03-23T06:40:22Z","snapshot_observed_at":"2026-08-07T23:03:26.266685Z","submitted_at":"2024-01-16T17:04:30Z","title":"Real3D-Portrait: One-shot Realistic 3D Talking Portrait Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08503","snapshot_observed_at":"2026-08-07T12:01:09.114112Z","title":"Real3d-portrait: One-shot realistic 3d talking portrait synthesis.arXiv preprint arXiv:2401.08503, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:09.114112Z"},"links":{"cited_paper":"/paper/2401.08503","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:5716253cabdc018d7dcd3402c63d5be4aafbdf200a485d0d6f926c64eae15f19","observation_id":"f7ed62cd-0952-48cc-a2e7-53fa20bc31c0","resolution":{"observed_at":"2026-08-07T12:01:09.114112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05978","last_updated":"2025-03-07T23:21:11Z","snapshot_observed_at":"2026-08-07T17:20:57.588862Z","submitted_at":"2025-03-07T23:21:11Z","title":"MagicInfinite: Generating Infinite Talking Videos with Your Words and Voice","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05978","snapshot_observed_at":"2026-08-07T12:01:09.189058Z","title":"Magicinfinite: Generating infinite talking videos with your words and voice.arXiv preprint arXiv:2503.05978, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:09.189058Z"},"links":{"cited_paper":"/paper/2503.05978","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:e12d75479e7e33d28c4a092190219bd10b0d483b93a2544258def730d763407b","observation_id":"6948a4df-cda3-4398-8093-8a432a7d9b6c","resolution":{"observed_at":"2026-08-07T12:01:09.189058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:09.233037Z","title":"Sadtalker: Learning realistic 3d motion coefficients for stylized audio-driven single image talking face animation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:09.233037Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:88314380efb5669051383eb63776851b599bc0fe32495a7ffc9a8da77fd684eb","observation_id":"b2abdc3d-d2eb-4e01-9ac0-bdbff7effd07","resolution":{"observed_at":"2026-08-07T12:01:09.233037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:01:10.617106Z","title":"Flow-guided one-shot talking face generation with a high-resolution audio-visual dataset","venue":null,"work_id":"5c98e21c-1ffb-42a7-a2d3-42e612186565","year":2021},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:09.303110Z"},"links":{"citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:9c456443a95b20efcd9f9016064b1ac8f25d613f32a8ce8b3ddd036cf7960063","observation_id":"4ebb5b4c-f4f4-439a-8f30-e00783eeb534","resolution":{"observed_at":"2026-08-07T12:01:10.709000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04448","last_updated":"2024-12-05T18:57:26Z","snapshot_observed_at":"2026-07-06T20:02:21.509050Z","submitted_at":"2024-12-05T18:57:26Z","title":"MEMO: Memory-Guided Diffusion for Expressive Talking Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04448","snapshot_observed_at":"2026-08-07T12:01:09.337775Z","title":"Memo: Memory-guided diffusion for expressive talking video generation.arXiv preprint arXiv:2412.04448, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:09.337775Z"},"links":{"cited_paper":"/paper/2412.04448","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:1771875715d83d4ce0bc437ba9b7bf87fc706581cacda058d2f4efd9be8c9468","observation_id":"9c612247-a0e5-44b8-83f3-b9743f5235ed","resolution":{"observed_at":"2026-08-07T12:01:09.337775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01561","last_updated":"2025-02-08T17:46:58Z","snapshot_observed_at":"2026-07-06T18:24:34.736988Z","submitted_at":"2024-06-03T17:44:11Z","title":"Guided Score identity Distillation for Data-Free One-Step Text-to-Image Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01561","snapshot_observed_at":"2026-08-07T12:01:09.387556Z","title":"Long and short guidance in score identity distillation for one-step text-to-image generation.ArXiv 2406.01561, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:09.387556Z"},"links":{"cited_paper":"/paper/2406.01561","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:9ff8e6f0e04dec09e11cb6553183bd1f6aa39fab5293d4b3f271593c6e2570b2","observation_id":"46f733c2-0eb1-4197-9ca4-6e096bada95d","resolution":{"observed_at":"2026-08-07T12:01:09.387556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15458","last_updated":"2024-10-20T17:51:35Z","snapshot_observed_at":"2026-07-06T19:36:41.445591Z","submitted_at":"2024-10-20T17:51:35Z","title":"Allegro: Open the Black Box of Commercial-Level Video Generation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15458","snapshot_observed_at":"2026-08-07T12:01:09.480529Z","title":"Allegro: Open the black box of commercial-level video generation model.arXiv preprint arXiv:2410.15458, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:09.480529Z"},"links":{"cited_paper":"/paper/2410.15458","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:6f08cf9c48b0a9b4d46e3737518016bd739f8134ef58ce0078780425a77b75ba","observation_id":"0f82b039-061e-4c9a-ab90-560cdd0c3a34","resolution":{"observed_at":"2026-08-07T12:01:09.480529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12888","last_updated":"2024-04-19T13:45:14Z","snapshot_observed_at":"2026-07-06T18:02:45.104204Z","submitted_at":"2024-04-19T13:45:14Z","title":"Learn2Talk: 3D Talking Face Learns from 2D Talking Face","version":1},"cited_work":{"arxiv_id":"2404.12888","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.12888","snapshot_observed_at":"2026-08-07T12:01:09.651753Z","title":"Learn2Talk: 3D Talking Face Learns from 2D Talking Face","venue":"cs.CV","work_id":"c1827acf-3c04-4417-b6fa-583ba07f59a7","year":2024},"citing_paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:09.561127Z"},"links":{"cited_paper":"/paper/2404.12888","citing_paper":"/paper/2506.00830"},"observation_digest":"sha256:057434b88bc25fca2f2a660c71921a144c8e64cf216c51340b2bcc27d41e64b3","observation_id":"1b6aa078-8e17-4763-873c-33eaaa507789","resolution":{"observed_at":"2026-08-07T12:01:09.744867Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.00830","last_updated":"2025-06-01T04:27:13Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T20:51:49.766697Z","submitted_at":"2025-06-01T04:27:13Z","title":"SkyReels-Audio: Omni Audio-Conditioned Talking Portraits in Video Diffusion Transformers"},"reference_resolution":{"displayed":83,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":61,"verified_exact":2,"verified_fuzzy":20},"total_outbound_references":83},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 83 of 83 outbound references and 2 inbound Pith citation observations for arXiv:2506.00830."}