{"as_of":"2026-08-09T15:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4188611e47f5c49527c4b2f4341f3ff9c9b1e40877c5c3068c1ab12b8f49a9ad","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T21:24:08.721929Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.08891/citation-record","integrity":"/paper/2508.08891/integrity","json":"/paper/2508.08891/citation-record.json","paper":"/paper/2508.08891"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T21:24:05.359067Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets.arXiv preprint arXiv:2311.15127, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-07T05:22:38.697912Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:05.359067Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:6b1b66b292a0a6c72bda22207eefa0229477a5c7a717abd1e6c102e95274b283","observation_id":"de2bf21f-4036-459e-8002-dcefadac5b4b","resolution":{"observed_at":"2026-08-05T21:24:05.359067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:24:05.426808Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-07T05:22:38.697912Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:05.426808Z"},"links":{"citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:cc1befdc8f9214b19eefe136bbb3b3eb4ad4a4fb9fd2d1b77f3ab895682d8d0d","observation_id":"f01b6fc9-2761-4af7-8c24-c0df7620a36c","resolution":{"observed_at":"2026-08-05T21:24:05.426808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17198","last_updated":"2025-02-24T14:31:20Z","snapshot_observed_at":"2026-08-07T17:53:08.807427Z","submitted_at":"2025-02-24T14:31:20Z","title":"Dimitra: Audio-driven Diffusion model for Expressive Talking Head Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17198","snapshot_observed_at":"2026-08-05T21:24:05.525128Z","title":"Dimitra: Audio-driven dif- fusion model for expressive talking head generation.arXiv preprint arXiv:2502.17198, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-07T05:22:38.697912Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:05.525128Z"},"links":{"cited_paper":"/paper/2502.17198","citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:ab6dd232241a5041c9c2da73ba72dbc57bb0acaf8ba8691e71ed5a8db3a7f99c","observation_id":"66a2cb35-9ef2-4aa1-990f-4f17cadf014f","resolution":{"observed_at":"2026-08-05T21:24:05.525128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07718","last_updated":"2024-10-14T13:35:17Z","snapshot_observed_at":"2026-08-05T03:23:39.587839Z","submitted_at":"2024-10-10T08:34:41Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07718","snapshot_observed_at":"2026-08-05T21:24:05.595256Z","title":"Hallo2: Long-duration and high-resolution audio-driven portrait im- age animation.arXiv preprint arXiv:2410.07718, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-07T05:22:38.697912Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:05.595256Z"},"links":{"cited_paper":"/paper/2410.07718","citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:7165bb1a33d0c56584c97720c03da05b1d2551ddc85b308bb121727b40691396","observation_id":"9d7248bf-9fae-4233-a7e6-de05a57562a0","resolution":{"observed_at":"2026-08-05T21:24:05.595256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00733","last_updated":"2025-03-13T08:23:27Z","snapshot_observed_at":"2026-07-06T19:59:37.692710Z","submitted_at":"2024-12-01T08:54:30Z","title":"Hallo3: Highly Dynamic and Realistic Portrait Image Animation with Video Diffusion Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00733","snapshot_observed_at":"2026-08-05T21:24:05.723175Z","title":"Hallo3: Highly dynamic and realistic portrait image an- imation with diffusion transformer networks.arXiv preprint arXiv:2412.00733, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-07T05:22:38.697912Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:05.723175Z"},"links":{"cited_paper":"/paper/2412.00733","citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:5b7aa3a209bfac44ce27432051cf7d552f32df344bb6298a22997088762658b7","observation_id":"d160ab63-8d60-43af-b7dd-56f2ed06878c","resolution":{"observed_at":"2026-08-05T21:24:05.723175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:24:11.506465Z","title":"Gemini 2.5 pro: Our most intelligent ai model, 2025","venue":null,"work_id":"dc51e5de-bfe7-4800-88fc-b4597865ed4e","year":2025},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-07T05:22:38.697912Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:05.819589Z"},"links":{"citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:0291d21b3922c71dc987387d8097f4367d9c0938d25a42679e9806a1bed55f52","observation_id":"d42da7a8-dbf2-4411-9906-0afc46933a68","resolution":{"observed_at":"2026-08-05T21:24:11.556123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:24:11.340264Z","title":"Stylesync: High-fidelity generalized and personalized lip sync in style-based genera- tor","venue":null,"work_id":"cb8dbb48-0507-4658-8d20-fa87f4a27ac8","year":null},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-07T05:22:38.697912Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:05.908061Z"},"links":{"citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:64994ccc68fdce9614b4375946f1f9a6747a8358ebb9da56b074923e12c3fcc8","observation_id":"dd4d3973-3b7d-4bba-98d6-54fc4a4c9f97","resolution":{"observed_at":"2026-08-05T21:24:11.416785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-07-06T15:52:13.602170Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-05T21:24:06.035484Z","title":"Animatediff: Animate your personalized text- to-image diffusion models without specific tuning.arXiv preprint arXiv:2307.04725, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-07T05:22:38.697912Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:06.035484Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:f1751bb07db149372d7007787abcea9e873b82733df579bc080a8b0b56294431","observation_id":"02cab4ec-693a-4221-b10c-8befa4cd10b2","resolution":{"observed_at":"2026-08-05T21:24:06.035484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:24:06.127789Z","title":"Video dif- fusion models.Advances in Neural Information Processing Systems, 35:8633–8646, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-07T05:22:38.697912Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:06.127789Z"},"links":{"citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:e3070ed561935cebcaa5e6b913db145a95deb5b39fbfb75a440c118b25cb13a6","observation_id":"34596d63-1629-49b9-8b82-950be13908ba","resolution":{"observed_at":"2026-08-05T21:24:06.127789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11251","last_updated":"2025-03-14T10:01:55Z","snapshot_observed_at":"2026-08-09T05:35:15.000362Z","submitted_at":"2025-03-14T10:01:55Z","title":"Step-Video-TI2V Technical Report: A State-of-the-Art Text-Driven Image-to-Video Generation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11251","snapshot_observed_at":"2026-08-05T21:24:06.186484Z","title":"Step-video-ti2v technical re- port: A state-of-the-art text-driven image-to-video genera- tion model.arXiv preprint arXiv:2503.11251, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-07T05:22:38.697912Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:06.186484Z"},"links":{"cited_paper":"/paper/2503.11251","citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:58eeb5365288ab8c0e81fddafb4bd3bedce52889054e059e1f0cb02620f6c039","observation_id":"5fa83f4b-3bcc-4a19-bffc-ba006d6dbe76","resolution":{"observed_at":"2026-08-05T21:24:06.186484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:24:11.164628Z","title":"The accu- racy of psnr in predicting video quality for different video scenes and frame rates.Telecommunication systems, 49:35– 48, 2012","venue":null,"work_id":"e041ac89-3c65-48ee-903a-366bef5e9708","year":2012},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-07T05:22:38.697912Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:06.279489Z"},"links":{"citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:6529a0c36c307efff6609fcdbb65b2f01055187f47dfd2f0d7d9d6d372577753","observation_id":"6471fbcf-7a4d-4bf6-921e-b3a5270daf23","resolution":{"observed_at":"2026-08-05T21:24:11.226142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16331","last_updated":"2025-06-05T11:49:59Z","snapshot_observed_at":"2026-07-06T19:56:30.344759Z","submitted_at":"2024-11-25T12:24:52Z","title":"Sonic: Shifting Focus to Global Audio Perception in Portrait Animation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16331","snapshot_observed_at":"2026-08-05T21:24:06.340492Z","title":"Sonic: Shifting focus to global audio perception in portrait animation.arXiv preprint arXiv:2411.16331, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-07T05:22:38.697912Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:06.340492Z"},"links":{"cited_paper":"/paper/2411.16331","citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:2cbd2520a666c44343e29977326c130fc91d2ac0fcf0216778e99e58013ff9b0","observation_id":"e54293de-0b29-48d9-924f-b7446fb7133d","resolution":{"observed_at":"2026-08-05T21:24:06.340492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02634","last_updated":"2025-04-04T05:13:40Z","snapshot_observed_at":"2026-08-05T07:44:02.175955Z","submitted_at":"2024-09-04T11:55:14Z","title":"Loopy: Taming Audio-Driven Portrait Avatar with Long-Term Motion Dependency","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02634","snapshot_observed_at":"2026-08-05T21:24:06.431313Z","title":"Loopy: Taming audio-driven portrait avatar with long-term motion dependency.arXiv preprint arXiv:2409.02634, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-07T05:22:38.697912Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:06.431313Z"},"links":{"cited_paper":"/paper/2409.02634","citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:b86253e6bc6fe3e19dec4a4a942d495d8b6065ebe1daccf30e419c35fef2644b","observation_id":"80926fae-08ce-4f87-9008-0757494756b5","resolution":{"observed_at":"2026-08-05T21:24:06.431313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:24:10.953696Z","title":"Musiq: Multi-scale image quality transformer","venue":null,"work_id":"69766f49-85d6-4980-80bb-bbde5b1fd652","year":2021},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-07T05:22:38.697912Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:06.551175Z"},"links":{"citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:6b115c88b691c6d8c537f76d0e0b9031c589b63906815dbed391fee0156dc9ff","observation_id":"893ea3b1-3f2f-4b33-880b-bca847ba4a81","resolution":{"observed_at":"2026-08-05T21:24:11.048008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-05T21:24:06.688755Z","title":"Hunyuanvideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-07T05:22:38.697912Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:06.688755Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:a71e3236b1b80cdaba03f37ad6b128912c31daa8df01e2d5eb37d2853af9a9c9","observation_id":"994d9fab-d6d1-4b4d-8c98-01ac622ec4b9","resolution":{"observed_at":"2026-08-05T21:24:06.688755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:24:10.789361Z","title":"Luma ray 2 video model.https : / / lumalabs.ai/ray","venue":null,"work_id":"01ae36a1-e32b-4b78-acde-94198e0dfaa9","year":2025},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-07T05:22:38.697912Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:06.807169Z"},"links":{"citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:70841b11745a33d827c043a9980415533828dceeb3ee96a94d738509209d8815","observation_id":"27d6c694-364a-4966-928b-b35d9c2e7396","resolution":{"observed_at":"2026-08-05T21:24:10.854778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:24:10.615893Z","title":"Laion aesthetic predictor.https : / / github.com/LAION-AI/aesthetic-predictor,","venue":null,"work_id":"9194311b-8e28-4727-a3f0-d98cfdacfa41","year":null},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-07T05:22:38.697912Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:06.887819Z"},"links":{"citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:d65ad56ef5277fb62f5dd2a71becda47d48932aea8ec81b119cccbaf24e640b5","observation_id":"8bcc75af-195b-48d1-bd86-58844b0ad169","resolution":{"observed_at":"2026-08-05T21:24:10.700967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-08-07T20:59:22.905615Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-08-05T21:24:07.088948Z","title":"Latentsync: Au- dio conditioned latent diffusion models for lip sync.arXiv preprint arXiv:2412.09262, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-07T05:22:38.697912Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:07.088948Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:dfe33f4ae2c468d1b9812d7a23660816f154b873119fb29f4ed4be964859da86","observation_id":"98cb3211-2ac2-4a1d-8998-c10475b07b4b","resolution":{"observed_at":"2026-08-05T21:24:07.088948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00398","last_updated":"2023-09-07T08:11:01Z","snapshot_observed_at":"2026-07-06T16:13:15.274672Z","submitted_at":"2023-09-01T11:14:43Z","title":"VideoGen: A Reference-Guided Latent Diffusion Approach for High Definition Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00398","snapshot_observed_at":"2026-08-05T21:24:07.155337Z","title":"Videogen: A reference-guided latent diffusion ap- proach for high definition text-to-video generation.arXiv preprint arXiv:2309.00398, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-07T05:22:38.697912Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:07.155337Z"},"links":{"cited_paper":"/paper/2309.00398","citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:71d69ea377121747ee41415e5efaad5613c53e9d3194876440da21986b6bfb9a","observation_id":"57901d56-65ea-4a19-9d9f-23e6f2a6ce66","resolution":{"observed_at":"2026-08-05T21:24:07.155337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:24:10.267309Z","title":"Amt: All-pairs multi-field transforms for efficient frame interpolation","venue":null,"work_id":"4d905cf5-1ffc-466a-9bc9-a77a65deed28","year":2023},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-07T05:22:38.697912Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:07.257087Z"},"links":{"citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:eb4c2e8ad5bf3dc9e6ec8c9f639112bb93c912baad060692dab5550c0c48821e","observation_id":"57d2b5d0-0628-4f84-b681-3eafd24e774d","resolution":{"observed_at":"2026-08-05T21:24:10.374361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:24:07.313868Z","title":"Echomimicv2: Towards striking, simplified, and semi-body human animation.arXiv preprint arXiv:2411.10061, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-07T05:22:38.697912Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:07.313868Z"},"links":{"citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:15eddd3d83d0daa1a7a525d8f2f12982591c72c5db4e0a187ae79d601890e29c","observation_id":"8685b4a7-33cc-4bf9-98ef-1e5cffc6b000","resolution":{"observed_at":"2026-08-05T21:24:07.313868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.10922","last_updated":"2024-03-15T08:48:04Z","snapshot_observed_at":"2026-07-06T13:44:37.384708Z","submitted_at":"2022-08-23T12:49:01Z","title":"StyleTalker: One-shot Style-based Audio-driven Talking Head Video Generation","version":2},"cited_work":{"arxiv_id":"2208.10922","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.10922","snapshot_observed_at":"2026-08-05T21:24:09.304578Z","title":"StyleTalker: One-shot Style-based Audio-driven Talking Head Video Generation","venue":"cs.CV","work_id":"930c6515-2df9-43c1-8fd1-d84decc080d0","year":2022},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-07T05:22:38.697912Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:07.379667Z"},"links":{"cited_paper":"/paper/2208.10922","citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:8924e6d790d8d79b8a16d4997761b1f12f84024c8efad8c5a684ea8ff976f46e","observation_id":"c88e2b08-679f-473c-a951-557d39ae9b46","resolution":{"observed_at":"2026-08-05T21:24:09.334830Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09642","last_updated":"2026-03-02T11:31:23Z","snapshot_observed_at":"2026-08-02T11:33:41.662779Z","submitted_at":"2025-03-12T05:00:07Z","title":"Open-Sora 2.0: Training a Commercial-Level Video Generation Model in $200k","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09642","snapshot_observed_at":"2026-08-05T21:24:07.462449Z","title":"Open-sora 2.0: Train- ing a commercial-level video generation model in $200k","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-07T05:22:38.697912Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:07.462449Z"},"links":{"cited_paper":"/paper/2503.09642","citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:b5ec75907939cb4ec27e444a20c4fc714e3f61067284676564ca2f88427bce7a","observation_id":"9da70060-4f55-40ab-a22f-0f3d457aee67","resolution":{"observed_at":"2026-08-05T21:24:07.462449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:24:10.051363Z","title":"A lip sync expert is all you need for speech to lip generation in the wild","venue":null,"work_id":"3808144f-90d0-4d9d-bfd0-c7268d40a51d","year":2020},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-07T05:22:38.697912Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:07.587910Z"},"links":{"citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:350e64c21609d70c142211d87b3dcfd09e857fa8e95143015e7b927ae468d509","observation_id":"b7948f18-721e-4235-828d-3ad5a26b8791","resolution":{"observed_at":"2026-08-05T21:24:10.148523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08714","last_updated":"2025-07-27T04:08:12Z","snapshot_observed_at":"2026-08-07T17:17:37.868071Z","submitted_at":"2025-03-10T08:38:25Z","title":"Versatile Multimodal Controls for Expressive Talking Human Animation","version":4},"cited_work":{"arxiv_id":"2503.08714","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.08714","snapshot_observed_at":"2026-08-05T21:24:09.120511Z","title":"Versatile Multimodal Controls for Expressive Talking Human Animation","venue":"cs.CV","work_id":"3a4caa75-a7e2-4145-8b3e-fbfe19f61800","year":2025},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-07T05:22:38.697912Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:07.672135Z"},"links":{"cited_paper":"/paper/2503.08714","citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:601d18ba47d4ec056e65c6a94cd8a546b1ec5d853a8670ec2b9fa4057afe41bd","observation_id":"67dfffa3-33ec-4b33-a529-05935706537a","resolution":{"observed_at":"2026-08-05T21:24:09.176859Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10841","last_updated":"2025-02-15T16:08:40Z","snapshot_observed_at":"2026-08-07T18:15:43.122539Z","submitted_at":"2025-02-15T16:08:40Z","title":"SkyReels-A1: Expressive Portrait Animation in Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10841","snapshot_observed_at":"2026-08-05T21:24:07.747573Z","title":"Skyreels-a1: Expressive portrait animation in video diffusion transform- ers.arXiv preprint arXiv:2502.10841, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-07T05:22:38.697912Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:07.747573Z"},"links":{"cited_paper":"/paper/2502.10841","citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:326b21eb8c2a66dc0e837f6a03da75d776e351f0d9639dd893489b0045b98b90","observation_id":"5101bf6c-1045-4805-b9a0-3fa55900749e","resolution":{"observed_at":"2026-08-05T21:24:07.747573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:24:07.813333Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-07T05:22:38.697912Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:07.813333Z"},"links":{"citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:a94c23730bbee6318803814f73c85d737add785b4837e42b5309b641929be9c5","observation_id":"8f735ff8-6cea-431c-bd36-ad67c6eb923c","resolution":{"observed_at":"2026-08-05T21:24:07.813333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-05T21:24:07.908609Z","title":"Make-a-video: Text-to-video generation without text-video data.arXiv preprint arXiv:2209.14792,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-07T05:22:38.697912Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:07.908609Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:bb8e9e1578583e1952eeecfe1cfef8b4cd1ee5f6e9cde140abe6fb5f5eafbbf9","observation_id":"aeca28fe-9986-42bb-a0a5-5681bdb3fc2b","resolution":{"observed_at":"2026-08-05T21:24:07.908609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:24:09.855908Z","title":"Diffused heads: Diffusion models beat gans on talking-face genera- tion","venue":null,"work_id":"2ea6b4ab-baaa-4617-ab27-e83f9a81519c","year":2024},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-07T05:22:38.697912Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:07.986728Z"},"links":{"citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:f86520e567f7e31b2e3685c04c52b42e3608dc34f985ddcd056d11ca7cdb75e9","observation_id":"cd24ca58-02cc-4f59-afc6-e10a8b08301d","resolution":{"observed_at":"2026-08-05T21:24:09.922883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:24:08.082383Z","title":"Raft: Recurrent all-pairs field transforms for optical flow","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-07T05:22:38.697912Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:08.082383Z"},"links":{"citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:9a1d103eb66c0f318891275ef7741944687172bbab8f8bc0c35c3382424edcc4","observation_id":"5a0d1fb3-327d-4405-8d2e-8cd94feae4db","resolution":{"observed_at":"2026-08-05T21:24:08.082383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17697","last_updated":"2024-11-27T07:39:20Z","snapshot_observed_at":"2026-08-06T12:03:20.133598Z","submitted_at":"2024-11-26T18:59:22Z","title":"StableAnimator: High-Quality Identity-Preserving Human Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17697","snapshot_observed_at":"2026-08-05T21:24:08.163993Z","title":"Stableanimator: High- quality identity-preserving human image animation.arXiv preprint arXiv:2411.17697, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-07T05:22:38.697912Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:08.163993Z"},"links":{"cited_paper":"/paper/2411.17697","citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:02fe24a0adefa74f7dfde93c2bf32594a75da8874c94396414455086656a07a5","observation_id":"cf2d0577-8566-4b21-bb82-73ba931ad1ae","resolution":{"observed_at":"2026-08-05T21:24:08.163993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-07-06T07:19:11.957225Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-05T21:24:08.229848Z","title":"To- wards accurate generative models of video: A new metric & challenges.arXiv preprint arXiv:1812.01717, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-07T05:22:38.697912Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:08.229848Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:201b89299eca256ca8fa1bb2bf82957c607ad38467b5aee309fa3e197d43eccb","observation_id":"42b3d4fe-6134-4f02-b366-e5a92e2e859a","resolution":{"observed_at":"2026-08-05T21:24:08.229848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-05T21:24:08.292449Z","title":"Wan: Open and advanced large-scale video generative models.arXiv preprint arXiv:2503.20314, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-07T05:22:38.697912Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:08.292449Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:b37b0244627806e284b69cd6911d0e25b0b8980429dbcce923282a791a08f275","observation_id":"fc65f202-0682-40f7-ace3-c363d5aed292","resolution":{"observed_at":"2026-08-05T21:24:08.292449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:24:09.696544Z","title":"Lavie: High-quality video generation with cascaded latent diffusion models.International Journal of Computer Vision, pages 1–20, 2024","venue":null,"work_id":"209d7f3a-d96c-45f0-8e1b-dd6b8d4125b1","year":2024},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-07T05:22:38.697912Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:08.373562Z"},"links":{"citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:2ce3ad026c16691104c5aa4b183f9d71e1c0a9ef3fc23f32abade4a0313df877","observation_id":"3182e70d-7162-457e-a16b-6345e95beead","resolution":{"observed_at":"2026-08-05T21:24:09.761627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:24:08.460168Z","title":"Image quality assessment: from error visibility to structural similarity.IEEE transactions on image processing, 13(4):600–612, 2004","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-07T05:22:38.697912Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:08.460168Z"},"links":{"citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:2e2fa638a3645f2d23e00b7521bca37d6e212225997ba6911aec419190f0230a","observation_id":"f3bcd8ed-ba27-4c22-85a8-309c428e58a6","resolution":{"observed_at":"2026-08-05T21:24:08.460168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:24:08.543292Z","title":"Easyanimate: A high-performance long video generation method based on transformer architecture.arXiv preprint arXiv:2405.18991,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-07T05:22:38.697912Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:08.543292Z"},"links":{"citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:395d797827518c7ebc7dbf4c5959c9d5c6a59a02a2a0baf840e222d79036a595","observation_id":"6e2d9b1d-8293-4304-a815-28494b7920de","resolution":{"observed_at":"2026-08-05T21:24:08.543292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-05T21:24:08.608636Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer.arXiv preprint arXiv:2408.06072, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-07T05:22:38.697912Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:08.608636Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:c32c0f78f17088fe23aa72c69fb3cafea9cca9cb28e4b27b1f8b9e9c017bda2c","observation_id":"d6d1aa7b-b701-498d-aa61-9fe116bdff55","resolution":{"observed_at":"2026-08-05T21:24:08.608636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04145","last_updated":"2023-11-07T17:16:06Z","snapshot_observed_at":"2026-08-02T12:25:34.488259Z","submitted_at":"2023-11-07T17:16:06Z","title":"I2VGen-XL: High-Quality Image-to-Video Synthesis via Cascaded Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04145","snapshot_observed_at":"2026-08-05T21:24:08.669726Z","title":"I2vgen-xl: High-quality image-to-video synthesis via cascaded diffusion models.arXiv preprint arXiv:2311.04145, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-07T05:22:38.697912Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:08.669726Z"},"links":{"cited_paper":"/paper/2311.04145","citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:0daee0b382be447569ece3d14931f2373d3bb81fdba9e596d1ea6fe68fc8dd65","observation_id":"adcbc9e8-b530-4c38-8aea-e0c81a9ad333","resolution":{"observed_at":"2026-08-05T21:24:08.669726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:24:08.721929Z","title":"Pose-controllable talking face generation by implicitly modularized audio-visual rep- resentation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-07T05:22:38.697912Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:08.721929Z"},"links":{"citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:a37c41441dbd64afd2f2e3d808183099ab0288906b7e28c93e133207d236045d","observation_id":"d0689d79-1e84-4c1b-b2cf-a75876eef380","resolution":{"observed_at":"2026-08-05T21:24:08.721929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:24:10.487674Z","title":null,"venue":null,"work_id":"e24430f5-50bc-40e3-80a4-9ad38fa4f56e","year":2025},"citing_paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","snapshot_observed_at":"2026-08-07T05:22:38.697912Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-05T21:24:06.990235Z"},"links":{"citing_paper":"/paper/2508.08891"},"observation_digest":"sha256:b4b125046b058efa04e071a767a0332e5492d5f73123c28c70df1964ea4a20db","observation_id":"22c0ad9a-3c42-4827-90bf-7a15d8360f3d","resolution":{"observed_at":"2026-08-05T21:24:10.530104Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.08891","last_updated":"2025-08-12T12:25:56Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T05:22:38.697912Z","submitted_at":"2025-08-12T12:25:56Z","title":"Preview WB-DH: Towards Whole Body Digital Human Bench for the Generation of Whole-body Talking Avatar Videos"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":27,"verified_exact":2,"verified_fuzzy":10},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2508.08891."}