{"as_of":"2026-08-08T08:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:42c1a54025902fc5cf5fd577b55cad389898dfb679063641f8d2df0a8d47da08","coverage":[{"denominator":228,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T10:36:55.691493Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.03883/citation-record","integrity":"/paper/2509.03883/integrity","json":"/paper/2509.03883/citation-record.json","paper":"/paper/2509.03883"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:48.887967Z","title":"Deep video portraits,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:48.887967Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:eb7c05f91b6059301f773659da9a5cf1e99eea7487afca000f29f8bbcba018b8","observation_id":"f95da5f0-5166-4cbc-91b5-4003ab12495c","resolution":{"observed_at":"2026-08-05T10:36:48.887967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:48.970520Z","title":"Faceformer:Speech- driven 3d facial animation with transformers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:48.970520Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:94c5e7f3fc79ab1cd0edc2e9e3013a48323e2872c6a181d9000a14f6f262130e","observation_id":"a24baf39-178c-4360-adda-a78ea16f0c88","resolution":{"observed_at":"2026-08-05T10:36:48.970520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-05T10:36:49.092801Z","title":"Make-a-video: Text-to-video generation without text-video data,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:49.092801Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:72c5d894c2613a25bf4839b7d2a0dbe67afd91377591e68b8aa55841bf173890","observation_id":"cd7f49ad-3ec6-4700-bd27-747d8cefa3a8","resolution":{"observed_at":"2026-08-05T10:36:49.092801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:49.159879Z","title":"Animatediff: Animate your personalized text-to- image diffusion models without specific tuning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:49.159879Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:776f61f32534b242ea47fe93443f749decba69eecb7071d40a392c82cf6570f4","observation_id":"26813512-657e-4181-b184-6d7aa6204fa2","resolution":{"observed_at":"2026-08-05T10:36:49.159879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T10:36:49.239210Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:49.239210Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:10538d9c1cc8a0efc7ada83817d3fb4e5563e7af26307a6a9867eba6014ffe1d","observation_id":"94db31dc-7003-4a00-8710-6af5c5cab0aa","resolution":{"observed_at":"2026-08-05T10:36:49.239210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:49.318463Z","title":"Faces that speak: Jointly synthesising talking face and speech from text,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:49.318463Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:d9597ee15f35aa9fb47bebea7e9f26cfc15d6b320bc15b81c864d04ce2ea3d04","observation_id":"7b169ad2-017c-4d24-8270-8e3568cb2bfa","resolution":{"observed_at":"2026-08-05T10:36:49.318463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12052","last_updated":"2024-05-05T05:07:34Z","snapshot_observed_at":"2026-08-01T16:10:16.293275Z","submitted_at":"2023-11-18T10:22:44Z","title":"MagicPose: Realistic Human Poses and Facial Expressions Retargeting with Identity-aware Diffusion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12052","snapshot_observed_at":"2026-08-05T10:36:49.374447Z","title":"Magicdance: Realistic human dance video gen- eration with motions & facial expressions transfer,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:49.374447Z"},"links":{"cited_paper":"/paper/2311.12052","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:8d5c2d8fbd4db07f9773da5a3003e2c7f8eb092956e458669aad80b7ec024616","observation_id":"1cef78bd-e8c1-4cf2-9800-3447126b7a23","resolution":{"observed_at":"2026-08-05T10:36:49.374447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:49.451505Z","title":"Nerf: Representing scenes as neural radiance fields for view synthesis,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:49.451505Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:5a077bf01a81db383253d030d1e61bbdee26a02a80458d06dc509af67036db08","observation_id":"d40138a0-a809-478d-b4d4-c46d4ed8ac14","resolution":{"observed_at":"2026-08-05T10:36:49.451505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:49.513818Z","title":"3d gaussian splatting for real-time radiance field rendering,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:49.513818Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:9f172eed5eb8ce8af46199bc15be4c765326f674f704f9857d629135cb5783ac","observation_id":"7b7fd77b-ed8b-4cef-9f87-1a6789fa5f00","resolution":{"observed_at":"2026-08-05T10:36:49.513818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:49.591482Z","title":"Deep person generation: A survey from the perspective of face, pose, and cloth synthesis,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:49.591482Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:e6ca4b09789799e5a2c08261ff7206a9f78a3a4a21c02abc4a7f04c145d26e2f","observation_id":"7eeb9952-bb2b-4d3b-b5c7-7f1c41679862","resolution":{"observed_at":"2026-08-05T10:36:49.591482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08428","last_updated":"2024-07-11T12:09:05Z","snapshot_observed_at":"2026-08-04T00:06:53.740379Z","submitted_at":"2024-07-11T12:09:05Z","title":"A Comprehensive Survey on Human Video Generation: Challenges, Methods, and Insights","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08428","snapshot_observed_at":"2026-08-05T10:36:49.645540Z","title":"A comprehensive survey on human video generation: Challenges, methods, and insights,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:49.645540Z"},"links":{"cited_paper":"/paper/2407.08428","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:0e2b963ad54245d82ac4c34c05e77f6fe69e1bd07bb98232460f49ae3e8627ce","observation_id":"294a4644-7e29-4b56-846e-aeb8949c0813","resolution":{"observed_at":"2026-08-05T10:36:49.645540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:49.742383Z","title":"Image-based virtual try-on: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:49.742383Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:8a1c110eda0e3b1f894232f48fedb9b7e103947f91f7064b3bb35bbcec3b09f4","observation_id":"b01d6abe-af0b-4308-b541-213e8c2377e1","resolution":{"observed_at":"2026-08-05T10:36:49.742383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10553","last_updated":"2024-06-18T07:39:51Z","snapshot_observed_at":"2026-07-06T18:31:27.512384Z","submitted_at":"2024-06-15T08:14:59Z","title":"A Comprehensive Taxonomy and Analysis of Talking Head Synthesis: Techniques for Portrait Generation, Driving Mechanisms, and Editing","version":2},"cited_work":{"arxiv_id":"2406.10553","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.10553","snapshot_observed_at":"2026-08-05T10:36:58.948911Z","title":"A Comprehensive Taxonomy and Analysis of Talking Head Synthesis: Techniques for Portrait Generation, Driving Mechanisms, and Editing","venue":"cs.CV","work_id":"db62db0b-665e-4c17-892f-b96f5cad664e","year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:49.794534Z"},"links":{"cited_paper":"/paper/2406.10553","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:e51624ca19c236a6ccb07246e4b55b3a3f57ac5bdd6cd2b8b54328d1c67cf364","observation_id":"52958468-5877-4275-ae6e-7b9dcd5dec0d","resolution":{"observed_at":"2026-08-05T10:36:58.954166Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:49.872986Z","title":"Multilingual video dubbing—a technology review and current challenges,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:49.872986Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:7374d22b7bcb8ceed757d2f92eeaa035eb277cdb2a758710e72354f99337b063","observation_id":"f829e0b9-2e0e-4499-bada-7ba5bb7aadbc","resolution":{"observed_at":"2026-08-05T10:36:49.872986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:49.948773Z","title":"Difftalk: Crafting diffusion models for generalized audio-driven portraits anima- tion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:49.948773Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:14f5554c36e2c181358dced8fe3b83bcd42b83dd7c6680478ba6328b4912f0fd","observation_id":"b3705933-00bd-4c0b-8dea-af99e0cac63f","resolution":{"observed_at":"2026-08-05T10:36:49.948773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:50.025023Z","title":"Identity-preserving talking face generation with landmark and appear- ance priors,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:50.025023Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:0f5431e2ac7332963d8b148a1a4be9d153b7c87b8f3d813f1801fd613a16e9e7","observation_id":"20c57b9c-547e-4543-ab8f-cb9dbbbb4769","resolution":{"observed_at":"2026-08-05T10:36:50.025023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.10939","last_updated":"2023-01-26T05:00:09Z","snapshot_observed_at":"2026-07-06T14:44:45.326057Z","submitted_at":"2023-01-26T05:00:09Z","title":"Affective Faces for Goal-Driven Dyadic Communication","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.10939","snapshot_observed_at":"2026-08-05T10:36:50.075167Z","title":"Af- fective faces for goal-driven dyadic communication,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:50.075167Z"},"links":{"cited_paper":"/paper/2301.10939","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:a46c03e2a115190508b18915a106fb56e7d9a47b7329cff9e4d33ab9526d6c17","observation_id":"1b2b5664-056c-4e89-9ed6-3158cdefa1af","resolution":{"observed_at":"2026-08-05T10:36:50.075167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17465","last_updated":"2023-12-04T16:49:18Z","snapshot_observed_at":"2026-07-06T16:54:14.216770Z","submitted_at":"2023-11-29T09:13:00Z","title":"AgentAvatar: Disentangling Planning, Driving and Rendering for Photorealistic Avatar Agents","version":3},"cited_work":{"arxiv_id":"2311.17465","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.17465","snapshot_observed_at":"2026-08-05T10:36:58.908484Z","title":"AgentAvatar: Disentangling Planning, Driving and Rendering for Photorealistic Avatar Agents","venue":"cs.CV","work_id":"de5dd4b0-a6cb-42cd-8ff2-238d72b6440f","year":2023},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:50.144987Z"},"links":{"cited_paper":"/paper/2311.17465","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:697e7bafb777d86ed9aa5ac60ccb0493807485b1f546797de1870ad793bc4a72","observation_id":"772294c5-ddd2-4528-8f9f-a8cd4e122bd3","resolution":{"observed_at":"2026-08-05T10:36:58.913967Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:50.226236Z","title":"Instructavatar: Text-guided emotion and motion control for avatar generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:50.226236Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:e94e5bf6b78c4d6091e5dacab8af628a01785c9303c9d8f73b2eb3cc873dd1c4","observation_id":"9a49104e-7b28-46f4-b392-fc81ff03714d","resolution":{"observed_at":"2026-08-05T10:36:50.226236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:50.287757Z","title":"Human motion generation: A survey,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:50.287757Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:ef87284ef8c9c20dec239e4cd0cc8c263f2aaabda7c7e9de0b9531c014d33b61","observation_id":"8b556212-d124-413a-80fe-02527b13bd9c","resolution":{"observed_at":"2026-08-05T10:36:50.287757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:50.350825Z","title":"A survey of talking-head generation technology and its applications,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:50.350825Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:f4df18d3210627cc0b26235749166621647ded9b04ad12ba51f68c77fd59fbc2","observation_id":"4f36bf34-f59a-48cb-9bbc-a03cf0aceac9","resolution":{"observed_at":"2026-08-05T10:36:50.350825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:50.427366Z","title":"Unsupervised high-resolution portrait gaze correction and animation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:50.427366Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:eb327fa58e4a5c9254d8d57f27f58d604fe7e661edb1885cd97d6e67424f1901","observation_id":"fe0bf50d-710e-4c45-bd0a-8ecb171f4c50","resolution":{"observed_at":"2026-08-05T10:36:50.427366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:50.506521Z","title":"Expression domain translation network for cross-domain head reenactment,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:50.506521Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:4f087d0c9f24996a18a449659f7cf2141bf735c6ed42fd6549a3a9e2a3018e75","observation_id":"96978db2-617b-45c6-a88c-2b9dcd7adace","resolution":{"observed_at":"2026-08-05T10:36:50.506521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:50.593467Z","title":"Otavatar: One-shot talking face avatar with controllable tri-plane rendering,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:50.593467Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:0a0c69ac4131c693cc9889a31f03475c3db41d9c09d676d7fb5a9f88c8e45a3f","observation_id":"15cb19b0-2feb-468d-917d-09e9e1f2921c","resolution":{"observed_at":"2026-08-05T10:36:50.593467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:50.663654Z","title":"Follow-your-emoji: Fine-controllable and expressive freestyle portrait animation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:50.663654Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:e874677cde3e93fd496c218b9d77be2a970b70fa66e8472543a8345b60025d4c","observation_id":"61e15e95-e4b3-4a44-9078-783033ffbf80","resolution":{"observed_at":"2026-08-05T10:36:50.663654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03168","last_updated":"2025-02-28T14:39:17Z","snapshot_observed_at":"2026-08-07T22:08:51.244821Z","submitted_at":"2024-07-03T14:41:39Z","title":"LivePortrait: Efficient Portrait Animation with Stitching and Retargeting Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03168","snapshot_observed_at":"2026-08-05T10:36:50.724953Z","title":"Liveportrait: Efficient portrait animation with stitching and retargeting control,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:50.724953Z"},"links":{"cited_paper":"/paper/2407.03168","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:3124cb3c775170d06d188045bf08ea27c35b8dad17b87e7bb7094a2a37b2f3ef","observation_id":"32360012-a949-4738-80f6-3f8eadb82ceb","resolution":{"observed_at":"2026-08-05T10:36:50.724953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:50.800840Z","title":"X-portrait: Expressive portrait animation with hierarchical motion attention,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:50.800840Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:144c5c1a840214956a0c8aee6696a2db3d9b3189e767386f03d125444b2467ad","observation_id":"56a2bb31-334d-4406-9232-280ad738af38","resolution":{"observed_at":"2026-08-05T10:36:50.800840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05712","last_updated":"2025-04-08T08:10:07Z","snapshot_observed_at":"2026-07-06T18:42:51.512751Z","submitted_at":"2024-07-08T08:12:57Z","title":"MobilePortrait: Real-Time One-Shot Neural Head Avatars on Mobile Devices","version":3},"cited_work":{"arxiv_id":"2407.05712","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.05712","snapshot_observed_at":"2026-08-05T10:36:58.866954Z","title":"MobilePortrait: Real-Time One-Shot Neural Head Avatars on Mobile Devices","venue":"cs.CV","work_id":"c4ac95ba-382b-4e83-8ea6-2d8b74e8a415","year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:50.885066Z"},"links":{"cited_paper":"/paper/2407.05712","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:861a77d33e7c0a8eb9755c564e8c2215ee4d11ff65623b3ebf2531157e42cc7d","observation_id":"83530f0c-6aad-4473-b9ad-45305848293f","resolution":{"observed_at":"2026-08-05T10:36:58.872770Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:50.958740Z","title":"Everybody dance now,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:50.958740Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:8126784d1ef063d9f6be1a9d0c12c062c3e86d3121bcf36e2d90783f66ba9744","observation_id":"c0ff62f4-6f49-463f-8945-49c096b8a056","resolution":{"observed_at":"2026-08-05T10:36:50.958740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:51.046502Z","title":"Human motionformer: Transferring human motions with vision transformers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:51.046502Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:6aa0619aeb888284fbaf4043b2d233da47f6878bea0173406d11e43e08061d87","observation_id":"c22c8b7c-2ad8-42fb-9342-4e3d98fb9a9c","resolution":{"observed_at":"2026-08-05T10:36:51.046502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:51.122153Z","title":"Bidirectional temporal diffusion model for temporally consistent human animation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:51.122153Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:01af604a36d8d7ef0464465e56b37ad6e1c8f559f52faf2b7518c55971816aaf","observation_id":"36ec9f0e-890f-45dd-9bf3-6d155fb9f32c","resolution":{"observed_at":"2026-08-05T10:36:51.122153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:51.184832Z","title":"Disco: Disentangled control for realistic human dance generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:51.184832Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:3a712674e63d98d6e1847253018f374ecc4aae4dad2ab4ccdc891171e33c950e","observation_id":"376dcc8e-92eb-48a6-8726-8ea2a0052aa4","resolution":{"observed_at":"2026-08-05T10:36:51.184832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:51.227878Z","title":"Animate anyone: Consistent and controllable image-to-video synthesis for character animation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:51.227878Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:4f832b23980128ad5f58a52625c66a1a89a22a5375684e1ed8f98853fda13f24","observation_id":"0e943829-ccb7-47e3-93fa-a4f5586821f7","resolution":{"observed_at":"2026-08-05T10:36:51.227878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03035","last_updated":"2025-03-01T09:24:04Z","snapshot_observed_at":"2026-07-06T18:25:44.620682Z","submitted_at":"2024-06-05T08:03:18Z","title":"Towards Multiple Character Image Animation Through Enhancing Implicit Decoupling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03035","snapshot_observed_at":"2026-08-05T10:36:51.276195Z","title":"Follow-your-pose v2: Multiple- condition guided character image animation for stable pose control,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:51.276195Z"},"links":{"cited_paper":"/paper/2406.03035","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:142b9b5cbffd7ebed77ce3df6bb5ed26d7bdfe9fda82dacb23a21105586f0d00","observation_id":"3362df08-e56c-40f9-82cb-c6b2badd3684","resolution":{"observed_at":"2026-08-05T10:36:51.276195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17405","last_updated":"2024-09-23T20:52:01Z","snapshot_observed_at":"2026-07-06T18:20:44.070255Z","submitted_at":"2024-05-27T17:53:29Z","title":"Human4DiT: 360-degree Human Video Generation with 4D Diffusion Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17405","snapshot_observed_at":"2026-08-05T10:36:51.336374Z","title":"Human4dit: Free-view human video generation with 4d diffusion transformer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:51.336374Z"},"links":{"cited_paper":"/paper/2405.17405","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:1f98cd234e3c106e75ce93fee18ae0dd724c1d74bdaa5092b0036e971481b33d","observation_id":"fd85064b-470f-4b74-a4e5-6886a46b3cf6","resolution":{"observed_at":"2026-08-05T10:36:51.336374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19680","last_updated":"2025-06-27T10:06:13Z","snapshot_observed_at":"2026-08-04T16:03:06.733403Z","submitted_at":"2024-06-28T06:40:53Z","title":"MimicMotion: High-Quality Human Motion Video Generation with Confidence-aware Pose Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19680","snapshot_observed_at":"2026-08-05T10:36:51.408510Z","title":"Mimicmotion: High-quality human motion video generation with confidence-aware pose guidance,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:51.408510Z"},"links":{"cited_paper":"/paper/2406.19680","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:8a8335cb877747b9703a84a9bc5b7a046ec1d1af828b7cd62d86be5bc38eeea3","observation_id":"2b9aff82-d393-46fd-87cf-80804041afcd","resolution":{"observed_at":"2026-08-05T10:36:51.408510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:51.491529Z","title":"I2v-adapter: A general image-to-video adapter for diffusion models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:51.491529Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:40d5f54ff97d2f700422ab9f1edc5fe244b12bd544469e77186761184b44c1a6","observation_id":"c63e07aa-2336-4688-a64f-0b50089fa4a4","resolution":{"observed_at":"2026-08-05T10:36:51.491529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11794","last_updated":"2024-05-28T04:08:09Z","snapshot_observed_at":"2026-07-06T18:16:33.179338Z","submitted_at":"2024-05-20T05:28:22Z","title":"ViViD: Video Virtual Try-on using Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11794","snapshot_observed_at":"2026-08-05T10:36:51.546340Z","title":"Vivid: Video virtual try-on using diffusion models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:51.546340Z"},"links":{"cited_paper":"/paper/2405.11794","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:2d8b217082774505d8286c5c0213c1316b7ff8fb5acea6ba9f46dfe3c5ef4661","observation_id":"fa9be2f3-e5e9-410a-b530-6a312ebe37a2","resolution":{"observed_at":"2026-08-05T10:36:51.546340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:51.631647Z","title":"Dreampose: Fashion image-to-video synthesis via stable diffusion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:51.631647Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:27fb686823a7f3878ff0e9db1c39600fd44755031dfb166adf98cb7ce62ddfd6","observation_id":"d2cc0be8-39bb-45d9-9c37-b4ecd5fd78aa","resolution":{"observed_at":"2026-08-05T10:36:51.631647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:51.697233Z","title":"Make-your-anchor: A diffusion-based 2d avatar generation frame- work,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:51.697233Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:5c0d999fd04144ae1ea2700c9ef4f6b31770633759e1c508e29f22799306f6da","observation_id":"9d8ee456-6b82-45e0-ad5d-8ea8e26f1ef1","resolution":{"observed_at":"2026-08-05T10:36:51.697233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:51.768275Z","title":"Write-a-speaker: Text-based emotional and rhythmic talking-head gen- eration,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:51.768275Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:59d30a24f7fca8e706633ac02f99ca6b7b3da701edfa2e6738e06c20feae95b7","observation_id":"427b93f9-4609-4dbb-9155-50f757a47e9d","resolution":{"observed_at":"2026-08-05T10:36:51.768275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15275","last_updated":"2024-06-25T16:57:27Z","snapshot_observed_at":"2026-07-06T18:04:33.726854Z","submitted_at":"2024-04-23T17:59:43Z","title":"ID-Animator: Zero-Shot Identity-Preserving Human Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.15275","snapshot_observed_at":"2026-08-05T10:36:51.833596Z","title":"Id-animator: Zero-shot identity-preserving human video generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:51.833596Z"},"links":{"cited_paper":"/paper/2404.15275","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:472e3adc73718b6548d7447aa7397b22ab50ff03e83baadbe138719cc5734618","observation_id":"5039d190-f301-4c72-9d74-ef59776b9279","resolution":{"observed_at":"2026-08-05T10:36:51.833596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04496","last_updated":"2024-10-15T03:43:36Z","snapshot_observed_at":"2026-07-06T18:11:09.767624Z","submitted_at":"2024-05-07T17:06:59Z","title":"Edit-Your-Motion: Space-Time Diffusion Decoupling Learning for Video Motion Editing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04496","snapshot_observed_at":"2026-08-05T10:36:51.888269Z","title":"Edit-your-motion: Space-time diffusion decoupling learning for video motion editing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:51.888269Z"},"links":{"cited_paper":"/paper/2405.04496","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:f5687f1682ea8e74011408ee65886ecd848f2bf5ba1f8549d08813c117e316e1","observation_id":"26db761e-aec1-4493-a7a7-cda9aa260e5c","resolution":{"observed_at":"2026-08-05T10:36:51.888269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:51.996370Z","title":"Follow your pose: Pose-guided text-to-video generation using pose- free videos,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:51.996370Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:4c95cfa09d2deb44348c74170e6256621250f0db9cded5d953e5b9a6dcb482b3","observation_id":"d555322f-e779-41da-9a18-576579a9c741","resolution":{"observed_at":"2026-08-05T10:36:51.996370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:52.049764Z","title":"Text2performer: Text-driven human video generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:52.049764Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:eca7be85aeda6204ef684bf176b4ef442fc2d7aeea6947d76f7698629d837dae","observation_id":"9cc1b22d-2e2c-43b6-b574-ba33f0834aa2","resolution":{"observed_at":"2026-08-05T10:36:52.049764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:52.111709Z","title":"Styleheat: One-shot high-resolution editable talking face generation via pre-trained stylegan,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:52.111709Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:cc4870237a490b69697057e07b023250362eab4480dc7d5a079911f92efc2bd6","observation_id":"bbe3cd7c-9b7f-48d4-8566-34a95489be60","resolution":{"observed_at":"2026-08-05T10:36:52.111709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:52.290746Z","title":"Pose- controllable talking face generation by implicitly modularized audio- visual representation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:52.290746Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:174c9b36071775723a94471e35baf5f58db8ab5ce5b47531b9001b221662b67e","observation_id":"6993dca4-834c-4cac-bfaf-32c063d5f9b6","resolution":{"observed_at":"2026-08-05T10:36:52.290746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:52.375519Z","title":"Edtalk: Efficient disentanglement for emotional talking head synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:52.375519Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:2dbdaebfd1c4d89308d19244527ba69b9e40c7307d6f537b56d4e23b9b0259d2","observation_id":"09be9cb8-1621-43ec-9083-065b215e6636","resolution":{"observed_at":"2026-08-05T10:36:52.375519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08136","last_updated":"2024-07-12T02:41:51Z","snapshot_observed_at":"2026-08-05T23:17:13.069591Z","submitted_at":"2024-07-11T02:26:51Z","title":"EchoMimic: Lifelike Audio-Driven Portrait Animations through Editable Landmark Conditions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08136","snapshot_observed_at":"2026-08-05T10:36:52.470098Z","title":"Echomimic: Lifelike audio-drivenportraitanimationsthrougheditablelandmarkconditions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:52.470098Z"},"links":{"cited_paper":"/paper/2407.08136","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:b5c08a3481252de1ec0c985f559fb00293c901904718639137e1c5aae0d8c728","observation_id":"e47c006d-73d1-47e7-8e90-e6c2ecf9bc31","resolution":{"observed_at":"2026-08-05T10:36:52.470098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:52.561850Z","title":"Emo: Emote portrait alive generating expressive portrait videos with audio2video diffusion model under weak conditions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:52.561850Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:50eb5bdb83473d35d55a038f85180b55a2d9780fcea15b133a23dcc3bd910017","observation_id":"908e1770-efa3-4e48-8a70-5ecf9d94803f","resolution":{"observed_at":"2026-08-05T10:36:52.561850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-08-05T10:36:52.656632Z","title":"Hallo: Hierarchical audio-driven visual synthesis for portrait image animation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:52.656632Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:c0ad7a7a72ecef8a41c0763b85dc2a99932e4d6c765836d4459ea5a05c3c2652","observation_id":"e0f06b7c-dffa-4f88-a39b-534522cb11ef","resolution":{"observed_at":"2026-08-05T10:36:52.656632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07895","last_updated":"2024-06-12T06:00:00Z","snapshot_observed_at":"2026-07-06T18:29:21.709395Z","submitted_at":"2024-06-12T06:00:00Z","title":"Emotional Conversation: Empowering Talking Faces with Cohesive Expression, Gaze and Pose Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07895","snapshot_observed_at":"2026-08-05T10:36:52.721044Z","title":"Emotional conversation: Empowering talking faces with cohesive expression, gaze and pose generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:52.721044Z"},"links":{"cited_paper":"/paper/2406.07895","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:adbff491a63195f068b8aa75111c5bf47121421dca662044e2df09e57d0c5ee8","observation_id":"1840df13-0112-470c-926c-ea26659a34e1","resolution":{"observed_at":"2026-08-05T10:36:52.721044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:52.772995Z","title":"Makeittalk: Speaker-aware talking-head animation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:52.772995Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:a9634ea3db515c03586cd0e2de16616232eb5d4b6e83035fef7d8eec8ef57bd1","observation_id":"db688d56-7413-4c21-a9cb-29c65e141393","resolution":{"observed_at":"2026-08-05T10:36:52.772995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:52.824523Z","title":"Live speech portraits: Real-time photore- alistic talking-head animation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:52.824523Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:889cc376b242f477e56a06160e47023ceb689a506a5f46a3af74457a3d251e8e","observation_id":"b815adc8-8abc-4055-8865-f5e35b3ae217","resolution":{"observed_at":"2026-08-05T10:36:52.824523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08764","last_updated":"2024-03-13T17:59:02Z","snapshot_observed_at":"2026-07-06T17:44:09.081164Z","submitted_at":"2024-03-13T17:59:02Z","title":"VLOGGER: Multimodal Diffusion for Embodied Avatar Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08764","snapshot_observed_at":"2026-08-05T10:36:52.868747Z","title":"Vlogger: Multimodal diffusion for embodied avatar synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:52.868747Z"},"links":{"cited_paper":"/paper/2403.08764","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:83280352ad1c65882209f3b65ba5f1f02337b4432eb6a5853b247b45673fe803","observation_id":"75aff3a9-89ae-4ee7-82fe-024be2d77f6e","resolution":{"observed_at":"2026-08-05T10:36:52.868747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09266","last_updated":"2024-11-28T10:30:14Z","snapshot_observed_at":"2026-08-04T01:51:44.943383Z","submitted_at":"2024-05-15T11:33:07Z","title":"Dance Any Beat: Blending Beats with Visuals in Dance Video Generation","version":3},"cited_work":{"arxiv_id":"2405.09266","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.09266","snapshot_observed_at":"2026-08-05T10:36:58.675160Z","title":"Dance Any Beat: Blending Beats with Visuals in Dance Video Generation","venue":"cs.CV","work_id":"fc7ef36e-3d46-44ac-8847-0e8df07313e8","year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:52.930420Z"},"links":{"cited_paper":"/paper/2405.09266","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:a8cc42e308187b2ff28f3510b54fefd816c0c675e750337db9147a6e8fbef556","observation_id":"e4ed9920-2db5-4442-853b-631547e6c554","resolution":{"observed_at":"2026-08-05T10:36:58.680484Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-05T10:36:52.986651Z","title":"Auto-encoding variational bayes,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:52.986651Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:b3f4c7ccc52d37b0167e7877baaece7ff2bb44f18f9f412c23613fa966bfbe25","observation_id":"4dd2bf06-54a9-41ab-85b5-337b555a0042","resolution":{"observed_at":"2026-08-05T10:36:52.986651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:53.070888Z","title":"Geneface: Generalized and high-fidelity audio-driven 3d talking face synthesis,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:53.070888Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:4d93aa59650268da8d3d62165c4b34e6ce922ff7cd25b312ad1069eed232dc21","observation_id":"3083795b-dd6a-49a6-b9bb-51d2e49b28e8","resolution":{"observed_at":"2026-08-05T10:36:53.070888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.00787","last_updated":"2023-05-01T12:24:09Z","snapshot_observed_at":"2026-07-06T15:21:50.037094Z","submitted_at":"2023-05-01T12:24:09Z","title":"GeneFace++: Generalized and Stable Real-Time Audio-Driven 3D Talking Face Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.00787","snapshot_observed_at":"2026-08-05T10:36:53.123535Z","title":"Geneface++: Generalized and stable real-time audio-driven 3d talking face generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:53.123535Z"},"links":{"cited_paper":"/paper/2305.00787","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:47ff4d4e52a129d65816a5cf5b622d8024d214cdecc2f17d18370a3f9d4024bf","observation_id":"d79c4897-2ea4-4059-bd1f-e962667fb198","resolution":{"observed_at":"2026-08-05T10:36:53.123535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:53.184941Z","title":"Neural discrete representation learning,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:53.184941Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:22e28e11f4bd265c03b988b229f691c7a2f6dd7b61e616f23aab325e2c119590","observation_id":"cb5922ee-b2fb-48c4-8552-736c338f3a81","resolution":{"observed_at":"2026-08-05T10:36:53.184941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:53.226243Z","title":"Generative adversarial nets,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:53.226243Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:bd2fb503188541e135507d9e89974d1dda7a7645aa4ccf4c5e967e32391e035c","observation_id":"b3d7e218-04ec-42f8-a14d-a7c24694e47b","resolution":{"observed_at":"2026-08-05T10:36:53.226243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:53.303004Z","title":"A style-based generator architecture for generative adversarial networks,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:53.303004Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:9cb64e95cc2f61afa9b242f8f3d58cf9bfbf1922019c3f2cdf231249a0ba77d9","observation_id":"8033ef9e-f150-46a2-af76-6b2d726a9db5","resolution":{"observed_at":"2026-08-05T10:36:53.303004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:53.394240Z","title":"Analyzing and improving the image quality of stylegan,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:53.394240Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:3d79f795f3d533470c065f00c1c3d9625589131af1a857080be938f3e0791fe5","observation_id":"c9f97cf7-0614-4fa7-989d-6b4aee2fb06d","resolution":{"observed_at":"2026-08-05T10:36:53.394240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:53.443233Z","title":"An identity-preserved framework for human motion transfer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:53.443233Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:b3b3eedeaf8f5a78817315f12e4c38ccd0372cd2e7f35817dbab0e30f81d0c63","observation_id":"85c06782-9c16-45a3-a75a-1911663f5447","resolution":{"observed_at":"2026-08-05T10:36:53.443233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:53.506844Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:53.506844Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:e7ada198906488ee55f7418794877d4808bc9071eeb5beec6d0e40ee9d0c2770","observation_id":"39d5a18e-48cc-4112-b3e6-17f8765e922c","resolution":{"observed_at":"2026-08-05T10:36:53.506844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:53.572864Z","title":"Improved techniques for training score-based generative models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:53.572864Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:e28d9d12efb2bb4bbf235ed8b824f206c813c3598a6e34761c033e0365779fac","observation_id":"48c3a0b4-1986-412c-bde6-5acd5cac82a3","resolution":{"observed_at":"2026-08-05T10:36:53.572864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:53.628440Z","title":"Improved denoising diffusion proba- bilistic models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:53.628440Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:d1929ae12c7edb2537a4c6245e9fd2ad829dd55f349ed3cedc6de357b00609dc","observation_id":"e63960fd-1b14-47fe-b658-9c84020277ed","resolution":{"observed_at":"2026-08-05T10:36:53.628440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:53.693869Z","title":"Denoising diffusion implicit mod- els,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:53.693869Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:1cd4c1f6e2c38c4cc59d7ff1251146ccd46c68ece470e5ed38b8b4f5d59e2b3b","observation_id":"41063b16-eb8b-410f-943a-b7554e3697c2","resolution":{"observed_at":"2026-08-05T10:36:53.693869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:53.755074Z","title":"Diffusion models beat gans on image synthesis,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:53.755074Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:655121be46d72bc1eb9936864742970ad91a10a122b2128ff26f921f7fa08d36","observation_id":"23363c7a-46bb-418b-9d09-6ed5900097d3","resolution":{"observed_at":"2026-08-05T10:36:53.755074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:53.789291Z","title":"A survey on generative diffusion models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:53.789291Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:944ed172b4597530097d98c114607d8da4d31bbf3ccd62830dd316bc96216e8d","observation_id":"cff4e806-623b-46ca-b538-4a87f6e4e325","resolution":{"observed_at":"2026-08-05T10:36:53.789291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:53.822594Z","title":"Denoising diffusion probabilistic models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:53.822594Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:297f2043613e60855620024bf9cb28880dbb589d572d4087f6563882afcff1d6","observation_id":"902e7970-5ad5-45b6-ac03-5b2b8410360d","resolution":{"observed_at":"2026-08-05T10:36:53.822594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14780","last_updated":"2023-10-20T12:53:08Z","snapshot_observed_at":"2026-08-05T15:57:22.966737Z","submitted_at":"2023-10-20T12:53:08Z","title":"Dance Your Latents: Consistent Dance Generation through Spatial-temporal Subspace Attention Guided by Motion Flow","version":1},"cited_work":{"arxiv_id":"2310.14780","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.14780","snapshot_observed_at":"2026-08-05T10:36:58.617590Z","title":"Dance Your Latents: Consistent Dance Generation through Spatial-temporal Subspace Attention Guided by Motion Flow","venue":"cs.CV","work_id":"0dd2366d-d12b-4e45-b170-c8781d0ac65f","year":2023},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:53.851100Z"},"links":{"cited_paper":"/paper/2310.14780","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:b6b6e1bbcd13bd160b1334b05da1a1d67be651d3bc9b113f75f9d14e56d14e64","observation_id":"722e2ae5-ab12-4b38-97fe-1aa5f7795f8d","resolution":{"observed_at":"2026-08-05T10:36:58.622748Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19290","last_updated":"2024-06-27T16:04:41Z","snapshot_observed_at":"2026-07-06T18:38:00.379225Z","submitted_at":"2024-06-27T16:04:41Z","title":"Human Modelling and Pose Estimation Overview","version":1},"cited_work":{"arxiv_id":"2406.19290","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.19290","snapshot_observed_at":"2026-08-05T10:36:58.591925Z","title":"Human Modelling and Pose Estimation Overview","venue":"cs.CV","work_id":"47cdf20a-79bd-41f5-a613-f5c8f8ad7f75","year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:53.890018Z"},"links":{"cited_paper":"/paper/2406.19290","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:95d2a6ba5f2f67dc176b93622e497f0ebe8c2953b0ba618e1c00c790eed26f73","observation_id":"4ee471ec-042e-4a69-8fd4-a15731b82897","resolution":{"observed_at":"2026-08-05T10:36:58.598466Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:53.932596Z","title":"Champ: Controllable and consistent human image animation with 3d parametric guidance,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:53.932596Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:26683e6aeb3f2faff62f446cac10cabd06a317efbe0097e8365e9a5a02fd83e2","observation_id":"1c81d839-0969-4e81-aed5-9c32b5da1054","resolution":{"observed_at":"2026-08-05T10:36:53.932596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:54.005829Z","title":"Openpose: Realtime multi-person 2d pose estimation using part affinity fields,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:54.005829Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:968279cb24a1da3674602f268d84786157a59b9350e3b42b70b97a13fff112f6","observation_id":"3d3ca1b2-7a7e-41b2-a397-b9d0a406c75e","resolution":{"observed_at":"2026-08-05T10:36:54.005829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:54.073205Z","title":"Effective whole-body pose estimation with two-stages distillation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:54.073205Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:a5b57d9965961e4289e6d30c5cca2c0376f4a4fc7c651c74d7769ce809fdf71c","observation_id":"00303c56-3dd2-43b6-a9c8-d02c764d3a83","resolution":{"observed_at":"2026-08-05T10:36:54.073205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18156","last_updated":"2024-05-28T13:18:32Z","snapshot_observed_at":"2026-07-06T18:21:18.150567Z","submitted_at":"2024-05-28T13:18:32Z","title":"VividPose: Advancing Stable Video Diffusion for Realistic Human Image Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18156","snapshot_observed_at":"2026-08-05T10:36:54.118365Z","title":"Vividpose: Advancing stable video diffusion for realistic human image animation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:54.118365Z"},"links":{"cited_paper":"/paper/2405.18156","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:25acfa4fd7fcf8a15dda28854b1ffbf508d806bd63af945cc6206436c2c404c4","observation_id":"fca9ccc0-861b-41cd-a53e-4046ced5ca35","resolution":{"observed_at":"2026-08-05T10:36:54.118365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:54.172725Z","title":"Magicanimate: Temporally consistent human image animation using diffusion model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:54.172725Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:086ada20f038271c20e9dacc56d713d4b567675dc305fe4a13c6da7967f8b46f","observation_id":"8cef5567-ea4f-42e2-8552-9e11eea741bb","resolution":{"observed_at":"2026-08-05T10:36:54.172725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:54.269247Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:54.269247Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:14bb85f8669b38e0e8a01c31148fa7d9197cdcade503d9279d76cfd6e51b6072","observation_id":"c0371e81-1ba4-4557-89c8-b7d49adb864e","resolution":{"observed_at":"2026-08-05T10:36:54.269247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:54.305057Z","title":"Conformer: Convolution- augmented transformer for speech recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:54.305057Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:4e4e5c239629403c5a7048dc82351a9cace72c09516ec20f428fd412cbe9b1d4","observation_id":"53c38695-d68d-4e77-95e5-73b17a9f919f","resolution":{"observed_at":"2026-08-05T10:36:54.305057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:54.380434Z","title":"Omniavatar: Geometry-guided controllable 3d head synthesis,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:54.380434Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:c442cd64a09a29fddbce2bcfefb29cac4bd3124bf444aa9a6df26b4c1f9a6087","observation_id":"00de6092-d0b5-4c1e-b388-ef81c2fb428b","resolution":{"observed_at":"2026-08-05T10:36:54.380434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20851","last_updated":"2024-06-18T05:36:11Z","snapshot_observed_at":"2026-07-06T18:23:19.450809Z","submitted_at":"2024-05-31T14:33:13Z","title":"MegActor: Harness the Power of Raw Video for Vivid Portrait Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20851","snapshot_observed_at":"2026-08-05T10:36:54.430237Z","title":"Megactor: Harness the power of raw video for vivid portrait anima- tion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:54.430237Z"},"links":{"cited_paper":"/paper/2405.20851","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:b2973f216ca88336666d8744d970fa4c4f5c7e1d7460f6c4e9234bea086bdb30","observation_id":"f3e72e65-8d87-413e-a9b3-442f8a2327e3","resolution":{"observed_at":"2026-08-05T10:36:54.430237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:54.497161Z","title":"Faceoff: A video-to-video face swapping system,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:54.497161Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:1de1e48b023cb4cf63579075a97f64648bd132536cdccf5669c801805ecad993","observation_id":"bb96ac18-cfcb-4dd1-addf-5fc27ca2a887","resolution":{"observed_at":"2026-08-05T10:36:54.497161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:54.633347Z","title":"Finemogen:Fine- grained spatio-temporal motion generation and editing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:54.633347Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:cb1b191a197f95316cf79be6f15e088d7ab1be32b92f0a40c6f778d02bb8d4b7","observation_id":"1031deee-83e3-44be-ae43-5bebd3d0aa85","resolution":{"observed_at":"2026-08-05T10:36:54.633347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14828","last_updated":"2023-12-22T17:02:45Z","snapshot_observed_at":"2026-07-06T17:07:14.412645Z","submitted_at":"2023-12-22T17:02:45Z","title":"Plan, Posture and Go: Towards Open-World Text-to-Motion Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14828","snapshot_observed_at":"2026-08-05T10:36:54.701074Z","title":"Plan, posture and go: Towards open-world text-to-motion generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:54.701074Z"},"links":{"cited_paper":"/paper/2312.14828","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:e5ef88572178e4fc86885ef7974ea239777584065d2dc5e2038a3244fa5aee02","observation_id":"adf6c3d4-e998-4b9e-b1a5-84e6f8448b0f","resolution":{"observed_at":"2026-08-05T10:36:54.701074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:54.779686Z","title":"Avatargpt: All-in-one framework for motion understanding planning generation and beyond,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:54.779686Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:d5994ef633c3d0e49ba371ea4fe02d5af009a51dd5f10d361baaa91cc669bcf5","observation_id":"4d30bd36-f327-41d8-b0e1-3e1bc4a9f982","resolution":{"observed_at":"2026-08-05T10:36:54.779686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:54.842912Z","title":"Motiongpt:Finetunedllmsaregeneral-purpose motion generators,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:54.842912Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:f6c1a7b77068c989b047aa74befbfb874e336723d4cd3f2683c27180f9cc0188","observation_id":"1c3d735b-8c4f-4ff5-996e-a0d9bad80c5c","resolution":{"observed_at":"2026-08-05T10:36:54.842912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2312.12634","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:58.513311Z","title":"Motionscript: Natural language descriptions for expressive 3d human motions,","venue":null,"work_id":"88c2f1c0-1235-4d4d-8c30-a24a8e9ac396","year":2023},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:54.889171Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:62029968cbf5657cb5b72824b10c1b3af4df3f6d8ec4b40e14dad5aae9e3b42f","observation_id":"1f47c7cd-23b3-45ad-89d5-e377bb05ad77","resolution":{"observed_at":"2026-08-05T10:36:58.521924Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:54.941478Z","title":"Can language models learn to listen?,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:54.941478Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:3b9733a4ec8d6a4784f2cdf0bb28e2adfecfbcbb8cace6be3c801ede0f9e1742","observation_id":"52cd2ab0-f22e-4a3b-8213-f8f36c2ea07c","resolution":{"observed_at":"2026-08-05T10:36:54.941478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:54.987297Z","title":"Intercontrol: Zero-shot human interaction generation by controlling every joint,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:54.987297Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:31878d88632ca7a33b97b4854953f7400c19ee1a288e70d617001ac3c4a92640","observation_id":"fae80bfd-7c96-4782-88fc-93930b81ffc6","resolution":{"observed_at":"2026-08-05T10:36:54.987297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:55.061656Z","title":"Digital life project: Autonomous 3d characters with social intelligence,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:55.061656Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:0c277a933a1be82b9c6d5e6361c805aa25ce3ebf677deaf72800554a0d2781ae","observation_id":"ef22c8f3-2093-4d31-81c7-6e7635981c47","resolution":{"observed_at":"2026-08-05T10:36:55.061656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05412","last_updated":"2025-06-18T10:45:08Z","snapshot_observed_at":"2026-07-06T18:59:05.329809Z","submitted_at":"2024-08-10T02:46:11Z","title":"Style-Preserving Lip Sync via Audio-Aware Style Reference","version":2},"cited_work":{"arxiv_id":"2408.05412","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.05412","snapshot_observed_at":"2026-08-05T10:36:58.388816Z","title":"Style-Preserving Lip Sync via Audio-Aware Style Reference","venue":"cs.CV","work_id":"4eeaf445-7f68-4d7b-ae34-80abb04cf2d2","year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:55.147557Z"},"links":{"cited_paper":"/paper/2408.05412","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:cf4fcfdbfd6922ece442728d24bfe13b6962fa3a99e46326e2d52e913fa251a8","observation_id":"ab34fd6c-d07c-4b82-8c22-208514e94cc1","resolution":{"observed_at":"2026-08-05T10:36:58.393948Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:55.219526Z","title":"Dae-talker: High fidelity speech-driven talking face generation with diffusion autoencoder,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:55.219526Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:18564b8975a4a54f41e17f363b9a6307bdb0ce0a6fe1c2846c2dfd6ffea80cd1","observation_id":"cef580a5-5bc0-4f25-9d36-dc9475c1b393","resolution":{"observed_at":"2026-08-05T10:36:55.219526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:55.341313Z","title":"High-fidelity generalized emotional talking face generation with multi-modal emotion space learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:55.341313Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:96b56c8470f4ed853f04fcdd089b6998acdd2ab9dd5d6ebb98d466f8ea25e7f4","observation_id":"3940f10e-57e5-4fed-9b1f-410f2e027b65","resolution":{"observed_at":"2026-08-05T10:36:55.341313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:55.437623Z","title":"Do as i do: Pose guided human motion copy,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:55.437623Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:6c6601260f96fcb020223acb85172f914bef33420341d553426b36def4130856","observation_id":"6f19b458-6964-4118-b3e8-de5a03a081fd","resolution":{"observed_at":"2026-08-05T10:36:55.437623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:36:55.499737Z","title":"Magicpose: Realistic human poses and facial expressions retargeting with identity-aware diffusion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:55.499737Z"},"links":{"citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:408d65ce1beb8ed39230b4ea7477ff31134cffa1e66d70220da09d1f8099fb46","observation_id":"a0884bf4-d635-46bb-87a5-e0fe8da07a45","resolution":{"observed_at":"2026-08-05T10:36:55.499737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05107","last_updated":"2023-12-11T11:00:13Z","snapshot_observed_at":"2026-07-06T16:58:51.683654Z","submitted_at":"2023-12-08T15:37:17Z","title":"DreaMoving: A Human Video Generation Framework based on Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05107","snapshot_observed_at":"2026-08-05T10:36:55.542297Z","title":"Dreamoving: A human dance video generation framework based on diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:55.542297Z"},"links":{"cited_paper":"/paper/2312.05107","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:cbfaadfb6b29740b98eafcd4e66d768703865843563040e12e42a49d4511b4d7","observation_id":"0aa3248d-5c1b-43a6-8876-4d88a106f95d","resolution":{"observed_at":"2026-08-05T10:36:55.542297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16393","last_updated":"2024-05-28T05:25:00Z","snapshot_observed_at":"2026-07-06T18:20:01.382394Z","submitted_at":"2024-05-26T00:53:26Z","title":"Disentangling Foreground and Background Motion for Enhanced Realism in Human Video Generation","version":2},"cited_work":{"arxiv_id":"2405.16393","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.16393","snapshot_observed_at":"2026-08-05T10:36:58.346870Z","title":"Disentangling Foreground and Background Motion for Enhanced Realism in Human Video Generation","venue":"cs.CV","work_id":"869aa1e2-2bda-43b8-a154-fabc4a424e3f","year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:55.595181Z"},"links":{"cited_paper":"/paper/2405.16393","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:99861b1149c9e59ac6425622c5bd6bb84c8b0f1a6a5bddf2c647d09becb4464f","observation_id":"cb9c6960-cff5-4172-adef-5badaf5e1108","resolution":{"observed_at":"2026-08-05T10:36:58.352828Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20325","last_updated":"2024-05-30T17:57:30Z","snapshot_observed_at":"2026-08-05T00:06:43.226806Z","submitted_at":"2024-05-30T17:57:30Z","title":"MotionFollower: Editing Video Motion via Lightweight Score-Guided Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20325","snapshot_observed_at":"2026-08-05T10:36:55.671513Z","title":"Motionfollower: Editing video motion via lightweight score-guided diffusion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:55.671513Z"},"links":{"cited_paper":"/paper/2405.20325","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:78a03ba6508899ab746f3d54d9e70d4219d4c373a14d861b92082313bad77e5c","observation_id":"6172c528-1170-46b3-a805-c2950208d190","resolution":{"observed_at":"2026-08-05T10:36:55.671513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01188","last_updated":"2024-06-03T10:51:10Z","snapshot_observed_at":"2026-07-06T18:24:17.711867Z","submitted_at":"2024-06-03T10:51:10Z","title":"UniAnimate: Taming Unified Video Diffusion Models for Consistent Human Image Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01188","snapshot_observed_at":"2026-08-05T10:36:55.691493Z","title":"Unianimate: Taming unified video diffusion models for consistent human image animation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:55.691493Z"},"links":{"cited_paper":"/paper/2406.01188","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:ad1f66ce3e48acd1eb479e3ff40229f460a9630ac900c71bd4b2098b13bc05d3","observation_id":"67aa83bb-1e4d-451d-8d3c-178e608f0a1e","resolution":{"observed_at":"2026-08-05T10:36:55.691493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T20:50:00.215211Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":91,"verified_exact":9,"verified_fuzzy":0},"total_outbound_references":228},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 100 of 228 outbound references and 0 inbound Pith citation observations for arXiv:2509.03883."}