{"as_of":"2026-08-16T22:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fd9ade74c325935f4948c4b0070150f84b5520c640088cdcce5caa0201e709d8","coverage":[{"denominator":84,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":84,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T17:42:41.582183Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":17,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T18:50:16.277725Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T10:09:44.567147Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.08248","snapshot_observed_at":"2026-08-05T18:50:16.277725Z","title":"Stableavatar: Infinite-length audio-driven avatar video generation.arXiv preprint arXiv:2508.08248,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.14033","last_updated":"2025-08-19T17:55:23Z","snapshot_observed_at":"2026-08-14T22:06:04.675421Z","submitted_at":"2025-08-19T17:55:23Z","title":"InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T18:50:16.277725Z"},"links":{"cited_paper":"/paper/2508.08248","citing_paper":"/paper/2508.14033"},"observation_digest":"sha256:18d4735b49406844ec1ee34b79098de45ca474108f83f6047db1ca3d075b1a34","observation_id":"3867d22b-ded7-46e9-8995-d25f4a2a5c66","resolution":{"observed_at":"2026-08-05T18:50:16.277725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"cited_work":{"arxiv_id":"2508.08248","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.08248","snapshot_observed_at":"2026-07-04T10:09:44.567147Z","title":"Stableavatar: Infinite-length audio-driven avatar video generation","venue":null,"work_id":"3574a448-3f7b-4866-9df3-518765342707","year":2025},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-13T11:03:16.956715Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":5},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-17T01:56:44.123092Z"},"links":{"cited_paper":"/paper/2508.08248","citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:04d88eaf2158d989f6a3d55eda5b5223367cd56898c9656f714e26d7dc176871","observation_id":"95b1e05f-eddc-4452-abb5-874588786b7c","resolution":{"observed_at":"2026-05-17T01:58:51.431375Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.08248","snapshot_observed_at":"2026-08-03T18:39:42.827965Z","title":"Sta- bleavatar: Infinite-length audio-driven avatar video generation.arXiv preprint arXiv:2508.08248, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-13T11:03:16.956715Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:42.827965Z"},"links":{"cited_paper":"/paper/2508.08248","citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:e15362eeb8f883ebee46c6d55812d98b4b99ea5c794f16c233b688743ca3d12e","observation_id":"8ec5b113-bb5e-47f2-8bf6-efac56ea9c95","resolution":{"observed_at":"2026-08-03T18:39:42.827965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"cited_work":{"arxiv_id":"2508.08248","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.08248","snapshot_observed_at":"2026-07-04T10:09:44.567147Z","title":"Stableavatar: Infinite-length audio-driven avatar video generation","venue":null,"work_id":"3574a448-3f7b-4866-9df3-518765342707","year":2025},"citing_paper":{"arxiv_id":"2602.13669","last_updated":"2026-04-22T07:41:44Z","snapshot_observed_at":"2026-08-11T04:55:53.338738Z","submitted_at":"2026-02-14T08:32:38Z","title":"EchoTorrent: Towards Swift, Sustained, and Streaming Multi-Modal Video Generation","version":5},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-15T22:20:16.320171Z"},"links":{"cited_paper":"/paper/2508.08248","citing_paper":"/paper/2602.13669"},"observation_digest":"sha256:a93ab937e8cb6b96de614af4018bb1ca45f31c1da5b72cd77ad621f6d3a3dbd9","observation_id":"97f45688-6707-4187-a32c-b9c874fd9b36","resolution":{"observed_at":"2026-05-15T22:20:22.337035Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"cited_work":{"arxiv_id":"2508.08248","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.08248","snapshot_observed_at":"2026-07-04T10:09:44.567147Z","title":"Stableavatar: Infinite-length audio-driven avatar video generation","venue":null,"work_id":"3574a448-3f7b-4866-9df3-518765342707","year":2025},"citing_paper":{"arxiv_id":"2604.07823","last_updated":"2026-04-14T22:09:01Z","snapshot_observed_at":"2026-08-12T18:55:29.657974Z","submitted_at":"2026-04-09T05:26:09Z","title":"LPM 1.0: Video-based Character Performance Model","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T17:09:17.360697Z"},"links":{"cited_paper":"/paper/2508.08248","citing_paper":"/paper/2604.07823"},"observation_digest":"sha256:536c522711c06397e685786be22afcc0c690ca46d18a2835c37a5d22be79fe7f","observation_id":"0dca01a7-ebba-41ad-80c9-80227c101f9a","resolution":{"observed_at":"2026-05-11T07:30:59.745520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"cited_work":{"arxiv_id":"2508.08248","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.08248","snapshot_observed_at":"2026-07-04T10:09:44.567147Z","title":"Stableavatar: Infinite-length audio-driven avatar video generation","venue":null,"work_id":"3574a448-3f7b-4866-9df3-518765342707","year":2025},"citing_paper":{"arxiv_id":"2604.10367","last_updated":"2026-04-11T22:34:21Z","snapshot_observed_at":"2026-08-04T17:39:32.698422Z","submitted_at":"2026-04-11T22:34:21Z","title":"Beyond Monologue: Interactive Talking-Listening Avatar Generation with Conversational Audio Context-Aware Kernels","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T15:16:53.603971Z"},"links":{"cited_paper":"/paper/2508.08248","citing_paper":"/paper/2604.10367"},"observation_digest":"sha256:6bee5890915e48347b9e71766d14837b659e31347582a2a662f80092e60b5cd8","observation_id":"a7811afd-0fe4-4b0d-b4b6-474076ee2096","resolution":{"observed_at":"2026-05-11T10:56:01.789969Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"cited_work":{"arxiv_id":"2508.08248","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.08248","snapshot_observed_at":"2026-07-04T10:09:44.567147Z","title":"Stableavatar: Infinite-length audio-driven avatar video generation","venue":null,"work_id":"3574a448-3f7b-4866-9df3-518765342707","year":2025},"citing_paper":{"arxiv_id":"2604.27918","last_updated":"2026-04-30T14:22:27Z","snapshot_observed_at":"2026-08-13T15:04:09.568604Z","submitted_at":"2026-04-30T14:22:27Z","title":"Generate Your Talking Avatar from Video Reference","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-07T05:32:04.519820Z"},"links":{"cited_paper":"/paper/2508.08248","citing_paper":"/paper/2604.27918"},"observation_digest":"sha256:1e42cd3fe2a5e5a297634e5586cc6107e629920afe4031d3d7d70ff183ad80e5","observation_id":"5a6660e7-8455-412e-89ec-95778ab559f1","resolution":{"observed_at":"2026-05-12T10:36:29.782699Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"cited_work":{"arxiv_id":"2508.08248","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.08248","snapshot_observed_at":"2026-07-04T10:09:44.567147Z","title":"Stableavatar: Infinite-length audio-driven avatar video generation","venue":null,"work_id":"3574a448-3f7b-4866-9df3-518765342707","year":2025},"citing_paper":{"arxiv_id":"2605.02948","last_updated":"2026-05-11T03:04:55Z","snapshot_observed_at":"2026-08-15T15:07:40.497568Z","submitted_at":"2026-05-01T16:38:06Z","title":"AsymTalker: Identity-Consistent Long-Term Talking Head Generation via Asymmetric Distillation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-09T20:19:39.565157Z"},"links":{"cited_paper":"/paper/2508.08248","citing_paper":"/paper/2605.02948"},"observation_digest":"sha256:6668b40d2a4fb62c91dd4ae1f8e561026dcaa4585428162bc06300efb24fabca","observation_id":"17b4dcd5-78dc-4c14-8a80-fa2c44e27751","resolution":{"observed_at":"2026-05-11T15:16:11.280276Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"cited_work":{"arxiv_id":"2508.08248","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.08248","snapshot_observed_at":"2026-07-04T10:09:44.567147Z","title":"Stableavatar: Infinite-length audio-driven avatar video generation","venue":null,"work_id":"3574a448-3f7b-4866-9df3-518765342707","year":2025},"citing_paper":{"arxiv_id":"2605.02948","last_updated":"2026-05-11T03:04:55Z","snapshot_observed_at":"2026-08-15T15:07:40.497568Z","submitted_at":"2026-05-01T16:38:06Z","title":"AsymTalker: Identity-Consistent Long-Term Talking Head Generation via Asymmetric Distillation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-11T02:18:58.996355Z"},"links":{"cited_paper":"/paper/2508.08248","citing_paper":"/paper/2605.02948"},"observation_digest":"sha256:1ee8167a0723a9d520b39daab2ebedb5f252252ef2c3711fcb720d1e3ea13ab4","observation_id":"d8a846bd-998e-44ee-adaa-e18a85700ebd","resolution":{"observed_at":"2026-05-11T03:45:57.481774Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"cited_work":{"arxiv_id":"2508.08248","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.08248","snapshot_observed_at":"2026-07-04T10:09:44.567147Z","title":"Stableavatar: Infinite-length audio-driven avatar video generation","venue":null,"work_id":"3574a448-3f7b-4866-9df3-518765342707","year":2025},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-16T00:14:17.051626Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"cited_paper":"/paper/2508.08248","citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:1bd4ad800bcc7dff56ad783c9954ec1e8d87aaf32bd7887c3f3478370fb0c48b","observation_id":"0a3db86e-b4d9-4a68-af6a-e10d66743f1b","resolution":{"observed_at":"2026-05-20T15:08:24.856783Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"cited_work":{"arxiv_id":"2508.08248","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.08248","snapshot_observed_at":"2026-07-04T10:09:44.567147Z","title":"Stableavatar: Infinite-length audio-driven avatar video generation","venue":null,"work_id":"3574a448-3f7b-4866-9df3-518765342707","year":2025},"citing_paper":{"arxiv_id":"2606.22905","last_updated":"2026-06-30T08:27:33Z","snapshot_observed_at":"2026-08-12T18:44:08.929234Z","submitted_at":"2026-06-22T06:41:17Z","title":"InteractiveAvatar: Real-Time Streaming Video Generation for Consistent and Intent-Aware Avatars","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-26T09:09:06.925645Z"},"links":{"cited_paper":"/paper/2508.08248","citing_paper":"/paper/2606.22905"},"observation_digest":"sha256:66eda9f135a4d43acf93400cc80f18ef20d817daa3c86bbe86e923d0239816b9","observation_id":"53551e67-339a-4fc9-bed6-9674e8388422","resolution":{"observed_at":"2026-07-04T10:09:44.568665Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"cited_work":{"arxiv_id":"2508.08248","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.08248","snapshot_observed_at":"2026-07-04T10:09:44.567147Z","title":"Stableavatar: Infinite-length audio-driven avatar video generation","venue":null,"work_id":"3574a448-3f7b-4866-9df3-518765342707","year":2025},"citing_paper":{"arxiv_id":"2606.22905","last_updated":"2026-06-30T08:27:33Z","snapshot_observed_at":"2026-08-12T18:44:08.929234Z","submitted_at":"2026-06-22T06:41:17Z","title":"InteractiveAvatar: Real-Time Streaming Video Generation for Consistent and Intent-Aware Avatars","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-01T07:00:53.496569Z"},"links":{"cited_paper":"/paper/2508.08248","citing_paper":"/paper/2606.22905"},"observation_digest":"sha256:1a0f662cf9cd9e461bae8f67e139d4911ce0c20e312dcd2ef8deb61e6101548c","observation_id":"9a9792b3-173e-4831-91b2-a9640321a30f","resolution":{"observed_at":"2026-07-01T07:05:29.169879Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"cited_work":{"arxiv_id":"2508.08248","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.08248","snapshot_observed_at":"2026-07-04T10:09:44.567147Z","title":"Stableavatar: Infinite-length audio-driven avatar video generation","venue":null,"work_id":"3574a448-3f7b-4866-9df3-518765342707","year":2025},"citing_paper":{"arxiv_id":"2607.01222","last_updated":"2026-07-01T17:56:39Z","snapshot_observed_at":"2026-08-04T02:18:09.786163Z","submitted_at":"2026-07-01T17:56:39Z","title":"Ink3D: Sculpting 3D Assets with Extremely Complex Textures via Video Generative Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-02T13:16:16.676244Z"},"links":{"cited_paper":"/paper/2508.08248","citing_paper":"/paper/2607.01222"},"observation_digest":"sha256:296c6d21a5aa32528e08e55429122b808be0a8177d481a7dbd27ed5fcd5fe433","observation_id":"882b8048-118f-4e4d-b328-edbcce86fe21","resolution":{"observed_at":"2026-07-02T13:16:58.053509Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.08248","snapshot_observed_at":"2026-07-12T04:46:57.581402Z","title":"Stableavatar: Infinite-length audio-driven avatar video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-12T04:46:57.581402Z"},"links":{"cited_paper":"/paper/2508.08248","citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:fde2dd6d8936e705f6ad171e125f5f95b21f1d993a83865dbe06340cebdbd9b8","observation_id":"a78fb0de-f7ef-4e3a-939b-6d205f4d7b00","resolution":{"observed_at":"2026-07-12T04:46:57.581402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.08248","snapshot_observed_at":"2026-08-02T08:56:31.619017Z","title":"Stableavatar: Infinite-length audio-driven avatar video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-12T18:56:17.359554Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.619017Z"},"links":{"cited_paper":"/paper/2508.08248","citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:6d8e882af0980ab489cfb2ca9b172420d17fcee49780bc89f27c5777b55b62dd","observation_id":"62419ab1-da7b-4530-bc99-fb8a4f8b7e7d","resolution":{"observed_at":"2026-08-02T08:56:31.619017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.08248","snapshot_observed_at":"2026-07-31T17:08:11.848419Z","title":"arXiv preprint arXiv:2508.08248 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-16T22:25:24.499511Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:11.848419Z"},"links":{"cited_paper":"/paper/2508.08248","citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:b3c1b9a2936eae89e3ce04c3e44a81b8e79c2066230f307491d579b4efa2a234","observation_id":"94d852de-3e98-4137-a7e8-b664b39ce114","resolution":{"observed_at":"2026-07-31T17:08:11.848419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.08248","snapshot_observed_at":"2026-08-04T01:32:13.172496Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00079","last_updated":"2026-07-29T14:44:57Z","snapshot_observed_at":"2026-08-07T16:05:36.413106Z","submitted_at":"2026-07-29T14:44:57Z","title":"LeapTalk: Breaking the Latency-Quality Trade-off in Talking Head Generation","version":1},"reference_index":121,"source":"arxiv_source","source_observed_at":"2026-08-04T01:32:13.172496Z"},"links":{"cited_paper":"/paper/2508.08248","citing_paper":"/paper/2608.00079"},"observation_digest":"sha256:d95a4adb3de58b54b833ec51c07e67f20c0b2e24a67301a6db0bbd9a78c852ef","observation_id":"2e8ea637-0565-4ec6-8a97-7e2bd55c7ba1","resolution":{"observed_at":"2026-08-04T01:32:13.172496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.08248/citation-record","integrity":"/paper/2508.08248/integrity","json":"/paper/2508.08248/citation-record.json","paper":"/paper/2508.08248"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:42:40.977975Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:40.977975Z"},"links":{"citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:14629ad86fd675fefee3f8183b0fdba7a4875d9bd8b6f1521b52f6ee509424d0","observation_id":"c69d9c9a-e8d8-4be0-aabd-54805ae88541","resolution":{"observed_at":"2026-08-15T17:42:40.977975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04233","last_updated":"2024-05-07T11:52:49Z","snapshot_observed_at":"2026-08-16T13:54:44.432320Z","submitted_at":"2024-05-07T11:52:49Z","title":"Vidu: a Highly Consistent, Dynamic and Skilled Text-to-Video Generator with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04233","snapshot_observed_at":"2026-08-15T17:42:40.986932Z","title":"Vidu: a highly consistent, dynamic and skilled text-to-video generator with diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:40.986932Z"},"links":{"cited_paper":"/paper/2405.04233","citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:01338e4f1a6103d0808e400599144d3dc262df78f841f4654c7d9f2ef69f315f","observation_id":"839ed655-b625-40d3-8c84-1b09e90b6ab1","resolution":{"observed_at":"2026-08-15T17:42:40.986932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-16T12:52:49.101262Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-15T17:42:40.994346Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:40.994346Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:f6c7172c2934f270d409d6befd6dab6bbeb3a7f602ab87bec0cafe7f96b5e6dd","observation_id":"2ea6c613-1f58-41af-9fc4-8a9e08090952","resolution":{"observed_at":"2026-08-15T17:42:40.994346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:42:41.000851Z","title":"Generating long videos of dynamic scenes","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.000851Z"},"links":{"citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:82ee2898ef9bfa03f77ff085912d258decc1163a1a0196c8ce5afbe2fe7cc343","observation_id":"30a331b9-5a08-4b31-8ecf-63a8e2a5e77e","resolution":{"observed_at":"2026-08-15T17:42:41.000851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:42:41.009011Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.009011Z"},"links":{"citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:7a0254d878d6f9036e7049da7b52037dc0276d28af7428270d82d9cffa5a01f2","observation_id":"445ad62c-1336-4621-92b7-ae5303613afb","resolution":{"observed_at":"2026-08-15T17:42:41.009011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20156","last_updated":"2025-06-03T15:15:31Z","snapshot_observed_at":"2026-08-07T13:55:40.621856Z","submitted_at":"2025-05-26T15:57:27Z","title":"HunyuanVideo-Avatar: High-Fidelity Audio-Driven Human Animation for Multiple Characters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20156","snapshot_observed_at":"2026-08-15T17:42:41.019438Z","title":"Hunyuanvideo-avatar: High-fidelity audio-driven hu- man animation for multiple characters","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.019438Z"},"links":{"cited_paper":"/paper/2505.20156","citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:0a19e31d48fcc29e6e91e8c6cf04534e98fdbd4bc01edc4891ed3cd209fda438","observation_id":"0301e8b9-c0db-4444-bf66-3fabdaf38afe","resolution":{"observed_at":"2026-08-15T17:42:41.019438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:42:41.027937Z","title":"Echomimic: Lifelike audio-driven portrait animations through editable landmark conditions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.027937Z"},"links":{"citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:10eb1634183db5bf351d66d251a9550f981474fd8c7ee09bd4e699171dedd0d9","observation_id":"bf44ecba-104e-458e-83c4-0b6e6a565173","resolution":{"observed_at":"2026-08-15T17:42:41.027937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:42:43.395040Z","title":"Videoretalking: Audio-based lip synchronization for talking head video editing in the wild","venue":null,"work_id":"dd608875-52aa-4759-ab78-50c023575858","year":null},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.038911Z"},"links":{"citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:cc7e5e527df0e26576fe0ad8ca2d5b708fb0550bf4efef43d500bb08d1f346ee","observation_id":"c81f3aaf-6730-45c4-9239-864a998b2baa","resolution":{"observed_at":"2026-08-15T17:42:43.400049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:42:43.377199Z","title":"Out of time: auto- mated lip sync in the wild","venue":null,"work_id":"a92e3b6c-2068-482c-b2ae-2d1dfd5ade1c","year":2016},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.043125Z"},"links":{"citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:5ed8b0bc42fbfee38350cd2ccc336df3ba405aa11e3f10765ea44618405404c9","observation_id":"7e04000d-896b-4062-b456-7d911fb07474","resolution":{"observed_at":"2026-08-15T17:42:43.383022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:42:43.358264Z","title":"Hallo3: Highly dynamic and realistic portrait image animation with video diffusion transformer","venue":null,"work_id":"66e2c849-f767-4e79-acf8-5bc0c70d1345","year":2025},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.048540Z"},"links":{"citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:f39b3158e229b7e8dc89f0b07b37b1dd2580fe0ffbf594d9720c8488ddb9790f","observation_id":"cdd1946f-fe20-4967-8b3f-87f02a926cb4","resolution":{"observed_at":"2026-08-15T17:42:43.364898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:42:43.338179Z","title":"Arcface: Additive angular margin loss for deep face recognition","venue":null,"work_id":"17680e26-b53e-471c-be05-9fc04a1f50e7","year":2019},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.055606Z"},"links":{"citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:f811d001997a8c61e71e767b9ad0e97c450945930bc29fa9894af9f419cbaed2","observation_id":"7ea366e1-574e-4abc-9a2d-2dc7bc378601","resolution":{"observed_at":"2026-08-15T17:42:43.344353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:42:41.061019Z","title":"Diffusion models beat gans on image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.061019Z"},"links":{"citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:dc67723364e4ed962e46e6d5fa8017419ce5afd98f8c0923768d479f14686fb2","observation_id":"a073ec08-2b39-4528-ad1c-3ad2e510a00c","resolution":{"observed_at":"2026-08-15T17:42:41.061019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.03619","last_updated":"2018-08-09T21:22:37Z","snapshot_observed_at":"2026-08-14T19:27:22.210405Z","submitted_at":"2018-04-10T16:28:59Z","title":"Looking to Listen at the Cocktail Party: A Speaker-Independent Audio-Visual Model for Speech Separation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.03619","snapshot_observed_at":"2026-08-15T17:42:41.066587Z","title":"Looking to listen at the cocktail party: A speaker-independent audio-visual model for speech sepa- ration","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.066587Z"},"links":{"cited_paper":"/paper/1804.03619","citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:d9e7dea0e7ad9fadec1f6df635d7b517029c103ecacc5b5a0bfb51b47f046f59","observation_id":"60559ac8-fca3-4e86-bc87-26c13f473b96","resolution":{"observed_at":"2026-08-15T17:42:41.066587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18866","last_updated":"2025-06-23T17:33:03Z","snapshot_observed_at":"2026-08-15T18:39:33.154486Z","submitted_at":"2025-06-23T17:33:03Z","title":"OmniAvatar: Efficient Audio-Driven Avatar Video Generation with Adaptive Body Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18866","snapshot_observed_at":"2026-08-15T17:42:41.074231Z","title":"Omniavatar: Efficient audio-driven avatar video generation with adaptive body animation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.074231Z"},"links":{"cited_paper":"/paper/2506.18866","citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:a89e151872f40187a3130ec3c4873a92f3c99b54e394b5e64e6fd7696788e058","observation_id":"d14334f3-82d7-4d7c-807f-ce0f470b4a1b","resolution":{"observed_at":"2026-08-15T17:42:41.074231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:42:43.306009Z","title":"Toontalker: Cross-domain face reenactment","venue":null,"work_id":"ca5c3c21-405f-47d0-a08f-df220d989565","year":2023},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.085158Z"},"links":{"citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:9b17246da22329bd87d9710ba1ebef6e3e11a431dfd0220ac6f3c80f0c9c09be","observation_id":"9bbeb57a-835d-40c2-87ad-61aa52dbd58c","resolution":{"observed_at":"2026-08-15T17:42:43.312956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:42:41.093788Z","title":"Generative adversarial networks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.093788Z"},"links":{"citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:5eb66b992ca9c2282a68dec06c052ce38874a7bc63ebc84ba3cf94d75fef9f49","observation_id":"da82443d-76c7-4a9d-8083-2525ccdffdfb","resolution":{"observed_at":"2026-08-15T17:42:41.093788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:42:43.280095Z","title":"Stylesync: High-fidelity generalized and personalized lip sync in style-based genera- tor","venue":null,"work_id":"a97bd932-f7e4-49b4-aa7f-1b55a8f7acc6","year":2023},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.100639Z"},"links":{"citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:e28e0131f78817bba4d2c8c331414122ab860c7594d251d46ab20126ccaadd34","observation_id":"d28bd83a-dd02-4ebd-aeb2-c54ec80b9402","resolution":{"observed_at":"2026-08-15T17:42:43.286683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:42:41.108850Z","title":"Animatediff: Animate your personalized text-to- image diffusion models without specific tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.108850Z"},"links":{"citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:ced0e7bacc28302ecf1cf547f79638c98503fc9b71f09a3b73ca7fce6bf1b568","observation_id":"6c035ce8-f966-443a-8bce-d0115951af3d","resolution":{"observed_at":"2026-08-15T17:42:41.108850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:42:43.229557Z","title":"Flexible diffusion modeling of long videos","venue":null,"work_id":"0d95d620-b844-4f50-9899-1bc326a8c0f2","year":2022},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.118692Z"},"links":{"citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:9efe3beb895307c4745d92199135f3dd548e664eef2ab9bf15a9bb04ba997b16","observation_id":"72d6ce37-226d-49f0-b124-a05aabce093c","resolution":{"observed_at":"2026-08-15T17:42:43.238950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:42:43.212533Z","title":"Streamingt2v: Con- sistent, dynamic, and extendable long video generation from text","venue":null,"work_id":"7b7a47f3-8164-4c24-b4d6-3d8aceb5c312","year":2025},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.125330Z"},"links":{"citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:b7c7d648214e27f4a64f6124df96fb83f6d9bf2d7555b69f7df1f8d4c22fab0e","observation_id":"7036fcbe-ce39-4256-9ac7-6fed99f94b43","resolution":{"observed_at":"2026-08-15T17:42:43.217461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01626","last_updated":"2022-08-02T17:55:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-02T17:55:41Z","title":"Prompt-to-Prompt Image Editing with Cross Attention Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01626","snapshot_observed_at":"2026-08-15T17:42:41.131913Z","title":"Prompt-to-prompt im- age editing with cross attention control","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.131913Z"},"links":{"cited_paper":"/paper/2208.01626","citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:4d44583500c9ba6ac7101da97a5a630d729c267d101a5091c78497b8da1239c6","observation_id":"803e194a-f107-4bc8-a5f0-980f52030910","resolution":{"observed_at":"2026-08-15T17:42:41.131913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:42:43.194297Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium","venue":null,"work_id":"96f43fb0-8adc-45b7-98ff-2b9f70a225a1","year":2017},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.136957Z"},"links":{"citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:7632297983c15eadcb190af699dc002abd0b99a2d58666c80961b408ab17d2ab","observation_id":"cab46965-6aea-445a-8f6d-e25e56b2fa94","resolution":{"observed_at":"2026-08-15T17:42:43.200218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-14T06:37:15.299690Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-15T17:42:41.142589Z","title":"Classifier-free diffusion guidance","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.142589Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:ab55f1b20969ca6823c35892e60f2706ad53a04216c576b0c73623c3ab25f5ee","observation_id":"f8fd2980-13dc-4fcb-ab8c-33476defee4d","resolution":{"observed_at":"2026-08-15T17:42:41.142589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:42:41.148234Z","title":"Denoising diffu- sion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.148234Z"},"links":{"citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:d38bbb436dc80901c9048e5c132ecb46c722358012f3709719d6239d1519dcde","observation_id":"91c0c1ab-017a-4166-a72a-2f914d74ca87","resolution":{"observed_at":"2026-08-15T17:42:41.148234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:42:41.153667Z","title":"Cascaded diffusion models for high fidelity image generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.153667Z"},"links":{"citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:ea28f5c212a0698b4ba2c665ea3476baadf3061b077c862e0d8bbe7b25b76cb8","observation_id":"5a105573-43e1-4e47-b88b-cdfa8b707e0d","resolution":{"observed_at":"2026-08-15T17:42:41.153667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15868","last_updated":"2022-05-29T19:02:15Z","snapshot_observed_at":"2026-08-12T19:21:15.526321Z","submitted_at":"2022-05-29T19:02:15Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15868","snapshot_observed_at":"2026-08-15T17:42:41.158973Z","title":"Cogvideo: Large-scale pretraining for text-to-video generation via transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.158973Z"},"links":{"cited_paper":"/paper/2205.15868","citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:4336dc64f77f358193c5f83f98130c7aafa7e4b86e01cb7f07e25512eeb0e1c3","observation_id":"3b2a53f8-9892-44e3-956c-e211d0b7aef3","resolution":{"observed_at":"2026-08-15T17:42:41.158973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:42:43.141618Z","title":"Sonic: Shifting focus to global audio perception in portrait animation","venue":null,"work_id":"ef6de24c-bcd2-44d9-9ee6-b989ca080b07","year":2025},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.164964Z"},"links":{"citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:e0db05b3a272860c78eedc2030c9a8f9572755e1a6369161968a2e790b0a2c14","observation_id":"3534acf8-c5ac-428a-844d-93c2408f5574","resolution":{"observed_at":"2026-08-15T17:42:43.149756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02634","last_updated":"2025-04-04T05:13:40Z","snapshot_observed_at":"2026-08-16T13:21:27.388712Z","submitted_at":"2024-09-04T11:55:14Z","title":"Loopy: Taming Audio-Driven Portrait Avatar with Long-Term Motion Dependency","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02634","snapshot_observed_at":"2026-08-15T17:42:41.170885Z","title":"Loopy: Taming audio-driven portrait avatar with long-term motion dependency","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.170885Z"},"links":{"cited_paper":"/paper/2409.02634","citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:df4dc3fc443a7963ef35d2a85bd282a5fe511a5aef73425e7cc5835c759d98d4","observation_id":"d894506c-96fe-4f5a-8312-9ad9101195b8","resolution":{"observed_at":"2026-08-15T17:42:41.170885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-13T14:41:45.809481Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-15T17:42:41.175771Z","title":"Hunyuanvideo: A systematic framework for large video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.175771Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:c8539080f9faa4f84293ebc2c720a19a8b23ccf6ee7d18270237595f94ca02bc","observation_id":"0cffeb50-3fb2-4455-a4c1-c8848a00ed8c","resolution":{"observed_at":"2026-08-15T17:42:41.175771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22647","last_updated":"2025-05-28T17:57:06Z","snapshot_observed_at":"2026-08-07T20:49:17.257002Z","submitted_at":"2025-05-28T17:57:06Z","title":"Let Them Talk: Audio-Driven Multi-Person Conversational Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22647","snapshot_observed_at":"2026-08-15T17:42:41.185614Z","title":"Let them talk: Audio-driven multi-person conversa- tional video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.185614Z"},"links":{"cited_paper":"/paper/2505.22647","citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:1d5eaac0a2fe5af819940cf5f73dc2651bbc2b2ba685242fbd64318b2aef901e","observation_id":"9138e043-e8ec-4bc5-b3e6-77ca87adc231","resolution":{"observed_at":"2026-08-15T17:42:41.185614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:42:43.115092Z","title":"Latentsync: Audio conditioned latent diffusion models for lip sync","venue":null,"work_id":"ba6c6696-eec9-4670-b4fa-f681f1a9dfdb","year":2024},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.192847Z"},"links":{"citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:268b7bb0e4988a713ef4e5f365cebbc7bab70271029c7bc7cffd0f2fff00d08f","observation_id":"cc0d49b1-2c46-4716-99d2-147d8707d79d","resolution":{"observed_at":"2026-08-15T17:42:43.122274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:42:41.199776Z","title":"Magicmotion: Controllable video genera- tion with dense-to-sparse trajectory guidance","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.199776Z"},"links":{"citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:cea38838666303d0403fc2f43342cabc59569ce88c41dbaba00545b988742441","observation_id":"27ece483-d068-4a83-aa1e-e6782a867e94","resolution":{"observed_at":"2026-08-15T17:42:41.199776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:42:43.099199Z","title":"Cyberhost: A one-stage diffusion framework for audio-driven talking body generation","venue":null,"work_id":"9f1c41c3-c8f2-41fd-819c-95d0d5adcac1","year":2025},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.204451Z"},"links":{"citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:b6d9f89aac5947ace231082410cfd6216bd7d7824554942a59d89684068c2163","observation_id":"5aac34a8-2018-454c-b74d-15b8bddc6393","resolution":{"observed_at":"2026-08-15T17:42:43.104390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01061","last_updated":"2025-06-30T08:26:56Z","snapshot_observed_at":"2026-08-15T11:53:30.534687Z","submitted_at":"2025-02-03T05:17:32Z","title":"OmniHuman-1: Rethinking the Scaling-Up of One-Stage Conditioned Human Animation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01061","snapshot_observed_at":"2026-08-15T17:42:41.213234Z","title":"Omnihuman-1: Rethinking the scaling-up of one-stage conditioned human animation models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.213234Z"},"links":{"cited_paper":"/paper/2502.01061","citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:c4d2c506505879a9e5fda3c0ebdecdec0bcf8d722cd3ba001ccbbded95c55f7d","observation_id":"3e09dfa9-6353-457d-90a2-c6c8a7e1481e","resolution":{"observed_at":"2026-08-15T17:42:41.213234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-16T02:30:42.660030Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-15T17:42:41.220929Z","title":"Flow matching for generative mod- eling","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.220929Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:9affb2f47a2112f776ab51e636e137f26d8898f020595f18370cf2df547af144","observation_id":"8b05a0bf-5f53-4b93-a819-6fbc1823d3be","resolution":{"observed_at":"2026-08-15T17:42:41.220929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11079","last_updated":"2025-04-10T10:24:37Z","snapshot_observed_at":"2026-08-16T12:58:02.352853Z","submitted_at":"2025-02-16T11:02:50Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11079","snapshot_observed_at":"2026-08-15T17:42:41.228859Z","title":"Phantom: Subject-consistent video generation via cross- modal alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.228859Z"},"links":{"cited_paper":"/paper/2502.11079","citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:9c79a47b92a6f98c7cdb62e8c366bc47b4abf90308acafb4568d7e6849de1ebc","observation_id":"f2cf013e-3fff-4eb4-9ca7-031795e4bd32","resolution":{"observed_at":"2026-08-15T17:42:41.228859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.00162","last_updated":"2025-06-30T18:11:21Z","snapshot_observed_at":"2026-08-16T18:58:53.286701Z","submitted_at":"2025-06-30T18:11:21Z","title":"FreeLong++: Training-Free Long Video Generation via Multi-band SpectralFusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.00162","snapshot_observed_at":"2026-08-15T17:42:41.236296Z","title":"Freelong++: Training-free long video generation via multi-band spectralfusion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.236296Z"},"links":{"cited_paper":"/paper/2507.00162","citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:dfd7094f492e5dc1d90a7684c473369db7208e074646f960ef221bd04aafbd34","observation_id":"2226dbe0-4063-43ef-951a-efe244027142","resolution":{"observed_at":"2026-08-15T17:42:41.236296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:42:43.081726Z","title":"Free- long: Training-free long video generation with spectralblend temporal attention","venue":null,"work_id":"bbf101f5-a894-4c66-a8fc-d16481968ae6","year":2024},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.242401Z"},"links":{"citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:f4f7e77b18bd32a25bd6bba0c61fd7f620567612653dd4089db1c52bdf340a13","observation_id":"b61a8e22-2179-4def-9901-440d8b9091d0","resolution":{"observed_at":"2026-08-15T17:42:43.086814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.08172","last_updated":"2019-06-14T05:49:22Z","snapshot_observed_at":"2026-08-15T17:22:09.610128Z","submitted_at":"2019-06-14T05:49:22Z","title":"MediaPipe: A Framework for Building Perception Pipelines","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.08172","snapshot_observed_at":"2026-08-15T17:42:41.253407Z","title":"Medi- apipe: A framework for building perception pipelines","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.253407Z"},"links":{"cited_paper":"/paper/1906.08172","citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:892909c0bc7ab05bde08127d52ca2827b8d23005921247245d3aefec45efb57c","observation_id":"a9db388b-756c-4ee9-9607-2c955c912bda","resolution":{"observed_at":"2026-08-15T17:42:41.253407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:42:41.261434Z","title":"Sdedit: Guided image synthesis and editing with stochastic differential equa- tions","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.261434Z"},"links":{"citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:70d15ba19878b0da6f3d8252641a032fe79f068f9979510a7192765047d3af01","observation_id":"bed4585e-a05a-4b7f-8bfe-675551417018","resolution":{"observed_at":"2026-08-15T17:42:41.261434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:42:43.053472Z","title":"Echomimicv2: Towards striking, simplified, and semi-body human animation","venue":null,"work_id":"a2551ba4-a8be-4d30-86f8-0c3728af0753","year":2025},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.272599Z"},"links":{"citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:6863304cc87c52cc594abe21fd30dbe5a3cc07d973b736e6336477a696906e06","observation_id":"a1f00a5f-109c-42c5-9620-489fdbe9ddfe","resolution":{"observed_at":"2026-08-15T17:42:43.058999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:42:41.287406Z","title":"Improved denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.287406Z"},"links":{"citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:8152ac44682d2fb445a31d08f50de1466470aae453ea061590e1d5eb436362bd","observation_id":"547de582-4b04-4f7e-b6f0-1330e679cb6a","resolution":{"observed_at":"2026-08-15T17:42:41.287406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:42:43.023540Z","title":"Dpe: Disen- tanglement of pose and expression for general video portrait editing","venue":null,"work_id":"be69de24-b5d3-4666-a31d-fb6428356234","year":2023},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.292896Z"},"links":{"citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:91a55023f45fbbca715d82a796eab5c4799107ac318ab4f2afed13d876a74b1d","observation_id":"cbeb2677-d5da-47a7-b42d-0a588335d867","resolution":{"observed_at":"2026-08-15T17:42:43.029288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:42:41.301544Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.301544Z"},"links":{"citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:db73050f984eb7e672a142e3932f61f8b7e6f37b5eb0fe2dcfaa031caf27d94d","observation_id":"77036fed-9c00-4116-8d2f-118fbb7f08d0","resolution":{"observed_at":"2026-08-15T17:42:41.301544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15169","last_updated":"2024-01-30T16:44:20Z","snapshot_observed_at":"2026-08-16T14:49:38.190260Z","submitted_at":"2023-10-23T17:59:58Z","title":"FreeNoise: Tuning-Free Longer Video Diffusion via Noise Rescheduling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15169","snapshot_observed_at":"2026-08-15T17:42:41.307854Z","title":"Freenoise: Tuning-free longer video diffusion via noise rescheduling.arXiv preprint arXiv:2310.15169, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.307854Z"},"links":{"cited_paper":"/paper/2310.15169","citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:783d0550948d0837d459ea93bd94686e09addf06eb7cfd15e077f8057c82c384","observation_id":"5982f282-a473-4b47-b71c-4563fe7b585f","resolution":{"observed_at":"2026-08-15T17:42:41.307854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:42:41.312923Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.312923Z"},"links":{"citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:9ec8adf40c2f17d83e006f7f5e7a1de7e3d0a9e2e7318883846e5ad666f9a18a","observation_id":"f3d31eb9-738a-46fa-89f8-245afc1bfde6","resolution":{"observed_at":"2026-08-15T17:42:41.312923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:42:41.322616Z","title":"High-resolution image syn- thesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.322616Z"},"links":{"citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:f21655f4d4f4a9191c7d301879fe43cfb8cdfabda7c168b2ddd7d848e8625c3e","observation_id":"2e556a22-bd27-4978-b46e-e7ac1b40a17a","resolution":{"observed_at":"2026-08-15T17:42:41.322616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:42:42.971370Z","title":"The ciede2000 color-difference formula: Implementation notes, supplementary test data, and mathematical observations","venue":null,"work_id":"e031b89f-6282-4e55-870a-3ec7f64b2e52","year":2005},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.328388Z"},"links":{"citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:e7b9f9deb26178822e17666267d4afdce5872229617b92c1fa8d8e5da65d4fa1","observation_id":"f11d1407-3a35-46fd-abea-c6187b901027","resolution":{"observed_at":"2026-08-15T17:42:42.975577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-15T17:42:41.338827Z","title":"Make-a-video: Text-to-video generation without text-video data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.338827Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:3455addc339a4fae8f952e28735abc7a8ef6f146ef37a87cf86fe9249e1cdc52","observation_id":"8db41c13-255c-4ebb-8668-6a139372ddbb","resolution":{"observed_at":"2026-08-15T17:42:41.338827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:42:42.951041Z","title":"Stylegan-v: A continuous video generator with the price, image quality and perks of stylegan2","venue":null,"work_id":"ff716e95-1455-4b47-adb8-8a34d4cfb630","year":2022},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.346383Z"},"links":{"citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:c9a8b824d91dee7a611d60400b225aa9ac03b55713029fcdc4c061144c25c874","observation_id":"4cf07a77-92dd-44ae-a749-67f9d9f99562","resolution":{"observed_at":"2026-08-15T17:42:42.958485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:42:41.353304Z","title":"Denois- ing diffusion implicit models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.353304Z"},"links":{"citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:24c573b0e4bd5c272084deb41604254c7dc3050b72d15312f318525d005cd857","observation_id":"2d8a0822-61a7-457f-829b-037d357af0b3","resolution":{"observed_at":"2026-08-15T17:42:41.353304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:42:42.918257Z","title":null,"venue":null,"work_id":"776d3a8a-604b-44e7-8ed1-ccc8a23e8d31","year":2022},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.359057Z"},"links":{"citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:028da2d6a05fbd873c709a717e56151c3a09e7c7c5d67e3bd9c724344cf022d4","observation_id":"1b0ab518-e0da-4b86-a50d-cd2e61c133f6","resolution":{"observed_at":"2026-08-15T17:42:42.924782Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:42:42.901717Z","title":"Score-based generative modeling through stochastic differential equa- tions","venue":null,"work_id":"3887ea28-7f9a-467c-afcc-cd1e44cd60af","year":2021},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.363005Z"},"links":{"citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:9798513cdf121287fafc7680959147da8ca6d2c820086038c18d7118813628ac","observation_id":"a31dc00a-7c83-40d1-a81c-850ad50a2d8d","resolution":{"observed_at":"2026-08-15T17:42:42.907752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:42:42.885625Z","title":"Emo: Emote portrait alive generating expressive portrait videos with audio2video diffusion model under weak conditions","venue":null,"work_id":"68ca2fa2-c1bb-48fe-851b-5a57fae79fb2","year":2024},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.368359Z"},"links":{"citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:8ff587e88e881bd42b723c4c24de097cc35d09a490f185824d1b2797fc302ba1","observation_id":"26b9c185-c63c-42d8-8626-bfaef8680b1c","resolution":{"observed_at":"2026-08-15T17:42:42.890553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-15T05:23:08.447798Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10687","snapshot_observed_at":"2026-08-15T17:42:41.372498Z","title":"Emo2: End-effector guided audio-driven avatar video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.372498Z"},"links":{"cited_paper":"/paper/2501.10687","citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:b59c2ddadf6fba6d88e9701087322a1cd5ab94bff929a9d128a2588555c778be","observation_id":"9bcad11c-f830-4166-bf18-e135b4ea1500","resolution":{"observed_at":"2026-08-15T17:42:41.372498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:42:42.862194Z","title":"Nonlinear 3d face morphable model","venue":null,"work_id":"6a6383c8-bbf1-4220-8d70-01907dcbf4b1","year":2018},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.382516Z"},"links":{"citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:ccb43d294a68f318cd8e1457caa8fa044cde94409869df3083f87bdbde6fded5","observation_id":"07b1d5e9-3f7f-4165-83f4-b143ddae5752","resolution":{"observed_at":"2026-08-15T17:42:42.871456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:42:41.389449Z","title":"Consistent view synthesis with pose-guided diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.389449Z"},"links":{"citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:b5838bbeda35bd8cd74b6a558745155a620774fef786e4a9905a531a807c2248","observation_id":"50654bc0-6ac5-402a-870d-f4b451e28703","resolution":{"observed_at":"2026-08-15T17:42:41.389449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:42:42.818342Z","title":"Implicit temporal modeling with learn- able alignment for video recognition","venue":null,"work_id":"7639b29b-1b45-4845-b096-cd158ef96ec3","year":2023},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.394772Z"},"links":{"citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:8d3c11d1a5b66a0ad0aee2e5dc27186ae3a087125dc5fc81977170c1b50f8d42","observation_id":"16f1a1fe-f5b1-4144-b0fc-3c5c05ca5566","resolution":{"observed_at":"2026-08-15T17:42:42.823995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:42:42.793077Z","title":"Motioneditor: Editing video motion via content-aware diffusion","venue":null,"work_id":"11079547-26f4-4dd6-befc-2ad38b551493","year":2024},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.399732Z"},"links":{"citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:7cf72c0db43c90606c63bd92c7b8ce64f862522f08866da6f0953ee5414218f7","observation_id":"ffba25b5-47c9-4d14-87a8-ca07947658b2","resolution":{"observed_at":"2026-08-15T17:42:42.799720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20325","last_updated":"2024-05-30T17:57:30Z","snapshot_observed_at":"2026-08-16T13:47:38.427202Z","submitted_at":"2024-05-30T17:57:30Z","title":"MotionFollower: Editing Video Motion via Lightweight Score-Guided Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20325","snapshot_observed_at":"2026-08-15T17:42:41.405005Z","title":"Motionfollower: Editing video motion via lightweight score-guided diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.405005Z"},"links":{"cited_paper":"/paper/2405.20325","citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:83f337aae3a43a3602788a61fbc7ca1c8b0e0644f28a9fa127f9c8ba2628443b","observation_id":"b69dfc47-5a15-4e94-b6b0-c71bc700ad63","resolution":{"observed_at":"2026-08-15T17:42:41.405005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:42:42.762419Z","title":"Stableanimator: High- quality identity-preserving human image animation","venue":null,"work_id":"7357995b-869f-48c5-b2eb-455f5af83938","year":2025},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.412853Z"},"links":{"citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:15e05033881ae7406e604f4d4baf9888516e3676021e7786b68f419c254b709f","observation_id":"a1ff18fd-b0cb-47b8-9568-6cb46e6f2aaa","resolution":{"observed_at":"2026-08-15T17:42:42.774818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15064","last_updated":"2025-07-20T17:59:26Z","snapshot_observed_at":"2026-08-15T16:12:36.596591Z","submitted_at":"2025-07-20T17:59:26Z","title":"StableAnimator++: Overcoming Pose Misalignment and Face Distortion for Human Image Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15064","snapshot_observed_at":"2026-08-15T17:42:41.421511Z","title":"Sta- bleanimator++: Overcoming pose misalignment and face distortion for human image animation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.421511Z"},"links":{"cited_paper":"/paper/2507.15064","citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:4e24cf35366ddc95494c4a9386c6c1b2e0372be7e65f6252e71a615a5ee7a503","observation_id":"c39e102a-8d8f-46cd-b47d-ffdb66bc6924","resolution":{"observed_at":"2026-08-15T17:42:41.421511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:42:41.429589Z","title":"Plug-and-play diffusion features for text-driven image-to-image translation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.429589Z"},"links":{"citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:0e6f6182588a74a30adbd6894a4913774e0f17618e1619dd88a1248d41afba91","observation_id":"d41c2c12-8a3a-49ac-beff-c3ca9504c309","resolution":{"observed_at":"2026-08-15T17:42:41.429589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-08-15T00:26:15.250313Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-15T17:42:41.438169Z","title":"To- wards accurate generative models of video: A new metric & challenges","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.438169Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:4aba657ac9c242cea3f20ae1724039ffbfa875bf5f628286ce5e5d93502fd1c4","observation_id":"a2ce71c7-6984-4cd2-b9f6-99a20a8765a5","resolution":{"observed_at":"2026-08-15T17:42:41.438169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:42:42.708079Z","title":"Mcvd-masked conditional video diffusion for prediction, generation, and interpolation","venue":null,"work_id":"b716c409-7bb6-4a98-8d79-f47f4b64b4d9","year":2022},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.447198Z"},"links":{"citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:e2e1eb354ec0f7eeb7ecab88b5523c2636e1197ccece2accc325e13deae67d29","observation_id":"7f6b674d-beb3-441d-81c4-42d8e84c8299","resolution":{"observed_at":"2026-08-15T17:42:42.726162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-08-12T22:34:51.361078Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-15T17:42:41.456020Z","title":"Wan: Open and advanced large-scale video generative models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.456020Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:49469eb782dff7b2229b285cbc279566c498b35534ce254b404ca63ed5945591","observation_id":"2c3792d9-8b8f-4bf9-a43e-ee69ed0b428a","resolution":{"observed_at":"2026-08-15T17:42:41.456020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02511","last_updated":"2024-06-04T17:32:52Z","snapshot_observed_at":"2026-08-16T13:46:11.086947Z","submitted_at":"2024-06-04T17:32:52Z","title":"V-Express: Conditional Dropout for Progressive Training of Portrait Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02511","snapshot_observed_at":"2026-08-15T17:42:41.462685Z","title":"V-express: Conditional dropout for progres- sive training of portrait video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.462685Z"},"links":{"cited_paper":"/paper/2406.02511","citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:5fb652223d96f6106fdc7903b420d0351e282d86d6948313b51287f70bba5194","observation_id":"bd0d2812-c1c1-47d0-9891-71082cba091c","resolution":{"observed_at":"2026-08-15T17:42:41.462685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18264","last_updated":"2023-05-29T17:38:18Z","snapshot_observed_at":"2026-08-16T15:28:36.013854Z","submitted_at":"2023-05-29T17:38:18Z","title":"Gen-L-Video: Multi-Text to Long Video Generation via Temporal Co-Denoising","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18264","snapshot_observed_at":"2026-08-15T17:42:41.473093Z","title":"Gen-l-video: Multi-text to long video generation via temporal co-denoising","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.473093Z"},"links":{"cited_paper":"/paper/2305.18264","citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:8cfb3f9e8c22d239a09964842ab331dcd84fc65de6e01288542fa37f72954e42","observation_id":"2f87002f-248d-49e6-a418-524b8d753cb8","resolution":{"observed_at":"2026-08-15T17:42:41.473093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04842","last_updated":"2025-04-07T08:56:01Z","snapshot_observed_at":"2026-08-16T12:43:28.043771Z","submitted_at":"2025-04-07T08:56:01Z","title":"FantasyTalking: Realistic Talking Portrait Generation via Coherent Motion Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04842","snapshot_observed_at":"2026-08-15T17:42:41.482324Z","title":"Fanta- sytalking: Realistic talking portrait generation via coherent motion synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.482324Z"},"links":{"cited_paper":"/paper/2504.04842","citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:3d9cdd3c2450c1d6a626f20257fb9e2b073d50402071cf4e8d1533c07f40fabf","observation_id":"44aa8c24-ece2-49ce-8ead-a57373747d9f","resolution":{"observed_at":"2026-08-15T17:42:41.482324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04468","last_updated":"2024-01-09T10:12:52Z","snapshot_observed_at":"2026-08-16T14:28:51.989546Z","submitted_at":"2024-01-09T10:12:52Z","title":"MagicVideo-V2: Multi-Stage High-Aesthetic Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04468","snapshot_observed_at":"2026-08-15T17:42:41.488248Z","title":"Magicvideo-v2: Multi- stage high-aesthetic video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.488248Z"},"links":{"cited_paper":"/paper/2401.04468","citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:a257ae352537ceb7427887a637c4c08cd40052a81c3118fe229a96d4d632ecd3","observation_id":"4904f2f5-c3d1-4421-969e-d2129fac2ac6","resolution":{"observed_at":"2026-08-15T17:42:41.488248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-16T14:06:16.545839Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-08-15T17:42:41.497013Z","title":"Aniportrait: Audio-driven synthesis of photorealistic portrait animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.497013Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:ed56777031833504b6f61e13d5d83d9899e1e7673e675b3ce1f967c263d381ae","observation_id":"3eb16f06-c3a9-4754-9280-3cd1f15c2b3c","resolution":{"observed_at":"2026-08-15T17:42:41.497013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15241","last_updated":"2024-11-12T06:08:29Z","snapshot_observed_at":"2026-08-16T13:23:25.032548Z","submitted_at":"2024-08-27T17:59:41Z","title":"GenRec: Unifying Video Generation and Recognition with Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15241","snapshot_observed_at":"2026-08-15T17:42:41.503095Z","title":"Genrec: Unifying video generation and recognition with diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.503095Z"},"links":{"cited_paper":"/paper/2408.15241","citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:23502fc3d671457b43ad7bb2f1a3d714d883ad05531865ab224afb13c8742550","observation_id":"a3464d82-edd5-4f5c-b21f-a51c0721ea37","resolution":{"observed_at":"2026-08-15T17:42:41.503095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17090","last_updated":"2023-12-28T16:10:25Z","snapshot_observed_at":"2026-08-02T07:14:02.308302Z","submitted_at":"2023-12-28T16:10:25Z","title":"Q-Align: Teaching LMMs for Visual Scoring via Discrete Text-Defined Levels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17090","snapshot_observed_at":"2026-08-15T17:42:41.509127Z","title":"Q-align: Teaching lmms for visual scoring via discrete text-defined levels","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.509127Z"},"links":{"cited_paper":"/paper/2312.17090","citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:5d18272fc76edd8ec0fafbe05a0f81ff13572092313d334f1f304109ef3d559c","observation_id":"ffb11c49-9339-4e67-8c00-cfa27a4b8669","resolution":{"observed_at":"2026-08-15T17:42:41.509127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:42:41.517365Z","title":"Tune-a-video: One-shot tuning of image diffusion models for text-to-video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.517365Z"},"links":{"citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:e3a3e4c1f18d521427e6aaccfc8e7d15329b585fe2d73b6a32abdc8143c1f14f","observation_id":"8e327c62-b157-4ba9-b99f-34ecbdecf7b1","resolution":{"observed_at":"2026-08-15T17:42:41.517365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:42:41.524102Z","title":"Simda: Simple diffusion adapter for efficient video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.524102Z"},"links":{"citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:c77838ab0b0363cc101824f220c813ac8faf1a4b5e3ffd2dc5e37c00dae2b6cd","observation_id":"8d106cc3-614e-4854-bd3e-65617fb31f80","resolution":{"observed_at":"2026-08-15T17:42:41.524102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06465","last_updated":"2024-06-10T17:02:08Z","snapshot_observed_at":"2026-08-16T13:44:28.228457Z","submitted_at":"2024-06-10T17:02:08Z","title":"AID: Adapting Image2Video Diffusion Models for Instruction-guided Video Prediction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06465","snapshot_observed_at":"2026-08-15T17:42:41.530158Z","title":"Aid: Adapting image2video diffusion mod- els for instruction-guided video prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.530158Z"},"links":{"cited_paper":"/paper/2406.06465","citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:1d232eea98c66617742d4c0c552b99ba7ba90df2b8c6823525ebd029be32181a","observation_id":"d284f919-94c6-461c-b9d3-571eab5a3249","resolution":{"observed_at":"2026-08-15T17:42:41.530158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:42:41.534966Z","title":"A survey on video dif- fusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.534966Z"},"links":{"citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:cf097a9cc2cbff1eb5b32585dae4c0acd20a05f693a752a5fa7df6877786f334","observation_id":"f07ec46e-52d9-48ec-965e-b7092b5d942f","resolution":{"observed_at":"2026-08-15T17:42:41.534966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-08-16T13:43:29.827089Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-08-15T17:42:41.546662Z","title":"Hallo: Hierarchical audio-driven visual synthesis for portrait image animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.546662Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:aa21d8f402ee752c3ea5cdabb562e89a8dd7b180752704cd5f4df95d89b1d904","observation_id":"02deb5b9-eea9-47b5-ae19-f1c4d44d3b15","resolution":{"observed_at":"2026-08-15T17:42:41.546662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:42:41.552940Z","title":"Styleheat: One-shot high-resolution editable talking face generation via pre-trained stylegan","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.552940Z"},"links":{"citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:7dd02fc3e7e56ea63f41cf3d6f005254ff3f30ddcd4bc26fc9305fcdf3c33582","observation_id":"f288fd74-31d8-49d4-b74c-ae1adaecb16f","resolution":{"observed_at":"2026-08-15T17:42:41.552940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.12346","last_updated":"2023-03-22T07:10:09Z","snapshot_observed_at":"2026-08-16T15:46:20.217004Z","submitted_at":"2023-03-22T07:10:09Z","title":"NUWA-XL: Diffusion over Diffusion for eXtremely Long Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.12346","snapshot_observed_at":"2026-08-15T17:42:41.557669Z","title":"Nuwa-xl: Diffusion over diffusion for extremely long video generation.arXiv preprint arXiv:2303.12346, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.557669Z"},"links":{"cited_paper":"/paper/2303.12346","citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:0ae1e05f5d382db99f088458075f507bfc24ad6c8976d7a49b07d95c98265e0d","observation_id":"79648eae-37e2-4909-a2ad-c67d51290553","resolution":{"observed_at":"2026-08-15T17:42:41.557669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:42:42.619349Z","title":"Sadtalker: Learning realistic 3d motion coefficients for stylized audio- driven single image talking face animation","venue":null,"work_id":"36af2aa6-35c9-4e42-b64a-44a48743a7bb","year":2023},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.562763Z"},"links":{"citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:745303344106d56059f046b38f62716f1a0ea61a2ea8106a696ff3f7172275af","observation_id":"8689081b-384b-4425-bebb-6b28001a4854","resolution":{"observed_at":"2026-08-15T17:42:42.624372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:42:42.595579Z","title":"Flow-guided one-shot talking face generation with a high- resolution audio-visual dataset","venue":null,"work_id":"98bf4fab-a279-4e4a-9ad8-adec701f205c","year":2021},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.569709Z"},"links":{"citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:cf452b81cf2db0c4446d4fd3fcee02849cef61e89dfc3aaf068ef3590bac4109","observation_id":"ff19d0d5-0d32-4afa-bc7a-9c384a3ee816","resolution":{"observed_at":"2026-08-15T17:42:42.602316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:42:41.574634Z","title":"CelebV- HQ: A large-scale video facial attributes dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.574634Z"},"links":{"citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:c0142244ad7590eef3328194fa8dc79a6961ed3ab5a0af57719846969a2f7f00","observation_id":"e8e94383-fe78-4bc8-bd01-740988c66392","resolution":{"observed_at":"2026-08-15T17:42:41.574634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:42:42.556178Z","title":"The pipeline of our DWSW","venue":null,"work_id":"84007013-8776-4e17-a4bb-b88f993b43fe","year":null},"citing_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-15T17:42:41.582183Z"},"links":{"citing_paper":"/paper/2508.08248"},"observation_digest":"sha256:94d028ac06c8fc652ca74cf435514952cd5e30cce3033c7098f168604ffc3b8b","observation_id":"104a45ee-66df-4cce-90a9-e66aa390890b","resolution":{"observed_at":"2026-08-15T17:42:42.562975Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T17:33:47.410399Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation"},"reference_resolution":{"displayed":84,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":57,"verified_exact":0,"verified_fuzzy":26},"total_outbound_references":84},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 84 of 84 outbound references and 17 inbound Pith citation observations for arXiv:2508.08248."}