{"as_of":"2026-08-05T14:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:332a4206d5124fa2535dec5c529f140c780fb09d71f5152d59e2be78ac87f892","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T18:39:43.814175Z","state":"measured"},{"denominator":82,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":82,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":27,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T12:30:58.218249Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T20:00:07.549832Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.04677","snapshot_observed_at":"2026-08-05T12:30:58.218249Z","title":"arXiv preprint arXiv:2512.04677 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01557","last_updated":"2026-05-24T17:24:39Z","snapshot_observed_at":"2026-08-05T12:30:53.871176Z","submitted_at":"2025-09-01T15:36:17Z","title":"Real-Time Hardware-Free HIFU Interference Suppression via Teacher-Student Diffusion Framework","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-05T12:30:58.218249Z"},"links":{"cited_paper":"/paper/2512.04677","citing_paper":"/paper/2509.01557"},"observation_digest":"sha256:4546e07be771752b568c63079459b043e9ffc5ae70a95393a61d7d166fec479e","observation_id":"3d10dccb-15b9-4fc3-a5af-16fe68fbb412","resolution":{"observed_at":"2026-08-05T12:30:58.218249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"cited_work":{"arxiv_id":"2512.04677","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.04677","snapshot_observed_at":"2026-07-04T20:00:07.549832Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","venue":"cs.CV","work_id":"6162e20b-7f90-4812-8c9b-a2423c67be80","year":2025},"citing_paper":{"arxiv_id":"2602.13669","last_updated":"2026-04-22T07:41:44Z","snapshot_observed_at":"2026-07-06T22:45:53.926021Z","submitted_at":"2026-02-14T08:32:38Z","title":"EchoTorrent: Towards Swift, Sustained, and Streaming Multi-Modal Video Generation","version":5},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-15T22:20:16.320171Z"},"links":{"cited_paper":"/paper/2512.04677","citing_paper":"/paper/2602.13669"},"observation_digest":"sha256:88ecb658325f68dd6a3f4338e716d6b0cfd3a5f064de759cc23f9179c9884b28","observation_id":"99a45afe-36b5-44ca-96e6-55e0c3724223","resolution":{"observed_at":"2026-05-15T22:20:22.223470Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"cited_work":{"arxiv_id":"2512.04677","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.04677","snapshot_observed_at":"2026-07-04T20:00:07.549832Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","venue":"cs.CV","work_id":"6162e20b-7f90-4812-8c9b-a2423c67be80","year":2025},"citing_paper":{"arxiv_id":"2603.28489","last_updated":"2026-07-04T13:25:12Z","snapshot_observed_at":"2026-08-05T11:17:52.410204Z","submitted_at":"2026-03-30T14:23:45Z","title":"Video Generation Models as World Models: Efficient Paradigms, Architectures and Algorithms","version":2},"reference_index":141,"source":"pdf_text","source_observed_at":"2026-05-14T01:35:14.878069Z"},"links":{"cited_paper":"/paper/2512.04677","citing_paper":"/paper/2603.28489"},"observation_digest":"sha256:43787f50e81aaef6b4b37b09699eccafd8ce7c00d5a7a120f9861c0a23ddaf0a","observation_id":"1613a44a-fc5a-4f64-b077-2620caabc7e5","resolution":{"observed_at":"2026-05-14T01:38:36.168716Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"cited_work":{"arxiv_id":"2512.04677","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.04677","snapshot_observed_at":"2026-07-04T20:00:07.549832Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","venue":"cs.CV","work_id":"6162e20b-7f90-4812-8c9b-a2423c67be80","year":2025},"citing_paper":{"arxiv_id":"2604.04707","last_updated":"2026-05-25T06:28:44Z","snapshot_observed_at":"2026-07-13T09:42:22.607962Z","submitted_at":"2026-04-06T14:19:48Z","title":"OpenWorldLib: A Unified Codebase and Definition of Advanced World Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T19:36:42.100191Z"},"links":{"cited_paper":"/paper/2512.04677","citing_paper":"/paper/2604.04707"},"observation_digest":"sha256:36a9a265e86d9eae6cfa7dc3d13e059e25b1d7c8907a1f2ee97d72de63dfebc6","observation_id":"7aa332d0-ea76-48ad-9c40-329268c0e053","resolution":{"observed_at":"2026-05-10T22:45:49.266963Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.04677","snapshot_observed_at":"2026-07-13T09:42:23.808691Z","title":"Live avatar: Streaming real-time audio-driven avatar generation with infinite length","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.04707","last_updated":"2026-05-25T06:28:44Z","snapshot_observed_at":"2026-07-13T09:42:22.607962Z","submitted_at":"2026-04-06T14:19:48Z","title":"OpenWorldLib: A Unified Codebase and Definition of Advanced World Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-13T09:42:23.808691Z"},"links":{"cited_paper":"/paper/2512.04677","citing_paper":"/paper/2604.04707"},"observation_digest":"sha256:b4f7e14422045b3fa69db8bf57e5e37fbcfe550db054998b921688c2b12254b3","observation_id":"ef8231ae-2667-4bbf-8895-cc2fc003d90a","resolution":{"observed_at":"2026-07-13T09:42:23.808691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"cited_work":{"arxiv_id":"2512.04677","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.04677","snapshot_observed_at":"2026-07-04T20:00:07.549832Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","venue":"cs.CV","work_id":"6162e20b-7f90-4812-8c9b-a2423c67be80","year":2025},"citing_paper":{"arxiv_id":"2604.07823","last_updated":"2026-04-14T22:09:01Z","snapshot_observed_at":"2026-07-06T22:57:05.146373Z","submitted_at":"2026-04-09T05:26:09Z","title":"LPM 1.0: Video-based Character Performance Model","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T17:09:17.360697Z"},"links":{"cited_paper":"/paper/2512.04677","citing_paper":"/paper/2604.07823"},"observation_digest":"sha256:949a4b6994a81850b2a0b901684c2b98a7782315255a000b404f104527e6a7bc","observation_id":"b469a634-839d-4870-a18e-d83cecd4e917","resolution":{"observed_at":"2026-05-11T07:30:59.831661Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"cited_work":{"arxiv_id":"2512.04677","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.04677","snapshot_observed_at":"2026-07-04T20:00:07.549832Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","venue":"cs.CV","work_id":"6162e20b-7f90-4812-8c9b-a2423c67be80","year":2025},"citing_paper":{"arxiv_id":"2604.15911","last_updated":"2026-04-17T10:11:39Z","snapshot_observed_at":"2026-07-06T23:03:21.422544Z","submitted_at":"2026-04-17T10:11:39Z","title":"Efficient Video Diffusion Models: Advancements and Challenges","version":1},"reference_index":300,"source":"pdf_text","source_observed_at":"2026-05-10T08:28:29.706249Z"},"links":{"cited_paper":"/paper/2512.04677","citing_paper":"/paper/2604.15911"},"observation_digest":"sha256:be6bf97ba1371db55b5f931d5615236cdb8f02693e4a45b5c598a39a8072b052","observation_id":"b2d76868-eb4e-43d0-b807-9a5534514e36","resolution":{"observed_at":"2026-05-10T09:03:26.263831Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"cited_work":{"arxiv_id":"2512.04677","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.04677","snapshot_observed_at":"2026-07-04T20:00:07.549832Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","venue":"cs.CV","work_id":"6162e20b-7f90-4812-8c9b-a2423c67be80","year":2025},"citing_paper":{"arxiv_id":"2604.23688","last_updated":"2026-04-26T13:04:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-26T13:04:33Z","title":"Do Protective Perturbations Really Protect Portrait Privacy under Real-world Image Transformations?","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-08T06:42:31.456648Z"},"links":{"cited_paper":"/paper/2512.04677","citing_paper":"/paper/2604.23688"},"observation_digest":"sha256:50a5aa827d89c9eb2fcaf7eea63400e1d1099c3a8a71923f8f4d0ea46802e786","observation_id":"395d64aa-8104-412c-9a1f-f417e39b568e","resolution":{"observed_at":"2026-05-11T21:06:14.726705Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"cited_work":{"arxiv_id":"2512.04677","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.04677","snapshot_observed_at":"2026-07-04T20:00:07.549832Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","venue":"cs.CV","work_id":"6162e20b-7f90-4812-8c9b-a2423c67be80","year":2025},"citing_paper":{"arxiv_id":"2605.09681","last_updated":"2026-05-10T17:59:21Z","snapshot_observed_at":"2026-08-03T15:08:14.904751Z","submitted_at":"2026-05-10T17:59:21Z","title":"Forcing-KV: Hybrid KV Cache Compression for Efficient Autoregressive Video Diffusion Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-12T03:56:25.472887Z"},"links":{"cited_paper":"/paper/2512.04677","citing_paper":"/paper/2605.09681"},"observation_digest":"sha256:9f3a03633587a6da5e4713dd0f456208a3fb625bfa06edc8b2db17e0ba6ccf45","observation_id":"d385db71-4ea4-4b20-9de2-a3e220d19151","resolution":{"observed_at":"2026-05-12T06:51:28.014977Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"cited_work":{"arxiv_id":"2512.04677","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.04677","snapshot_observed_at":"2026-07-04T20:00:07.549832Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","venue":"cs.CV","work_id":"6162e20b-7f90-4812-8c9b-a2423c67be80","year":2025},"citing_paper":{"arxiv_id":"2605.12496","last_updated":"2026-05-12T17:59:51Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:59:51Z","title":"CausalCine: Real-Time Autoregressive Generation for Multi-Shot Video Narratives","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T05:38:21.587653Z"},"links":{"cited_paper":"/paper/2512.04677","citing_paper":"/paper/2605.12496"},"observation_digest":"sha256:cc2852817f33b54ab110fee12d8f01ff1920184fd01892e6fa41e50c88abfe04","observation_id":"c330c1f8-ecf7-4b1d-a4eb-ebdf59e968f9","resolution":{"observed_at":"2026-05-13T05:42:21.265641Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"cited_work":{"arxiv_id":"2512.04677","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.04677","snapshot_observed_at":"2026-07-04T20:00:07.549832Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","venue":"cs.CV","work_id":"6162e20b-7f90-4812-8c9b-a2423c67be80","year":2025},"citing_paper":{"arxiv_id":"2605.15141","last_updated":"2026-06-01T14:27:49Z","snapshot_observed_at":"2026-07-06T23:26:28.006734Z","submitted_at":"2026-05-14T17:46:36Z","title":"Causal Forcing++: Scalable Few-Step Autoregressive Diffusion Distillation for Real-Time Interactive Video Generation","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T20:59:34.847496Z"},"links":{"cited_paper":"/paper/2512.04677","citing_paper":"/paper/2605.15141"},"observation_digest":"sha256:532507a96eab16d4de2abe31457d3cb7f0d63d259367fdf7296dc5fb1e4d1071","observation_id":"8fe64862-0510-4907-b932-acbf5047c503","resolution":{"observed_at":"2026-06-30T21:05:04.356614Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"cited_work":{"arxiv_id":"2512.04677","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.04677","snapshot_observed_at":"2026-07-04T20:00:07.549832Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","venue":"cs.CV","work_id":"6162e20b-7f90-4812-8c9b-a2423c67be80","year":2025},"citing_paper":{"arxiv_id":"2605.15824","last_updated":"2026-06-17T15:16:37Z","snapshot_observed_at":"2026-08-03T19:41:20.540916Z","submitted_at":"2026-05-15T10:25:06Z","title":"FashionChameleon: Towards Real-Time and Interactive Human-Garment Video Customization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-20T20:11:33.277349Z"},"links":{"cited_paper":"/paper/2512.04677","citing_paper":"/paper/2605.15824"},"observation_digest":"sha256:9f92194e75a97ffcaf970f9f455c446f98e56992186eeeb6ebf9272bd2180d22","observation_id":"6fd0936e-c7c2-437f-87da-36a07ebbdeb3","resolution":{"observed_at":"2026-05-20T20:13:43.552039Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"cited_work":{"arxiv_id":"2512.04677","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.04677","snapshot_observed_at":"2026-07-04T20:00:07.549832Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","venue":"cs.CV","work_id":"6162e20b-7f90-4812-8c9b-a2423c67be80","year":2025},"citing_paper":{"arxiv_id":"2605.15824","last_updated":"2026-06-17T15:16:37Z","snapshot_observed_at":"2026-08-03T19:41:20.540916Z","submitted_at":"2026-05-15T10:25:06Z","title":"FashionChameleon: Towards Real-Time and Interactive Human-Garment Video Customization","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-30T19:23:07.044659Z"},"links":{"cited_paper":"/paper/2512.04677","citing_paper":"/paper/2605.15824"},"observation_digest":"sha256:f0901395ffaa7ef0143f17668dfe292607a923482b3a3a53e7395df381b55fec","observation_id":"b7229994-1b38-4141-835f-f6c850336a4f","resolution":{"observed_at":"2026-06-30T19:25:00.595707Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"cited_work":{"arxiv_id":"2512.04677","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.04677","snapshot_observed_at":"2026-07-04T20:00:07.549832Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","venue":"cs.CV","work_id":"6162e20b-7f90-4812-8c9b-a2423c67be80","year":2025},"citing_paper":{"arxiv_id":"2605.25659","last_updated":"2026-05-25T10:04:52Z","snapshot_observed_at":"2026-07-06T23:35:36.158984Z","submitted_at":"2026-05-25T10:04:52Z","title":"StreamChar: Long-Horizon Streaming Character Audio-Video Generation with Decoupled Orchestration","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T22:15:17.804936Z"},"links":{"cited_paper":"/paper/2512.04677","citing_paper":"/paper/2605.25659"},"observation_digest":"sha256:181712cc1a7955d4ee84d9409416698e98221bc768131c76a588803546c4c0c2","observation_id":"7040923c-9aff-48c2-ad82-54f78f4ce2fe","resolution":{"observed_at":"2026-06-29T22:24:00.828792Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"cited_work":{"arxiv_id":"2512.04677","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.04677","snapshot_observed_at":"2026-07-04T20:00:07.549832Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","venue":"cs.CV","work_id":"6162e20b-7f90-4812-8c9b-a2423c67be80","year":2025},"citing_paper":{"arxiv_id":"2605.30263","last_updated":"2026-05-28T17:27:03Z","snapshot_observed_at":"2026-07-06T23:39:34.232661Z","submitted_at":"2026-05-28T17:27:03Z","title":"minWM: A Full-Stack Open-Source Framework for Real-Time Interactive Video World Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T08:22:48.074724Z"},"links":{"cited_paper":"/paper/2512.04677","citing_paper":"/paper/2605.30263"},"observation_digest":"sha256:a09c3bdf29693d6d7941f78f126d4bd1349838d5fba201630e658e9304cd115b","observation_id":"a3054365-5e85-48ab-a15d-d5981e0af8a0","resolution":{"observed_at":"2026-06-29T08:23:14.768411Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"cited_work":{"arxiv_id":"2512.04677","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.04677","snapshot_observed_at":"2026-07-04T20:00:07.549832Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","venue":"cs.CV","work_id":"6162e20b-7f90-4812-8c9b-a2423c67be80","year":2025},"citing_paper":{"arxiv_id":"2606.11180","last_updated":"2026-06-09T17:56:36Z","snapshot_observed_at":"2026-08-05T12:57:25.376491Z","submitted_at":"2026-06-09T17:56:36Z","title":"Lip Forcing: Few-Step Autoregressive Diffusion for Real-time Lip Synchronization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T13:40:14.506288Z"},"links":{"cited_paper":"/paper/2512.04677","citing_paper":"/paper/2606.11180"},"observation_digest":"sha256:b6b081d1f0c41c5223efa7183c7ec661549433cdc8675021bd13eb31dc3619f3","observation_id":"968f2d3e-6397-4882-9859-6b793af4a90a","resolution":{"observed_at":"2026-07-03T04:47:38.045330Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"cited_work":{"arxiv_id":"2512.04677","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.04677","snapshot_observed_at":"2026-07-04T20:00:07.549832Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","venue":"cs.CV","work_id":"6162e20b-7f90-4812-8c9b-a2423c67be80","year":2025},"citing_paper":{"arxiv_id":"2606.17800","last_updated":"2026-06-16T11:25:37Z","snapshot_observed_at":"2026-07-06T23:53:21.186284Z","submitted_at":"2026-06-16T11:25:37Z","title":"MaineCoon: Pursuing A Real-Time Audio-Visual Social World Model","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T01:09:02.214590Z"},"links":{"cited_paper":"/paper/2512.04677","citing_paper":"/paper/2606.17800"},"observation_digest":"sha256:0e52701e06c7619880323bb108e884980f17896314f92817d8032b1b15419c11","observation_id":"d644cd62-1d19-40a8-b50e-07e65f48a20f","resolution":{"observed_at":"2026-07-03T20:48:55.732426Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"cited_work":{"arxiv_id":"2512.04677","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.04677","snapshot_observed_at":"2026-07-04T20:00:07.549832Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","venue":"cs.CV","work_id":"6162e20b-7f90-4812-8c9b-a2423c67be80","year":2025},"citing_paper":{"arxiv_id":"2606.22905","last_updated":"2026-06-30T08:27:33Z","snapshot_observed_at":"2026-08-04T09:09:38.078398Z","submitted_at":"2026-06-22T06:41:17Z","title":"InteractiveAvatar: Real-Time Streaming Video Generation for Consistent and Intent-Aware Avatars","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-26T09:09:06.925645Z"},"links":{"cited_paper":"/paper/2512.04677","citing_paper":"/paper/2606.22905"},"observation_digest":"sha256:04c990078ac07deee48fc1f1d4a5c6f6878ea7c1d6f9e5465ae6fe5e1fe49781","observation_id":"f2c5dc92-729e-44a0-bb40-35e7883ccabd","resolution":{"observed_at":"2026-07-04T10:09:44.558809Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"cited_work":{"arxiv_id":"2512.04677","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.04677","snapshot_observed_at":"2026-07-04T20:00:07.549832Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","venue":"cs.CV","work_id":"6162e20b-7f90-4812-8c9b-a2423c67be80","year":2025},"citing_paper":{"arxiv_id":"2606.22905","last_updated":"2026-06-30T08:27:33Z","snapshot_observed_at":"2026-08-04T09:09:38.078398Z","submitted_at":"2026-06-22T06:41:17Z","title":"InteractiveAvatar: Real-Time Streaming Video Generation for Consistent and Intent-Aware Avatars","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-01T07:00:53.496569Z"},"links":{"cited_paper":"/paper/2512.04677","citing_paper":"/paper/2606.22905"},"observation_digest":"sha256:454d27bafe32dd4503ee04658a21662c320ed78941ec6979fe7bdf4fba37838c","observation_id":"4a6eda4c-79e3-4002-86ef-bd3402d610ab","resolution":{"observed_at":"2026-07-01T07:05:29.126354Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"cited_work":{"arxiv_id":"2512.04677","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.04677","snapshot_observed_at":"2026-07-04T20:00:07.549832Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","venue":"cs.CV","work_id":"6162e20b-7f90-4812-8c9b-a2423c67be80","year":2025},"citing_paper":{"arxiv_id":"2606.25473","last_updated":"2026-06-24T06:58:02Z","snapshot_observed_at":"2026-07-06T23:59:57.346004Z","submitted_at":"2026-06-24T06:58:02Z","title":"Causal-rCM: A Unified Teacher-Forcing and Self-Forcing Open Recipe for Autoregressive Diffusion Distillation in Streaming Video Generation and Interactive World Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-25T20:57:30.765802Z"},"links":{"cited_paper":"/paper/2512.04677","citing_paper":"/paper/2606.25473"},"observation_digest":"sha256:09decf93403afe7aca6969bc60d06ba6cd382d0e503bcb4ad86b52c67dd78f99","observation_id":"cabe0c64-4d48-4b5c-a328-0f3353363351","resolution":{"observed_at":"2026-07-04T20:00:07.552738Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"cited_work":{"arxiv_id":"2512.04677","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.04677","snapshot_observed_at":"2026-07-04T20:00:07.549832Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","venue":"cs.CV","work_id":"6162e20b-7f90-4812-8c9b-a2423c67be80","year":2025},"citing_paper":{"arxiv_id":"2607.00712","last_updated":"2026-07-01T09:59:28Z","snapshot_observed_at":"2026-07-07T00:06:20.346610Z","submitted_at":"2026-07-01T09:59:28Z","title":"Towards Memory-Efficient Autoregressive Video Generation via Instance-Specific Parametric Absorption","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-02T14:12:29.528065Z"},"links":{"cited_paper":"/paper/2512.04677","citing_paper":"/paper/2607.00712"},"observation_digest":"sha256:15f2ddb6d347a091a85e9897b504b74690df04e0d9a45fc294051b6e001fb531","observation_id":"3076cf5c-aefb-4d2c-97f9-974b1dfc8c0e","resolution":{"observed_at":"2026-07-02T14:17:02.583722Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.04677","snapshot_observed_at":"2026-07-12T04:46:57.581402Z","title":"Live avatar: Streaming real-time audio-driven avatar generation with infinite length","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-02T08:56:30.830884Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-12T04:46:57.581402Z"},"links":{"cited_paper":"/paper/2512.04677","citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:3fb78892165a821a96d0465dc409288039dc7470c45dfa15c049f3f75be47ce6","observation_id":"2b5db40c-d9d9-4e59-be53-d991f80c4163","resolution":{"observed_at":"2026-07-12T04:46:57.581402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.04677","snapshot_observed_at":"2026-08-02T08:56:31.566881Z","title":"Live avatar: Streaming real-time audio-driven avatar generation with infinite length","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03118","last_updated":"2026-07-21T13:03:04Z","snapshot_observed_at":"2026-08-02T08:56:30.830884Z","submitted_at":"2026-07-03T08:58:06Z","title":"Vidu S1: A Real-Time Interactive Video Generation Model","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T08:56:31.566881Z"},"links":{"cited_paper":"/paper/2512.04677","citing_paper":"/paper/2607.03118"},"observation_digest":"sha256:ed7d24ada91888d751df1bd251522f3300346d3453c68a3a7f2d0d2c2c26c165","observation_id":"40026c4a-3386-4c42-9dce-a3c30f010f97","resolution":{"observed_at":"2026-08-02T08:56:31.566881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.04677","snapshot_observed_at":"2026-08-01T03:52:55.366559Z","title":"arXiv preprint arXiv:2512.04677 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23023","last_updated":"2026-07-28T02:01:27Z","snapshot_observed_at":"2026-08-04T00:58:02.081329Z","submitted_at":"2026-07-25T03:42:52Z","title":"OmniMate: Open-Ended Real-Time Streaming Audio-Visual Generation for Interactive Avatars","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-01T03:52:55.366559Z"},"links":{"cited_paper":"/paper/2512.04677","citing_paper":"/paper/2607.23023"},"observation_digest":"sha256:9dadcecb8fef5a01d82211afcfcad0ccea17ad0e9a7bbad8ee7bd2a78c5e49ed","observation_id":"d64ade22-3c3d-4a9b-8c53-dd76bc0c4b5d","resolution":{"observed_at":"2026-08-01T03:52:55.366559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.04677","snapshot_observed_at":"2026-07-31T17:08:11.655887Z","title":"arXiv preprint arXiv:2512.04677 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24359","last_updated":"2026-07-27T12:35:32Z","snapshot_observed_at":"2026-08-04T19:58:13.639778Z","submitted_at":"2026-07-27T12:35:32Z","title":"TaoMate: Anchor-Guided Memory Bridging Evolving and Reference States for Real-Time Audio-Video Digital Human Generation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-31T17:08:11.655887Z"},"links":{"cited_paper":"/paper/2512.04677","citing_paper":"/paper/2607.24359"},"observation_digest":"sha256:bd4af28fe6d89b4fdcaa5ae72afd5cf66506b5e22d824d363fc97a9c26a37ad7","observation_id":"8cbe9111-a429-44bd-9408-8e140c0c33b2","resolution":{"observed_at":"2026-07-31T17:08:11.655887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.04677","snapshot_observed_at":"2026-07-31T06:35:52.560992Z","title":"Live avatar: Streaming real-time audio-driven avatar generation with infinite length.arXiv preprint arXiv:2512.04677,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24731","last_updated":"2026-07-30T05:33:15Z","snapshot_observed_at":"2026-08-02T23:20:12.029664Z","submitted_at":"2026-07-27T17:57:02Z","title":"Rethinking Classifier-Free Guidance in On-Policy Diffusion Distillation","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-07-31T06:35:52.560992Z"},"links":{"cited_paper":"/paper/2512.04677","citing_paper":"/paper/2607.24731"},"observation_digest":"sha256:d8e11b84988dbabf68481decb956855b8dfe4b6fb46fbaec3ffa1fba7dbe53e0","observation_id":"00153b5a-8d9e-4c80-8ac8-93c7c3184ff8","resolution":{"observed_at":"2026-07-31T06:35:52.560992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.04677","snapshot_observed_at":"2026-08-04T01:32:13.124086Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.00079","last_updated":"2026-07-29T14:44:57Z","snapshot_observed_at":"2026-08-05T13:19:03.379608Z","submitted_at":"2026-07-29T14:44:57Z","title":"LeapTalk: Breaking the Latency-Quality Trade-off in Talking Head Generation","version":1},"reference_index":107,"source":"arxiv_source","source_observed_at":"2026-08-04T01:32:13.124086Z"},"links":{"cited_paper":"/paper/2512.04677","citing_paper":"/paper/2608.00079"},"observation_digest":"sha256:5c64f9d33e861f220740d23398bbd5f5a0af5ffd0bcdcb0fdfedb74fb9772abb","observation_id":"1dd65f5d-9171-4ebd-b592-5ac3970ae992","resolution":{"observed_at":"2026-08-04T01:32:13.124086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2512.04677/citation-record","integrity":"/paper/2512.04677/integrity","json":"/paper/2512.04677/citation-record.json","paper":"/paper/2512.04677"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2408.02879","last_updated":"2024-08-06T01:13:09Z","snapshot_observed_at":"2026-07-06T18:57:14.251413Z","submitted_at":"2024-08-06T01:13:09Z","title":"Body of Her: A Preliminary Study on End-to-End Humanoid Agent","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02879","snapshot_observed_at":"2026-08-03T18:39:41.166965Z","title":"Body of her: A preliminary study on end-to-end humanoid agent.arXiv preprint arXiv:2408.02879, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:41.166965Z"},"links":{"cited_paper":"/paper/2408.02879","citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:63d857437356690649a16f4903efc88916c1902d6baa80b75f0ad9850c06d869","observation_id":"82cc5007-8824-4d43-8e61-1b0d29077801","resolution":{"observed_at":"2026-08-03T18:39:41.166965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:39:41.175579Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:41.175579Z"},"links":{"citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:9e69b5df8aa061aeed1475e7ff532d4a924da5a0bd531b6cb107b4cf42f3ffdb","observation_id":"6c882b2d-70b8-48fe-9241-f11e7331f72c","resolution":{"observed_at":"2026-08-03T18:39:41.175579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:39:41.188926Z","title":"Diffusion forcing: Next-token prediction meets full-sequence diffusion.Advances in Neural Information Processing Systems, 37:24081–24125, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:41.188926Z"},"links":{"citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:f15e6c39c471c53e5c15f6a0e3d3f8e9be212121aeeb0c6031b44704a325e9dc","observation_id":"83acffe0-41fe-4059-98eb-121e9b300650","resolution":{"observed_at":"2026-08-03T18:39:41.188926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19320","last_updated":"2025-08-28T09:15:43Z","snapshot_observed_at":"2026-07-06T22:19:04.692881Z","submitted_at":"2025-08-26T14:00:16Z","title":"MIDAS: Multimodal Interactive Digital-humAn Synthesis via Real-time Autoregressive Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.19320","snapshot_observed_at":"2026-08-03T18:39:41.196491Z","title":"Midas: Multimodal interactive digital-human synthesis via real-time autoregressive video generation.arXiv preprint arXiv:2508.19320, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:41.196491Z"},"links":{"cited_paper":"/paper/2508.19320","citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:80e3db652796bb9233151f8fa1211933950dd3393cf3090a9681caabf546a3a6","observation_id":"0cb89d86-de96-464c-a2f5-08274b1f2d33","resolution":{"observed_at":"2026-08-03T18:39:41.196491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:39:41.205395Z","title":"Out of time: automated lip sync in the wild","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:41.205395Z"},"links":{"citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:695f4f40d963338fb344e3da7e7b9e22706da71aa3c26e0957cb4331374f5fab","observation_id":"bb9c26c1-4969-4ad2-b9f9-386bf32495ba","resolution":{"observed_at":"2026-08-03T18:39:41.205395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:39:41.212151Z","title":"Hallo3: Highly dynamic and realistic portrait image animation with video diffusion transformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:41.212151Z"},"links":{"citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:fa08ed555a2b4d609a56e301e6b89c5e097ae1c34fee69bf9bb3c2f25bee9dee","observation_id":"ce87fdb9-d959-4db0-b7c1-2bbc735cc005","resolution":{"observed_at":"2026-08-03T18:39:41.212151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.02283","last_updated":"2025-10-02T17:55:42Z","snapshot_observed_at":"2026-08-02T07:40:05.046770Z","submitted_at":"2025-10-02T17:55:42Z","title":"Self-Forcing++: Towards Minute-Scale High-Quality Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.02283","snapshot_observed_at":"2026-08-03T18:39:41.218899Z","title":"Self-forcing++: Towards minute-scale high-quality video generation.arXiv preprint arXiv:2510.02283, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:41.218899Z"},"links":{"cited_paper":"/paper/2510.02283","citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:f5b85702f6b4f402feec1fc9e66c559305c2b2b1b00595c4bf5af5130edfe852","observation_id":"6293f12b-6786-4b41-8b35-ff1be19c0e59","resolution":{"observed_at":"2026-08-03T18:39:41.218899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:39:41.226981Z","title":"Rap: Real-time audio-driven portrait animation with video diffusion transformer.arXiv preprint arXiv:2508.05115, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:41.226981Z"},"links":{"citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:706024b2d2861e5a1d2f6ce3c2920b7161ae3ced29d21a698d1acd8788c2ca28","observation_id":"b4fb6205-9393-40a4-8c36-61d27f317e2f","resolution":{"observed_at":"2026-08-03T18:39:41.226981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:39:41.233681Z","title":"Cosyvoice 2: Scalable streaming speech synthesis with large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:41.233681Z"},"links":{"citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:97a4ac22b5443036cdbea457abb16e2d13810c216fab2589557027fac07b044a","observation_id":"f195593b-1f3c-4f72-af00-3b3ef7bebe31","resolution":{"observed_at":"2026-08-03T18:39:41.233681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.03619","last_updated":"2018-08-09T21:22:37Z","snapshot_observed_at":"2026-07-06T06:32:41.685350Z","submitted_at":"2018-04-10T16:28:59Z","title":"Looking to Listen at the Cocktail Party: A Speaker-Independent Audio-Visual Model for Speech Separation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.03619","snapshot_observed_at":"2026-08-03T18:39:41.244873Z","title":"Looking to listen at the cocktail party: A speaker-independent audio-visual model for speech separation.arXiv preprint arXiv:1804.03619, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:41.244873Z"},"links":{"cited_paper":"/paper/1804.03619","citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:19b860ae6a9e129e0932a58f58224a245382c1030eb6bf119948d9399efe5888","observation_id":"930b2a88-d848-461f-aa7e-834e4d51655c","resolution":{"observed_at":"2026-08-03T18:39:41.244873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:39:41.255976Z","title":"Phased dmd: Few-step distribution matching distillation via score matching within subintervals.arXiv preprint arXiv:2510.27684,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:41.255976Z"},"links":{"citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:963667df795eb57b80a9a3b738af0b715439ac1b03d557103894df1a14354a28","observation_id":"d581221e-ad3c-4401-ad91-16328a1fc7a5","resolution":{"observed_at":"2026-08-03T18:39:41.255976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12557","last_updated":"2025-06-23T14:26:35Z","snapshot_observed_at":"2026-07-06T19:34:32.629776Z","submitted_at":"2024-10-16T13:34:40Z","title":"One Step Diffusion via Shortcut Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12557","snapshot_observed_at":"2026-08-03T18:39:41.263893Z","title":"One step diffusion via shortcut models.arXiv preprint arXiv:2410.12557, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:41.263893Z"},"links":{"cited_paper":"/paper/2410.12557","citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:8181a8e72e6ef0a5a034e9adf51b36c95c23fcd8569b1f2bb31add67e1911740","observation_id":"d79c79e1-ba36-4e21-938d-bdf59918cd5d","resolution":{"observed_at":"2026-08-03T18:39:41.263893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18866","last_updated":"2025-06-23T17:33:03Z","snapshot_observed_at":"2026-07-06T21:46:30.250293Z","submitted_at":"2025-06-23T17:33:03Z","title":"OmniAvatar: Efficient Audio-Driven Avatar Video Generation with Adaptive Body Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18866","snapshot_observed_at":"2026-08-03T18:39:41.281527Z","title":"Omniavatar: Efficient audio-driven avatar video generation with adaptive body animation.arXiv preprint arXiv:2506.18866, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:41.281527Z"},"links":{"cited_paper":"/paper/2506.18866","citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:2b7ae11ef979caafef000cb6e2a14f46c949229ee7195616d7a953a2c0a33db9","observation_id":"1663fec6-a4ca-4694-89e5-b22af599ca08","resolution":{"observed_at":"2026-08-03T18:39:41.281527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:39:41.288890Z","title":"Wan-s2v: Audio-driven cinematic video generation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:41.288890Z"},"links":{"citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:e3cee03b3d7e4eacb2fb5e9d92b12dde7f503848aab678495c399ee92e50846e","observation_id":"021482ff-045d-404b-86df-c9c56096c618","resolution":{"observed_at":"2026-08-03T18:39:41.288890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18621","last_updated":"2025-08-26T02:51:31Z","snapshot_observed_at":"2026-07-06T22:18:40.868747Z","submitted_at":"2025-08-26T02:51:31Z","title":"Wan-S2V: Audio-Driven Cinematic Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18621","snapshot_observed_at":"2026-08-03T18:39:41.295310Z","title":"Wan-s2v: Audio-driven cinematic video generation.arXiv preprint arXiv:2508.18621, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:41.295310Z"},"links":{"cited_paper":"/paper/2508.18621","citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:25fefbd736bbc9a5d307368042c19d05c154452f7f41fd5664f1ab9b2c875e4b","observation_id":"81c585a6-fcc6-41ec-8429-171803c4fc2b","resolution":{"observed_at":"2026-08-03T18:39:41.295310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.00472","last_updated":"2025-07-01T06:38:14Z","snapshot_observed_at":"2026-07-06T21:50:16.465983Z","submitted_at":"2025-07-01T06:38:14Z","title":"ARIG: Autoregressive Interactive Head Generation for Real-time Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.00472","snapshot_observed_at":"2026-08-03T18:39:41.303159Z","title":"Arig: Autoregressive interactive head generation for real-time conversations.arXiv preprint arXiv:2507.00472, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:41.303159Z"},"links":{"cited_paper":"/paper/2507.00472","citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:22e649224b2688c4b6a68f43411ea42cdfe9ef824bd8697d3b186be6c1be3aaf","observation_id":"8be3340d-0da7-46d2-818d-dcfec0a56880","resolution":{"observed_at":"2026-08-03T18:39:41.303159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00103","last_updated":"2024-12-30T19:00:25Z","snapshot_observed_at":"2026-07-06T20:14:54.297131Z","submitted_at":"2024-12-30T19:00:25Z","title":"LTX-Video: Realtime Video Latent Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00103","snapshot_observed_at":"2026-08-03T18:39:41.318204Z","title":"Ltx-video: Realtime video latent diffusion.arXiv preprint arXiv:2501.00103, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:41.318204Z"},"links":{"cited_paper":"/paper/2501.00103","citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:00c526820773b924383a8c0f4d347c396031e64b0940b72d2c02782ed964746c","observation_id":"8524f4d6-e8e5-4578-be4a-92bf81207454","resolution":{"observed_at":"2026-08-03T18:39:41.318204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:39:41.335539Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:41.335539Z"},"links":{"citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:c2870447553e91a99dc6a73fc3221de55e8e64e60b78896e167e0d3c1af9464b","observation_id":"63dbcf92-3228-4a37-aa08-0f00a73b0cd0","resolution":{"observed_at":"2026-08-03T18:39:41.335539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08009","last_updated":"2025-11-10T04:36:27Z","snapshot_observed_at":"2026-08-02T00:07:53.851104Z","submitted_at":"2025-06-09T17:59:55Z","title":"Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08009","snapshot_observed_at":"2026-08-03T18:39:41.344768Z","title":"Self forcing: Bridging the train-test gap in autoregressive video diffusion.arXiv preprint arXiv:2506.08009, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:41.344768Z"},"links":{"cited_paper":"/paper/2506.08009","citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:eac1e62911aa8feed47933be4d7fa0d5df449e02d75444bc48c46941e46b682f","observation_id":"cfbac149-1467-4cb7-b140-b48b69acd3e4","resolution":{"observed_at":"2026-08-03T18:39:41.344768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19209","last_updated":"2025-08-26T17:15:26Z","snapshot_observed_at":"2026-08-04T10:10:45.263899Z","submitted_at":"2025-08-26T17:15:26Z","title":"OmniHuman-1.5: Instilling an Active Mind in Avatars via Cognitive Simulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.19209","snapshot_observed_at":"2026-08-03T18:39:41.351503Z","title":"Omnihuman-1.5: Instilling an active mind in avatars via cognitive simulation.arXiv preprint arXiv:2508.19209, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:41.351503Z"},"links":{"cited_paper":"/paper/2508.19209","citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:44068992c218f9d0fe4688ee5260d4e86b9cb42adf1ee65aa10ab38ae10366be","observation_id":"cc9cfed6-5d97-41d9-bf07-a26e1da6796c","resolution":{"observed_at":"2026-08-03T18:39:41.351503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:39:41.358078Z","title":"Streamdit: Real-time streaming text-to-video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:41.358078Z"},"links":{"citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:b80fc19d04a5614e97dfc8b804e169e0f529006d3d780bcd12cd37186d2bac48","observation_id":"544bbe8d-08dc-4075-be83-c277f6817d28","resolution":{"observed_at":"2026-08-03T18:39:41.358078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-03T18:39:41.373827Z","title":"Hunyuanvideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:41.373827Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:853297ae820bb3f4123abdce949e2efaef072ce98132c2fcf4a9843ecb7dae1f","observation_id":"abc910a8-b0b3-480e-828e-57e52457be0a","resolution":{"observed_at":"2026-08-03T18:39:41.373827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:39:41.393147Z","title":"Autoregressive image generation without vector quantization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:41.393147Z"},"links":{"citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:2b8d695d8c632f099825cd7f3d11cac0b539c663b4e7fc0a74a4363914ad0157","observation_id":"9add171d-7f97-4bd4-8578-e5b5000b0dec","resolution":{"observed_at":"2026-08-03T18:39:41.393147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:39:41.484166Z","title":"Ditto: Motion-space diffusion for controllable realtime talking head synthesis.arXiv preprint arXiv:2411.19509, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:41.484166Z"},"links":{"citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:9ca1c97abe963e8b4b987d1279610ed661ba333c18938e58aa6b10de12e44eb2","observation_id":"be87dee5-2d14-4507-a117-c2207b12a1db","resolution":{"observed_at":"2026-08-03T18:39:41.484166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-03T18:39:41.581561Z","title":"Flow matching for generative modeling.arXiv preprint arXiv:2210.02747, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:41.581561Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:9efdbfc19c5a4f945bd2d900ce7b969fd0aa7b3c544d860272847a6793199064","observation_id":"2bb663be-07a6-41a9-bc80-f75257e63abe","resolution":{"observed_at":"2026-08-03T18:39:41.581561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.25161","last_updated":"2025-09-29T17:57:14Z","snapshot_observed_at":"2026-07-06T22:31:10.099674Z","submitted_at":"2025-09-29T17:57:14Z","title":"Rolling Forcing: Autoregressive Long Video Diffusion in Real Time","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.25161","snapshot_observed_at":"2026-08-03T18:39:41.712340Z","title":"Rolling forcing: Autoregressive long video diffusion in real time","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:41.712340Z"},"links":{"cited_paper":"/paper/2509.25161","citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:9317ed6c4a564d843d567995edd3a6e5a0c451edf45900e08e0ef878e431565b","observation_id":"f9c82ac0-cd8a-47d3-a9b9-e4470c33fb2a","resolution":{"observed_at":"2026-08-03T18:39:41.712340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03099","last_updated":"2025-06-03T17:29:28Z","snapshot_observed_at":"2026-07-06T21:35:56.582332Z","submitted_at":"2025-06-03T17:29:28Z","title":"TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03099","snapshot_observed_at":"2026-08-03T18:39:41.890004Z","title":"Talkingmachines: Real-time audio-driven facetime-style video via autoregressive diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:41.890004Z"},"links":{"cited_paper":"/paper/2506.03099","citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:d577a6b4220cc36534d37cc6ff9c36e6072830b1144b67cb86f38721241fe386","observation_id":"4a3213b5-584f-4e40-8b81-1465a29f7d90","resolution":{"observed_at":"2026-08-03T18:39:41.890004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11081","last_updated":"2025-03-01T09:52:49Z","snapshot_observed_at":"2026-07-06T19:33:30.263638Z","submitted_at":"2024-10-14T20:43:25Z","title":"Simplifying, Stabilizing and Scaling Continuous-Time Consistency Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11081","snapshot_observed_at":"2026-08-03T18:39:41.980575Z","title":"Simplifying, stabilizing and scaling continuous-time consistency models.arXiv preprint arXiv:2410.11081, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:41.980575Z"},"links":{"cited_paper":"/paper/2410.11081","citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:185d7eff3a2d7a4878e862c991e03edde388499d1a10fd25e7e8617542ee2650","observation_id":"29508ad4-6461-4533-9415-ca95679d4c8d","resolution":{"observed_at":"2026-08-03T18:39:41.980575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18881","last_updated":"2025-06-05T12:44:07Z","snapshot_observed_at":"2026-08-03T02:35:47.927103Z","submitted_at":"2024-10-24T16:17:18Z","title":"Diff-Instruct++: Training One-step Text-to-image Generator Model to Align with Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18881","snapshot_observed_at":"2026-08-03T18:39:42.081824Z","title":"Diff-instruct++: Training one-step text-to-image generator model to align with human preferences.arXiv preprint arXiv:2410.18881, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:42.081824Z"},"links":{"cited_paper":"/paper/2410.18881","citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:44e7c9d6d8e677a223013b35417ef29e5424aa5a86777ab33f84e67c359b6f03","observation_id":"7a651115-1861-4b43-ac1f-06cf972e5c69","resolution":{"observed_at":"2026-08-03T18:39:42.081824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:39:42.153832Z","title":"Diff-instruct: A universal approach for transferring knowledge from pre-trained diffusion models.Advances in Neural Information Processing Systems, 36:76525–76546,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:42.153832Z"},"links":{"citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:97b65f012014e1f0d881b12726a82d3075c6b1a5b7ba91a9db99763e6d8149ae","observation_id":"6df3d4ce-7ea4-41b3-8423-5b75d5b20f4f","resolution":{"observed_at":"2026-08-03T18:39:42.153832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06674","last_updated":"2025-03-12T12:25:18Z","snapshot_observed_at":"2026-07-06T20:49:27.466064Z","submitted_at":"2025-03-09T15:53:49Z","title":"Learning Few-Step Diffusion Models by Trajectory Distribution Matching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06674","snapshot_observed_at":"2026-08-03T18:39:42.201403Z","title":"Learning few-step diffusion models by trajectory distribution matching.arXiv preprint arXiv:2503.06674, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:42.201403Z"},"links":{"cited_paper":"/paper/2503.06674","citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:411b7b6df10f58627e84f77ed2723acc0a04c49869aad51ec39555f846787ab8","observation_id":"6a612ec4-8215-42b1-8543-4df5888466b5","resolution":{"observed_at":"2026-08-03T18:39:42.201403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22065","last_updated":"2025-06-27T09:57:23Z","snapshot_observed_at":"2026-08-05T04:40:29.229402Z","submitted_at":"2025-06-27T09:57:23Z","title":"MirrorMe: Towards Realtime and High Fidelity Audio-Driven Halfbody Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.22065","snapshot_observed_at":"2026-08-03T18:39:42.261377Z","title":"Mirrorme: Towards realtime and high fidelity audio-driven halfbody animation.arXiv preprint arXiv:2506.22065, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:42.261377Z"},"links":{"cited_paper":"/paper/2506.22065","citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:82c2717daa04a6b7911288f8cbbe244279f3f49fa956c0f3e1f2092b35b8f407","observation_id":"e7d1445d-3efc-48f8-866b-590dff817efe","resolution":{"observed_at":"2026-08-03T18:39:42.261377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:39:42.324041Z","title":"Echomimicv2: Towards striking, simplified, and semi-body human animation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:42.324041Z"},"links":{"citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:89ee9200cf4fbd6f3db83a638066ee59221dec48619e8a67dff88d7f3c820996","observation_id":"62f569ff-33e4-4aae-9f1b-f801de2eee1f","resolution":{"observed_at":"2026-08-03T18:39:42.324041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:39:42.391465Z","title":"A lip sync expert is all you need for speech to lip generation in the wild","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:42.391465Z"},"links":{"citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:ef6964c817f1606c7acf5f9e961e2f659ac0c3a32b247e01b6f6fb15084d2d99","observation_id":"59e93b2b-a253-42dd-adca-af494b46dc89","resolution":{"observed_at":"2026-08-03T18:39:42.391465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:39:42.472526Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:42.472526Z"},"links":{"citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:11325b87d62871c5f1e59c6f478992cddf4ebee9274e85eebec9aa46fb79e42c","observation_id":"b7cc940c-c6ba-4fca-863b-4cbd4d3f1d7b","resolution":{"observed_at":"2026-08-03T18:39:42.472526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:39:42.602085Z","title":"Consistency models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:42.602085Z"},"links":{"citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:6451483ce39438fc364cfd2a802ef760dd598d9b18b213b3e6b24e2412e4117e","observation_id":"aa6e5242-a570-4805-bed4-be3d0f9c858e","resolution":{"observed_at":"2026-08-03T18:39:42.602085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:39:42.726198Z","title":"Emo: Emote portrait alive generating expressive portrait videos with audio2video diffusion model under weak conditions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:42.726198Z"},"links":{"citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:72de5f319dc39adbf89bda2cc24d0fdb4cd313c1636a6b1207509a815f119c17","observation_id":"b1f3b75b-42d1-4bd0-b6c8-f7e5e0eb9d70","resolution":{"observed_at":"2026-08-03T18:39:42.726198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.08248","last_updated":"2025-08-11T17:58:24Z","snapshot_observed_at":"2026-07-06T22:11:19.157797Z","submitted_at":"2025-08-11T17:58:24Z","title":"StableAvatar: Infinite-Length Audio-Driven Avatar Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.08248","snapshot_observed_at":"2026-08-03T18:39:42.827965Z","title":"Sta- bleavatar: Infinite-length audio-driven avatar video generation.arXiv preprint arXiv:2508.08248, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:42.827965Z"},"links":{"cited_paper":"/paper/2508.08248","citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:444115cbe26db79cda3e7e37fc13e6be92ce9f41c5c6fe4e5f69c731f2968766","observation_id":"8ec5b113-bb5e-47f2-8bf6-efac56ea9c95","resolution":{"observed_at":"2026-08-03T18:39:42.827965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-07-06T07:19:11.957225Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-03T18:39:42.932746Z","title":"Towards accurate generative models of video: A new metric & challenges.arXiv preprint arXiv:1812.01717, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:42.932746Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:539c2d4e31e70adf3e8b6a53f4e2f1de88f1c05682a80d3088de0129921f3b09","observation_id":"727c6acc-45c6-412a-857c-9552b1181343","resolution":{"observed_at":"2026-08-03T18:39:42.932746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-03T18:39:43.025308Z","title":"Wan: Open and advanced large-scale video generative models.arXiv preprint arXiv:2503.20314, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:43.025308Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:81e1737704d7cbc11c3bf98b6fe730f36ebc4bde4e39c60a36fa1f1b64f0fe3a","observation_id":"78f1af44-fc27-42c5-8430-e0ebe4f7be37","resolution":{"observed_at":"2026-08-03T18:39:43.025308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:39:43.128520Z","title":"Fantasytalking: Realistic talking portrait generation via coherent motion synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:43.128520Z"},"links":{"citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:fb0f43f303711e2206465a0f0361f2b13258c508acca861df640e5ca457f0a3c","observation_id":"9e9f5b62-f9b4-4460-b856-8a17fd453039","resolution":{"observed_at":"2026-08-03T18:39:43.128520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:39:43.173394Z","title":"Omnitalker: Real-time text- driven talking head generation with in-context audio-visual style replication.arXiv e-prints, pages arXiv–2504, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:43.173394Z"},"links":{"citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:558b78798dc9644b89f483c0e1287b5a308371cd469acd4f66a3762ac95bcfe9","observation_id":"d217822f-4c81-4158-a40f-eacbfaf14068","resolution":{"observed_at":"2026-08-03T18:39:43.173394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:39:43.232969Z","title":"Qwen-image technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:43.232969Z"},"links":{"citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:1dfa52b6800dad3b38c96b839b48e5efe8bfc2198033056bdd50f15d21e31e24","observation_id":"9d568af0-4201-43db-9b95-c408d0059081","resolution":{"observed_at":"2026-08-03T18:39:43.232969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17090","last_updated":"2023-12-28T16:10:25Z","snapshot_observed_at":"2026-08-02T07:14:02.308302Z","submitted_at":"2023-12-28T16:10:25Z","title":"Q-Align: Teaching LMMs for Visual Scoring via Discrete Text-Defined Levels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17090","snapshot_observed_at":"2026-08-03T18:39:43.295251Z","title":"Q-align: Teaching lmms for visual scoring via discrete text-defined levels.arXiv preprint arXiv:2312.17090, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:43.295251Z"},"links":{"cited_paper":"/paper/2312.17090","citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:d3c47bc6019c7e9ab76844e47689372fc5cb6be1ff8fdf355bc562cf672e152f","observation_id":"e8cffe70-559d-4425-be2f-dadef4d00fc0","resolution":{"observed_at":"2026-08-03T18:39:43.295251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:39:43.350746Z","title":"X-streamer: Unified human world modeling with audiovisual interaction.arXiv preprint arXiv:2509.21574, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:43.350746Z"},"links":{"citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:a03b726bf3acea548bdeb7db3c392fbe1b53dd91746833d46554ea14406d809d","observation_id":"0be907c6-0a19-4a25-b7d9-042ab3293749","resolution":{"observed_at":"2026-08-03T18:39:43.350746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.22622","last_updated":"2025-10-13T22:41:26Z","snapshot_observed_at":"2026-07-06T22:30:55.313733Z","submitted_at":"2025-09-26T17:48:24Z","title":"LongLive: Real-time Interactive Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.22622","snapshot_observed_at":"2026-08-03T18:39:43.393621Z","title":"Longlive: Real-time interactive long video generation.arXiv preprint arXiv:2509.22622, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:43.393621Z"},"links":{"cited_paper":"/paper/2509.22622","citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:152e7c688aa4e0d67d92cbd4f6e703c000cff13be30b24044ec305869950548b","observation_id":"29915014-a2a3-4557-8498-8ddf07022dd1","resolution":{"observed_at":"2026-08-03T18:39:43.393621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.14033","last_updated":"2025-08-19T17:55:23Z","snapshot_observed_at":"2026-08-05T04:26:17.043718Z","submitted_at":"2025-08-19T17:55:23Z","title":"InfiniteTalk: Audio-driven Video Generation for Sparse-Frame Video Dubbing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.14033","snapshot_observed_at":"2026-08-03T18:39:43.445612Z","title":"Infinitetalk: Audio-driven video generation for sparse-frame video dubbing.arXiv preprint arXiv:2508.14033, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:43.445612Z"},"links":{"cited_paper":"/paper/2508.14033","citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:b154490fbf42cc2ec5f06e293959675019276d4f612115d3a3ca929965d05689","observation_id":"dcfaf336-cea5-4464-abb7-4b61cee2862c","resolution":{"observed_at":"2026-08-03T18:39:43.445612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:39:43.497860Z","title":"Improved distribution matching distillation for fast image synthesis.Advances in neural information processing systems, 37:47455–47487, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:43.497860Z"},"links":{"citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:5f28835f350b76fcec34f631d8153b2b5764d137957475100f0bb6995ef2602a","observation_id":"6cd75b41-b782-4efc-8903-0aabfa672d10","resolution":{"observed_at":"2026-08-03T18:39:43.497860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:39:43.551659Z","title":"One-step diffu- sion with distribution matching distillation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:43.551659Z"},"links":{"citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:3a092527c8610cb0bc6336d1c88cdfe032932c916cef19cf81c8f842cf2ec227","observation_id":"6f4624c1-3451-4656-bded-75e00a55ae3d","resolution":{"observed_at":"2026-08-03T18:39:43.551659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:39:43.594113Z","title":"From slow bidi- rectional to fast autoregressive video diffusion models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:43.594113Z"},"links":{"citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:5269387a7ecbe741d822d342e9823217d317b5f55e1bd4cc0b12ebc1d47efa31","observation_id":"65cdae69-2ece-439f-8028-6d82c92bde4a","resolution":{"observed_at":"2026-08-03T18:39:43.594113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05806","last_updated":"2025-06-06T07:09:07Z","snapshot_observed_at":"2026-07-06T21:37:47.215709Z","submitted_at":"2025-06-06T07:09:07Z","title":"LLIA -- Enabling Low-Latency Interactive Avatars: Real-Time Audio-Driven Portrait Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05806","snapshot_observed_at":"2026-08-03T18:39:43.646679Z","title":"Llia–enabling low-latency interactive avatars: Real-time audio-driven portrait video generation with diffusion models.arXiv preprint arXiv:2506.05806, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:43.646679Z"},"links":{"cited_paper":"/paper/2506.05806","citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:360b053bfdd0bf7695946ece21f485133d80e9afe29fdf8ef6d2d3930c2f012f","observation_id":"fb09a11e-2136-4d79-978a-df66026497ea","resolution":{"observed_at":"2026-08-03T18:39:43.646679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:39:43.675227Z","title":"Sadtalker: Learning realistic 3d motion coefficients for stylized audio-driven single image talking face animation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:43.675227Z"},"links":{"citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:c1c1fc9ce1927ccdc7f09975165248e19b59b8e02415918f96e2f1b2d2804e1c","observation_id":"8d3fc1ae-13a4-4a63-bed2-617bbd222386","resolution":{"observed_at":"2026-08-03T18:39:43.675227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:39:43.715177Z","title":"Teller: Real-time streaming audio-driven portrait animation with autoregressive motion generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:43.715177Z"},"links":{"citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:7fa8d88ccffb435b331e10937d78b741bae8b1f7b404728b366b3c8b4fb9f0c9","observation_id":"a67120ca-2a4f-48d9-a07e-fb084c0cef00","resolution":{"observed_at":"2026-08-03T18:39:43.715177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.08431","last_updated":"2026-05-06T15:49:52Z","snapshot_observed_at":"2026-07-06T22:32:13.055128Z","submitted_at":"2025-10-09T16:45:30Z","title":"Large Scale Diffusion Distillation via Score-Regularized Continuous-Time Consistency","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.08431","snapshot_observed_at":"2026-08-03T18:39:43.757479Z","title":"Large scale diffusion distillation via score-regularized continuous-time consistency.arXiv preprint arXiv:2510.08431, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:43.757479Z"},"links":{"cited_paper":"/paper/2510.08431","citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:fe0271d8c8c2bc98a8ed9ca2362d1a3651033321239540526e1b74353d70aa1e","observation_id":"33c64dea-f1c6-4d3d-bcff-3be202bd471d","resolution":{"observed_at":"2026-08-03T18:39:43.757479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T18:39:43.814175Z","title":"Infp: Audio-driven interactive head generation in dyadic conversations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length","version":6},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-03T18:39:43.814175Z"},"links":{"citing_paper":"/paper/2512.04677"},"observation_digest":"sha256:66d799fbaf1a11c56ee5c08ea9c6d191bc30fbda76edebf71056f742629df984","observation_id":"ca5c6681-a875-443a-8714-d4fd1789ff83","resolution":{"observed_at":"2026-08-03T18:39:43.814175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2512.04677","last_updated":"2026-07-31T10:43:50Z","latest_version":6,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-05T14:11:11.645006Z","submitted_at":"2025-12-04T11:11:24Z","title":"Live Avatar: Streaming Real-time Audio-Driven Avatar Generation with Infinite Length"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":55,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 27 inbound Pith citation observations for arXiv:2512.04677."}