{"as_of":"2026-08-07T08:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f6841a0bf2bb713c8ee685495b1b24fd4a22865b650fc0e60107c15b38f069c5","coverage":[{"denominator":78,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":78,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T15:41:59.683979Z","state":"measured"},{"denominator":78,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":78,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.01620/citation-record","integrity":"/paper/2606.01620/integrity","json":"/paper/2606.01620/citation-record.json","paper":"/paper/2606.01620"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:41:59.683979Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:210c8cc4a4ec3266d6f09d9294875df715fecfe62c829bc327f53f518ba5d2a7","observation_id":"c813f42c-f684-4bae-b51c-48dfe9a889d5","resolution":{"observed_at":"2026-06-28T15:41:59.683979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":"2311.15127","doi":"10.48550/arxiv.2311.15127","metadata_source":"pith","pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","venue":"cs.CV","work_id":"4f68eada-27e3-437a-a2fe-6e4ca524d0d3","year":2023},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:5a984455963f1e7ead6cc804ff4682fd9ded6ee8b8d8a7ad9202dec98c2ba5a6","observation_id":"83ca6265-f657-48e3-a336-382951465e1c","resolution":{"observed_at":"2026-07-01T22:06:17.013473Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:53:24.472993+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:41:59.683979Z","title":"V oice puppetry","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:de00de871efcfa5fe357497b58ec300c5baabd79d624b2c0ec0c3b6f9e56ae96","observation_id":"4c9f3cf7-807c-4417-a283-666403fc1a0a","resolution":{"observed_at":"2026-06-28T15:41:59.683979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:41:59.683979Z","title":"Video rewrite: Driving visual speech with audio","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:c35a51d3b111a0de2b62ac01fe66913cf2d541326e99a72b8d014594d127d168","observation_id":"7c8bda84-1a96-47c1-935f-cb4ea9608c49","resolution":{"observed_at":"2026-06-28T15:41:59.683979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:41:59.683979Z","title":"Diffusion forcing: Next-token prediction meets full-sequence diffu- sion.Advances in Neural Information Processing Systems, 37:24081–24125, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:7006ae77b8af75b874dd49d45c85177a7d91012dbb2594b6905de814cb38867f","observation_id":"5739b4dc-38b7-45ed-b468-484c6a477c62","resolution":{"observed_at":"2026-06-28T15:41:59.683979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10733","last_updated":"2025-05-18T21:17:22Z","snapshot_observed_at":"2026-07-06T19:33:12.610676Z","submitted_at":"2024-10-14T17:15:07Z","title":"Deep Compression Autoencoder for Efficient High-Resolution Diffusion Models","version":8},"cited_work":{"arxiv_id":"2410.10733","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.10733","snapshot_observed_at":"2026-07-09T07:06:02.921871Z","title":"Deep compression autoencoder for efficient high-resolution diffusion models","venue":"cs.CV","work_id":"fb6e768c-674c-4587-921d-4c0ad09a87fd","year":2024},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"cited_paper":"/paper/2410.10733","citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:90fa7ff7248ac2842ec5fbc399d4492661243c20e26bcffc3e44d2acac85c7e9","observation_id":"cf2927df-d842-44d5-ab01-d491843454d1","resolution":{"observed_at":"2026-07-01T22:06:17.016488Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.25182","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T01:07:45.168345Z","title":"Dc-videogen: Efficient video gen- eration with deep compression video autoencoder","venue":null,"work_id":"9e08b3a1-d003-44e0-88e6-d710a4965842","year":2025},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:6349fa0bea9f65a57c81656ac3090397d0d3e81a078e65c6344ede9d34f642a8","observation_id":"d0c54751-da2e-4982-928b-52405f182036","resolution":{"observed_at":"2026-07-01T22:06:17.019820Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:41:59.683979Z","title":"Lip movements generation at a glance","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:56ec40a36ee03de7a347e96b2049bce3d0bc40abfdccb8ae24fa831a503e93de","observation_id":"84883b82-5ab2-4acc-9875-908523c39f90","resolution":{"observed_at":"2026-06-28T15:41:59.683979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:41:59.683979Z","title":"Echomimic: Lifelike audio-driven portrait animations through editable landmark conditions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:804c3c3baace2a70101de60e2012d0f3213f2284486445e96cf47f5ee74beeb6","observation_id":"e8fb1432-b4cb-4bfd-9ad5-3c106087b9c5","resolution":{"observed_at":"2026-06-28T15:41:59.683979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:41:59.683979Z","title":"Out of time: auto- mated lip sync in the wild","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:d54e634f9bcb5fbc58ff7a10fe7ce81bc5832ef6b005d62c087c8afc5d4bb050","observation_id":"e3bff521-6d9e-447b-93e2-9a13aa0a305f","resolution":{"observed_at":"2026-06-28T15:41:59.683979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.05622","last_updated":"2018-06-27T01:49:17Z","snapshot_observed_at":"2026-08-04T08:09:48.365818Z","submitted_at":"2018-06-14T15:59:12Z","title":"VoxCeleb2: Deep Speaker Recognition","version":2},"cited_work":{"arxiv_id":"1806.05622","doi":null,"metadata_source":"pith","pith_arxiv_id":"1806.05622","snapshot_observed_at":"2026-07-05T12:41:04.363820Z","title":"V oxceleb2: Deep speaker recognition","venue":"cs.SD","work_id":"34bd493f-4aed-4603-a33c-9658bfb84686","year":2018},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"cited_paper":"/paper/1806.05622","citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:686ed0e120513d6cd014e33d4a22cca251f1881d53888cd65dbcadef0b143f07","observation_id":"abad4ece-1d32-4592-a098-be24efa0a62a","resolution":{"observed_at":"2026-07-01T22:06:17.027913Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:41:59.683979Z","title":"Hallo2: Long-duration and high-resolution audio-driven portrait im- age animation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:3952a69f6c2e82197861076610c654b393b7135f2cbe0cc6a9e34d5287f28a28","observation_id":"bd568a8e-1ed5-45e7-b378-c40b135ec2fe","resolution":{"observed_at":"2026-06-28T15:41:59.683979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:41:59.683979Z","title":"Hallo3: Highly dynamic and realistic portrait image animation with video diffusion transformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:89dbf62f26b99c8862fdcfecd7f9884e745eccb343ce0d24ed209417ce344523","observation_id":"d182d93f-391d-4f3c-9894-f5b9293c93d7","resolution":{"observed_at":"2026-06-28T15:41:59.683979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19110","last_updated":"2024-04-29T21:23:29Z","snapshot_observed_at":"2026-08-04T11:52:15.613064Z","submitted_at":"2024-04-29T21:23:29Z","title":"EMOPortraits: Emotion-enhanced Multimodal One-shot Head Avatars","version":1},"cited_work":{"arxiv_id":"2404.19110","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.19110","snapshot_observed_at":"2026-07-01T22:06:16.976922Z","title":"Emoportraits: Emotion-enhanced multimodal one-shot head avatars.arXiv preprint arXiv:2404.19110, 2024","venue":null,"work_id":"e595a0b2-2dc9-4d3b-bdf2-767fefdb2884","year":2024},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"cited_paper":"/paper/2404.19110","citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:ad2419296a6c5fef20b1a9bf62cca1d89317947303a4197d288689b6a6ef0d3e","observation_id":"68a15157-24ca-439d-ab10-cf9f7192b1a6","resolution":{"observed_at":"2026-07-01T22:06:16.978617Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:41:59.683979Z","title":"Scaling recti- fied flow transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:ef12c2c9cdada87ca7ea3eea3b5604d553037aa4ee58512987a192befb0013cc","observation_id":"78929906-de10-4040-bc24-d20d1778260e","resolution":{"observed_at":"2026-06-28T15:41:59.683979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:41:59.683979Z","title":"Introducing gemini 2.5 flash image: Our state-of-the-art image model.https://developers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:d09c2304e95ead1f9325c78300397a0e60b84a07f7f7b82c59fa38523b355604","observation_id":"faa4bb31-951f-4461-b8bc-bbda93ad11fe","resolution":{"observed_at":"2026-06-28T15:41:59.683979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03168","last_updated":"2025-02-28T14:39:17Z","snapshot_observed_at":"2026-07-06T18:40:57.362549Z","submitted_at":"2024-07-03T14:41:39Z","title":"LivePortrait: Efficient Portrait Animation with Stitching and Retargeting Control","version":2},"cited_work":{"arxiv_id":"2407.03168","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.03168","snapshot_observed_at":"2026-07-04T06:19:38.680614Z","title":"Liveportrait: Efficient portrait animation with stitching and retargeting control","venue":null,"work_id":"a6d04417-1655-4dfd-91f6-8ac466a59dab","year":2024},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"cited_paper":"/paper/2407.03168","citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:02f7ea701983710757cd5f128279e7717bdfc984af385333cb8313a36512e679","observation_id":"0b3e1e87-c56e-44ce-a5b9-47ae08da7fc7","resolution":{"observed_at":"2026-07-01T22:06:16.968008Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:41:59.683979Z","title":"Space: Speech-driven portrait an- imation with controllable expression","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:a38ea14e39655740328188746d17d1045b87904df9ade5fdeeb0aba6abfe44b4","observation_id":"128d84e6-e17b-41dd-8ebd-9da7e4358dd6","resolution":{"observed_at":"2026-06-28T15:41:59.683979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00103","last_updated":"2024-12-30T19:00:25Z","snapshot_observed_at":"2026-07-06T20:14:54.297131Z","submitted_at":"2024-12-30T19:00:25Z","title":"LTX-Video: Realtime Video Latent Diffusion","version":1},"cited_work":{"arxiv_id":"2501.00103","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.00103","snapshot_observed_at":"2026-07-09T07:56:04.699528Z","title":"LTX-Video: Realtime Video Latent Diffusion","venue":"cs.CV","work_id":"cee5c521-3ce9-466e-a035-1e42f89254f4","year":2024},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"cited_paper":"/paper/2501.00103","citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:09513beeddbcd1c62432b60c52002b4b3089d7f72b2ce42cf6e88e9274575154","observation_id":"0bfd662d-e545-45f4-bd5b-b2c13df345b6","resolution":{"observed_at":"2026-07-01T22:06:16.975818Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":"2207.12598","doi":"10.1109/cvpr52733.2024.02494","metadata_source":"pith","pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Classifier-Free Diffusion Guidance","venue":"cs.LG","work_id":"acf2c588-c088-4a6c-938e-150ad7c666d7","year":2022},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:4846609e090bc5d9b73a5592b5ab484746ad0c5cba2515e5bd087b437f4f8d1a","observation_id":"c7086045-68a1-4c48-a328-e741cc56d020","resolution":{"observed_at":"2026-07-01T22:06:17.022220Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:41:59.683979Z","title":"Denoising dif- fusion probabilistic models.Advances in neural information processing systems, 33:6840–6851, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:e66c96048a4a012e55d4311f4dd6c4179d6622b1f09888a0588abf0f78862cd5","observation_id":"404d936d-962b-45dd-bf0b-9a73af6c4195","resolution":{"observed_at":"2026-06-28T15:41:59.683979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08009","last_updated":"2025-11-10T04:36:27Z","snapshot_observed_at":"2026-08-02T00:07:53.851104Z","submitted_at":"2025-06-09T17:59:55Z","title":"Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion","version":2},"cited_work":{"arxiv_id":"2506.08009","doi":"10.48550/arxiv.2506.08009","metadata_source":"pith","pith_arxiv_id":"2506.08009","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self Forcing: Bridging the Train-Test Gap in Autoregressive Video Diffusion","venue":"cs.CV","work_id":"53e58ef9-7932-4b83-b757-34ac14db3e0f","year":2025},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"cited_paper":"/paper/2506.08009","citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:84efdd05d537eca3ad30427d7f01764f36c6918c88a9db4af378cb738b6445db","observation_id":"32d6b69a-ae24-4da6-bd77-39fd3d3a2434","resolution":{"observed_at":"2026-07-01T22:06:17.025068Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:41:59.683979Z","title":"Eamm: One-shot emotional talking face via audio-based emotion-aware motion model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:2e464449498a6f87d449ac235ace1a8a1edca7188151194f37124b7f2fd60379","observation_id":"348273fd-297f-4451-865d-48fcf9465b53","resolution":{"observed_at":"2026-06-28T15:41:59.683979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:41:59.683979Z","title":"Sonic: Shifting focus to global audio perception in portrait anima- tion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:4a7ee9889a421934451f36077b533e6cb22af395dbc33b5d6639128f38d10220","observation_id":"c439a47e-ae37-440c-992f-82413fc84d00","resolution":{"observed_at":"2026-06-28T15:41:59.683979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:41:59.683979Z","title":"Auto-encoding vari- ational bayes, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:ef58af0818159a89496d1ea8c3066f74434abc8f437656c2812809b5a44a8b5e","observation_id":"7af8d6f1-de50-408a-88c2-75fbd8775aab","resolution":{"observed_at":"2026-06-28T15:41:59.683979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:41:59.683979Z","title":"Tokenmotion: Decoupled motion control via token disentanglement for human-centric video generation","venue":null,"work_id":null,"year":1951},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:f42abe96bcb77013f7c8b2d634061741773dca5408d5ffb779cee09cbcd38479","observation_id":"dd95b62a-58e9-4853-94f9-a9075aad1e5a","resolution":{"observed_at":"2026-06-28T15:41:59.683979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:41:59.683979Z","title":"Expressive talking head generation with granular audio-visual control","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:0a4b2ed2883fc76d3a9bef2fce55413e8be98fb91c9553f443d80d4f90f12019","observation_id":"77dd19b0-02c9-4605-a2ad-aed09b59b4e4","resolution":{"observed_at":"2026-06-28T15:41:59.683979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01061","last_updated":"2025-06-30T08:26:56Z","snapshot_observed_at":"2026-07-06T20:30:02.903743Z","submitted_at":"2025-02-03T05:17:32Z","title":"OmniHuman-1: Rethinking the Scaling-Up of One-Stage Conditioned Human Animation Models","version":3},"cited_work":{"arxiv_id":"2502.01061","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.01061","snapshot_observed_at":"2026-07-04T16:49:57.651919Z","title":"Omnihuman-1: Rethinking the scaling-up of one-stage conditioned human animation models","venue":null,"work_id":"85d90e10-908d-44a4-8c36-6f2228da1d25","year":2025},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"cited_paper":"/paper/2502.01061","citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:1f2dcda72f7aab39dd9ba1dafdbff394e0a1d9dd0b419d82d7223cbb07eb4865","observation_id":"d8f06aec-259c-4c30-9bd3-b12057a11376","resolution":{"observed_at":"2026-07-01T22:06:17.031391Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2501.08316","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T01:07:45.233309Z","title":"Diffusion adversarial post-training for one-step video generation","venue":null,"work_id":"62c7164b-8dc8-4fc0-898d-e70790cfb89c","year":2025},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:1bee2ac17320f376aa561a18a3642252caa2f32c6e4d909b681ce6ce65f34597","observation_id":"28fe0d3c-60e9-4a85-8542-8a889451a53a","resolution":{"observed_at":"2026-07-01T22:06:17.042850Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.09350","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T20:00:07.534148Z","title":"Autoregressive adversarial post- training for real-time interactive video generation","venue":null,"work_id":"b69b5a7a-ef08-4ef4-bd1a-5f3bac90186d","year":2025},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:eb2892ae99b28172a6c1ab40af1244cd4b403ab4782f581b5b4b04156d4a5257","observation_id":"d20be360-94c1-42cf-9542-e8a98fa6d7ef","resolution":{"observed_at":"2026-07-01T22:06:17.037239Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":"2210.02747","doi":"10.1038/s41467-024-47656-z","metadata_source":"pith","pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flow Matching for Generative Modeling","venue":"cs.LG","work_id":"6edb71c4-5d64-40af-a394-9757ea051a36","year":2022},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:9949ad95b0a721bc72c0476a8ecf779821ecf6d411a549ee074e7a13bcb9053f","observation_id":"42eb07bb-d5c3-464e-a546-3a0bc46992d7","resolution":{"observed_at":"2026-07-01T22:06:17.042323Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"crossref_status_cache"},{"observed_at":"2026-06-01T22:57:59.860918+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":"2209.03003","doi":"10.48550/arxiv.2209.03003","metadata_source":"pith","pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","venue":"cs.LG","work_id":"a1989e1b-d66d-4533-be3a-fb9c5fd62290","year":2022},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:a075d3e56fc4c28ca38f396129fb5431a01f747f0d34363c8f43e798132233e9","observation_id":"2578d23f-a9fa-472f-9cc1-2a4f51157076","resolution":{"observed_at":"2026-07-01T22:06:17.036750Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-07-11T22:49:29.244251+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T22:49:29.244251+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03099","last_updated":"2025-06-03T17:29:28Z","snapshot_observed_at":"2026-07-06T21:35:56.582332Z","submitted_at":"2025-06-03T17:29:28Z","title":"TalkingMachines: Real-Time Audio-Driven FaceTime-Style Video via Autoregressive Diffusion Models","version":1},"cited_work":{"arxiv_id":"2506.03099","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03099","snapshot_observed_at":"2026-07-04T16:49:57.653031Z","title":"Talkingmachines: Real-time audio-driven facetime-style video via autoregressive diffusion models","venue":null,"work_id":"0b5d3c51-5773-40e2-a037-6d6cc663e566","year":2025},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"cited_paper":"/paper/2506.03099","citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:594d6a0f56f68c7a3dca26496b399b8a079a261deb6a7146c50815d36302d0c4","observation_id":"8824b76c-9096-4e16-acbf-911c9d25e250","resolution":{"observed_at":"2026-07-01T22:06:17.028231Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:41:59.683979Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:01298a19ebcbb3010ee1f85e01348c25560ea75bd5268cc38b4627aeca44e00e","observation_id":"63907d27-5bd1-4706-acdd-6f4e2e0b7191","resolution":{"observed_at":"2026-06-28T15:41:59.683979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09642","last_updated":"2026-03-02T11:31:23Z","snapshot_observed_at":"2026-08-02T11:33:41.662779Z","submitted_at":"2025-03-12T05:00:07Z","title":"Open-Sora 2.0: Training a Commercial-Level Video Generation Model in $200k","version":3},"cited_work":{"arxiv_id":"2503.09642","doi":"10.48550/arxiv.2503.09642","metadata_source":"pith","pith_arxiv_id":"2503.09642","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Open-Sora 2.0: Training a Commercial-Level Video Generation Model in $200k","venue":"cs.GR","work_id":"c22f9060-268c-4cc9-8018-dee486a23da1","year":2025},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"cited_paper":"/paper/2503.09642","citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:aafad9b1f604ca5b35221493599ca0ce828090a79efc223e1d0b8b10dc786a52","observation_id":"837f0016-0877-4393-a5be-724c0ca2cb0b","resolution":{"observed_at":"2026-07-01T22:06:17.007451Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:41:59.683979Z","title":"A lip sync expert is all you need for speech to lip generation in the wild","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:a7868ba64566bbf77eaec048b5bf11b054d78071b56d3a150e0ac1c61d35c25e","observation_id":"080d370c-711e-4619-8f20-38259de1b6f4","resolution":{"observed_at":"2026-06-28T15:41:59.683979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21144","last_updated":"2025-03-27T04:18:53Z","snapshot_observed_at":"2026-08-04T01:03:05.023067Z","submitted_at":"2025-03-27T04:18:53Z","title":"ChatAnyone: Stylized Real-time Portrait Video Generation with Hierarchical Motion Diffusion Model","version":1},"cited_work":{"arxiv_id":"2503.21144","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.21144","snapshot_observed_at":"2026-07-01T22:06:17.003075Z","title":"Chatanyone: Stylized real-time portrait video generation with hierarchical motion diffusion model","venue":null,"work_id":"9a61f598-61ea-40b2-b6c7-6d2ae6fc284e","year":2025},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"cited_paper":"/paper/2503.21144","citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:5dcf509c719690687f450232fe699686496ee3ff691c356ceb138b8f9e846105","observation_id":"07d79fc0-424d-4c60-9975-3ef5356e3887","resolution":{"observed_at":"2026-07-01T22:06:17.004633Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:41:59.683979Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:5cd645c5a320f443fe96fffc53a086add83e0b55a9c2f837a30427b2daa2e6c2","observation_id":"ca902b09-28de-436b-8798-6240138994d0","resolution":{"observed_at":"2026-06-28T15:41:59.683979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:41:59.683979Z","title":"Fast high- resolution image synthesis with latent adversarial diffusion distillation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:1fa2409e34028e4f5a950d29469d79d55d47ff9c815fe738edf3612e2d016573","observation_id":"b3f0d381-da78-4aa0-ad2b-15a1ccd747ec","resolution":{"observed_at":"2026-06-28T15:41:59.683979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:41:59.683979Z","title":"Adversarial diffusion distillation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:fcc1014abac433d93cfde0ee5ccb16c799fa42a2d8637f6ee5c3a3230b290c0e","observation_id":"d598ce8a-f2a1-459b-b5bc-5b82075bb1c6","resolution":{"observed_at":"2026-06-28T15:41:59.683979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":"2011.13456","doi":"10.1088/1748-9326/aae98d","metadata_source":"pith","pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","venue":"cs.LG","work_id":"d9110e53-a5d4-4794-a4c5-a575e91c31ad","year":2020},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:71fe18bc73c4fcc2b5fef114e743dccb2ae5a94167d37eb3d3e5b369e9a82b0e","observation_id":"7c11c598-c407-470b-837c-4e473c7f0831","resolution":{"observed_at":"2026-07-01T22:06:17.010726Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-06-01T22:58:00.812405+00:00","source":"crossref_status_cache"},{"observed_at":"2026-06-01T22:58:00.812405+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:41:59.683979Z","title":"Diffused heads: Diffusion models beat gans on talking-face genera- tion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:0b42396a6dc1b4c83e8567055eb619b907d83b678a7073ea196d3edfc474fe09","observation_id":"382db98f-2f1e-4f0e-82f9-a28b56fe37d3","resolution":{"observed_at":"2026-06-28T15:41:59.683979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:41:59.683979Z","title":"Synthesizing obama: learn- ing lip sync from audio.ACM Transactions on Graphics, 36 (4):1–13, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:247d92326c03ab4a586d6bc73720558ebed072d1587afba55d8c0bb33f9533f3","observation_id":"ed3414aa-3d56-43ed-86b7-623ea378a884","resolution":{"observed_at":"2026-06-28T15:41:59.683979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13211","last_updated":"2025-05-19T14:58:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-19T14:58:50Z","title":"MAGI-1: Autoregressive Video Generation at Scale","version":1},"cited_work":{"arxiv_id":"2505.13211","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.13211","snapshot_observed_at":"2026-07-10T01:46:41.063877Z","title":"MAGI-1: Autoregressive Video Generation at Scale","venue":"cs.CV","work_id":"25e8bd3d-e51c-43ae-8126-4ea6ecdb3321","year":2025},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"cited_paper":"/paper/2505.13211","citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:bdc7b081f9d1c98c703630490c443f207b9226bd5c0208cdbb6cf23ce42e3379","observation_id":"1207205d-4708-4eba-b7f2-6443f6133cc3","resolution":{"observed_at":"2026-07-01T22:06:17.002298Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:41:59.683979Z","title":"Emo: Emote portrait alive generating expressive portrait videos with audio2video diffusion model under weak conditions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:7606a76559f15c1339dd8e459e806d48f35d94983bd933fa188fb498abc3f08f","observation_id":"6c77681b-e29f-4049-af64-1e9cda9efae0","resolution":{"observed_at":"2026-06-28T15:41:59.683979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:41:59.683979Z","title":"Reducio! generating 1k video within 16 seconds using extremely compressed mo- tion latents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:48019f4df57555ff24730ad59ff8f4a7c8715f33a3c508c19cd9d489d906efb3","observation_id":"e098ef0b-d711-436a-85db-e978b75d2a8b","resolution":{"observed_at":"2026-06-28T15:41:59.683979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:41:59.683979Z","title":"Fvd: A new metric for video generation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:aa2c6f3e3c3a1abfe01bca44a39cb3466b0ad151b1adb0c60ee782d21f21f0d9","observation_id":"1ad01a55-9503-45e5-a82e-a7492f7f1d9e","resolution":{"observed_at":"2026-06-28T15:41:59.683979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:41:59.683979Z","title":"Conditional image genera- tion with pixelcnn decoders.Advances in neural information processing systems, 29, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:abad44e20e5dc658feb1101af94c3ca89517f7ca762f9eb65300c9fd9c2ce566","observation_id":"e25ec6e8-9d5f-40f5-b002-445fa2f40815","resolution":{"observed_at":"2026-06-28T15:41:59.683979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:41:59.683979Z","title":"Pixel recurrent neural networks","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:f138a035898e0d7b96e636090913d5b83a91ba0e1fd2cb9ab3e349294cbddf77","observation_id":"c4c3dd92-4805-48e8-88e7-cb56beb32e2a","resolution":{"observed_at":"2026-06-28T15:41:59.683979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":"2503.20314","doi":"10.1109/19.492748","metadata_source":"pith","pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":"cs.CV","work_id":"ad3ebc3b-4224-46c9-b61d-bcf135da0a7c","year":2025},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:53cb657c12b2eb165811c851644701d471390945e479234728520170b50feb8d","observation_id":"c06e113e-91ef-48c1-b6f4-fef71baf7dec","resolution":{"observed_at":"2026-07-01T22:06:17.004638Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:41:59.683979Z","title":"Progressive disentangled representation 10 learning for fine-grained controllable talking head synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:892f5412257a187e4984c837d4bc00f277f7108296d080d4ddd647f158a1e57f","observation_id":"19201b67-4902-4a91-93fe-d0e67f4cf536","resolution":{"observed_at":"2026-06-28T15:41:59.683979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:41:59.683979Z","title":"Echoshot: Multi-shot portrait video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:1ad62e79cd51bb1b88aea258c3839ae6490391c532394d0f92805e4914d2d6e1","observation_id":"fab4fd07-4d3b-4af9-9191-04be2ccc08eb","resolution":{"observed_at":"2026-06-28T15:41:59.683979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:41:59.683979Z","title":"Fanta- sytalking: Realistic talking portrait generation via coherent motion synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:800dd42dbddf281e320ff733a02409583045e89ee9c80aa0eab64efa75c8d635","observation_id":"274846f4-57e9-4428-ae7d-daf5365ca4d3","resolution":{"observed_at":"2026-06-28T15:41:59.683979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:41:59.683979Z","title":"Audio2head: Audio-driven one-shot talking-head gener- ation with natural head motion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:9cbf2c1cca1b2e0cb308458e3fda129cf39310677aa83902d12e4ea60f53e889","observation_id":"98847c52-c98e-4f91-a1a1-970789955024","resolution":{"observed_at":"2026-06-28T15:41:59.683979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:41:59.683979Z","title":"One-shot free-view neural talking-head synthesis for video conferenc- ing","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:cdd7bf8fcf37d186019399b5b61a83dad83730241200fc7bbfffe1859d93dd65","observation_id":"de4bb315-8d87-4484-ac21-c4228792c5b2","resolution":{"observed_at":"2026-06-28T15:41:59.683979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-06T01:54:50.445862Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":"2403.17694","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-07-02T02:16:26.575398Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","venue":null,"work_id":"d41ca9c8-5720-452c-86ce-b4d81eaf7dee","year":2024},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:23d3171d26ce6a31f63bbc41c374f437941b2977b393b862f5a35bccbe308020","observation_id":"679e79a2-4c15-4b52-8c6a-2414065c442f","resolution":{"observed_at":"2026-07-01T22:06:17.010720Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:41:59.683979Z","title":"A learning algorithm for continually running fully recurrent neural networks.Neu- ral computation, 1(2):270–280, 1989","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:ca7e5041e8c8d7ce7dd33e6857a5962516d96087f9820c94f6d6809d943e66f4","observation_id":"0019adac-4292-42ae-8420-c522e548afc7","resolution":{"observed_at":"2026-06-28T15:41:59.683979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-07-06T18:30:06.570612Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":"2406.08801","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-07-01T22:06:16.996788Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","venue":null,"work_id":"c9aa1ca0-1c1b-4f82-99c8-f3bfda2b1e83","year":2024},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:e8d96bee8cbc56938ff27eeff004cf1b2e8053750297a590d48af312d1d9e91d","observation_id":"1a0bf6b9-050b-4aae-9500-3c2f8ad4609f","resolution":{"observed_at":"2026-07-01T22:06:16.998665Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:41:59.683979Z","title":"Vasa-1: Lifelike audio-driven talking faces generated in real time.Advances in Neural Information Pro- cessing Systems, 37:660–684, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:d000ea7c52b2f4ea6b8ad30d2af8663ac2f6357e35bebb79a5ede63782481ef5","observation_id":"56ac3d45-0d76-49e0-af35-1bfce50c0b49","resolution":{"observed_at":"2026-06-28T15:41:59.683979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.10157","last_updated":"2021-09-14T21:20:06Z","snapshot_observed_at":"2026-07-06T11:02:11.424356Z","submitted_at":"2021-04-20T17:58:03Z","title":"VideoGPT: Video Generation using VQ-VAE and Transformers","version":2},"cited_work":{"arxiv_id":"2104.10157","doi":"10.48550/arxiv.2104.10157","metadata_source":"pith","pith_arxiv_id":"2104.10157","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"VideoGPT: Video Generation using VQ-VAE and Transformers","venue":"cs.CV","work_id":"703c74c3-fa5e-455c-8c00-697c83511fcf","year":2021},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"cited_paper":"/paper/2104.10157","citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:e35f8e07aa726ad3fcdc317baaedb2d2fb9ad8b566a1a7975b323150b8b390c5","observation_id":"b1d6057f-fa6e-4fce-81af-0455903a8b65","resolution":{"observed_at":"2026-07-01T22:06:16.995433Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":"2408.06072","doi":"10.48550/arxiv.2408.06072","metadata_source":"pith","pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","venue":"cs.CV","work_id":"f38fc088-12aa-4bf4-9ecd-08d3e797ccb7","year":2024},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:eea73daed3b9e535334e6266586c49fd02c6b91dba4aa7fdec615e96b3672ad0","observation_id":"c6b6c8bd-bace-48d2-b730-5f653fedd40a","resolution":{"observed_at":"2026-07-01T22:06:16.983406Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08503","last_updated":"2024-03-23T06:40:22Z","snapshot_observed_at":"2026-07-06T17:16:17.240820Z","submitted_at":"2024-01-16T17:04:30Z","title":"Real3D-Portrait: One-shot Realistic 3D Talking Portrait Synthesis","version":3},"cited_work":{"arxiv_id":"2401.08503","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.08503","snapshot_observed_at":"2026-07-01T22:06:16.985446Z","title":"Real3d-portrait: One- shot realistic 3d talking portrait synthesis","venue":null,"work_id":"cd3062c8-43da-4cbe-89bb-4ecd631ab021","year":2024},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"cited_paper":"/paper/2401.08503","citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:d6ae9fff80d8af89f326278142582cf57a3f04251d657495dd390e2e57b4b2fd","observation_id":"b1aca6fa-de05-425d-afa0-29fcaae31a06","resolution":{"observed_at":"2026-07-01T22:06:16.987357Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:41:59.683979Z","title":"Styleheat: One-shot high-resolution editable talking face generation via pre-trained stylegan","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:508b049146506bb0b1bdbc23935a4196a7c512bd55fb2eb3adebb562cab19293","observation_id":"6893e448-5f43-4a37-a0aa-e5f020447700","resolution":{"observed_at":"2026-06-28T15:41:59.683979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:41:59.683979Z","title":"Im- proved distribution matching distillation for fast image syn- thesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:19c87caf00d3b99231436388d1bd580676a3adb04bd1a58a9f86a11f1ee0584a","observation_id":"b2fe0017-c206-4946-95fc-d2ba933d0ca8","resolution":{"observed_at":"2026-06-28T15:41:59.683979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:41:59.683979Z","title":"One-step diffusion with distribution matching distillation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:f78f1bb8eab91c6e4413dc23f4c4dc1d71fcded9becb430ba07101f391c4b685","observation_id":"92b13d9e-0fe2-4156-af8f-6e531913be1a","resolution":{"observed_at":"2026-06-28T15:41:59.683979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:41:59.683979Z","title":"One-step diffusion with distribution matching distillation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:0f6da9045fb897e645f472763e36585755d931d20dc784a441408089f1eaf251","observation_id":"b6e4521e-524d-46cf-8bbf-a039197b53eb","resolution":{"observed_at":"2026-06-28T15:41:59.683979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:41:59.683979Z","title":"From slow bidirectional to fast autoregressive video diffusion mod- els","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:5fad75ff18accc2ef5cde5ac17a1dacc9b2734c91c565de55f2d490edce68e11","observation_id":"3ba160af-7d76-4209-ba35-a4e79a86cff1","resolution":{"observed_at":"2026-06-28T15:41:59.683979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:41:59.683979Z","title":"An image is worth 32 tokens for reconstruction and generation.Advances in Neural Information Processing Systems, 37:128940– 128966, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:dee46cd06b609b21ee3eb03411106df3cb7ca56cb17e1ad76a83508255f85f4e","observation_id":"3a6c1562-5294-4ff8-9492-01538a1ad6dc","resolution":{"observed_at":"2026-06-28T15:41:59.683979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14148","last_updated":"2024-03-21T05:48:48Z","snapshot_observed_at":"2026-07-06T17:48:08.016138Z","submitted_at":"2024-03-21T05:48:48Z","title":"Efficient Video Diffusion Models via Content-Frame Motion-Latent Decomposition","version":1},"cited_work":{"arxiv_id":"2403.14148","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.14148","snapshot_observed_at":"2026-07-03T20:28:55.535457Z","title":"Effi- cient video diffusion models via content-frame motion-latent decomposition","venue":null,"work_id":"d262800e-d0e2-4bf8-ac7e-255fab126f46","year":2024},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"cited_paper":"/paper/2403.14148","citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:5201973ccb8286264908cafb28e3331914971223dbb7e97f4a88b4ab352e574b","observation_id":"26b29c8c-6b41-4f2b-aa04-8677dde9e0c0","resolution":{"observed_at":"2026-07-01T22:06:16.990094Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:41:59.683979Z","title":"Talking head generation with probabilistic audio-to-visual diffusion priors","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:ecfc63f519115d309ec269fe1e0e180a387779eaa65439bf363eb61a24a44f74","observation_id":"e97a59e1-a265-4adf-a3b4-1f20ce1bd1fc","resolution":{"observed_at":"2026-06-28T15:41:59.683979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:41:59.683979Z","title":"Identity- preserving text-to-video generation by frequency decompo- sition","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:9c751fc8ba35e328eb3c91f9c646b14882b8e233dc68f60bd93506e73e685087","observation_id":"a44d403c-9d15-47d6-a899-e0b09b9fea29","resolution":{"observed_at":"2026-06-28T15:41:59.683979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:41:59.683979Z","title":"Root mean square layer nor- malization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:a0d12c9042c6daf0d437ae19cac2300c292c9aabeb851c87f6c90b04c47adabc","observation_id":"fce1d9d8-c618-4f57-84b6-70d7487ca5c9","resolution":{"observed_at":"2026-06-28T15:41:59.683979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:41:59.683979Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:1c488eb1e1759b99094f975db248b3ed9484a3172d6d6fd79d8005a22e8eeb14","observation_id":"b0d344b0-bbb0-4bf3-97e8-3b1cdd83a99c","resolution":{"observed_at":"2026-06-28T15:41:59.683979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:41:59.683979Z","title":"Sadtalker: Learning realistic 3d motion coefficients for stylized audio- driven single image talking face animation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:4a09ac61dfdecc0b3118af2837204abdeebb81816a4e1528a9f121b7003860ee","observation_id":"21d60297-8308-45c1-b5be-8c109b7f30a0","resolution":{"observed_at":"2026-06-28T15:41:59.683979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:41:59.683979Z","title":"Flow-guided one-shot talking face generation with a high- resolution audio-visual dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:b94b09c26d0998f9fb46c265abfbd2583835bb6cd09c5af252b436560b6e12ce","observation_id":"c498c47c-c7e2-4d2e-8720-73b1c5d9b11a","resolution":{"observed_at":"2026-06-28T15:41:59.683979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:41:59.683979Z","title":"11 Taming teacher forcing for masked autoregressive video gen- eration","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:2315cac83ef84d50aaa8e30c182ae62625ce4749d541f8eeee9d198181053d96","observation_id":"42f90887-6782-47b2-92ca-d20516d65fbf","resolution":{"observed_at":"2026-06-28T15:41:59.683979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:41:59.683979Z","title":"Pose-controllable talking face generation by implicitly modularized audio-visual rep- resentation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:0bdef2fbe0d79466f32c016b7605115b6e5fe8f23d68064892d56d3cdaa25e80","observation_id":"0cef9d99-0165-4744-a646-493882917e41","resolution":{"observed_at":"2026-06-28T15:41:59.683979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T15:41:59.683979Z","title":"split-first","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-06-28T15:41:59.683979Z"},"links":{"citing_paper":"/paper/2606.01620"},"observation_digest":"sha256:0b4cd00a0d0f6ba34a9a07cfe27f2628e163297a610ba0f94355407f121bf189","observation_id":"9f1b0e0d-86c6-43cf-bbb9-693e66a7be1d","resolution":{"observed_at":"2026-06-28T15:41:59.683979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.01620","last_updated":"2026-06-01T03:12:23Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:42:07.508474Z","submitted_at":"2026-06-01T03:12:23Z","title":"Real-Time Generation of Streamable Talking Portrait Video with Reference-Guided Deep Compression VAEs"},"reference_resolution":{"displayed":78,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":52,"verified_exact":26,"verified_fuzzy":0},"total_outbound_references":78},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 78 of 78 outbound references and 0 inbound Pith citation observations for arXiv:2606.01620."}