{"as_of":"2026-08-07T03:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:150959b40091bf6624bfed17a406b89b0309790f1058818868a4ef0ece79ffb0","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":15,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":15,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":15,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:58:30.797463Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T16:49:57.635983Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.10667","last_updated":"2024-10-31T07:43:14Z","snapshot_observed_at":"2026-07-06T18:01:01.206270Z","submitted_at":"2024-04-16T15:43:22Z","title":"VASA-1: Lifelike Audio-Driven Talking Faces Generated in Real Time","version":2},"cited_work":{"arxiv_id":"2404.10667","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.10667","snapshot_observed_at":"2026-07-04T16:49:57.635983Z","title":"V ASA-1: Lifelike Audio-Driven Talking Faces Generated in Real Time","venue":null,"work_id":"2e86b860-32b0-45c8-bb26-0ab710237e5d","year":2024},"citing_paper":{"arxiv_id":"2411.09209","last_updated":"2026-04-16T07:45:17Z","snapshot_observed_at":"2026-08-02T02:41:31.202365Z","submitted_at":"2024-11-14T06:13:05Z","title":"JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation","version":5},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-23T16:59:57.727035Z"},"links":{"cited_paper":"/paper/2404.10667","citing_paper":"/paper/2411.09209"},"observation_digest":"sha256:05031b9e9da5ec11a1b90e81c5cee9bc6d53dd889629825238de270a7f09e1c0","observation_id":"8c25cec8-be35-4e04-b8e7-7ca8fb02e773","resolution":{"observed_at":"2026-05-23T17:03:12.581463Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10667","last_updated":"2024-10-31T07:43:14Z","snapshot_observed_at":"2026-07-06T18:01:01.206270Z","submitted_at":"2024-04-16T15:43:22Z","title":"VASA-1: Lifelike Audio-Driven Talking Faces Generated in Real Time","version":2},"cited_work":{"arxiv_id":"2404.10667","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.10667","snapshot_observed_at":"2026-07-04T16:49:57.635983Z","title":"V ASA-1: Lifelike Audio-Driven Talking Faces Generated in Real Time","venue":null,"work_id":"2e86b860-32b0-45c8-bb26-0ab710237e5d","year":2024},"citing_paper":{"arxiv_id":"2411.16748","last_updated":"2026-05-08T09:16:59Z","snapshot_observed_at":"2026-08-04T02:06:42.093429Z","submitted_at":"2024-11-24T04:46:00Z","title":"Multimodal Diffusion Transformer with Memory Bank for Scalable Long-Duration Talking Video Generation","version":5},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-23T17:19:51.411937Z"},"links":{"cited_paper":"/paper/2404.10667","citing_paper":"/paper/2411.16748"},"observation_digest":"sha256:647aca812efe8fa3d475e88796e8c057de9fe4eb68a14ad9ef6920a3b1622895","observation_id":"0cc5e7a5-9a5d-408b-aded-ecd31187f496","resolution":{"observed_at":"2026-05-23T17:23:15.423874Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10667","last_updated":"2024-10-31T07:43:14Z","snapshot_observed_at":"2026-07-06T18:01:01.206270Z","submitted_at":"2024-04-16T15:43:22Z","title":"VASA-1: Lifelike Audio-Driven Talking Faces Generated in Real Time","version":2},"cited_work":{"arxiv_id":"2404.10667","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.10667","snapshot_observed_at":"2026-07-04T16:49:57.635983Z","title":"V ASA-1: Lifelike Audio-Driven Talking Faces Generated in Real Time","venue":null,"work_id":"2e86b860-32b0-45c8-bb26-0ab710237e5d","year":2024},"citing_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-23T07:41:58.617477Z"},"links":{"cited_paper":"/paper/2404.10667","citing_paper":"/paper/2412.03603"},"observation_digest":"sha256:3d0f17d21b55648f82a23bcadb91348baade58364491868eeaf86f74c2b2fd29","observation_id":"3f856197-4b28-4730-8dcd-60b72f236c56","resolution":{"observed_at":"2026-05-23T07:42:43.499945Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10667","last_updated":"2024-10-31T07:43:14Z","snapshot_observed_at":"2026-07-06T18:01:01.206270Z","submitted_at":"2024-04-16T15:43:22Z","title":"VASA-1: Lifelike Audio-Driven Talking Faces Generated in Real Time","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10667","snapshot_observed_at":"2026-08-06T20:58:30.797463Z","title":"Vasa-1: Lifelike audio-driven talking faces generated in real time","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.01390","last_updated":"2025-07-02T06:10:52Z","snapshot_observed_at":"2026-08-06T20:50:14.467156Z","submitted_at":"2025-07-02T06:10:52Z","title":"FixTalk: Taming Identity Leakage for High-Quality Talking Head Generation in Extreme Cases","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T20:58:30.797463Z"},"links":{"cited_paper":"/paper/2404.10667","citing_paper":"/paper/2507.01390"},"observation_digest":"sha256:0cd36a33b2915a482caa02f11311ba816fdfc342ac999b14eecf765e0b7b6938","observation_id":"bd6d5c86-2636-4b16-af03-b15bd429c157","resolution":{"observed_at":"2026-08-06T20:58:30.797463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10667","last_updated":"2024-10-31T07:43:14Z","snapshot_observed_at":"2026-07-06T18:01:01.206270Z","submitted_at":"2024-04-16T15:43:22Z","title":"VASA-1: Lifelike Audio-Driven Talking Faces Generated in Real Time","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10667","snapshot_observed_at":"2026-08-06T19:38:20.570734Z","title":"Vasa-1: Lifelike audio-driven talking faces generated in real time","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05092","last_updated":"2025-07-07T15:13:46Z","snapshot_observed_at":"2026-08-06T19:30:12.159425Z","submitted_at":"2025-07-07T15:13:46Z","title":"MoDiT: Learning Highly Consistent 3D Motion Coefficients with Diffusion Transformer for Talking Head Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T19:38:20.570734Z"},"links":{"cited_paper":"/paper/2404.10667","citing_paper":"/paper/2507.05092"},"observation_digest":"sha256:5b9c4285c45fb5dff868374f591d4fb398f13899a01886555d713e9f328d7588","observation_id":"dca78684-f3f4-463c-bd87-e6cd7a31d531","resolution":{"observed_at":"2026-08-06T19:38:20.570734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10667","last_updated":"2024-10-31T07:43:14Z","snapshot_observed_at":"2026-07-06T18:01:01.206270Z","submitted_at":"2024-04-16T15:43:22Z","title":"VASA-1: Lifelike Audio-Driven Talking Faces Generated in Real Time","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10667","snapshot_observed_at":"2026-08-05T19:07:35.086557Z","title":"Vasa-1: Lifelike audio-driven talking faces generated in real time,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.13442","last_updated":"2025-08-19T01:55:25Z","snapshot_observed_at":"2026-08-05T19:07:24.374768Z","submitted_at":"2025-08-19T01:55:25Z","title":"EDTalk++: Full Disentanglement for Controllable Talking Head Synthesis","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T19:07:35.086557Z"},"links":{"cited_paper":"/paper/2404.10667","citing_paper":"/paper/2508.13442"},"observation_digest":"sha256:a0bc7fa540eb7b38592d854eab6fbadd3c859a89d42d51a272042dc7ac5234ee","observation_id":"defa1b85-eded-4fa7-aa44-41e30bb368f4","resolution":{"observed_at":"2026-08-05T19:07:35.086557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10667","last_updated":"2024-10-31T07:43:14Z","snapshot_observed_at":"2026-07-06T18:01:01.206270Z","submitted_at":"2024-04-16T15:43:22Z","title":"VASA-1: Lifelike Audio-Driven Talking Faces Generated in Real Time","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10667","snapshot_observed_at":"2026-08-05T10:36:57.436726Z","title":"Vasa-1: Lifelike audio-driven talking faces generated in real time,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03883","last_updated":"2025-09-04T04:39:21Z","snapshot_observed_at":"2026-08-05T10:36:47.088347Z","submitted_at":"2025-09-04T04:39:21Z","title":"Human Motion Video Generation: A Survey","version":1},"reference_index":167,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:57.436726Z"},"links":{"cited_paper":"/paper/2404.10667","citing_paper":"/paper/2509.03883"},"observation_digest":"sha256:5484f55eccc97382e170858d9eef1cc644137ead18c49bac5f5eb17dc59b187d","observation_id":"631b8e4e-8c90-431c-b991-178547ecd17f","resolution":{"observed_at":"2026-08-05T10:36:57.436726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10667","last_updated":"2024-10-31T07:43:14Z","snapshot_observed_at":"2026-07-06T18:01:01.206270Z","submitted_at":"2024-04-16T15:43:22Z","title":"VASA-1: Lifelike Audio-Driven Talking Faces Generated in Real Time","version":2},"cited_work":{"arxiv_id":"2404.10667","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.10667","snapshot_observed_at":"2026-07-04T16:49:57.635983Z","title":"V ASA-1: Lifelike Audio-Driven Talking Faces Generated in Real Time","venue":null,"work_id":"2e86b860-32b0-45c8-bb26-0ab710237e5d","year":2024},"citing_paper":{"arxiv_id":"2604.23632","last_updated":"2026-04-26T09:46:58Z","snapshot_observed_at":"2026-07-06T23:09:48.137856Z","submitted_at":"2026-04-26T09:46:58Z","title":"Hallo-Live: Real-Time Streaming Joint Audio-Video Avatar Generation with Asynchronous Dual-Stream and Human-Centric Preference Distillation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-08T06:56:19.795651Z"},"links":{"cited_paper":"/paper/2404.10667","citing_paper":"/paper/2604.23632"},"observation_digest":"sha256:9dcd963cf6d0135f29c5a7d75798b3cbd8b28191be20f1f8de212a55311d059d","observation_id":"d378b1fb-fafe-4aa5-9604-4b71c4d7aea2","resolution":{"observed_at":"2026-05-11T21:06:12.992772Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10667","last_updated":"2024-10-31T07:43:14Z","snapshot_observed_at":"2026-07-06T18:01:01.206270Z","submitted_at":"2024-04-16T15:43:22Z","title":"VASA-1: Lifelike Audio-Driven Talking Faces Generated in Real Time","version":2},"cited_work":{"arxiv_id":"2404.10667","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.10667","snapshot_observed_at":"2026-07-04T16:49:57.635983Z","title":"V ASA-1: Lifelike Audio-Driven Talking Faces Generated in Real Time","venue":null,"work_id":"2e86b860-32b0-45c8-bb26-0ab710237e5d","year":2024},"citing_paper":{"arxiv_id":"2606.25041","last_updated":"2026-06-29T05:06:50Z","snapshot_observed_at":"2026-07-06T23:59:32.831481Z","submitted_at":"2026-06-23T18:01:03Z","title":"Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-26T00:13:38.523397Z"},"links":{"cited_paper":"/paper/2404.10667","citing_paper":"/paper/2606.25041"},"observation_digest":"sha256:98675deb7968d0ec9a1dcf7df27d1c59cd1f80246e57e9f9f2c7f15094b17f41","observation_id":"ed98ad6d-6ed0-46e8-a93d-107e474c5cda","resolution":{"observed_at":"2026-07-04T16:49:57.637497Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10667","last_updated":"2024-10-31T07:43:14Z","snapshot_observed_at":"2026-07-06T18:01:01.206270Z","submitted_at":"2024-04-16T15:43:22Z","title":"VASA-1: Lifelike Audio-Driven Talking Faces Generated in Real Time","version":2},"cited_work":{"arxiv_id":"2404.10667","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.10667","snapshot_observed_at":"2026-07-04T16:49:57.635983Z","title":"V ASA-1: Lifelike Audio-Driven Talking Faces Generated in Real Time","venue":null,"work_id":"2e86b860-32b0-45c8-bb26-0ab710237e5d","year":2024},"citing_paper":{"arxiv_id":"2606.25041","last_updated":"2026-06-29T05:06:50Z","snapshot_observed_at":"2026-07-06T23:59:32.831481Z","submitted_at":"2026-06-23T18:01:03Z","title":"Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-26T05:27:24.078053Z"},"links":{"cited_paper":"/paper/2404.10667","citing_paper":"/paper/2606.25041"},"observation_digest":"sha256:0276444b4b1ec10faf1f0a348097606639ddbfd31b82758569301f1f724d78c4","observation_id":"1c7a07f4-c662-498b-b80f-cf82cbb00279","resolution":{"observed_at":"2026-07-04T13:09:50.918821Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10667","last_updated":"2024-10-31T07:43:14Z","snapshot_observed_at":"2026-07-06T18:01:01.206270Z","submitted_at":"2024-04-16T15:43:22Z","title":"VASA-1: Lifelike Audio-Driven Talking Faces Generated in Real Time","version":2},"cited_work":{"arxiv_id":"2404.10667","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.10667","snapshot_observed_at":"2026-07-04T16:49:57.635983Z","title":"V ASA-1: Lifelike Audio-Driven Talking Faces Generated in Real Time","venue":null,"work_id":"2e86b860-32b0-45c8-bb26-0ab710237e5d","year":2024},"citing_paper":{"arxiv_id":"2606.25041","last_updated":"2026-06-29T05:06:50Z","snapshot_observed_at":"2026-07-06T23:59:32.831481Z","submitted_at":"2026-06-23T18:01:03Z","title":"Wan-Streamer v0.1: End-to-end Real-time Interactive Foundation Models","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-30T09:43:09.347118Z"},"links":{"cited_paper":"/paper/2404.10667","citing_paper":"/paper/2606.25041"},"observation_digest":"sha256:f266468617aeceab7703e51c9cd8ce8330abccfbe797fb0667f5a1ec4542db3c","observation_id":"036119c6-0352-4b9d-b0a5-bd5cd851e5e1","resolution":{"observed_at":"2026-06-30T09:44:37.375791Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10667","last_updated":"2024-10-31T07:43:14Z","snapshot_observed_at":"2026-07-06T18:01:01.206270Z","submitted_at":"2024-04-16T15:43:22Z","title":"VASA-1: Lifelike Audio-Driven Talking Faces Generated in Real Time","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10667","snapshot_observed_at":"2026-07-12T06:59:35.258176Z","title":"arXiv preprint arXiv:2404.10667 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02799","last_updated":"2026-07-02T22:17:55Z","snapshot_observed_at":"2026-08-03T04:23:48.650624Z","submitted_at":"2026-07-02T22:17:55Z","title":"Conversational Human Audio-visual Talking Dialogue Generation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-12T06:59:35.258176Z"},"links":{"cited_paper":"/paper/2404.10667","citing_paper":"/paper/2607.02799"},"observation_digest":"sha256:235e27a3c478850178a4907def99c0058228e880baaf923e6164ac0e102eb701","observation_id":"34c30995-038f-4a29-9c72-3de725794378","resolution":{"observed_at":"2026-07-12T06:59:35.258176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10667","last_updated":"2024-10-31T07:43:14Z","snapshot_observed_at":"2026-07-06T18:01:01.206270Z","submitted_at":"2024-04-16T15:43:22Z","title":"VASA-1: Lifelike Audio-Driven Talking Faces Generated in Real Time","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10667","snapshot_observed_at":"2026-07-11T19:08:41.963746Z","title":"Vasa-1: Lifelike audio-driven talking faces generated in real time.arXiv preprint arXiv:2404.10667, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04443","last_updated":"2026-07-08T11:37:37Z","snapshot_observed_at":"2026-08-03T21:48:20.745411Z","submitted_at":"2026-07-05T18:05:20Z","title":"Wan-Streamer v0.2: Higher Resolution, Same Latency","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-11T19:08:41.963746Z"},"links":{"cited_paper":"/paper/2404.10667","citing_paper":"/paper/2607.04443"},"observation_digest":"sha256:d470e6fb41dc7caceffaf52f97b95ad877d4e4afff9f32f5335f847727100588","observation_id":"da9677bb-a446-4705-9658-d7c1e2343a4f","resolution":{"observed_at":"2026-07-11T19:08:41.963746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10667","last_updated":"2024-10-31T07:43:14Z","snapshot_observed_at":"2026-07-06T18:01:01.206270Z","submitted_at":"2024-04-16T15:43:22Z","title":"VASA-1: Lifelike Audio-Driven Talking Faces Generated in Real Time","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10667","snapshot_observed_at":"2026-07-31T23:01:32.146368Z","title":"Vasa-1: Lifelike audio-driven talking faces generated in real time.ArXiv, abs/2404.10667, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-06T21:24:01.524756Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:32.146368Z"},"links":{"cited_paper":"/paper/2404.10667","citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:e6fdce1f09c391f45bc1f23db548a41b17f7248acfb6623b0c68c7c9a1f42f22","observation_id":"5f3263dc-c411-4b99-9f14-0054058726f6","resolution":{"observed_at":"2026-07-31T23:01:32.146368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10667","last_updated":"2024-10-31T07:43:14Z","snapshot_observed_at":"2026-07-06T18:01:01.206270Z","submitted_at":"2024-04-16T15:43:22Z","title":"VASA-1: Lifelike Audio-Driven Talking Faces Generated in Real Time","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10667","snapshot_observed_at":"2026-08-06T18:10:17.093844Z","title":"arXiv preprint arXiv:2404.10667 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04722","last_updated":"2026-08-05T11:43:21Z","snapshot_observed_at":"2026-08-07T03:20:01.178009Z","submitted_at":"2026-08-05T11:43:21Z","title":"Multi-View Face and Gesture Animation with Dynamic Gaussians","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-06T18:10:17.093844Z"},"links":{"cited_paper":"/paper/2404.10667","citing_paper":"/paper/2608.04722"},"observation_digest":"sha256:c3113e4a12c4123296a64757d9413d426c4e58f90f0ce32698a9e87d8393ea3a","observation_id":"4461e6e6-a7a8-49ec-9237-9bef37115b62","resolution":{"observed_at":"2026-08-06T18:10:17.093844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2404.10667/citation-record","integrity":"/paper/2404.10667/integrity","json":"/paper/2404.10667/citation-record.json","paper":"/paper/2404.10667"},"outbound":[],"paper":{"arxiv_id":"2404.10667","last_updated":"2024-10-31T07:43:14Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T18:01:01.206270Z","submitted_at":"2024-04-16T15:43:22Z","title":"VASA-1: Lifelike Audio-Driven Talking Faces Generated in Real Time"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 15 inbound Pith citation observations for arXiv:2404.10667."}