{"as_of":"2026-08-01T00:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b07b52c70e8955ef49368b859b6c6492b9ce7a9990459a5c9737aea08c2aad59","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-23T16:59:57.727035Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-07-31T06:34:12.847434+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T22:36:53.138354Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-01T21:46:15.570278Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.09209","last_updated":"2026-04-16T07:45:17Z","snapshot_observed_at":"2026-07-06T19:50:11.368872Z","submitted_at":"2024-11-14T06:13:05Z","title":"JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation","version":5},"cited_work":{"arxiv_id":"2411.09209","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.09209","snapshot_observed_at":"2026-07-01T21:46:15.570278Z","title":"JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation","venue":"cs.CV","work_id":"c6d25826-aa4f-4595-8095-22de1e8c6d3c","year":2024},"citing_paper":{"arxiv_id":"2605.25488","last_updated":"2026-05-25T06:45:29Z","snapshot_observed_at":"2026-07-06T23:35:26.687529Z","submitted_at":"2026-05-25T06:45:29Z","title":"Test-Time Self-Adaptive Conditioning for Stable Audio-Driven Talking-Head Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-29T22:36:53.138354Z"},"links":{"cited_paper":"/paper/2411.09209","citing_paper":"/paper/2605.25488"},"observation_digest":"sha256:59a86e4833117789fad6874c32af026003002f10dbda65cf885507e38814e377","observation_id":"2a1d3b0f-91b5-4891-9e23-c231d5e89308","resolution":{"observed_at":"2026-06-29T22:44:01.684711Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09209","last_updated":"2026-04-16T07:45:17Z","snapshot_observed_at":"2026-07-06T19:50:11.368872Z","submitted_at":"2024-11-14T06:13:05Z","title":"JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation","version":5},"cited_work":{"arxiv_id":"2411.09209","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.09209","snapshot_observed_at":"2026-07-01T21:46:15.570278Z","title":"JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation","venue":"cs.CV","work_id":"c6d25826-aa4f-4595-8095-22de1e8c6d3c","year":2024},"citing_paper":{"arxiv_id":"2606.01031","last_updated":"2026-05-31T05:44:42Z","snapshot_observed_at":"2026-07-06T23:41:39.172310Z","submitted_at":"2026-05-31T05:44:42Z","title":"Temporally-Aligned Evaluation for Audio-Driven Talking Head Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-28T16:19:55.048831Z"},"links":{"cited_paper":"/paper/2411.09209","citing_paper":"/paper/2606.01031"},"observation_digest":"sha256:3f66a1516e588fecf7f0071cd7a81c4bedb86ccd2fa34fbbc5410da921cb5088","observation_id":"bad1223a-4c00-45a6-b6e1-3c8a4d901742","resolution":{"observed_at":"2026-07-01T21:46:15.571777Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.09209/citation-record","integrity":"/paper/2411.09209/integrity","json":"/paper/2411.09209/citation-record.json","paper":"/paper/2411.09209"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.00787","last_updated":"2023-05-01T12:24:09Z","snapshot_observed_at":"2026-07-06T15:21:50.037094Z","submitted_at":"2023-05-01T12:24:09Z","title":"GeneFace++: Generalized and Stable Real-Time Audio-Driven 3D Talking Face Generation","version":1},"cited_work":{"arxiv_id":"2305.00787","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.00787","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Geneface++: Generalized and stable real-time audio-driven 3d talking face generation","venue":null,"work_id":"4bd1483b-6bb5-4f77-9cf4-c125aa46a14c","year":2023},"citing_paper":{"arxiv_id":"2411.09209","last_updated":"2026-04-16T07:45:17Z","snapshot_observed_at":"2026-07-06T19:50:11.368872Z","submitted_at":"2024-11-14T06:13:05Z","title":"JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation","version":5},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-23T16:59:57.727035Z"},"links":{"cited_paper":"/paper/2305.00787","citing_paper":"/paper/2411.09209"},"observation_digest":"sha256:43496f0c92b0ed9de2095245d47c0c0548943c0ea3402c4d32b21aee29476809","observation_id":"43cf5105-36a2-49f2-809a-1a0fde3c3c3a","resolution":{"observed_at":"2026-05-23T17:03:12.603956Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07718","last_updated":"2024-10-14T13:35:17Z","snapshot_observed_at":"2026-07-06T19:31:00.754487Z","submitted_at":"2024-10-10T08:34:41Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation","version":2},"cited_work":{"arxiv_id":"2410.07718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.07718","snapshot_observed_at":"2026-07-01T21:46:15.594455Z","title":"Hallo2: Long-Duration and High-Resolution Audio-Driven Portrait Image Animation","venue":null,"work_id":"a36f46e1-e536-4499-b2bc-ed760196c9cf","year":2024},"citing_paper":{"arxiv_id":"2411.09209","last_updated":"2026-04-16T07:45:17Z","snapshot_observed_at":"2026-07-06T19:50:11.368872Z","submitted_at":"2024-11-14T06:13:05Z","title":"JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation","version":5},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-23T16:59:57.727035Z"},"links":{"cited_paper":"/paper/2410.07718","citing_paper":"/paper/2411.09209"},"observation_digest":"sha256:99222394ad58ec44b928950e24fca22afceda812c4912b4ce06e812402c8ab0c","observation_id":"af259182-f475-49fb-915f-2c93f8bd620b","resolution":{"observed_at":"2026-05-23T17:03:12.594476Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-07-06T17:51:02.529047Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":"2403.17694","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-07-02T02:16:26.575398Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","venue":null,"work_id":"d41ca9c8-5720-452c-86ce-b4d81eaf7dee","year":2024},"citing_paper":{"arxiv_id":"2411.09209","last_updated":"2026-04-16T07:45:17Z","snapshot_observed_at":"2026-07-06T19:50:11.368872Z","submitted_at":"2024-11-14T06:13:05Z","title":"JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation","version":5},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-23T16:59:57.727035Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2411.09209"},"observation_digest":"sha256:2b6d0b00e01d3485eab8b9bb361caa8144582172b1e8c172418662c60974668e","observation_id":"01855afa-757d-419b-9cb5-40e207cc27d3","resolution":{"observed_at":"2026-05-23T17:03:12.558326Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02634","last_updated":"2025-04-04T05:13:40Z","snapshot_observed_at":"2026-07-06T19:10:21.222045Z","submitted_at":"2024-09-04T11:55:14Z","title":"Loopy: Taming Audio-Driven Portrait Avatar with Long-Term Motion Dependency","version":3},"cited_work":{"arxiv_id":"2409.02634","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.02634","snapshot_observed_at":"2026-06-29T07:53:13.362380Z","title":"Loopy: Taming audio- driven portrait avatar with long-term motion dependency","venue":null,"work_id":"859b3e77-263d-470a-b684-a710acd16630","year":2024},"citing_paper":{"arxiv_id":"2411.09209","last_updated":"2026-04-16T07:45:17Z","snapshot_observed_at":"2026-07-06T19:50:11.368872Z","submitted_at":"2024-11-14T06:13:05Z","title":"JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation","version":5},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-23T16:59:57.727035Z"},"links":{"cited_paper":"/paper/2409.02634","citing_paper":"/paper/2411.09209"},"observation_digest":"sha256:ab2b246daed78efb57bce572fe468f2b877e1ae6642b2d2f4607db2a02ab116b","observation_id":"81bf1d80-3a4d-45d6-a9a3-59376834d9ae","resolution":{"observed_at":"2026-05-23T17:03:12.612108Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08764","last_updated":"2024-03-13T17:59:02Z","snapshot_observed_at":"2026-07-06T17:44:09.081164Z","submitted_at":"2024-03-13T17:59:02Z","title":"VLOGGER: Multimodal Diffusion for Embodied Avatar Synthesis","version":1},"cited_work":{"arxiv_id":"2403.08764","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.08764","snapshot_observed_at":"2026-07-02T02:16:26.572604Z","title":"Vlogger: Multimodal diffusion for embodied avatar synthesis","venue":null,"work_id":"f75aa125-10a2-4437-812d-c6f81b1c69ca","year":2024},"citing_paper":{"arxiv_id":"2411.09209","last_updated":"2026-04-16T07:45:17Z","snapshot_observed_at":"2026-07-06T19:50:11.368872Z","submitted_at":"2024-11-14T06:13:05Z","title":"JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation","version":5},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-23T16:59:57.727035Z"},"links":{"cited_paper":"/paper/2403.08764","citing_paper":"/paper/2411.09209"},"observation_digest":"sha256:f9d3c5de27e30f6190a98d2b316dd4ab6b0ce076b6897be3a6133c27bcf1ce6f","observation_id":"477d88a1-bf97-4697-8fbd-6fd9f95d32fd","resolution":{"observed_at":"2026-05-23T17:03:12.574515Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Emo: Emote portrait alive - generating expressive portrait videos with audio2video diffusion model under weak conditions","venue":null,"work_id":"c739107c-cd26-4ea6-86f0-f0d3fadfed2d","year":2024},"citing_paper":{"arxiv_id":"2411.09209","last_updated":"2026-04-16T07:45:17Z","snapshot_observed_at":"2026-07-06T19:50:11.368872Z","submitted_at":"2024-11-14T06:13:05Z","title":"JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation","version":5},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-23T16:59:57.727035Z"},"links":{"citing_paper":"/paper/2411.09209"},"observation_digest":"sha256:20d6de1e24c56272e928eef3b9d03cee7ffc7b4d7d3ee6eb8d0f0e1930ba9415","observation_id":"f8279f83-7197-421d-8218-d6473a9fc138","resolution":{"observed_at":"2026-05-23T17:03:13.909596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Emotalker: Emotionally editable talking face generation via diffusion model","venue":null,"work_id":"3293ec48-ad97-43c3-8b0c-4e409c363254","year":2024},"citing_paper":{"arxiv_id":"2411.09209","last_updated":"2026-04-16T07:45:17Z","snapshot_observed_at":"2026-07-06T19:50:11.368872Z","submitted_at":"2024-11-14T06:13:05Z","title":"JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation","version":5},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-23T16:59:57.727035Z"},"links":{"citing_paper":"/paper/2411.09209"},"observation_digest":"sha256:ebe509c9f38f67e5d7facffc5ccf9a96fd51ca10a4f4c49492845829a278daad","observation_id":"62cf65c2-c35f-40bb-9443-75208361bb64","resolution":{"observed_at":"2026-05-23T17:03:13.905886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Digital avatars: Promoting independent living for older adults","venue":null,"work_id":"1c59c2b9-d632-41f1-9dd8-a5996736e27f","year":2020},"citing_paper":{"arxiv_id":"2411.09209","last_updated":"2026-04-16T07:45:17Z","snapshot_observed_at":"2026-07-06T19:50:11.368872Z","submitted_at":"2024-11-14T06:13:05Z","title":"JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation","version":5},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-23T16:59:57.727035Z"},"links":{"citing_paper":"/paper/2411.09209"},"observation_digest":"sha256:1ea144608cd22194ccc62f0c4aaeb1b491fbf6c0963acd53310fe6640310d504","observation_id":"8a2da2d1-d68f-4003-bc52-d5b271ef16f5","resolution":{"observed_at":"2026-05-23T17:03:13.899634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Talking face generation with multilingual tts","venue":null,"work_id":"53dcdf59-e329-4037-9088-02d3d22dcf4d","year":2022},"citing_paper":{"arxiv_id":"2411.09209","last_updated":"2026-04-16T07:45:17Z","snapshot_observed_at":"2026-07-06T19:50:11.368872Z","submitted_at":"2024-11-14T06:13:05Z","title":"JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation","version":5},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-23T16:59:57.727035Z"},"links":{"citing_paper":"/paper/2411.09209"},"observation_digest":"sha256:f57fa5e391e50bb31013dac07c95f39deddb585f79a1e29d7199ccfedfec7784","observation_id":"31b53fbe-6680-4f4c-992f-8c1f8100db27","resolution":{"observed_at":"2026-05-23T17:03:13.895958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improving user experience of virtual health assistants: scoping review","venue":null,"work_id":"02c6aa7d-9b51-463b-bee6-3bcb0a7fe405","year":2021},"citing_paper":{"arxiv_id":"2411.09209","last_updated":"2026-04-16T07:45:17Z","snapshot_observed_at":"2026-07-06T19:50:11.368872Z","submitted_at":"2024-11-14T06:13:05Z","title":"JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation","version":5},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-23T16:59:57.727035Z"},"links":{"citing_paper":"/paper/2411.09209"},"observation_digest":"sha256:ce4b9ef14def58e083668423bc0e02cb31a40bc1d5dadd663b503212b60b45af","observation_id":"a73e94c4-44a2-441e-b089-acddd406dab4","resolution":{"observed_at":"2026-05-23T17:03:13.892170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.06772","last_updated":"2023-11-12T08:29:41Z","snapshot_observed_at":"2026-07-06T16:46:10.142093Z","submitted_at":"2023-11-12T08:29:41Z","title":"ChatAnything: Facetime Chat with LLM-Enhanced Personas","version":1},"cited_work":{"arxiv_id":"2311.06772","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.06772","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chatanything: Facetime chat with llm-enhanced personas","venue":null,"work_id":"de4e1743-8722-4e57-9aa9-ef78c28ed799","year":2023},"citing_paper":{"arxiv_id":"2411.09209","last_updated":"2026-04-16T07:45:17Z","snapshot_observed_at":"2026-07-06T19:50:11.368872Z","submitted_at":"2024-11-14T06:13:05Z","title":"JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation","version":5},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-23T16:59:57.727035Z"},"links":{"cited_paper":"/paper/2311.06772","citing_paper":"/paper/2411.09209"},"observation_digest":"sha256:7025af0dd8bd5247b9228e26dbb28c7e3f9f26bdab0a007f86750d430a7597c1","observation_id":"77549e31-efcf-478c-baae-7171dcfea7db","resolution":{"observed_at":"2026-05-23T17:03:12.590051Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Building llm-based ai agents in social virtual reality","venue":null,"work_id":"89ecbc3c-8ecc-4945-8cd1-7a0b403724bd","year":2024},"citing_paper":{"arxiv_id":"2411.09209","last_updated":"2026-04-16T07:45:17Z","snapshot_observed_at":"2026-07-06T19:50:11.368872Z","submitted_at":"2024-11-14T06:13:05Z","title":"JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation","version":5},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-23T16:59:57.727035Z"},"links":{"citing_paper":"/paper/2411.09209"},"observation_digest":"sha256:57b5f4db59f98c6f8925248400cb54db081c7cb6d52da5b4dd808fe2e0d8d3cc","observation_id":"9e0a6530-afb2-4dbb-bad0-9a656d3be864","resolution":{"observed_at":"2026-05-23T17:03:13.888288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stylesync: High-fidelity generalized and personalized lip sync in style-based generator","venue":null,"work_id":"44b97e02-d953-431c-9f05-7f2eca087b12","year":2023},"citing_paper":{"arxiv_id":"2411.09209","last_updated":"2026-04-16T07:45:17Z","snapshot_observed_at":"2026-07-06T19:50:11.368872Z","submitted_at":"2024-11-14T06:13:05Z","title":"JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation","version":5},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-23T16:59:57.727035Z"},"links":{"citing_paper":"/paper/2411.09209"},"observation_digest":"sha256:79ffd0f9518c071a767b807f3f67d0f08d5eb26d6572fc1c4771a22cc19e881a","observation_id":"fd48d80c-16f9-4d81-ac23-1e70175746e2","resolution":{"observed_at":"2026-05-23T17:03:13.884876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Echomimic: Lifelike audio-driven portrait animations through editable landmark conditioning","venue":null,"work_id":"6af4a07c-bde2-47b7-bfd7-d50db9599fdd","year":2024},"citing_paper":{"arxiv_id":"2411.09209","last_updated":"2026-04-16T07:45:17Z","snapshot_observed_at":"2026-07-06T19:50:11.368872Z","submitted_at":"2024-11-14T06:13:05Z","title":"JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation","version":5},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-23T16:59:57.727035Z"},"links":{"citing_paper":"/paper/2411.09209"},"observation_digest":"sha256:025165f42bfa15cfc266939655038895d276adc9d0adb619b6820a28a0da0c3a","observation_id":"f5270fe4-727a-4699-9929-6bb284221350","resolution":{"observed_at":"2026-05-23T17:03:13.881553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hallo: Hierarchical audio-driven visual synthesis for portrait image animation","venue":null,"work_id":"3cf99082-76b3-45e8-ae7f-ee4530ed5e9c","year":2024},"citing_paper":{"arxiv_id":"2411.09209","last_updated":"2026-04-16T07:45:17Z","snapshot_observed_at":"2026-07-06T19:50:11.368872Z","submitted_at":"2024-11-14T06:13:05Z","title":"JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation","version":5},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-23T16:59:57.727035Z"},"links":{"citing_paper":"/paper/2411.09209"},"observation_digest":"sha256:906e596720416932c3fe26d4639ea04cb55a1aece0208884b8c12235b21f5c52","observation_id":"30f4f98c-fe0d-49f9-b4eb-6835ef806755","resolution":{"observed_at":"2026-05-23T17:03:13.878139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13268","last_updated":"2024-09-20T06:57:42Z","snapshot_observed_at":"2026-07-06T19:18:36.400938Z","submitted_at":"2024-09-20T06:57:42Z","title":"JoyHallo: Digital human model for Mandarin","version":1},"cited_work":{"arxiv_id":"2409.13268","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.13268","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Joyhallo: Digital human model for mandarin","venue":null,"work_id":"1ce33f62-eba5-4166-8978-d3080cab03b0","year":2024},"citing_paper":{"arxiv_id":"2411.09209","last_updated":"2026-04-16T07:45:17Z","snapshot_observed_at":"2026-07-06T19:50:11.368872Z","submitted_at":"2024-11-14T06:13:05Z","title":"JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation","version":5},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-23T16:59:57.727035Z"},"links":{"cited_paper":"/paper/2409.13268","citing_paper":"/paper/2411.09209"},"observation_digest":"sha256:7386b97ccf10a3df2c0a24f236b0c7e662481dcb70613bc045118392a2a65a49","observation_id":"2aa6725c-b2e9-4778-b13f-4ad69909356d","resolution":{"observed_at":"2026-05-23T17:03:12.568862Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03168","last_updated":"2025-02-28T14:39:17Z","snapshot_observed_at":"2026-07-06T18:40:57.362549Z","submitted_at":"2024-07-03T14:41:39Z","title":"LivePortrait: Efficient Portrait Animation with Stitching and Retargeting Control","version":2},"cited_work":{"arxiv_id":"2407.03168","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.03168","snapshot_observed_at":"2026-07-04T06:19:38.680614Z","title":"Liveportrait: Efficient portrait animation with stitching and retargeting control","venue":null,"work_id":"a6d04417-1655-4dfd-91f6-8ac466a59dab","year":2024},"citing_paper":{"arxiv_id":"2411.09209","last_updated":"2026-04-16T07:45:17Z","snapshot_observed_at":"2026-07-06T19:50:11.368872Z","submitted_at":"2024-11-14T06:13:05Z","title":"JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation","version":5},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-23T16:59:57.727035Z"},"links":{"cited_paper":"/paper/2407.03168","citing_paper":"/paper/2411.09209"},"observation_digest":"sha256:3bcab223e1ceb9e79f721f94a1e70d0da32a0f7bf4e4deedd8006e79274b3782","observation_id":"cfae7aa5-7904-4cff-bc95-e877c8cf2f0e","resolution":{"observed_at":"2026-05-23T17:03:12.585478Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A lip sync expert is all you need for speech to lip generation in the wild","venue":null,"work_id":"a16dbd62-f821-45d7-b194-667abe5ff637","year":2020},"citing_paper":{"arxiv_id":"2411.09209","last_updated":"2026-04-16T07:45:17Z","snapshot_observed_at":"2026-07-06T19:50:11.368872Z","submitted_at":"2024-11-14T06:13:05Z","title":"JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation","version":5},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-23T16:59:57.727035Z"},"links":{"citing_paper":"/paper/2411.09209"},"observation_digest":"sha256:80ca7defe2b66e46b1df09d44a2cb19f2d277ebc7dcd403fda385808dea61df7","observation_id":"12aaf60a-78cf-4c43-a023-e3d238f0f981","resolution":{"observed_at":"2026-05-23T17:03:13.874641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dinet: Deformation inpainting network for realistic face visually dubbing on high resolution video","venue":null,"work_id":"0659743c-c300-402f-ba9b-0863a0f1a8f3","year":2023},"citing_paper":{"arxiv_id":"2411.09209","last_updated":"2026-04-16T07:45:17Z","snapshot_observed_at":"2026-07-06T19:50:11.368872Z","submitted_at":"2024-11-14T06:13:05Z","title":"JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation","version":5},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-23T16:59:57.727035Z"},"links":{"citing_paper":"/paper/2411.09209"},"observation_digest":"sha256:50886669d63159e98fa234a5e8cd11093683ed35f9df4d941b36693613ce2d14","observation_id":"7d09c244-92c5-4f6c-bd39-34f9fb9228a2","resolution":{"observed_at":"2026-05-23T17:03:13.871117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Synctalkface: Talking face generation with precise lip-syncing via audio-lip memory","venue":null,"work_id":"42bc1326-1620-461b-8337-d14acb74ed4d","year":2062},"citing_paper":{"arxiv_id":"2411.09209","last_updated":"2026-04-16T07:45:17Z","snapshot_observed_at":"2026-07-06T19:50:11.368872Z","submitted_at":"2024-11-14T06:13:05Z","title":"JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation","version":5},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-23T16:59:57.727035Z"},"links":{"citing_paper":"/paper/2411.09209"},"observation_digest":"sha256:a0701104ad65dcafe5fdbabc3dd5fbf65a92b8552ea3e913bd5834aa3560ee0a","observation_id":"e1b02d9b-12f9-41d0-995a-fbf9e51a4e9a","resolution":{"observed_at":"2026-05-23T17:03:13.867400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sadtalker: Learning realistic 3d motion coefficients for stylized audio-driven single image talking face animation","venue":null,"work_id":"c30a1028-ed8e-4342-a676-cf60742bbcce","year":2023},"citing_paper":{"arxiv_id":"2411.09209","last_updated":"2026-04-16T07:45:17Z","snapshot_observed_at":"2026-07-06T19:50:11.368872Z","submitted_at":"2024-11-14T06:13:05Z","title":"JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation","version":5},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-23T16:59:57.727035Z"},"links":{"citing_paper":"/paper/2411.09209"},"observation_digest":"sha256:3e1607cce89e13cb5a43a017657e7b63d0fb7586d162799b233463a59bacee86","observation_id":"2c4941b5-1469-48a7-b556-811492413afb","resolution":{"observed_at":"2026-05-23T17:03:13.863874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09767","last_updated":"2024-08-10T09:37:55Z","snapshot_observed_at":"2026-07-06T17:02:37.841641Z","submitted_at":"2023-12-15T13:15:42Z","title":"DreamTalk: When Emotional Talking Head Generation Meets Diffusion Probabilistic Models","version":3},"cited_work":{"arxiv_id":"2312.09767","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.09767","snapshot_observed_at":"2026-07-01T21:46:15.567696Z","title":"DreamTalk: When Emotional Talking Head Generation Meets Diffusion Probabilistic Models","venue":null,"work_id":"4352eabd-8ef9-4a9b-aecb-611a81401210","year":2023},"citing_paper":{"arxiv_id":"2411.09209","last_updated":"2026-04-16T07:45:17Z","snapshot_observed_at":"2026-07-06T19:50:11.368872Z","submitted_at":"2024-11-14T06:13:05Z","title":"JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation","version":5},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-23T16:59:57.727035Z"},"links":{"cited_paper":"/paper/2312.09767","citing_paper":"/paper/2411.09209"},"observation_digest":"sha256:ed177d9bfd76a29e453ce1138af0bbd2041dc5c2f1ca257933300be7788204b4","observation_id":"59433fa3-7ab4-4237-965d-87ed000e5eda","resolution":{"observed_at":"2026-05-23T17:03:12.563841Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01841","last_updated":"2023-12-07T03:14:22Z","snapshot_observed_at":"2026-07-30T10:55:21.867087Z","submitted_at":"2023-12-04T12:25:37Z","title":"VividTalk: One-Shot Audio-Driven Talking Head Generation Based on 3D Hybrid Prior","version":2},"cited_work":{"arxiv_id":"2312.01841","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.01841","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"VividTalk: One-Shot Audio-Driven Talking Head Generation Based on 3D Hybrid Prior","venue":null,"work_id":"5c788dd7-8559-4037-894f-ebf28237a675","year":2023},"citing_paper":{"arxiv_id":"2411.09209","last_updated":"2026-04-16T07:45:17Z","snapshot_observed_at":"2026-07-06T19:50:11.368872Z","submitted_at":"2024-11-14T06:13:05Z","title":"JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation","version":5},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-23T16:59:57.727035Z"},"links":{"cited_paper":"/paper/2312.01841","citing_paper":"/paper/2411.09209"},"observation_digest":"sha256:b5018f4258ed18db2e79d934ddefb97e75549396c4bb470962a73a02afe47c39","observation_id":"8d8f8fd9-c39e-4a0a-8df3-f130a291b359","resolution":{"observed_at":"2026-05-23T17:03:12.608008Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Moda: Mapping-once audio-driven portrait animation with dual attentions","venue":null,"work_id":"e3d67359-89cc-48b1-8eb0-8acb2ee8e5c1","year":2023},"citing_paper":{"arxiv_id":"2411.09209","last_updated":"2026-04-16T07:45:17Z","snapshot_observed_at":"2026-07-06T19:50:11.368872Z","submitted_at":"2024-11-14T06:13:05Z","title":"JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation","version":5},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-23T16:59:57.727035Z"},"links":{"citing_paper":"/paper/2411.09209"},"observation_digest":"sha256:d72ec223c0faa7de1035f9ce9aac6525b209c7eb113a24c33660ada5df862e13","observation_id":"0da630c4-6b96-4aa9-b628-0cf05ca64b60","resolution":{"observed_at":"2026-05-23T17:03:13.860487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hierarchical cross-modal talking face generation with dynamic pixel-wise loss","venue":null,"work_id":"96257413-eb59-494e-988c-f02a662e31ac","year":2019},"citing_paper":{"arxiv_id":"2411.09209","last_updated":"2026-04-16T07:45:17Z","snapshot_observed_at":"2026-07-06T19:50:11.368872Z","submitted_at":"2024-11-14T06:13:05Z","title":"JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation","version":5},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-23T16:59:57.727035Z"},"links":{"citing_paper":"/paper/2411.09209"},"observation_digest":"sha256:73574423d95929b026d7b80ad025185450308f4e08de2b321fe36e21fbc32e0f","observation_id":"9ceb3f55-3ffc-48d0-acb2-f738f8a39389","resolution":{"observed_at":"2026-05-23T17:03:13.857296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Neural voice puppetry: Audio-driven facial reenactment","venue":null,"work_id":"0032c9fc-1ad0-4320-b89c-85862ae8d980","year":2020},"citing_paper":{"arxiv_id":"2411.09209","last_updated":"2026-04-16T07:45:17Z","snapshot_observed_at":"2026-07-06T19:50:11.368872Z","submitted_at":"2024-11-14T06:13:05Z","title":"JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation","version":5},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-23T16:59:57.727035Z"},"links":{"citing_paper":"/paper/2411.09209"},"observation_digest":"sha256:078e80ee0a2e45e701a03f81fb55f9b785f12726539a82e9f7b1889ee06d0de2","observation_id":"62d81ef9-87ab-4874-bf70-2c088bf901d5","resolution":{"observed_at":"2026-05-23T17:03:13.854028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Audio-driven talking face video generation with learning-based personalized head pose","venue":null,"work_id":"0aba1104-5c82-4327-9819-e2d35906ef94","year":2020},"citing_paper":{"arxiv_id":"2411.09209","last_updated":"2026-04-16T07:45:17Z","snapshot_observed_at":"2026-07-06T19:50:11.368872Z","submitted_at":"2024-11-14T06:13:05Z","title":"JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation","version":5},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-23T16:59:57.727035Z"},"links":{"citing_paper":"/paper/2411.09209"},"observation_digest":"sha256:9d798d4ed71016ad0294d9f2a21daf99f51d0978fdc2b13271bca828d29bab83","observation_id":"69ae3649-7449-4d81-a742-2c54dbfbdcb1","resolution":{"observed_at":"2026-05-23T17:03:13.850618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"One-shot free-view neural talking-head synthesis for video conferencing","venue":null,"work_id":"686d79fd-82dd-4730-bfed-d5e33d8ff756","year":2021},"citing_paper":{"arxiv_id":"2411.09209","last_updated":"2026-04-16T07:45:17Z","snapshot_observed_at":"2026-07-06T19:50:11.368872Z","submitted_at":"2024-11-14T06:13:05Z","title":"JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation","version":5},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-23T16:59:57.727035Z"},"links":{"citing_paper":"/paper/2411.09209"},"observation_digest":"sha256:c045f2e5c53a765122b8306ff492919b2e55117b0d4ddd9b208cfe3eab04ffb2","observation_id":"299dbd96-e1f9-4b0b-88db-deb5615c11e6","resolution":{"observed_at":"2026-05-23T17:03:13.847600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pirenderer: Controllable portrait image generation via semantic neural rendering","venue":null,"work_id":"d516299e-02c3-4b10-95e0-b2e314f72494","year":2021},"citing_paper":{"arxiv_id":"2411.09209","last_updated":"2026-04-16T07:45:17Z","snapshot_observed_at":"2026-07-06T19:50:11.368872Z","submitted_at":"2024-11-14T06:13:05Z","title":"JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation","version":5},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-23T16:59:57.727035Z"},"links":{"citing_paper":"/paper/2411.09209"},"observation_digest":"sha256:cda858b917ea0305afffa8d686ab1b249ba9fc2dd76a5faeb61160fd45f68153","observation_id":"66e2a98f-19a4-46dc-b7f3-67fa40c502f4","resolution":{"observed_at":"2026-05-23T17:03:13.844484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10667","last_updated":"2024-10-31T07:43:14Z","snapshot_observed_at":"2026-07-06T18:01:01.206270Z","submitted_at":"2024-04-16T15:43:22Z","title":"VASA-1: Lifelike Audio-Driven Talking Faces Generated in Real Time","version":2},"cited_work":{"arxiv_id":"2404.10667","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.10667","snapshot_observed_at":"2026-07-04T16:49:57.635983Z","title":"V ASA-1: Lifelike Audio-Driven Talking Faces Generated in Real Time","venue":null,"work_id":"2e86b860-32b0-45c8-bb26-0ab710237e5d","year":2024},"citing_paper":{"arxiv_id":"2411.09209","last_updated":"2026-04-16T07:45:17Z","snapshot_observed_at":"2026-07-06T19:50:11.368872Z","submitted_at":"2024-11-14T06:13:05Z","title":"JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation","version":5},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-23T16:59:57.727035Z"},"links":{"cited_paper":"/paper/2404.10667","citing_paper":"/paper/2411.09209"},"observation_digest":"sha256:9fcd337cbc10223dfce045ff27a2de0f4fbb26935b4e73d88059a66ad4dc9ba4","observation_id":"8c25cec8-be35-4e04-b8e7-7ca8fb02e773","resolution":{"observed_at":"2026-05-23T17:03:12.581463Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Megaportraits: One-shot megapixel neural head avatars","venue":null,"work_id":"5713c389-3587-4dcf-867c-cbbefd9bd6ae","year":2022},"citing_paper":{"arxiv_id":"2411.09209","last_updated":"2026-04-16T07:45:17Z","snapshot_observed_at":"2026-07-06T19:50:11.368872Z","submitted_at":"2024-11-14T06:13:05Z","title":"JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation","version":5},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-23T16:59:57.727035Z"},"links":{"citing_paper":"/paper/2411.09209"},"observation_digest":"sha256:b3d9c2c32ec46a9004fc666d091e2de7c18e94ca665d1f6811de0a35589a125d","observation_id":"1c1fad3e-f6ec-48fc-8c33-d3e92b41a702","resolution":{"observed_at":"2026-05-23T17:03:13.840982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A morphable model for the synthesis of 3d faces","venue":null,"work_id":"9f49b714-618b-4228-b6ce-6d93adbebd06","year":2023},"citing_paper":{"arxiv_id":"2411.09209","last_updated":"2026-04-16T07:45:17Z","snapshot_observed_at":"2026-07-06T19:50:11.368872Z","submitted_at":"2024-11-14T06:13:05Z","title":"JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation","version":5},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-23T16:59:57.727035Z"},"links":{"citing_paper":"/paper/2411.09209"},"observation_digest":"sha256:1cbb71cbef3ccdd696ff16b968d8b53e1901497f1eb79844cdbd3e674b957f76","observation_id":"30927a77-d69d-49af-8725-db7155d20958","resolution":{"observed_at":"2026-05-23T17:03:13.837720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Expression invariant 3d face recognition with a morphable model","venue":null,"work_id":"d5f17888-7816-4418-9eba-3c92893f801e","year":2008},"citing_paper":{"arxiv_id":"2411.09209","last_updated":"2026-04-16T07:45:17Z","snapshot_observed_at":"2026-07-06T19:50:11.368872Z","submitted_at":"2024-11-14T06:13:05Z","title":"JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation","version":5},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-23T16:59:57.727035Z"},"links":{"citing_paper":"/paper/2411.09209"},"observation_digest":"sha256:8b07d15085633c2f6717982b11f8777cb486b4ae8a8a75df77a2bdeff8fc58c5","observation_id":"0ce78366-adbd-4f5c-a5a0-c9de4532e56c","resolution":{"observed_at":"2026-05-23T17:03:13.834119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning a model of facial shape and expression from 4d scans","venue":null,"work_id":"3c37c4c7-eecf-4c00-af59-d406b10c67f1","year":2017},"citing_paper":{"arxiv_id":"2411.09209","last_updated":"2026-04-16T07:45:17Z","snapshot_observed_at":"2026-07-06T19:50:11.368872Z","submitted_at":"2024-11-14T06:13:05Z","title":"JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation","version":5},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-23T16:59:57.727035Z"},"links":{"citing_paper":"/paper/2411.09209"},"observation_digest":"sha256:6205bb6c3c2c4ee9dd1afbbd11c32bd413b520065b688c52aea476f24491e4dc","observation_id":"385b1e27-a574-4399-b5d4-5c70fe15ebe5","resolution":{"observed_at":"2026-05-23T17:03:13.830479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Disentangled representation learning for 3d face shape","venue":null,"work_id":"d2167db5-2c19-4292-89a7-7ec8cfef988c","year":2019},"citing_paper":{"arxiv_id":"2411.09209","last_updated":"2026-04-16T07:45:17Z","snapshot_observed_at":"2026-07-06T19:50:11.368872Z","submitted_at":"2024-11-14T06:13:05Z","title":"JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation","version":5},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-23T16:59:57.727035Z"},"links":{"citing_paper":"/paper/2411.09209"},"observation_digest":"sha256:a3697cd8b2cdb0eefae1029187a85b589085ab82286b51860440100a66502cbf","observation_id":"7bc07450-5619-4044-b2a2-6b978f60549a","resolution":{"observed_at":"2026-05-23T17:03:13.826849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Emoportraits: Emotion-enhanced multimodal one-shot head avatars","venue":null,"work_id":"08d3c7cc-2e8d-40fb-9f16-2491ab380e1f","year":2024},"citing_paper":{"arxiv_id":"2411.09209","last_updated":"2026-04-16T07:45:17Z","snapshot_observed_at":"2026-07-06T19:50:11.368872Z","submitted_at":"2024-11-14T06:13:05Z","title":"JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation","version":5},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-23T16:59:57.727035Z"},"links":{"citing_paper":"/paper/2411.09209"},"observation_digest":"sha256:f2cfb31f1483698e9fa645f0cd3dd8e8e2d6b31b7374a5020b787548be105a43","observation_id":"2ba51db7-f8db-4ecf-a5d5-bada6296affd","resolution":{"observed_at":"2026-05-23T17:03:13.823622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"First order motion model for image animation","venue":null,"work_id":"aea15e34-a59d-48ec-a97b-5deec1e5afd4","year":2019},"citing_paper":{"arxiv_id":"2411.09209","last_updated":"2026-04-16T07:45:17Z","snapshot_observed_at":"2026-07-06T19:50:11.368872Z","submitted_at":"2024-11-14T06:13:05Z","title":"JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation","version":5},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-23T16:59:57.727035Z"},"links":{"citing_paper":"/paper/2411.09209"},"observation_digest":"sha256:640b179ad652395391f4b45850134a42b7622656b2bdea6754d58b70d2728bce","observation_id":"c2fd8d3c-062e-4d0a-82f3-54287005e5f7","resolution":{"observed_at":"2026-05-23T17:03:13.820600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations","venue":null,"work_id":"8cf7a495-2e15-4e2c-883d-38207d33c817","year":2020},"citing_paper":{"arxiv_id":"2411.09209","last_updated":"2026-04-16T07:45:17Z","snapshot_observed_at":"2026-07-06T19:50:11.368872Z","submitted_at":"2024-11-14T06:13:05Z","title":"JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation","version":5},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-23T16:59:57.727035Z"},"links":{"citing_paper":"/paper/2411.09209"},"observation_digest":"sha256:84ecd62a61bde300753b4fbf947940195d752c2701487da562959a80e7c0d798","observation_id":"0558fa06-ef45-4d92-bd5f-a18654b09ab0","resolution":{"observed_at":"2026-05-23T17:03:13.817648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Capture, learning, and synthesis of 3d speaking styles","venue":null,"work_id":"a974b0a9-e934-418a-b8c7-b80c25db001c","year":2019},"citing_paper":{"arxiv_id":"2411.09209","last_updated":"2026-04-16T07:45:17Z","snapshot_observed_at":"2026-07-06T19:50:11.368872Z","submitted_at":"2024-11-14T06:13:05Z","title":"JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation","version":5},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-23T16:59:57.727035Z"},"links":{"citing_paper":"/paper/2411.09209"},"observation_digest":"sha256:e0ccee190838b2138c658f3be24f162617a3df832df251be74dcb11b24c0d75b","observation_id":"37cbf5a4-ace7-4ad4-8c16-64a4645074b5","resolution":{"observed_at":"2026-05-23T17:03:13.813654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffposetalk: Speech-driven stylistic 3d facial animation and head pose generation via diffusion models","venue":null,"work_id":"3ec6b42b-065b-40ea-940f-5b485eae5205","year":2024},"citing_paper":{"arxiv_id":"2411.09209","last_updated":"2026-04-16T07:45:17Z","snapshot_observed_at":"2026-07-06T19:50:11.368872Z","submitted_at":"2024-11-14T06:13:05Z","title":"JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation","version":5},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-23T16:59:57.727035Z"},"links":{"citing_paper":"/paper/2411.09209"},"observation_digest":"sha256:021b9945bb659a8c7c3f5e52046ad8a7877253f0a29001115226225db2fe5867","observation_id":"45762e3c-f687-47d4-abdd-244a28f27ca4","resolution":{"observed_at":"2026-05-23T17:03:13.809792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flow-guided one-shot talking face generation with a high-resolution audio-visual dataset","venue":null,"work_id":"164768b1-f517-4886-9579-5a2681b164e9","year":2021},"citing_paper":{"arxiv_id":"2411.09209","last_updated":"2026-04-16T07:45:17Z","snapshot_observed_at":"2026-07-06T19:50:11.368872Z","submitted_at":"2024-11-14T06:13:05Z","title":"JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation","version":5},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-23T16:59:57.727035Z"},"links":{"citing_paper":"/paper/2411.09209"},"observation_digest":"sha256:9080185473d2fb8c49f9e3273f6d5d8d4df40806fd805c15fe992c44d2caf094","observation_id":"90c00899-965b-4375-bcca-2ab093d52a15","resolution":{"observed_at":"2026-05-23T17:03:13.806013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Celebv-hq: A large-scale video facial attributes dataset","venue":null,"work_id":"2525fbe6-3e7c-48fb-b981-dccdf05d4137","year":2022},"citing_paper":{"arxiv_id":"2411.09209","last_updated":"2026-04-16T07:45:17Z","snapshot_observed_at":"2026-07-06T19:50:11.368872Z","submitted_at":"2024-11-14T06:13:05Z","title":"JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation","version":5},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-23T16:59:57.727035Z"},"links":{"citing_paper":"/paper/2411.09209"},"observation_digest":"sha256:d763ccd6673ab58b99330f139d0643558b6bdb05999c73ff5aa4304a4d823ff0","observation_id":"7856fde6-9a8d-437b-8894-b349f5c50022","resolution":{"observed_at":"2026-05-23T17:03:13.801894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17090","last_updated":"2023-12-28T16:10:25Z","snapshot_observed_at":"2026-07-06T17:09:19.909685Z","submitted_at":"2023-12-28T16:10:25Z","title":"Q-Align: Teaching LMMs for Visual Scoring via Discrete Text-Defined Levels","version":1},"cited_work":{"arxiv_id":"2312.17090","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.17090","snapshot_observed_at":"2026-07-08T01:44:26.160588Z","title":"Q-Align: Teaching LMMs for Visual Scoring via Discrete Text-Defined Levels","venue":"cs.CV","work_id":"2a0ee74c-0c50-4cd3-91ce-b75cc297715e","year":2023},"citing_paper":{"arxiv_id":"2411.09209","last_updated":"2026-04-16T07:45:17Z","snapshot_observed_at":"2026-07-06T19:50:11.368872Z","submitted_at":"2024-11-14T06:13:05Z","title":"JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation","version":5},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-23T16:59:57.727035Z"},"links":{"cited_paper":"/paper/2312.17090","citing_paper":"/paper/2411.09209"},"observation_digest":"sha256:0d948a1fc2da44b3b469890cba492f9a70d410100a225cc77f254392f8a69cfb","observation_id":"3bc999ad-3cc3-4771-8b01-0342b21c69d1","resolution":{"observed_at":"2026-05-23T17:03:12.598662Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Out of time: Automated lip sync in the wild","venue":null,"work_id":"92fe1563-2ec1-44d0-8451-fdc93a638372","year":2016},"citing_paper":{"arxiv_id":"2411.09209","last_updated":"2026-04-16T07:45:17Z","snapshot_observed_at":"2026-07-06T19:50:11.368872Z","submitted_at":"2024-11-14T06:13:05Z","title":"JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation","version":5},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-23T16:59:57.727035Z"},"links":{"citing_paper":"/paper/2411.09209"},"observation_digest":"sha256:881d849e5ddd8f965c1d16a9a411f4ba8d8b93d585177f19e299224a385dc21a","observation_id":"06b2aab1-77c6-4825-aa34-141c87ba6343","resolution":{"observed_at":"2026-05-23T17:03:13.798558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"FVD: A new metric for video generation","venue":null,"work_id":"001fa7e2-c0e2-4260-9660-8d703a8312ca","year":2019},"citing_paper":{"arxiv_id":"2411.09209","last_updated":"2026-04-16T07:45:17Z","snapshot_observed_at":"2026-07-06T19:50:11.368872Z","submitted_at":"2024-11-14T06:13:05Z","title":"JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation","version":5},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-23T16:59:57.727035Z"},"links":{"citing_paper":"/paper/2411.09209"},"observation_digest":"sha256:748d59189274e2eb26a9bddf784687807c381aa98da2311b890a4d85e5a9ffc3","observation_id":"52fae500-32fa-40aa-a408-26fd8d746434","resolution":{"observed_at":"2026-05-23T17:03:13.795055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-07-31T06:34:12.847434+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.09209","last_updated":"2026-04-16T07:45:17Z","latest_version":5,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T19:50:11.368872Z","submitted_at":"2024-11-14T06:13:05Z","title":"JoyVASA: Portrait and Animal Image Animation with Diffusion-Based Audio-Driven Facial Dynamics and Head Motion Generation"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":12,"verified_fuzzy":33},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-07-31T06:34:12.847434+00:00","source":"crossref"},{"observed_at":"2026-07-31T06:34:08.642788+00:00","source":"retraction_watch"}],"thesis":"As of 1 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 2 inbound Pith citation observations for arXiv:2411.09209."}