{"as_of":"2026-08-21T05:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d86c9f5ef13a6559c7145a58390a39bf596ed1367d584fe87cb186f1980624a8","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T23:53:10.734059Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.03603/citation-record","integrity":"/paper/2505.03603/integrity","json":"/paper/2505.03603/citation-record.json","paper":"/paper/2505.03603"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:53:11.689664Z","title":null,"venue":null,"work_id":"4692437e-7d06-4d0e-9946-4254425c9e19","year":null},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.403299Z"},"links":{"citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:ac3d5e991ec5ea16b1da4993d59d9f61889d5a7eb9d4a5b9b679fa20f77fd485","observation_id":"005af95f-40fd-4416-ab9e-3e691170ca10","resolution":{"observed_at":"2026-08-15T23:53:11.694893Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:53:11.657542Z","title":null,"venue":null,"work_id":"b6e91cd3-6425-4407-941b-90810e94e339","year":2023},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.413088Z"},"links":{"citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:90d94422f9fa2b0a76a6c1442c9a551aa97f9c93f17a3dd6f729b70fcd639701","observation_id":"d3a6f0b1-14c9-4dd3-9779-70bd66e9abfd","resolution":{"observed_at":"2026-08-15T23:53:11.662525Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18616","last_updated":"2024-11-27T18:58:52Z","snapshot_observed_at":"2026-08-18T16:47:31.833926Z","submitted_at":"2024-11-27T18:58:52Z","title":"Diffusion Self-Distillation for Zero-Shot Customized Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18616","snapshot_observed_at":"2026-08-15T23:53:10.419914Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.419914Z"},"links":{"cited_paper":"/paper/2411.18616","citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:a5faaddedd79d03e6390a984b0508450030bfb898f85f44cdc2fa5aa399bd2f6","observation_id":"6ba4a103-5efc-4666-875d-51d049d5f19a","resolution":{"observed_at":"2026-08-15T23:53:10.419914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16666","last_updated":"2024-09-25T06:51:57Z","snapshot_observed_at":"2026-08-16T13:15:37.325031Z","submitted_at":"2024-09-25T06:51:57Z","title":"TalkinNeRF: Animatable Neural Fields for Full-Body Talking Humans","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16666","snapshot_observed_at":"2026-08-15T23:53:10.425457Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.425457Z"},"links":{"cited_paper":"/paper/2409.16666","citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:9648def539836e5635df58363028cfced41e05473d9603b3059a20a72d4b95e6","observation_id":"49b23449-0023-488e-9f9f-f7e699383ff6","resolution":{"observed_at":"2026-08-15T23:53:10.425457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:53:10.430700Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.430700Z"},"links":{"citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:7281a76967f40b1e6dad6d8b736c5189ba51541e4d0a4153dbd32452a9d286f8","observation_id":"185cb6d0-5542-4303-93cc-88bc4cd406f8","resolution":{"observed_at":"2026-08-15T23:53:10.430700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08764","last_updated":"2024-03-13T17:59:02Z","snapshot_observed_at":"2026-08-19T02:20:44.596097Z","submitted_at":"2024-03-13T17:59:02Z","title":"VLOGGER: Multimodal Diffusion for Embodied Avatar Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08764","snapshot_observed_at":"2026-08-15T23:53:10.435300Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.435300Z"},"links":{"cited_paper":"/paper/2403.08764","citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:d2d2f03dd15df93a0974990a811917fae1f121d3df4aa2065a500305e1a037a6","observation_id":"7dd9f936-42ed-41c7-82e0-f2edbfb001c8","resolution":{"observed_at":"2026-08-15T23:53:10.435300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:53:10.441037Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.441037Z"},"links":{"citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:abfb56eabeb1d76a6fcc6e3841e519411c712de1c510b5bc984149e72338f78e","observation_id":"722de5ee-6f4a-4973-ab22-1871f19a1d4f","resolution":{"observed_at":"2026-08-15T23:53:10.441037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03168","last_updated":"2025-02-28T14:39:17Z","snapshot_observed_at":"2026-08-18T14:48:47.548305Z","submitted_at":"2024-07-03T14:41:39Z","title":"LivePortrait: Efficient Portrait Animation with Stitching and Retargeting Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03168","snapshot_observed_at":"2026-08-15T23:53:10.445901Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.445901Z"},"links":{"cited_paper":"/paper/2407.03168","citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:d7d77b308e99cb15e3aad327c4ade13a23658b12ff5232c2d41e7f398fa84b47","observation_id":"a481f56a-d775-465f-b8fd-51ae7b4d808b","resolution":{"observed_at":"2026-08-15T23:53:10.445901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-08-17T14:04:31.230742Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-15T23:53:10.450533Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.450533Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:84adefe3a078e57011482d3644b680397fc713c17fe873a21e7a5a886b2487e8","observation_id":"1ef3b2ca-1976-4684-aff0-d3ef85777b31","resolution":{"observed_at":"2026-08-15T23:53:10.450533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:53:11.619104Z","title":null,"venue":null,"work_id":"2d1f610c-a149-41b6-8beb-2953d22a9cb4","year":2024},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.455230Z"},"links":{"citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:a7c6d7ad69ec89843b48ddcf42b9a03321c7e26ac86cffcf96596cd63351d889","observation_id":"c0773feb-bbb6-47f4-87cc-4a7c0e0c37b2","resolution":{"observed_at":"2026-08-15T23:53:11.623963Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:53:10.459848Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.459848Z"},"links":{"citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:6b6c5ef7928f7608ea3023811fa0011314c49ff2fa4a6c33548df18fa75fa48f","observation_id":"1054744f-9fea-449f-8c23-8f64091ff361","resolution":{"observed_at":"2026-08-15T23:53:10.459848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:53:10.464437Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.464437Z"},"links":{"citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:3e063d3432df1703666f0bffeff077837f066cc2906a49b1b95284ba10b7dd0c","observation_id":"570bd062-4347-43c8-ade6-0fadc0697da8","resolution":{"observed_at":"2026-08-15T23:53:10.464437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:53:11.581566Z","title":null,"venue":null,"work_id":"e39b2e8c-8f84-4836-9358-45410dde30e5","year":null},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.468650Z"},"links":{"citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:cbfdc6c9c270b67519e0460f9bede4a769973a87824e3c3bf7b23509808716c9","observation_id":"5901a5e4-6e56-4065-b3df-7b0790ebc8ea","resolution":{"observed_at":"2026-08-15T23:53:11.586577Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:53:10.477349Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.477349Z"},"links":{"citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:c25abc7936c0a4b54237a43fe195e74c3cd8973de723db7839c6ea3844bfa2fe","observation_id":"8c210c54-c825-4510-9167-3205de0ca737","resolution":{"observed_at":"2026-08-15T23:53:10.477349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:53:11.537369Z","title":null,"venue":null,"work_id":"62097a3e-1db8-4092-99e1-2cb6464cbeff","year":2024},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.481525Z"},"links":{"citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:c603409e268af47f8ef1339ffa37bf64be503042b5cbfcfb325b424f43b153b8","observation_id":"0a1aa957-c7a4-42d4-8f0b-54ee387975fc","resolution":{"observed_at":"2026-08-15T23:53:11.542059Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-20T22:03:51.775198Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-15T23:53:10.486014Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.486014Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:448605c4321a53bae5448f8a575a2e319a8913dfe17e8295a53833f4f55a9431","observation_id":"33510c13-426f-49eb-b921-173b64dfa8ef","resolution":{"observed_at":"2026-08-15T23:53:10.486014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.08779","last_updated":"2021-07-31T00:44:02Z","snapshot_observed_at":"2026-08-16T18:50:50.129356Z","submitted_at":"2021-01-21T18:59:22Z","title":"AI Choreographer: Music Conditioned 3D Dance Generation with AIST++","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.08779","snapshot_observed_at":"2026-08-15T23:53:10.491758Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.491758Z"},"links":{"cited_paper":"/paper/2101.08779","citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:628bcb47827b0a9244b17644f893d898138ae50d26e41b573f1d3f1f659ae3ee","observation_id":"3f73dec6-cc2a-4b71-92e4-83e7909e86d4","resolution":{"observed_at":"2026-08-15T23:53:10.491758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13929","last_updated":"2024-03-02T09:09:32Z","snapshot_observed_at":"2026-08-12T13:08:43.602176Z","submitted_at":"2024-02-21T16:51:05Z","title":"SDXL-Lightning: Progressive Adversarial Diffusion Distillation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13929","snapshot_observed_at":"2026-08-15T23:53:10.496803Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.496803Z"},"links":{"cited_paper":"/paper/2402.13929","citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:5d85bb0a20d227253341d0a5792dbb9f3e5398c112fb84892590f404c643d38c","observation_id":"40e798ac-ba3f-4401-b50c-ec51610da179","resolution":{"observed_at":"2026-08-15T23:53:10.496803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:53:11.520271Z","title":null,"venue":null,"work_id":"d19644bb-2b8c-48e5-9ef1-285065aad3a6","year":2024},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.502825Z"},"links":{"citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:e1a22b87846c6294dbc0ea75ee8b7a56f612bd1ec2c6e895e2f04043117cdc6b","observation_id":"4287bf23-297c-41c3-8659-5ffb7507518b","resolution":{"observed_at":"2026-08-15T23:53:11.525063Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:53:11.504862Z","title":null,"venue":null,"work_id":"a3cd63b7-56bc-4216-9d5d-e10434098253","year":2022},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.508026Z"},"links":{"citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:ff32573adcb628776257515f01f2a15d5c812fde3df90d30524ebb0a708728ce","observation_id":"6b9504d4-e80b-4215-9928-a054378dce1a","resolution":{"observed_at":"2026-08-15T23:53:11.509627Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:53:11.488905Z","title":null,"venue":null,"work_id":"4329a22a-2a3b-4592-8b0b-01dcf13dc8e3","year":2022},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.512922Z"},"links":{"citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:5c6e8a050e362ed5892930968bec2e01986d5f330b7c60b03377dc2fc8c473e5","observation_id":"152fa97d-6b5f-49ec-a272-6ae72f4d90f2","resolution":{"observed_at":"2026-08-15T23:53:11.493756Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-15T23:53:10.518299Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.518299Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:e2931aea8234043ecaff6d82625238a7b17e6edecb6bb67baaa08069a0a75eee","observation_id":"88d9163a-c62c-4887-9811-12741f093cc0","resolution":{"observed_at":"2026-08-15T23:53:10.518299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.08172","last_updated":"2019-06-14T05:49:22Z","snapshot_observed_at":"2026-08-20T11:52:04.914215Z","submitted_at":"2019-06-14T05:49:22Z","title":"MediaPipe: A Framework for Building Perception Pipelines","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.08172","snapshot_observed_at":"2026-08-15T23:53:10.526995Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.526995Z"},"links":{"cited_paper":"/paper/1906.08172","citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:970ffb0afcbd4253c15758e352090740fee42eac1b667ca4d8f3778bdacdd16e","observation_id":"4a580119-8b08-4141-88f6-c07d75d3481b","resolution":{"observed_at":"2026-08-15T23:53:10.526995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:53:11.473311Z","title":null,"venue":null,"work_id":"26b7705e-591f-4b3b-bae0-5df0f779ddf4","year":2025},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.534542Z"},"links":{"citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:0ddaf3bafc4248408583c1fdda68323b644803f0dbd68d3178e3ec54ab22d98d","observation_id":"934df314-22a0-4ea5-935f-0225e4a7eade","resolution":{"observed_at":"2026-08-15T23:53:11.478257Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:53:11.456163Z","title":null,"venue":null,"work_id":"0fcc0570-1cb1-4789-b846-967646dc398c","year":2024},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.539813Z"},"links":{"citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:1d52735bc952357780eb7a32d845293a94f6e13f8da2f889abea9c7b59ac560f","observation_id":"243c102f-64c8-4e22-801b-a22490f7fca2","resolution":{"observed_at":"2026-08-15T23:53:11.461239Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:53:11.439822Z","title":null,"venue":null,"work_id":"8654d6b3-bac7-43ff-a960-0ba0bb129f1e","year":2024},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.544250Z"},"links":{"citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:19b4a796ba81825011da498286ce05ec7bbb4a88501d0368ac77c64f0cd7f76f","observation_id":"5943780c-6607-4658-a650-9d1a4be6fc19","resolution":{"observed_at":"2026-08-15T23:53:11.444741Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-17T13:03:40.359628Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-15T23:53:10.549819Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.549819Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:c147318b8f86edf8ec08a121382a3a73ac34045d0f0746cbb94c1050524d6067","observation_id":"8d551484-6915-4553-8f65-3a5add798460","resolution":{"observed_at":"2026-08-15T23:53:10.549819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06070","last_updated":"2025-03-08T08:43:03Z","snapshot_observed_at":"2026-08-19T14:04:38.615117Z","submitted_at":"2024-08-12T11:41:18Z","title":"ControlNeXt: Powerful and Efficient Control for Image and Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06070","snapshot_observed_at":"2026-08-15T23:53:10.555077Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.555077Z"},"links":{"cited_paper":"/paper/2408.06070","citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:d7e5f57e724e501f2fe51d895d4df9bf4b09bfab68100f76ced0d98477a6d647","observation_id":"0470dd98-4275-4ece-bc6f-bf3f51b9fe48","resolution":{"observed_at":"2026-08-15T23:53:10.555077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:53:11.423086Z","title":null,"venue":null,"work_id":"3ac574ad-bc62-4f07-b443-4940f2e49e9b","year":2021},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.560203Z"},"links":{"citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:0bf24a5d91a0e326bfbb6f5c2415a2beec5ed4558b8f8d190cbf106af8a0343a","observation_id":"526f71d7-2b24-437b-bc1b-5eaff084742f","resolution":{"observed_at":"2026-08-15T23:53:11.428249Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:53:11.406708Z","title":null,"venue":null,"work_id":"57bb59f0-e507-4579-b2aa-df2da4508b3a","year":2015},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.566543Z"},"links":{"citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:aac3e12e6c944d98392abe05ac567aabfc9608b70747437badbc9ca5a71cd763","observation_id":"09c105c4-df68-4776-9060-d4d293ef14e5","resolution":{"observed_at":"2026-08-15T23:53:11.410926Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:53:11.390382Z","title":null,"venue":null,"work_id":"d9555f4f-64e5-4172-babd-636993094c4a","year":2023},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.573091Z"},"links":{"citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:0f11ef03d6711a0e4492628f4ec1078e43aca34d19340e7dd3f1d875bd2f14fc","observation_id":"ff39cfb5-80da-4a1c-b259-c5d4c245334f","resolution":{"observed_at":"2026-08-15T23:53:11.395603Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:53:11.372779Z","title":null,"venue":null,"work_id":"23ca91c4-3786-435c-956f-34ed808fb581","year":2025},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.579626Z"},"links":{"citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:95a6299f7ec17c8bd0d20934d6f25c99ea35dd4224e01ca817fbe6f353c3ba23","observation_id":"0ccd88bd-55a6-47f9-8618-316d1f97c6e5","resolution":{"observed_at":"2026-08-15T23:53:11.377870Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05862","last_updated":"2019-09-11T08:19:49Z","snapshot_observed_at":"2026-08-17T12:28:40.241678Z","submitted_at":"2019-04-11T17:29:30Z","title":"wav2vec: Unsupervised Pre-training for Speech Recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05862","snapshot_observed_at":"2026-08-15T23:53:10.585147Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.585147Z"},"links":{"cited_paper":"/paper/1904.05862","citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:9efacacd0b6cecf377f7ff104489c7ebf7b0c493abfe2870238f639e53a5133e","observation_id":"ec376700-f940-4ad6-bb8d-14b1b91cd02e","resolution":{"observed_at":"2026-08-15T23:53:10.585147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-15T23:53:10.591016Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.591016Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:f88d45e3ee6c55ab1ba7b2cb477ca28d6f9de2d295a008ca9a50146035626edc","observation_id":"ba653c28-f1b1-47d0-86f7-c62dda96d3cb","resolution":{"observed_at":"2026-08-15T23:53:10.591016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:53:10.597250Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.597250Z"},"links":{"citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:d50efac9f56d668e5b753144a9b05223c52dda4b8c189f3e09f6b0f3b38f84b9","observation_id":"d48b7f3e-3088-465a-b1ea-3ae99bd65432","resolution":{"observed_at":"2026-08-15T23:53:10.597250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-15T23:53:10.612956Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.612956Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:722996661f13bebc64c9629ad6d4bdf71f8583b270bc375db05c86c9c6e1a95e","observation_id":"8c2cd4b3-9997-4634-bf8a-8adb240c0342","resolution":{"observed_at":"2026-08-15T23:53:10.612956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:53:11.337349Z","title":null,"venue":null,"work_id":"e8d229d8-83c0-4e03-a4c3-ab8393457a5c","year":2022},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.618432Z"},"links":{"citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:1e5351f4953a0eac7b667a114794a1bb3102f5d5990f8839f14ae70253d1739b","observation_id":"f7380701-9000-4697-8f36-f3a5ec9f08db","resolution":{"observed_at":"2026-08-15T23:53:11.342742Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:53:10.623597Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.623597Z"},"links":{"citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:40759d154960a03e8a1b63c7e734a3675c54540c45a1ec09a9e4f4089fe925ae","observation_id":"28bccbb1-c3d1-4dac-9d8e-fc5d5387631d","resolution":{"observed_at":"2026-08-15T23:53:10.623597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:53:11.312866Z","title":null,"venue":null,"work_id":"22e6ae96-9faf-4fc3-9f54-4badd9fcbbc9","year":2018},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.628520Z"},"links":{"citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:e518bd57489ff4ce53fb15b42499417e75afaf720d47b7feb1ac1bc45f7cdd45","observation_id":"695ff11f-0adf-4324-b61a-1a01e7ed5d5a","resolution":{"observed_at":"2026-08-15T23:53:11.317700Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:53:11.297999Z","title":null,"venue":null,"work_id":"9ade6a6c-12c1-451e-b3d4-5b9b1f4c55a8","year":2025},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.633694Z"},"links":{"citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:526f8409613547f732ea3b1f57b7ee5ee347047d2e91c1e9c8bc12468d85ba3c","observation_id":"9034a1f9-f74a-4dd2-9503-e15695511b5c","resolution":{"observed_at":"2026-08-15T23:53:11.302533Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-08-18T04:00:09.136122Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-15T23:53:10.638352Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.638352Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:b024ba074a91448766ec9da0509f2b0592b19987bb59aed1c5190ba76ed91189","observation_id":"0a227b54-e910-4af0-a949-fa881e35e3a3","resolution":{"observed_at":"2026-08-15T23:53:10.638352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:53:10.643425Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.643425Z"},"links":{"citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:80a372a76fc9b415ba4808eff9723b488400772b17a0812c27449a88245a9e96","observation_id":"dc170380-bde5-48af-bd48-64a8ae8fad48","resolution":{"observed_at":"2026-08-15T23:53:10.643425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06571","last_updated":"2023-08-12T13:53:10Z","snapshot_observed_at":"2026-08-14T13:59:50.878772Z","submitted_at":"2023-08-12T13:53:10Z","title":"ModelScope Text-to-Video Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06571","snapshot_observed_at":"2026-08-15T23:53:10.648192Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.648192Z"},"links":{"cited_paper":"/paper/2308.06571","citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:98cf50f33234a5d9a6ef5377f14332f7cad5fdd28aade3a0d9975b2c6e3652a5","observation_id":"438b30cd-7b9f-4af1-bffe-e60496149786","resolution":{"observed_at":"2026-08-15T23:53:10.648192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:53:11.273628Z","title":null,"venue":null,"work_id":"de30b579-7112-418d-85ac-3416cf7f05da","year":2023},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.653510Z"},"links":{"citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:0429a19d9366e08535543d1f2b09e3dbc02cbb8b6461b835673187d97466a419","observation_id":"84e0847d-c304-47ba-bfa9-30152b57b80e","resolution":{"observed_at":"2026-08-15T23:53:11.277989Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:53:10.658318Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.658318Z"},"links":{"citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:5c5b468431c5fab973bc496139b288fdca295bdf63570ba9670124f361e9fae7","observation_id":"f35b49f5-4e1a-49d2-88a5-7d436ebc11db","resolution":{"observed_at":"2026-08-15T23:53:10.658318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:53:11.250005Z","title":null,"venue":null,"work_id":"4e564428-0f16-461f-8430-bcb00538b1f9","year":2019},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.663546Z"},"links":{"citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:b0204acd4aacf96743d891a925f11c13618056431a0e4443fb3ea971980c31e2","observation_id":"e20d1865-fd3d-499e-be39-03b3c7adaaf8","resolution":{"observed_at":"2026-08-15T23:53:11.254495Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:53:10.668792Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.668792Z"},"links":{"citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:cb567161ccc3c451d9294d7701ba91e0cafe5acb391a42ae9b936bd42bef53f7","observation_id":"fc7df374-127c-4936-83e7-6e2639f45238","resolution":{"observed_at":"2026-08-15T23:53:10.668792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17694","last_updated":"2024-03-26T13:35:02Z","snapshot_observed_at":"2026-08-18T10:29:36.587877Z","submitted_at":"2024-03-26T13:35:02Z","title":"AniPortrait: Audio-Driven Synthesis of Photorealistic Portrait Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17694","snapshot_observed_at":"2026-08-15T23:53:10.673843Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.673843Z"},"links":{"cited_paper":"/paper/2403.17694","citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:1d17d80896fee061e7c8a2290f184a4c7a536bf062ae35d9f8a6df87d72cec24","observation_id":"29a0538a-5a70-427e-be9b-db4061972ed7","resolution":{"observed_at":"2026-08-15T23:53:10.673843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:53:11.224723Z","title":null,"venue":null,"work_id":"6323db6d-8c34-4759-9a0f-bfbf105218b6","year":2022},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.678718Z"},"links":{"citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:e4d9a1047b3bbf93f3acde783155e2eb0bbe82489ef0d8b23c61a1f506d9366f","observation_id":"93044797-6903-437f-8e77-02ae360dbe3d","resolution":{"observed_at":"2026-08-15T23:53:11.229234Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:53:11.209372Z","title":null,"venue":null,"work_id":"c3281e00-8c43-4315-967a-3c07ea92edaf","year":2024},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.683384Z"},"links":{"citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:2a680b3c8d332bd230eca29c46dd679bb60d874d05acfe86202868cdee43e7ad","observation_id":"68eb3081-464b-46f1-957f-0217a99bf74c","resolution":{"observed_at":"2026-08-15T23:53:11.214332Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08801","last_updated":"2024-06-16T07:10:41Z","snapshot_observed_at":"2026-08-18T10:23:27.377504Z","submitted_at":"2024-06-13T04:33:20Z","title":"Hallo: Hierarchical Audio-Driven Visual Synthesis for Portrait Image Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08801","snapshot_observed_at":"2026-08-15T23:53:10.687815Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.687815Z"},"links":{"cited_paper":"/paper/2406.08801","citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:0a419fd0f3594a26b38283cbc237640a058e37d1b4c83f9f1adeb3b0370397dd","observation_id":"b8b41908-e160-4ff8-8045-cb71e677f3a3","resolution":{"observed_at":"2026-08-15T23:53:10.687815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10667","last_updated":"2024-10-31T07:43:14Z","snapshot_observed_at":"2026-08-16T14:00:25.942097Z","submitted_at":"2024-04-16T15:43:22Z","title":"VASA-1: Lifelike Audio-Driven Talking Faces Generated in Real Time","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10667","snapshot_observed_at":"2026-08-15T23:53:10.692654Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.692654Z"},"links":{"cited_paper":"/paper/2404.10667","citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:61cc04bac9fe8e32c677e2b93b459a31031ce30b5335b6e892f7f9a2a75bc300","observation_id":"a76dae3b-2ffe-4383-a3b9-36aff557014b","resolution":{"observed_at":"2026-08-15T23:53:10.692654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:53:11.194743Z","title":null,"venue":null,"work_id":"e6e0a624-1a1f-404f-8d78-22c7f845c4d9","year":2024},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.697775Z"},"links":{"citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:2ecfe36c932178f420878be9a32ddad887486f645eb3a03d0ca9de3e5de1f2f6","observation_id":"93b34006-b725-4b4f-a51c-f7c1c76f3d36","resolution":{"observed_at":"2026-08-15T23:53:11.199391Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:53:10.702560Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.702560Z"},"links":{"citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:2240510b06b5d2d440408e271ae32043c1a2937025629f4685784688ead37116","observation_id":"11c53886-22d7-4135-9e49-0efee8191c39","resolution":{"observed_at":"2026-08-15T23:53:10.702560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:53:11.169737Z","title":null,"venue":null,"work_id":"6551e8b7-d4f9-4c50-b3a3-4f8d9333fc69","year":2024},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.707015Z"},"links":{"citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:f8ec5ef3a74b0b4b2eb46e846ca495932af370730039c4b038799e7a9b02b999","observation_id":"708f8465-cdf9-440b-8177-0b2c76887735","resolution":{"observed_at":"2026-08-15T23:53:11.174379Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:53:11.154550Z","title":null,"venue":null,"work_id":"c5804655-dc4a-4a54-9636-669ca788280b","year":2020},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.711248Z"},"links":{"citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:7614824a85bcfa8337b52dabe5e935ec6d11e20d31b8ddfa1cb6ffcc0df741d0","observation_id":"9b1a6ac0-84ff-44cc-a151-2e23c45aacaa","resolution":{"observed_at":"2026-08-15T23:53:11.159064Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:53:11.138693Z","title":null,"venue":null,"work_id":"27711bc0-5dc2-4ebe-b9e0-55e378182f39","year":2024},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.715926Z"},"links":{"citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:d9c3e1f11498f00eb504c1c0b7e81a693c7240d0bbe7276f431d02033b69e137","observation_id":"17af8280-5d8b-4dd5-88c4-4503c457eed8","resolution":{"observed_at":"2026-08-15T23:53:11.143678Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:53:10.720581Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.720581Z"},"links":{"citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:c20e18bccd9dbe5fcdd6eb5faa7a7fb9fb05ce9d2280227059a7537957c0013b","observation_id":"9cd3f0ba-4317-4a76-8085-15056800c643","resolution":{"observed_at":"2026-08-15T23:53:10.720581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21705","last_updated":"2025-03-14T03:03:31Z","snapshot_observed_at":"2026-08-19T02:00:23.435408Z","submitted_at":"2024-07-31T15:53:20Z","title":"Tora: Trajectory-oriented Diffusion Transformer for Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21705","snapshot_observed_at":"2026-08-15T23:53:10.724733Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.724733Z"},"links":{"cited_paper":"/paper/2407.21705","citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:5b9adb0d3ee03b9300033c8c79b5896044e1e8b19378e76a1d335b2f1583196c","observation_id":"ca9288d0-7764-4d24-9e5f-2b5edab549ab","resolution":{"observed_at":"2026-08-15T23:53:10.724733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:53:11.113527Z","title":null,"venue":null,"work_id":"28d912d0-3450-4c1f-85c6-960044174e94","year":2021},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.729216Z"},"links":{"citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:0042dbdec0902b13d4c8f8760a952113b60fef274af74cb99998b60fbda68453","observation_id":"e40b2ffd-5e4b-4683-a806-f7fda36a5a30","resolution":{"observed_at":"2026-08-15T23:53:11.118567Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:53:11.096902Z","title":null,"venue":null,"work_id":"ff903583-b1de-4401-8c51-f6410b91e933","year":2025},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.734059Z"},"links":{"citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:021f5d74bfab077fdeba56a65a47746268a2d0a1f6ced51b984a2d100d9ad202","observation_id":"430b6695-fea2-4896-b1b3-95fac3d8e465","resolution":{"observed_at":"2026-08-15T23:53:11.102561Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:53:10.607878Z","title":"In International conference on machine learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.607878Z"},"links":{"citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:1281b8e9ef1b5ac9924ac68a2925346b273d72a0c3be34bfcfa2f400d1dd29f4","observation_id":"56434dc3-ae48-4ab4-bc7c-ed9ffbf30afb","resolution":{"observed_at":"2026-08-15T23:53:10.607878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:53:11.674450Z","title":"InComputer Vision–ECCV 2020: 16th European Conference, Glasgow, UK, August 23–28, 2020, Proceedings, Part XVIII 16","venue":null,"work_id":"5b7bb0da-9066-4568-b920-f2a18d5ba493","year":2020},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.408155Z"},"links":{"citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:b603d798fd30cd0e95d1802749e8c29c00c788c794a4a2221d13940267f55fa2","observation_id":"0dafdf2d-19ee-4e66-86d4-340166b337fb","resolution":{"observed_at":"2026-08-15T23:53:11.679323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:53:11.564110Z","title":"InProceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"2ec02e46-4b35-4713-bff4-9d8255f2cd19","year":1922},"citing_paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation","version":5},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T23:53:10.472950Z"},"links":{"citing_paper":"/paper/2505.03603"},"observation_digest":"sha256:c28078e4a79cc94037cb58b7a0054b7547e4607cc938ff2200fe46e7bd2469ef","observation_id":"01ee9dad-d260-4d56-9411-2fa03666a78e","resolution":{"observed_at":"2026-08-15T23:53:11.570259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.03603","last_updated":"2025-06-12T14:11:47Z","latest_version":5,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T10:29:38.919051Z","submitted_at":"2025-05-06T15:03:58Z","title":"A Unit Enhancement and Guidance Framework for Audio-Driven Avatar Video Generation"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":62,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 0 inbound Pith citation observations for arXiv:2505.03603."}