{"as_of":"2026-08-08T10:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b784537123efe48dbbc81a2c533485275c6b80ec34231cd1381ac4ab4122fa4f","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:54:07.692944Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-15T08:44:49.087457Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-15T08:45:19.106137Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.23290","last_updated":"2025-05-29T09:42:03Z","snapshot_observed_at":"2026-08-07T12:46:07.465341Z","submitted_at":"2025-05-29T09:42:03Z","title":"Wav2Sem: Plug-and-Play Audio Semantic Decoupling for 3D Speech-Driven Facial Animation","version":1},"cited_work":{"arxiv_id":"2505.23290","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23290","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wav2sem: Plug-and-play audio semantic decou- pling for 3d speech-driven facial animation","venue":null,"work_id":"a9d1133d-a975-425d-881e-94c00b75cdba","year":2025},"citing_paper":{"arxiv_id":"2603.19929","last_updated":"2026-04-10T11:31:02Z","snapshot_observed_at":"2026-07-06T22:49:52.077931Z","submitted_at":"2026-03-20T13:17:05Z","title":"RAM: Recover Any 3D Human Motion in-the-Wild","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-15T08:44:49.087457Z"},"links":{"cited_paper":"/paper/2505.23290","citing_paper":"/paper/2603.19929"},"observation_digest":"sha256:c3507bae6d63b71a8871ddc836a766a3535125c96469c384a7b6979bad811cbb","observation_id":"e50333f4-7b0c-4c81-a95b-b4b2d291f5ec","resolution":{"observed_at":"2026-05-15T08:45:19.107798Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.23290/citation-record","integrity":"/paper/2505.23290/integrity","json":"/paper/2505.23290/citation-record.json","paper":"/paper/2505.23290"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:16.407148Z","title":"Facetalk: Audio-driven motion diffusion for neu- ral parametric head models","venue":null,"work_id":"0667fa03-01e4-465e-bd4a-3e4c6a12721f","year":2024},"citing_paper":{"arxiv_id":"2505.23290","last_updated":"2025-05-29T09:42:03Z","snapshot_observed_at":"2026-08-07T12:46:07.465341Z","submitted_at":"2025-05-29T09:42:03Z","title":"Wav2Sem: Plug-and-Play Audio Semantic Decoupling for 3D Speech-Driven Facial Animation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:01.558841Z"},"links":{"citing_paper":"/paper/2505.23290"},"observation_digest":"sha256:2deb61a1ec5f9625d9f3cf399a617b72ed533a8664fa4a2a1ba13ae0eaec5ae4","observation_id":"fb9c18dc-9ec7-48ec-964e-53082ce003f5","resolution":{"observed_at":"2026-08-07T12:54:16.526076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:16.230504Z","title":"Gesturediffuclip: Gesture diffusion model with clip latents","venue":null,"work_id":"c72b0b77-49f8-413c-832a-77df36d5b997","year":2023},"citing_paper":{"arxiv_id":"2505.23290","last_updated":"2025-05-29T09:42:03Z","snapshot_observed_at":"2026-08-07T12:46:07.465341Z","submitted_at":"2025-05-29T09:42:03Z","title":"Wav2Sem: Plug-and-Play Audio Semantic Decoupling for 3D Speech-Driven Facial Animation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:01.674615Z"},"links":{"citing_paper":"/paper/2505.23290"},"observation_digest":"sha256:fbacc5bfc10563a793dd89e456517d13fe050cadba2d940abe094e842666a5cf","observation_id":"880fe63a-bdeb-4098-ac64-810dc5327e99","resolution":{"observed_at":"2026-08-07T12:54:16.329111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:16.067990Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations","venue":null,"work_id":"375a5a23-75c8-4f67-b53c-e73cec5df5a0","year":2020},"citing_paper":{"arxiv_id":"2505.23290","last_updated":"2025-05-29T09:42:03Z","snapshot_observed_at":"2026-08-07T12:46:07.465341Z","submitted_at":"2025-05-29T09:42:03Z","title":"Wav2Sem: Plug-and-Play Audio Semantic Decoupling for 3D Speech-Driven Facial Animation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:01.833993Z"},"links":{"citing_paper":"/paper/2505.23290"},"observation_digest":"sha256:81fb0455cea02efa428a9f2e9f28e9112b31cce17a6544cba3a801800a06b949","observation_id":"7d4a71ea-d624-4e29-a067-de88585b9d1d","resolution":{"observed_at":"2026-08-07T12:54:16.131668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:15.856662Z","title":"Expressive speech-driven facial animation","venue":null,"work_id":"e0cb84e5-8a44-4fab-8522-a80787b1bbe2","year":2005},"citing_paper":{"arxiv_id":"2505.23290","last_updated":"2025-05-29T09:42:03Z","snapshot_observed_at":"2026-08-07T12:46:07.465341Z","submitted_at":"2025-05-29T09:42:03Z","title":"Wav2Sem: Plug-and-Play Audio Semantic Decoupling for 3D Speech-Driven Facial Animation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:02.000493Z"},"links":{"citing_paper":"/paper/2505.23290"},"observation_digest":"sha256:bd8f297e9f7857cb5b5793524ce0ebebe3990080cdf8417e7ec2b2816404d9e7","observation_id":"977188a8-b5d4-4ae9-bacd-4406c897afa0","resolution":{"observed_at":"2026-08-07T12:54:15.953223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:15.627353Z","title":"Talking head generation with audio and speech related facial action units","venue":null,"work_id":"5bb8eb82-edad-496f-93ea-2a2e415e4642","year":2021},"citing_paper":{"arxiv_id":"2505.23290","last_updated":"2025-05-29T09:42:03Z","snapshot_observed_at":"2026-08-07T12:46:07.465341Z","submitted_at":"2025-05-29T09:42:03Z","title":"Wav2Sem: Plug-and-Play Audio Semantic Decoupling for 3D Speech-Driven Facial Animation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:02.167821Z"},"links":{"citing_paper":"/paper/2505.23290"},"observation_digest":"sha256:1ec33e34baff88a4ed8665d7f7b028ee58e425cf36e20176b00216cb6fcf8469","observation_id":"75aeae6e-a4ff-41c2-9523-564d9d338a9d","resolution":{"observed_at":"2026-08-07T12:54:15.722871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:15.451009Z","title":"Peters, Michael J","venue":null,"work_id":"fd234d34-0d91-41fb-9d3a-0b1701633c48","year":1942},"citing_paper":{"arxiv_id":"2505.23290","last_updated":"2025-05-29T09:42:03Z","snapshot_observed_at":"2026-08-07T12:46:07.465341Z","submitted_at":"2025-05-29T09:42:03Z","title":"Wav2Sem: Plug-and-Play Audio Semantic Decoupling for 3D Speech-Driven Facial Animation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:02.329610Z"},"links":{"citing_paper":"/paper/2505.23290"},"observation_digest":"sha256:1874feeae146bba6a96ddf08af94ef70df47777709a71d8f06b611b95161bb9a","observation_id":"34bf5d04-6b3c-4cac-89c6-f140472b8119","resolution":{"observed_at":"2026-08-07T12:54:15.545363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:15.233781Z","title":null,"venue":null,"work_id":"572947f1-e0bb-4c4f-a06c-cb0be940af18","year":2019},"citing_paper":{"arxiv_id":"2505.23290","last_updated":"2025-05-29T09:42:03Z","snapshot_observed_at":"2026-08-07T12:46:07.465341Z","submitted_at":"2025-05-29T09:42:03Z","title":"Wav2Sem: Plug-and-Play Audio Semantic Decoupling for 3D Speech-Driven Facial Animation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:02.505572Z"},"links":{"citing_paper":"/paper/2505.23290"},"observation_digest":"sha256:ae12709f86a497570d62d4cf3372d9c5fc1d6fa655ae97aac9304a2c72b05e8a","observation_id":"2db9501e-b2c4-40c2-9685-533be715a0f3","resolution":{"observed_at":"2026-08-07T12:54:15.341782Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:15.003779Z","title":"Emotional speech- driven animation with content-emotion disentanglement","venue":null,"work_id":"8b4ec26a-552f-4ff0-9267-5f69ad435bf8","year":2023},"citing_paper":{"arxiv_id":"2505.23290","last_updated":"2025-05-29T09:42:03Z","snapshot_observed_at":"2026-08-07T12:46:07.465341Z","submitted_at":"2025-05-29T09:42:03Z","title":"Wav2Sem: Plug-and-Play Audio Semantic Decoupling for 3D Speech-Driven Facial Animation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:02.674341Z"},"links":{"citing_paper":"/paper/2505.23290"},"observation_digest":"sha256:966d8bc6852e68971f8c0007599f80fdbcc4557190b80bdc563890a5733ab9ad","observation_id":"b861fe77-0988-4cfc-84c1-3d4d68035ae6","resolution":{"observed_at":"2026-08-07T12:54:15.080161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:14.810682Z","title":"BERT: pre-training of deep bidirectional trans- formers for language understanding","venue":null,"work_id":"e8905cee-b5a7-454b-94c1-9e25332cc107","year":2019},"citing_paper":{"arxiv_id":"2505.23290","last_updated":"2025-05-29T09:42:03Z","snapshot_observed_at":"2026-08-07T12:46:07.465341Z","submitted_at":"2025-05-29T09:42:03Z","title":"Wav2Sem: Plug-and-Play Audio Semantic Decoupling for 3D Speech-Driven Facial Animation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:02.812228Z"},"links":{"citing_paper":"/paper/2505.23290"},"observation_digest":"sha256:d0bdd88320aa286e99ba0f4e29451d88ab0af6c6d311b2a6d6951151a4e1b146","observation_id":"3f361a3e-6cdf-4c5b-996e-ae2be75dc88c","resolution":{"observed_at":"2026-08-07T12:54:14.921585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:14.612428Z","title":"Cross modal audio search and retrieval with joint embeddings based on text and audio","venue":null,"work_id":"58954094-3727-4a6f-a7cb-0967403cf944","year":2019},"citing_paper":{"arxiv_id":"2505.23290","last_updated":"2025-05-29T09:42:03Z","snapshot_observed_at":"2026-08-07T12:46:07.465341Z","submitted_at":"2025-05-29T09:42:03Z","title":"Wav2Sem: Plug-and-Play Audio Semantic Decoupling for 3D Speech-Driven Facial Animation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:02.978900Z"},"links":{"citing_paper":"/paper/2505.23290"},"observation_digest":"sha256:5686b749db45cee50ac9ddc0370ad6cc23a074ad9287aea60107c76276fe65fe","observation_id":"a4e84034-5fcc-4be4-88bd-f59e57c348cf","resolution":{"observed_at":"2026-08-07T12:54:14.714250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:14.404199Z","title":"Unitalker: Scaling up audio-driven 3d facial animation through A unified model","venue":null,"work_id":"d6c3e9f6-127c-41fb-a7f3-9f5bc16b61c0","year":2024},"citing_paper":{"arxiv_id":"2505.23290","last_updated":"2025-05-29T09:42:03Z","snapshot_observed_at":"2026-08-07T12:46:07.465341Z","submitted_at":"2025-05-29T09:42:03Z","title":"Wav2Sem: Plug-and-Play Audio Semantic Decoupling for 3D Speech-Driven Facial Animation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:03.177986Z"},"links":{"citing_paper":"/paper/2505.23290"},"observation_digest":"sha256:cc29c80f8376a61682a00205a6c3113a23fd65abd91b1b8e9efe91dd03b90bc1","observation_id":"c3c3ab6f-bd83-452c-8259-e903f434c39a","resolution":{"observed_at":"2026-08-07T12:54:14.534129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:14.180410Z","title":"Faceformer: Speech-driven 3d facial anima- tion with transformers","venue":null,"work_id":"aa6a2f9e-79a9-4ee9-b92d-22c89f83caba","year":2022},"citing_paper":{"arxiv_id":"2505.23290","last_updated":"2025-05-29T09:42:03Z","snapshot_observed_at":"2026-08-07T12:46:07.465341Z","submitted_at":"2025-05-29T09:42:03Z","title":"Wav2Sem: Plug-and-Play Audio Semantic Decoupling for 3D Speech-Driven Facial Animation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:03.337151Z"},"links":{"citing_paper":"/paper/2505.23290"},"observation_digest":"sha256:f77c74760820d6afb2d645e2c7ea474a11d00b4535a2f03e23babc63e584f9cf","observation_id":"4275f2ce-7cbc-487b-91c7-c2bb3693ddf8","resolution":{"observed_at":"2026-08-07T12:54:14.290319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:13.943871Z","title":"Joint audio-text model for expressive speech- driven 3d facial animation","venue":null,"work_id":"d4d6337f-b21f-43d4-8e9a-d671ae79aa7b","year":2022},"citing_paper":{"arxiv_id":"2505.23290","last_updated":"2025-05-29T09:42:03Z","snapshot_observed_at":"2026-08-07T12:46:07.465341Z","submitted_at":"2025-05-29T09:42:03Z","title":"Wav2Sem: Plug-and-Play Audio Semantic Decoupling for 3D Speech-Driven Facial Animation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:03.441886Z"},"links":{"citing_paper":"/paper/2505.23290"},"observation_digest":"sha256:722bb6aa94edd0b04f911526e8ed82d598ba823b1107460640ec27dc612d99f1","observation_id":"f35f5ab2-2349-4993-b5cb-30f6c1d2c79e","resolution":{"observed_at":"2026-08-07T12:54:14.053194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:13.795858Z","title":"Mimic: Speaking style disentanglement for speech-driven 3d facial animation","venue":null,"work_id":"00f9b230-2767-49f1-9a21-8b4070a329c3","year":2024},"citing_paper":{"arxiv_id":"2505.23290","last_updated":"2025-05-29T09:42:03Z","snapshot_observed_at":"2026-08-07T12:46:07.465341Z","submitted_at":"2025-05-29T09:42:03Z","title":"Wav2Sem: Plug-and-Play Audio Semantic Decoupling for 3D Speech-Driven Facial Animation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:03.588034Z"},"links":{"citing_paper":"/paper/2505.23290"},"observation_digest":"sha256:324cef8f6715c9ca824f41378f7f32868d79bb56e8c1724df7d6f8941c4892bf","observation_id":"7358179a-b5e2-466d-9ac3-41e30f57c03f","resolution":{"observed_at":"2026-08-07T12:54:13.867242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.5567","last_updated":"2014-12-19T21:36:13Z","snapshot_observed_at":"2026-07-06T04:03:56.251710Z","submitted_at":"2014-12-17T20:39:45Z","title":"Deep Speech: Scaling up end-to-end speech recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.5567","snapshot_observed_at":"2026-08-07T12:54:03.725530Z","title":"Hannun, Carl Case, Jared Casper, Bryan Catanzaro, Greg Diamos, Erich Elsen, Ryan Prenger, Sanjeev Satheesh, Shubho Sengupta, Adam Coates, and Andrew Y","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.23290","last_updated":"2025-05-29T09:42:03Z","snapshot_observed_at":"2026-08-07T12:46:07.465341Z","submitted_at":"2025-05-29T09:42:03Z","title":"Wav2Sem: Plug-and-Play Audio Semantic Decoupling for 3D Speech-Driven Facial Animation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:03.725530Z"},"links":{"cited_paper":"/paper/1412.5567","citing_paper":"/paper/2505.23290"},"observation_digest":"sha256:45ab132d11722e23bab488c10f7d299a20ad63f7fd347c4bd69d07c372a66685","observation_id":"65055018-5466-4ab9-9fed-4aa94ed05350","resolution":{"observed_at":"2026-08-07T12:54:03.725530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:13.634502Z","title":"Facexhubert: Text-less speech-driven e (x) pressive 3d facial animation synthesis using self-supervised speech representation learn- ing","venue":null,"work_id":"64f75dfe-ced9-48df-9209-2be28ba6ec49","year":2023},"citing_paper":{"arxiv_id":"2505.23290","last_updated":"2025-05-29T09:42:03Z","snapshot_observed_at":"2026-08-07T12:46:07.465341Z","submitted_at":"2025-05-29T09:42:03Z","title":"Wav2Sem: Plug-and-Play Audio Semantic Decoupling for 3D Speech-Driven Facial Animation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:03.884744Z"},"links":{"citing_paper":"/paper/2505.23290"},"observation_digest":"sha256:2c3861ed139648825342d3deae7b756bb10034baf3ed1e54e9175203242d0bd9","observation_id":"5e964826-975d-4e95-b6c5-7fe2b55c6323","resolution":{"observed_at":"2026-08-07T12:54:13.711516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:13.422434Z","title":"Phonemic similarity metrics to compare pronunciation methods","venue":null,"work_id":"5134aa20-8efd-45e0-99a6-02523960223c","year":2011},"citing_paper":{"arxiv_id":"2505.23290","last_updated":"2025-05-29T09:42:03Z","snapshot_observed_at":"2026-08-07T12:46:07.465341Z","submitted_at":"2025-05-29T09:42:03Z","title":"Wav2Sem: Plug-and-Play Audio Semantic Decoupling for 3D Speech-Driven Facial Animation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:04.032531Z"},"links":{"citing_paper":"/paper/2505.23290"},"observation_digest":"sha256:42352fefa9d045330ed2325c1c70ae99d953315e91b8622ef71233b24bc850b6","observation_id":"f512baf2-847a-4f41-9713-c95797b3b3b8","resolution":{"observed_at":"2026-08-07T12:54:13.534159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:13.246689Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units","venue":null,"work_id":"3677abbf-7d5a-4caf-92bd-d47db7007343","year":2021},"citing_paper":{"arxiv_id":"2505.23290","last_updated":"2025-05-29T09:42:03Z","snapshot_observed_at":"2026-08-07T12:46:07.465341Z","submitted_at":"2025-05-29T09:42:03Z","title":"Wav2Sem: Plug-and-Play Audio Semantic Decoupling for 3D Speech-Driven Facial Animation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:04.210627Z"},"links":{"citing_paper":"/paper/2505.23290"},"observation_digest":"sha256:640aa36f95078a8a6fd2949b7b6867772b4b26461ef046ece659629b30cc2559","observation_id":"a46928a1-0165-48dc-adc8-8f7941280d8e","resolution":{"observed_at":"2026-08-07T12:54:13.330358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:04.387362Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.23290","last_updated":"2025-05-29T09:42:03Z","snapshot_observed_at":"2026-08-07T12:46:07.465341Z","submitted_at":"2025-05-29T09:42:03Z","title":"Wav2Sem: Plug-and-Play Audio Semantic Decoupling for 3D Speech-Driven Facial Animation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:04.387362Z"},"links":{"citing_paper":"/paper/2505.23290"},"observation_digest":"sha256:39006fa80a24e46510382c8caaebeeb0baf72e4d278a349bcfd547ed70e82138","observation_id":"eecda33e-2527-47ba-9aae-186f8dbaabf7","resolution":{"observed_at":"2026-08-07T12:54:04.387362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:13.091927Z","title":"Mask-fpan: Semi-supervised face parsing in the wild with de-occlusion and uv gan","venue":null,"work_id":"f1d65829-bbfb-4c80-bfde-add1eb9ace2f","year":2023},"citing_paper":{"arxiv_id":"2505.23290","last_updated":"2025-05-29T09:42:03Z","snapshot_observed_at":"2026-08-07T12:46:07.465341Z","submitted_at":"2025-05-29T09:42:03Z","title":"Wav2Sem: Plug-and-Play Audio Semantic Decoupling for 3D Speech-Driven Facial Animation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:04.564888Z"},"links":{"citing_paper":"/paper/2505.23290"},"observation_digest":"sha256:10d44b8dc9da6e646b6f5aefdac63f09e4b4e0df91d027cad0bfde31262125df","observation_id":"9fec146e-fe99-423b-97d8-873b698ca677","resolution":{"observed_at":"2026-08-07T12:54:13.166424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:12.936118Z","title":"Omg: Towards open-vocabulary motion generation via mixture of controllers","venue":null,"work_id":"1cfc63e4-d8dd-4ce4-8295-f95b6206bdd1","year":2024},"citing_paper":{"arxiv_id":"2505.23290","last_updated":"2025-05-29T09:42:03Z","snapshot_observed_at":"2026-08-07T12:46:07.465341Z","submitted_at":"2025-05-29T09:42:03Z","title":"Wav2Sem: Plug-and-Play Audio Semantic Decoupling for 3D Speech-Driven Facial Animation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:04.723876Z"},"links":{"citing_paper":"/paper/2505.23290"},"observation_digest":"sha256:db9bbf0e7f8add2c200eebbd04a1cad29d1207a98f792b3dc411d4e414e78cd4","observation_id":"c087cc0c-1812-41a4-8c06-d83571ade16d","resolution":{"observed_at":"2026-08-07T12:54:13.009303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:12.731986Z","title":null,"venue":null,"work_id":"7beb08fe-74fe-40d7-9c8f-7a3aca17e3d9","year":2024},"citing_paper":{"arxiv_id":"2505.23290","last_updated":"2025-05-29T09:42:03Z","snapshot_observed_at":"2026-08-07T12:46:07.465341Z","submitted_at":"2025-05-29T09:42:03Z","title":"Wav2Sem: Plug-and-Play Audio Semantic Decoupling for 3D Speech-Driven Facial Animation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:04.899820Z"},"links":{"citing_paper":"/paper/2505.23290"},"observation_digest":"sha256:b60304f4516f8b0b590dc7192aa5b13455ffdd2ea4a87ac082d4b168239e1d95","observation_id":"2732a15f-42c3-42d0-afa1-c77dc26619d7","resolution":{"observed_at":"2026-08-07T12:54:12.818499Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:12.184267Z","title":"Convofusion: Multi-modal conversational diffu- sion for co-speech gesture synthesis","venue":null,"work_id":"2ea06a4c-1127-48d9-a4aa-eadb514bfbfe","year":2024},"citing_paper":{"arxiv_id":"2505.23290","last_updated":"2025-05-29T09:42:03Z","snapshot_observed_at":"2026-08-07T12:46:07.465341Z","submitted_at":"2025-05-29T09:42:03Z","title":"Wav2Sem: Plug-and-Play Audio Semantic Decoupling for 3D Speech-Driven Facial Animation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:05.069941Z"},"links":{"citing_paper":"/paper/2505.23290"},"observation_digest":"sha256:539220c0647713098645cce12aa4d422e6960741bdcc8247e66588d633a5cbb8","observation_id":"b09fbcc8-af9a-42df-9bea-3a8ed2adcf6c","resolution":{"observed_at":"2026-08-07T12:54:12.349161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:12.017441Z","title":"Librispeech: An ASR corpus based on public domain audio books","venue":null,"work_id":"2d91b7fd-3f33-4026-8ba0-2a960c0b7768","year":2015},"citing_paper":{"arxiv_id":"2505.23290","last_updated":"2025-05-29T09:42:03Z","snapshot_observed_at":"2026-08-07T12:46:07.465341Z","submitted_at":"2025-05-29T09:42:03Z","title":"Wav2Sem: Plug-and-Play Audio Semantic Decoupling for 3D Speech-Driven Facial Animation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:05.237049Z"},"links":{"citing_paper":"/paper/2505.23290"},"observation_digest":"sha256:2ef95b697d46a2407f916931902a39359b7647ac9bf805288ddcafee5fc3c145","observation_id":"8a7ae7cd-79d9-47c0-8b7a-f82bf9c98c67","resolution":{"observed_at":"2026-08-07T12:54:12.088950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:11.847776Z","title":"Emotalk: Speech-driven emotional disentanglement for 3d face anima- tion","venue":null,"work_id":"bbffe695-39cc-49d0-8c0a-1974816e666a","year":2023},"citing_paper":{"arxiv_id":"2505.23290","last_updated":"2025-05-29T09:42:03Z","snapshot_observed_at":"2026-08-07T12:46:07.465341Z","submitted_at":"2025-05-29T09:42:03Z","title":"Wav2Sem: Plug-and-Play Audio Semantic Decoupling for 3D Speech-Driven Facial Animation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:05.408691Z"},"links":{"citing_paper":"/paper/2505.23290"},"observation_digest":"sha256:ef1826c0f64856eb45c5b93b772e31f0b0d48bd371e77223c5c883ae32cd7503","observation_id":"e573cb65-3a46-4b16-99f9-2d03cfab0138","resolution":{"observed_at":"2026-08-07T12:54:11.911769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:11.593545Z","title":null,"venue":null,"work_id":"7bd8face-c8bb-4461-91ad-29ca3155128a","year":2020},"citing_paper":{"arxiv_id":"2505.23290","last_updated":"2025-05-29T09:42:03Z","snapshot_observed_at":"2026-08-07T12:46:07.465341Z","submitted_at":"2025-05-29T09:42:03Z","title":"Wav2Sem: Plug-and-Play Audio Semantic Decoupling for 3D Speech-Driven Facial Animation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:05.550901Z"},"links":{"citing_paper":"/paper/2505.23290"},"observation_digest":"sha256:ee892e5990da9b7bf9984cfc0b428e0ce39dd9517203c29e5ab980ec2da5de07","observation_id":"61c77f8b-5e1c-4a0b-be0f-fd65413d8565","resolution":{"observed_at":"2026-08-07T12:54:11.757569Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:11.446775Z","title":"Meshtalk: 3d face an- imation from speech using cross-modality disentanglement","venue":null,"work_id":"8b370ca1-b30c-4e55-b584-d3e815218902","year":null},"citing_paper":{"arxiv_id":"2505.23290","last_updated":"2025-05-29T09:42:03Z","snapshot_observed_at":"2026-08-07T12:46:07.465341Z","submitted_at":"2025-05-29T09:42:03Z","title":"Wav2Sem: Plug-and-Play Audio Semantic Decoupling for 3D Speech-Driven Facial Animation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:05.684758Z"},"links":{"citing_paper":"/paper/2505.23290"},"observation_digest":"sha256:7f7df06632b3d07b5280f0bff1fd947cf89c37d800a7cb680c2349a0ebb5f167","observation_id":"8266a45f-18e7-4439-856a-1e54ffee48e6","resolution":{"observed_at":"2026-08-07T12:54:11.519201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:11.232713Z","title":"Expressive 3d facial animation generation based on local-to-global latent diffusion","venue":null,"work_id":"d0672ba4-8998-4603-ac3e-10ddb566b37c","year":2024},"citing_paper":{"arxiv_id":"2505.23290","last_updated":"2025-05-29T09:42:03Z","snapshot_observed_at":"2026-08-07T12:46:07.465341Z","submitted_at":"2025-05-29T09:42:03Z","title":"Wav2Sem: Plug-and-Play Audio Semantic Decoupling for 3D Speech-Driven Facial Animation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:05.744599Z"},"links":{"citing_paper":"/paper/2505.23290"},"observation_digest":"sha256:82e90b9083806e707e3660db30533f0abdbb6861e20873b793062f6a058f8fe3","observation_id":"cd2f1206-42e4-4598-9c91-74258ffc8680","resolution":{"observed_at":"2026-08-07T12:54:11.347172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:11.045002Z","title":"Talkingstyle: Personalized speech-driven 3d facial animation with style preservation","venue":null,"work_id":"d106d076-c652-4238-a16c-649e5f7e36e8","year":2024},"citing_paper":{"arxiv_id":"2505.23290","last_updated":"2025-05-29T09:42:03Z","snapshot_observed_at":"2026-08-07T12:46:07.465341Z","submitted_at":"2025-05-29T09:42:03Z","title":"Wav2Sem: Plug-and-Play Audio Semantic Decoupling for 3D Speech-Driven Facial Animation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:05.855418Z"},"links":{"citing_paper":"/paper/2505.23290"},"observation_digest":"sha256:27d324c4ea740e8bebe40ab3b408a131975516f63dbad0ff6936032be9ddb59e","observation_id":"b98f197b-bb53-44d7-9993-02bbaadae7f7","resolution":{"observed_at":"2026-08-07T12:54:11.131632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:10.864547Z","title":"Facediffuser: Speech-driven 3d facial animation synthesis using diffusion","venue":null,"work_id":"21b0bdb0-e597-47aa-bf46-c5c0bee90d93","year":2023},"citing_paper":{"arxiv_id":"2505.23290","last_updated":"2025-05-29T09:42:03Z","snapshot_observed_at":"2026-08-07T12:46:07.465341Z","submitted_at":"2025-05-29T09:42:03Z","title":"Wav2Sem: Plug-and-Play Audio Semantic Decoupling for 3D Speech-Driven Facial Animation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:05.897428Z"},"links":{"citing_paper":"/paper/2505.23290"},"observation_digest":"sha256:4e74e0e3dda32d238ee44b3178e683e6aa6b5cf5cd8ed7a7812b1a7bdd255c37","observation_id":"06772a52-8deb-4a45-bc51-303597147eef","resolution":{"observed_at":"2026-08-07T12:54:10.968012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:10.667656Z","title":"Sun and Li Deng","venue":null,"work_id":"2e6619e2-6459-43b5-baf0-163e7cf20dec","year":1995},"citing_paper":{"arxiv_id":"2505.23290","last_updated":"2025-05-29T09:42:03Z","snapshot_observed_at":"2026-08-07T12:46:07.465341Z","submitted_at":"2025-05-29T09:42:03Z","title":"Wav2Sem: Plug-and-Play Audio Semantic Decoupling for 3D Speech-Driven Facial Animation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:05.923633Z"},"links":{"citing_paper":"/paper/2505.23290"},"observation_digest":"sha256:07b663e47e48f8928bbc051ad11d4c0e83c23393c2d739c5916b066594855cff","observation_id":"791ea625-63bf-4195-96fd-ad4b096e68fd","resolution":{"observed_at":"2026-08-07T12:54:10.785640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:10.493690Z","title":"Diff- posetalk: Speech-driven stylistic 3d facial animation and head pose generation via diffusion models","venue":null,"work_id":"f0501c46-377b-4ed1-b252-67393940df13","year":2024},"citing_paper":{"arxiv_id":"2505.23290","last_updated":"2025-05-29T09:42:03Z","snapshot_observed_at":"2026-08-07T12:46:07.465341Z","submitted_at":"2025-05-29T09:42:03Z","title":"Wav2Sem: Plug-and-Play Audio Semantic Decoupling for 3D Speech-Driven Facial Animation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:05.955195Z"},"links":{"citing_paper":"/paper/2505.23290"},"observation_digest":"sha256:78ac8f7e660d69ca3b47fbedfd539e492ea68d3b20f56086fa06f05e39d27d3a","observation_id":"7e96ea9f-ce27-47dd-ba78-6515fd3d71dd","resolution":{"observed_at":"2026-08-07T12:54:10.574651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:10.315498Z","title":"Taylor, Taehwan Kim, Yisong Yue, Moshe Mahler, James Krahe, Anastasio Garcia Rodriguez, Jessica K","venue":null,"work_id":"8c074235-861a-4c97-bcc2-f8ceab5f9124","year":2017},"citing_paper":{"arxiv_id":"2505.23290","last_updated":"2025-05-29T09:42:03Z","snapshot_observed_at":"2026-08-07T12:46:07.465341Z","submitted_at":"2025-05-29T09:42:03Z","title":"Wav2Sem: Plug-and-Play Audio Semantic Decoupling for 3D Speech-Driven Facial Animation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:06.058357Z"},"links":{"citing_paper":"/paper/2505.23290"},"observation_digest":"sha256:402e0dd9ab2bac4e4866b4a3d4899602c919669e5b4c4bd3e69d8c3c70f72c1f","observation_id":"df5437b6-5604-4c32-abf7-e877c91d6c41","resolution":{"observed_at":"2026-08-07T12:54:10.380201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00870","last_updated":"2023-12-01T19:01:05Z","snapshot_observed_at":"2026-07-06T16:55:49.813116Z","submitted_at":"2023-12-01T19:01:05Z","title":"3DiFACE: Diffusion-based Speech-driven 3D Facial Animation and Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00870","snapshot_observed_at":"2026-08-07T12:54:06.174746Z","title":"3diface: Diffusion-based speech-driven 3d facial animation and editing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23290","last_updated":"2025-05-29T09:42:03Z","snapshot_observed_at":"2026-08-07T12:46:07.465341Z","submitted_at":"2025-05-29T09:42:03Z","title":"Wav2Sem: Plug-and-Play Audio Semantic Decoupling for 3D Speech-Driven Facial Animation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:06.174746Z"},"links":{"cited_paper":"/paper/2312.00870","citing_paper":"/paper/2505.23290"},"observation_digest":"sha256:ed5f5aa2eed4b4866fd9f3384012685c775a7bc62357625cbc71b973f5c622ff","observation_id":"a486deaa-0431-46a5-947c-fd63a0f7ca75","resolution":{"observed_at":"2026-08-07T12:54:06.174746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:10.118154Z","title":"Imitator: Personalized speech-driven 3d facial animation","venue":null,"work_id":"e4e7ffa5-8147-4a6c-b01b-c057aeaa0b0e","year":2023},"citing_paper":{"arxiv_id":"2505.23290","last_updated":"2025-05-29T09:42:03Z","snapshot_observed_at":"2026-08-07T12:46:07.465341Z","submitted_at":"2025-05-29T09:42:03Z","title":"Wav2Sem: Plug-and-Play Audio Semantic Decoupling for 3D Speech-Driven Facial Animation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:06.304332Z"},"links":{"citing_paper":"/paper/2505.23290"},"observation_digest":"sha256:f8f1cf52ad1c97c2df146ce662cf65966addc13f47adac2fc6f268474ebf71ac","observation_id":"5d4d6f0a-9126-4816-8bc8-bcc575928f07","resolution":{"observed_at":"2026-08-07T12:54:10.215324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:09.977494Z","title":"Neural voice puppetry: Audio-driven facial reenactment","venue":null,"work_id":"81d1515e-8880-46c8-8f56-e38c8025f108","year":2020},"citing_paper":{"arxiv_id":"2505.23290","last_updated":"2025-05-29T09:42:03Z","snapshot_observed_at":"2026-08-07T12:46:07.465341Z","submitted_at":"2025-05-29T09:42:03Z","title":"Wav2Sem: Plug-and-Play Audio Semantic Decoupling for 3D Speech-Driven Facial Animation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:06.492254Z"},"links":{"citing_paper":"/paper/2505.23290"},"observation_digest":"sha256:37a9822255e8fdeda7f4345a3558818e889121737f9ec24c34556a410996f654","observation_id":"ea41a362-d842-4fd4-98df-b3789ecea87e","resolution":{"observed_at":"2026-08-07T12:54:10.041306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:09.770127Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":"59262d9f-e376-484e-98ec-f3b9009133b5","year":2017},"citing_paper":{"arxiv_id":"2505.23290","last_updated":"2025-05-29T09:42:03Z","snapshot_observed_at":"2026-08-07T12:46:07.465341Z","submitted_at":"2025-05-29T09:42:03Z","title":"Wav2Sem: Plug-and-Play Audio Semantic Decoupling for 3D Speech-Driven Facial Animation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:06.616378Z"},"links":{"citing_paper":"/paper/2505.23290"},"observation_digest":"sha256:bccb164b4e4e4540caf924496531e5ca240cfa7d22049efeaf38be87605c0bf7","observation_id":"060bec6f-0892-4851-8333-5a8919ee5369","resolution":{"observed_at":"2026-08-07T12:54:09.862468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:09.636062Z","title":"End-to-end speech-driven realistic facial animation with temporal gans","venue":null,"work_id":"f9523119-b6d9-4e5d-b3bc-83eede3c9401","year":2019},"citing_paper":{"arxiv_id":"2505.23290","last_updated":"2025-05-29T09:42:03Z","snapshot_observed_at":"2026-08-07T12:46:07.465341Z","submitted_at":"2025-05-29T09:42:03Z","title":"Wav2Sem: Plug-and-Play Audio Semantic Decoupling for 3D Speech-Driven Facial Animation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:06.789509Z"},"links":{"citing_paper":"/paper/2505.23290"},"observation_digest":"sha256:3162f1e8c41a581e6002911f1e021d7dc51bec8223b99c010a36f97d1ba8bf00","observation_id":"bd18af0b-fee2-41f1-a369-5dba1b63a086","resolution":{"observed_at":"2026-08-07T12:54:09.698081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:09.419155Z","title":"One- shot talking face generation from single-speaker audio-visual correlation learning","venue":null,"work_id":"c747d39f-5ad7-4f07-ac5f-391cac3f75c8","year":2022},"citing_paper":{"arxiv_id":"2505.23290","last_updated":"2025-05-29T09:42:03Z","snapshot_observed_at":"2026-08-07T12:46:07.465341Z","submitted_at":"2025-05-29T09:42:03Z","title":"Wav2Sem: Plug-and-Play Audio Semantic Decoupling for 3D Speech-Driven Facial Animation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:06.924625Z"},"links":{"citing_paper":"/paper/2505.23290"},"observation_digest":"sha256:f7179459b08f1053166b16e8b86d9538cb3236fa806cf3adc3680f76dfa79db1","observation_id":"1d9de22c-4ae4-47f7-9b79-9f859a04a1f4","resolution":{"observed_at":"2026-08-07T12:54:09.545374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:09.149733Z","title":"Codetalker: Speech-driven 3d facial animation with discrete motion prior","venue":null,"work_id":"bdf25c9f-51b5-4c92-a54b-0e2d6cdd059a","year":2023},"citing_paper":{"arxiv_id":"2505.23290","last_updated":"2025-05-29T09:42:03Z","snapshot_observed_at":"2026-08-07T12:46:07.465341Z","submitted_at":"2025-05-29T09:42:03Z","title":"Wav2Sem: Plug-and-Play Audio Semantic Decoupling for 3D Speech-Driven Facial Animation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:07.037851Z"},"links":{"citing_paper":"/paper/2505.23290"},"observation_digest":"sha256:82cc8be72af83b474d6719fcbe67d6cd838fd53896f1bb0c861f376b22210f5a","observation_id":"44cbe3cd-bdcc-4584-b2da-c1c17694c446","resolution":{"observed_at":"2026-08-07T12:54:09.282431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:08.919507Z","title":"Feng, Stacy Marsella, and Ari Shapiro","venue":null,"work_id":"79f5c4be-024f-415c-84f4-4ddefa91a161","year":2013},"citing_paper":{"arxiv_id":"2505.23290","last_updated":"2025-05-29T09:42:03Z","snapshot_observed_at":"2026-08-07T12:46:07.465341Z","submitted_at":"2025-05-29T09:42:03Z","title":"Wav2Sem: Plug-and-Play Audio Semantic Decoupling for 3D Speech-Driven Facial Animation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:07.194342Z"},"links":{"citing_paper":"/paper/2505.23290"},"observation_digest":"sha256:d85ef61047e4129bb7d04733f8ee607abb8c069498ab0ac357aa9525fd6ba7fc","observation_id":"37acc315-2d75-487b-ad54-50a0676394f1","resolution":{"observed_at":"2026-08-07T12:54:09.033295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:08.678820Z","title":"You only speak once to see","venue":null,"work_id":"a6095ffc-971d-4c65-9ceb-5f3eaeceef0b","year":2025},"citing_paper":{"arxiv_id":"2505.23290","last_updated":"2025-05-29T09:42:03Z","snapshot_observed_at":"2026-08-07T12:46:07.465341Z","submitted_at":"2025-05-29T09:42:03Z","title":"Wav2Sem: Plug-and-Play Audio Semantic Decoupling for 3D Speech-Driven Facial Animation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:07.342653Z"},"links":{"citing_paper":"/paper/2505.23290"},"observation_digest":"sha256:d8e1f017d7c51ed1caf5ffb764b6f8616ed244256d6077deff3dd90abf113b0c","observation_id":"3ff9156e-1d75-40b2-886e-aac50714b777","resolution":{"observed_at":"2026-08-07T12:54:08.764484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:08.434947Z","title":"Mining audio, text and visual information for talking face generation","venue":null,"work_id":"529b7221-0a76-4962-9be2-3c578ef23fa5","year":2019},"citing_paper":{"arxiv_id":"2505.23290","last_updated":"2025-05-29T09:42:03Z","snapshot_observed_at":"2026-08-07T12:46:07.465341Z","submitted_at":"2025-05-29T09:42:03Z","title":"Wav2Sem: Plug-and-Play Audio Semantic Decoupling for 3D Speech-Driven Facial Animation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:07.509187Z"},"links":{"citing_paper":"/paper/2505.23290"},"observation_digest":"sha256:2f53895dc2d34b7b63d194e391df091b73e59630cac3aa631f596705cb1377dc","observation_id":"a57b2918-b078-455e-96e5-8d9bd0cce1d0","resolution":{"observed_at":"2026-08-07T12:54:08.580082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:08.122094Z","title":"Motiondif- fuse: Text-driven human motion generation with diffusion model","venue":null,"work_id":"4e462466-b576-460f-b374-7f8149037df4","year":2024},"citing_paper":{"arxiv_id":"2505.23290","last_updated":"2025-05-29T09:42:03Z","snapshot_observed_at":"2026-08-07T12:46:07.465341Z","submitted_at":"2025-05-29T09:42:03Z","title":"Wav2Sem: Plug-and-Play Audio Semantic Decoupling for 3D Speech-Driven Facial Animation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:07.598810Z"},"links":{"citing_paper":"/paper/2505.23290"},"observation_digest":"sha256:7893fc04365fbe3c48cd3e8351362a36fbcdc985ee0c2f50e891c112c3e0b568","observation_id":"250eb052-f068-48e3-ae08-fc2ee0989261","resolution":{"observed_at":"2026-08-07T12:54:08.278339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:54:07.833496Z","title":"Media2face: Co-speech facial animation gener- ation with multi-modality guidance","venue":null,"work_id":"df0298bf-94b3-4081-bd20-4b7994b1a52d","year":2024},"citing_paper":{"arxiv_id":"2505.23290","last_updated":"2025-05-29T09:42:03Z","snapshot_observed_at":"2026-08-07T12:46:07.465341Z","submitted_at":"2025-05-29T09:42:03Z","title":"Wav2Sem: Plug-and-Play Audio Semantic Decoupling for 3D Speech-Driven Facial Animation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:54:07.692944Z"},"links":{"citing_paper":"/paper/2505.23290"},"observation_digest":"sha256:ba0ab43c5937d03455ef533542624b3d828cb3d2433ea0bda18f97be5d82b384","observation_id":"1d34f567-4d6b-45b9-b940-0482e0c8f529","resolution":{"observed_at":"2026-08-07T12:54:07.968350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.23290","last_updated":"2025-05-29T09:42:03Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T12:46:07.465341Z","submitted_at":"2025-05-29T09:42:03Z","title":"Wav2Sem: Plug-and-Play Audio Semantic Decoupling for 3D Speech-Driven Facial Animation"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":0,"verified_fuzzy":39},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 1 inbound Pith citation observation for arXiv:2505.23290."}