{"as_of":"2026-08-13T10:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:22f2275e9bd142ca597f11eeff7c0a806605e1b8c15b610cebee0d15703b9c74","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T16:47:09.073686Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.13209/citation-record","integrity":"/paper/2411.13209/integrity","json":"/paper/2411.13209/citation-record.json","paper":"/paper/2411.13209"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:10.128459Z","title":"Simulation-based learning in higher education: A meta-analysis","venue":null,"work_id":"b3e42463-5e67-470e-ace0-ea8c8714da97","year":2020},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-12T16:39:50.021770Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.809431Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:23fc328872510ba4b0527d72910522dd465baa1aa22789335010da2d6d570131","observation_id":"f79ae570-cab8-4f83-ab06-75077cbb4ac3","resolution":{"observed_at":"2026-08-12T16:47:10.137518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:10.109196Z","title":"Psychological foundations of emerging technologies for teaching and learning in higher education","venue":null,"work_id":"5019388f-ab87-4d1d-9437-40444ba3b656","year":2020},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-12T16:39:50.021770Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.815259Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:562607584aac113d4bb08c193620171f4dc900eb7aa490fd0bd6dedb1c212031","observation_id":"9dd10fdb-49bc-4d6e-8a30-eba6a04a0831","resolution":{"observed_at":"2026-08-12T16:47:10.116225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:10.092402Z","title":null,"venue":null,"work_id":"aca5488b-d229-4dfa-b76a-4c682cec32ee","year":2016},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-12T16:39:50.021770Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.821437Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:502910db114caac34d80dae45c370918e075e5af35dbe7c6c22080bc55523892","observation_id":"f15c7172-b18b-41a4-8d1f-96d407ea625f","resolution":{"observed_at":"2026-08-12T16:47:10.097669Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:10.073010Z","title":"Designing effective training programs for investigative interviewers of children","venue":null,"work_id":"fbe79ea2-a18f-42bb-bd4f-199995f5d4a6","year":2008},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-12T16:39:50.021770Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.826723Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:69386cb4ca288dca9f61416394d08f750ccec2ac34a5e9a2cfd40cca6ddfb780","observation_id":"b8c58379-42cb-4f6a-b13a-ba795041be66","resolution":{"observed_at":"2026-08-12T16:47:10.079749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:10.051107Z","title":null,"venue":null,"work_id":"0dd95417-5788-4962-9caa-33b942d4a7fc","year":2007},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-12T16:39:50.021770Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.831853Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:5883925a6a474365b81b6f38fe876656ee9292d71369853f142da512bc6d6d3f","observation_id":"7fb1a43d-1ef9-482a-9fa9-76a5447ead54","resolution":{"observed_at":"2026-08-12T16:47:10.058801Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:10.027361Z","title":"Interviewing children","venue":null,"work_id":"daf0dd3b-fd5a-4419-95c3-0bdbc9b2632e","year":2014},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-12T16:39:50.021770Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.837457Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:52e68c509b369d769a9ac77761ab09a674191806f9fa5b199da89dfff0bd2772","observation_id":"06bbf19c-0514-4af6-aea9-aa1f47d53b63","resolution":{"observed_at":"2026-08-12T16:47:10.037742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:10.008019Z","title":"Tell me what happened: Questioning children about abuse","venue":null,"work_id":"b3fadbe5-867a-40d0-a823-d555602ae517","year":2018},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-12T16:39:50.021770Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.845623Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:2ecddc0e2fd481193beb555215714ce607fa18f69fb8c65fe5306c001efd718f","observation_id":"d63462fa-9032-4607-a731-0f2b2fd92dff","resolution":{"observed_at":"2026-08-12T16:47:10.013244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:09.991370Z","title":"An overview of mock interviews as a training tool for interviewers of children","venue":null,"work_id":"2c4e5249-a892-4b1d-99c2-16e99dee4944","year":2022},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-12T16:39:50.021770Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.854431Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:c1efaa91b5ceb5815c8e5d3433c59b3e112e134afc49f9ef935ad0029cf0ab33","observation_id":"8de70706-2588-468e-9620-a250123246a0","resolution":{"observed_at":"2026-08-12T16:47:09.996698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:09.973971Z","title":"Towards an ai-driven talking avatar in virtual reality for investigative interviews of children","venue":null,"work_id":"3408b22c-aca3-4800-834a-21fca5bbe9aa","year":2022},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-12T16:39:50.021770Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.860126Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:05a2d8c25bd0afc39acf29b739f44c9540a6f32713be28f0acc856e778445899","observation_id":"ef11a872-8f79-49ef-a3da-61ca9fdfec2f","resolution":{"observed_at":"2026-08-12T16:47:09.979634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:09.957580Z","title":null,"venue":null,"work_id":"0efd2f06-cea5-4b62-9ea4-7e2fe481b9e4","year":2024},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-12T16:39:50.021770Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.866481Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:aebce544860695a72143e7a68b9e80b7996d4709ae46afb8bfd768d4f5758f2e","observation_id":"e6547aa4-dfc5-4c06-ad48-0e81540c28da","resolution":{"observed_at":"2026-08-12T16:47:09.962601Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:08.871543Z","title":"Nerf: Representing scenes as neural radiance fields for view synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-12T16:39:50.021770Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.871543Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:f41def6b175cb93f85b2fa99a9b55284094a9a71b8ddc0a93f3dc742a198741c","observation_id":"459553b4-ab63-4bf2-8d48-a903b32abb04","resolution":{"observed_at":"2026-08-12T16:47:08.871543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:08.876364Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-12T16:39:50.021770Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.876364Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:1f8fcfd30f628261b3b11e7fca058cbea9bcc193374343830b4ff2568169c106","observation_id":"49f82dc4-9230-4af4-b7c9-93105dbfb566","resolution":{"observed_at":"2026-08-12T16:47:08.876364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:09.917682Z","title":"Whisper afe for talking heads generation","venue":null,"work_id":"e602135b-e354-45bc-8519-86130d4769be","year":2024},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-12T16:39:50.021770Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.881311Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:b86e11b6406f36e3bd08fedb1b5d803f0e827d48f928907c4a5ce4877917738c","observation_id":"9afcc583-79bf-4bae-8a57-dd3d1b84e27f","resolution":{"observed_at":"2026-08-12T16:47:09.923125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:09.900519Z","title":"Technological acceptance of an avatar based interview training application: The development and technological acceptance study of the avbit application., 2021","venue":null,"work_id":"7a98edbb-6ba2-4d65-9035-7820fe74f6fc","year":2021},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-12T16:39:50.021770Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.886036Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:b5348a8fcd94109142b5dbdb6e479eab7d82fc1996d6c24fe7ad199ca9958cac","observation_id":"1e4731ba-445f-4ebe-85c7-2beadc0f5829","resolution":{"observed_at":"2026-08-12T16:47:09.906522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:09.883796Z","title":"A field assessment of child abuse investigators’ engagement with a child-avatar to develop interviewing skills.Child Abuse & Neglect, 143:106324, 2023","venue":null,"work_id":"801b5838-3410-47f9-9456-19c54fba16a0","year":2023},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-12T16:39:50.021770Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.890840Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:f4a4ce3eecbcd35137c17811c450d44b0ba60138bdf5c88b54e67b79dec8bab0","observation_id":"254f0f89-aefd-464a-8222-e8ef696b67b7","resolution":{"observed_at":"2026-08-12T16:47:09.889013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:09.860596Z","title":"Evaluation of a comprehensive interactive training system for investigative interviewers of children","venue":null,"work_id":"ab33c7fd-62ff-4f7c-ad9e-5be8f38ee72a","year":2015},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-12T16:39:50.021770Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.895764Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:63e3829af9e767ec8a021965d19930f43e4d6f8cd7771a35e7f9220cc9ada78d","observation_id":"685af020-1d76-4329-ba5f-1a0148af9b01","resolution":{"observed_at":"2026-08-12T16:47:09.871318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:09.836520Z","title":"Training in investigative interviews of children: Serious gaming paired with feedback improves interview quality","venue":null,"work_id":"36f6fa1f-5082-4166-8c4e-06b8d1735b09","year":2018},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-12T16:39:50.021770Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.900547Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:1b6fd40f021779d83bc28cc60eb7ff0a1a92bb39fd6578672ae78b883909c533","observation_id":"702d9421-bf07-49a6-9884-87ad94a959c6","resolution":{"observed_at":"2026-08-12T16:47:09.842122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:09.817538Z","title":"How to prepare for conversations with children about suspicions of sexual abuse? evaluation of an interactive virtual reality training for student teachers","venue":null,"work_id":"7fa61528-7b9f-45b6-8bdb-0c7dd6637c96","year":2024},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-12T16:39:50.021770Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.905396Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:ba81a4ec5216a6f186e071d8b0a273ebd1efa1b2616531815d8373b3b86145d5","observation_id":"61322ef2-4dae-47ec-8f1a-1dda5755b770","resolution":{"observed_at":"2026-08-12T16:47:09.823380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:09.798329Z","title":"A theoretical and empirical analysis of 2d and 3d virtual environments in training for child interview skills","venue":null,"work_id":"a56c0c29-2cc3-4d8d-a62e-01f16efb962a","year":2024},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-12T16:39:50.021770Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.910586Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:5fd2b29704a1dc2ecf3f9eba166d0d6eb32e25cfb2fc91c902e7084967a63485","observation_id":"6d6295ca-6422-4315-b270-9bbbae55ebbd","resolution":{"observed_at":"2026-08-12T16:47:09.805367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:09.777043Z","title":"Live speech portraits: real-time photorealistic talking-head animation","venue":null,"work_id":"bc663734-c03e-4a4a-ba31-f274bf738d6d","year":2021},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-12T16:39:50.021770Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.915545Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:6cedbdbfeed2e6b4e57c1c7f736d346d7a00a1be0b09615096ad2614e1b670de","observation_id":"c2fae4ba-10c1-41fd-8864-375aade7d8dc","resolution":{"observed_at":"2026-08-12T16:47:09.784817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:09.758317Z","title":"Generative pre-training for speech with autoregressive predictive coding","venue":null,"work_id":"cafbc5b2-10c2-405f-b31f-e27593250910","year":2020},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-12T16:39:50.021770Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.921810Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:c2abef7c7ce7c1d16a577e4daff0e8ed710f6913f5002ab285904e3207a50f51","observation_id":"20e87e22-84b4-49f7-9d7e-c043b3586c9c","resolution":{"observed_at":"2026-08-12T16:47:09.764253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18284","last_updated":"2024-08-08T12:18:30Z","snapshot_observed_at":"2026-08-12T23:34:33.336433Z","submitted_at":"2024-06-26T12:09:59Z","title":"RealTalk: Real-time and Realistic Audio-driven Face Generation with 3D Facial Prior-guided Identity Alignment Network","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18284","snapshot_observed_at":"2026-08-12T16:47:08.927249Z","title":"Realtalk: Real-time and realistic audio-driven face generation with 3d facial prior-guided identity alignment network","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-12T16:39:50.021770Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.927249Z"},"links":{"cited_paper":"/paper/2406.18284","citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:c266b21d15ce6feb48aa1a005178f1df00688fd94fbc80a4fba0a60ab06bd22e","observation_id":"968615b6-4508-44d6-aeb5-d66cba41690e","resolution":{"observed_at":"2026-08-12T16:47:08.927249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:08.934320Z","title":"3d gaussian splatting for real-time radiance field rendering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-12T16:39:50.021770Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.934320Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:da2c6f19e00ca10074de9b50d980ea6782b223fa5748dbf9bdc24b960f87dca2","observation_id":"eccb74c8-ffda-4f2a-b55a-d225e16f4298","resolution":{"observed_at":"2026-08-12T16:47:08.934320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19040","last_updated":"2024-04-29T18:28:36Z","snapshot_observed_at":"2026-08-13T00:19:10.238235Z","submitted_at":"2024-04-29T18:28:36Z","title":"GSTalker: Real-time Audio-Driven Talking Face Generation via Deformable Gaussian Splatting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19040","snapshot_observed_at":"2026-08-12T16:47:08.940014Z","title":"Gstalker: Real-time audio-driven talking face generation via deformable gaussian splatting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-12T16:39:50.021770Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.940014Z"},"links":{"cited_paper":"/paper/2404.19040","citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:1bdd82081a2eda15f9fe053407379c83694736b07a3c0c42fc62e9f63ad2f087","observation_id":"73e3db43-c7ed-4143-8bb4-e062bdbeafc8","resolution":{"observed_at":"2026-08-12T16:47:08.940014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:09.726910Z","title":"Gaussiantalker: Real-time talking head synthesis with 3d gaussian splatting","venue":null,"work_id":"6e2a39ee-532c-4c1a-8b22-bab181dfa802","year":2024},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-12T16:39:50.021770Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.945932Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:fb8dc46ecb967e1b72994977277340ec6b6008809494231aa26572e657dc1415","observation_id":"b3479857-ac82-4187-914f-25a0c087d6b8","resolution":{"observed_at":"2026-08-12T16:47:09.733110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.12368","last_updated":"2022-11-22T16:03:11Z","snapshot_observed_at":"2026-08-11T11:46:25.700946Z","submitted_at":"2022-11-22T16:03:11Z","title":"Real-time Neural Radiance Talking Portrait Synthesis via Audio-spatial Decomposition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.12368","snapshot_observed_at":"2026-08-12T16:47:08.951700Z","title":"Real-time neural radiance talking portrait synthesis via audio-spatial decomposition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-12T16:39:50.021770Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.951700Z"},"links":{"cited_paper":"/paper/2211.12368","citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:ba172661dff55242122ce4d6490e8aec85b432fd0fc4b268dc834a1faf58df47","observation_id":"5d2d5425-b974-4633-b021-4a6d0777df82","resolution":{"observed_at":"2026-08-12T16:47:08.951700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:09.707379Z","title":"Ad-nerf: Audio driven neural radiance fields for talking head synthesis","venue":null,"work_id":"3857268c-310a-4f16-8c9c-294a479566a4","year":2021},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-12T16:39:50.021770Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.957073Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:f2859e12396b7c03358a14e49d64389145d7907e9021f65061c6e400b5f11c02","observation_id":"340d058e-1a90-42b8-a0eb-a1ba860a06db","resolution":{"observed_at":"2026-08-12T16:47:09.713679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:09.687698Z","title":"Efficient region-aware neural radiance fields for high-fidelity talking portrait synthesis","venue":null,"work_id":"01d3455f-95bf-4b9d-9a91-c252c4fe88d5","year":2023},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-12T16:39:50.021770Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.962409Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:9844bc06c5fbdb9c8588c62b97967c9f7035cc95c69631e10f26ef3ba1278bd3","observation_id":"6a0bc73a-2840-4c52-a266-a925773d2d0e","resolution":{"observed_at":"2026-08-12T16:47:09.693229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.00787","last_updated":"2023-05-01T12:24:09Z","snapshot_observed_at":"2026-07-06T15:21:50.037094Z","submitted_at":"2023-05-01T12:24:09Z","title":"GeneFace++: Generalized and Stable Real-Time Audio-Driven 3D Talking Face Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.00787","snapshot_observed_at":"2026-08-12T16:47:08.967948Z","title":"Geneface++: Generalized and stable real-time audio-driven 3d talking face generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-12T16:39:50.021770Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.967948Z"},"links":{"cited_paper":"/paper/2305.00787","citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:7959562d6c60b6782326fb43f3292957cc7c73f7a210811f18edfae8cd8e33b3","observation_id":"64c5e362-c91c-447e-b9b9-abd19f84ba16","resolution":{"observed_at":"2026-08-12T16:47:08.967948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05572","last_updated":"2023-12-09T13:21:01Z","snapshot_observed_at":"2026-08-13T05:06:42.996776Z","submitted_at":"2023-12-09T13:21:01Z","title":"R2-Talker: Realistic Real-Time Talking Head Synthesis with Hash Grid Landmarks Encoding and Progressive Multilayer Conditioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05572","snapshot_observed_at":"2026-08-12T16:47:08.974918Z","title":"R2-talker: Realistic real-time talking head synthesis with hash grid landmarks encoding and progressive multilayer conditioning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-12T16:39:50.021770Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.974918Z"},"links":{"cited_paper":"/paper/2312.05572","citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:9cc9153f750389754ade3ba21f64e34cccf02da425b3e5890ca190794d92143a","observation_id":"d4842ba4-5216-4a80-80a5-f2b6cf9ca685","resolution":{"observed_at":"2026-08-12T16:47:08.974918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:08.980477Z","title":"Deep speech 2: End-to-end speech recognition in english and mandarin","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-12T16:39:50.021770Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.980477Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:d496e7c4ab716cc9413fd9d17d1ed251fdbbfeebb6c969333b28f74a5198f205","observation_id":"332784ed-7baa-4373-bca8-fab16268a54e","resolution":{"observed_at":"2026-08-12T16:47:08.980477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:09.657770Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations","venue":null,"work_id":"4baf6f64-94e5-4afa-b8ff-74a1be894492","year":2020},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-12T16:39:50.021770Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.985782Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:092bd12abd485084a151c5c14009b50935a591669ba0369b9278e74b47c60eb0","observation_id":"fb0395bf-b997-4d87-82f8-3aae258faa57","resolution":{"observed_at":"2026-08-12T16:47:09.663290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:09.640230Z","title":"Hubert: How much can a bad teacher benefit asr pre-training? In ICASSP 2021-2021 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) , pages 6533–6537","venue":null,"work_id":"5c2a8d64-f6c7-4545-a27e-f031d430dce9","year":2021},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-12T16:39:50.021770Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.991193Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:a8b225782d4bb6e5d993ee26a10dd3ffd1ae8a8d67f89a02e4ad3e19ab82efaf","observation_id":"cf61b4c4-1e46-434f-b3a0-86b91a4766d9","resolution":{"observed_at":"2026-08-12T16:47:09.645909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:08.997783Z","title":"Bidirectional recurrent neural networks","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-12T16:39:50.021770Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:08.997783Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:c21fed6d6c96436ba3095f85d9f4855c1c83518982d92163a91b6a9914a02800","observation_id":"8f0216d4-df7f-4a21-a22a-ae3c0b888dcc","resolution":{"observed_at":"2026-08-12T16:47:08.997783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-07-06T05:01:27.910364Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-12T16:47:09.003205Z","title":"Gaussian error linear units (gelus)","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-12T16:39:50.021770Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:09.003205Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:721e7c357223eb48ca75acf6a50db9dd2de312a01923db1f3aaf145c0d73771f","observation_id":"89851c0b-c735-49f0-8656-174646668c90","resolution":{"observed_at":"2026-08-12T16:47:09.003205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.05453","last_updated":"2020-02-16T18:35:27Z","snapshot_observed_at":"2026-08-11T05:38:01.369830Z","submitted_at":"2019-10-12T00:55:06Z","title":"vq-wav2vec: Self-Supervised Learning of Discrete Speech Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.05453","snapshot_observed_at":"2026-08-12T16:47:09.012586Z","title":"vq-wav2vec: Self-supervised learning of discrete speech representations","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-12T16:39:50.021770Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:09.012586Z"},"links":{"cited_paper":"/paper/1910.05453","citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:a92c89c81846c2b1638c8a2da03c59b8c204b8a8313385d04ffabe7a59c20e0b","observation_id":"058cc7c1-7830-4a7c-9327-49db50e7c999","resolution":{"observed_at":"2026-08-12T16:47:09.012586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:09.018545Z","title":"Product quantization for nearest neighbor search","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-12T16:39:50.021770Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:09.018545Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:c5d02068bddc21a357493a654f78c3fa54ee6a836ed34f14e55ca057b7e0a19c","observation_id":"0dcb4ce5-457d-45d7-b455-1c25e382afc7","resolution":{"observed_at":"2026-08-12T16:47:09.018545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:09.026473Z","title":"Librispeech: an asr corpus based on public domain audio books","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-12T16:39:50.021770Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:09.026473Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:f1c7abd7d40dcaee945d6bdf5c7aa8b3cf0eb241a9fee50e38a6e5e63c739440","observation_id":"bb09211e-51af-44f9-bdc5-38409a41b11b","resolution":{"observed_at":"2026-08-12T16:47:09.026473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:09.581885Z","title":"Libri-light: A benchmark for asr with limited or no supervision","venue":null,"work_id":"c466e4aa-ea50-49a1-836a-d430ad51ad54","year":2020},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-12T16:39:50.021770Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:09.033426Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:509629783846f9e7b8cc0e2f43c9082a033825413c04e681b7a3fbdc5ca504c2","observation_id":"07afb9dd-47a8-4890-a6f3-30820aa4e43a","resolution":{"observed_at":"2026-08-12T16:47:09.588803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:09.554195Z","title":"Spanbert: Improving pre-training by representing and predicting spans","venue":null,"work_id":"60b1de5e-939d-4931-99a5-62dabb0b7639","year":2020},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-12T16:39:50.021770Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:09.038620Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:a4cde25a030c2c1b0d11d677f63978c971fe10fc5fb2ae7412c8fb55fa472f23","observation_id":"f6ef059b-e217-4d56-a14b-a04a74f80190","resolution":{"observed_at":"2026-08-12T16:47:09.560601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:09.521255Z","title":"Aws polly","venue":null,"work_id":"8b89ed63-10b6-4268-8140-2c43e8703e05","year":2024},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-12T16:39:50.021770Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:09.043469Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:f86bcb4148cef9bfec77a3aa43ac0ffa8bb83c2a9bae76f20769ac434ec58dcc","observation_id":"3a3b8606-b8d1-438e-92b2-cead2e4d942e","resolution":{"observed_at":"2026-08-12T16:47:09.527753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:09.048662Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-12T16:39:50.021770Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:09.048662Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:98d4fcc18b0c543b05554ee6c39b72993e7e54fc555a5a2fcd44fd071a29b8c4","observation_id":"25de3783-3ddb-49b7-823b-b5f12ffaaf4a","resolution":{"observed_at":"2026-08-12T16:47:09.048662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:09.341695Z","title":"Lip movements generation at a glance","venue":null,"work_id":"83b87a4c-9739-447d-a732-bbaec9345a21","year":2018},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-12T16:39:50.021770Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:09.053891Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:872687a3e902c9e7d5dee06be3251d4b01392a56bba251764c807b2ad42c7a5f","observation_id":"35fb33ed-2fd1-432c-a89f-493632187426","resolution":{"observed_at":"2026-08-12T16:47:09.347158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:09.058524Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-12T16:39:50.021770Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:09.058524Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:6849e144df47ba09f4e766d0b44510c7dafaf36fbd4da3c831b69b6c04c86c77","observation_id":"fc2861b9-2d0f-4d83-aeea-a5060dc8bc2d","resolution":{"observed_at":"2026-08-12T16:47:09.058524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:09.306226Z","title":"Openface: an open source facial behavior analysis toolkit","venue":null,"work_id":"317a3f81-239c-48b1-97d8-6c80578b7ef1","year":2016},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-12T16:39:50.021770Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:09.063648Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:3547bae24e97316777032be5f62070344a30832141ec37207606dc064f0c20bd","observation_id":"feaa8353-5d57-414f-a279-d85d128132f7","resolution":{"observed_at":"2026-08-12T16:47:09.313668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:09.068356Z","title":"Out of time: automated lip sync in the wild","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-12T16:39:50.021770Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:09.068356Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:34a59f1637c26eea87eb4a8157612b73cdf5f647455674e15c4e1ad69812c7ad","observation_id":"41c8fe3c-3a32-4f46-a06b-c9de70833c37","resolution":{"observed_at":"2026-08-12T16:47:09.068356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:47:09.263492Z","title":"The uncanny valley [from the field]","venue":null,"work_id":"694b68ea-babc-4dbb-82ef-223458e53b67","year":2012},"citing_paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","snapshot_observed_at":"2026-08-12T16:39:50.021770Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T16:47:09.073686Z"},"links":{"citing_paper":"/paper/2411.13209"},"observation_digest":"sha256:7120eb6faac89f833106752e355d5708aa476174424363fe9ea6bf6d0e2be129","observation_id":"7fb85829-6862-4cb8-9218-679ab8d50885","resolution":{"observed_at":"2026-08-12T16:47:09.272448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.13209","last_updated":"2024-11-20T11:18:05Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-12T16:39:50.021770Z","submitted_at":"2024-11-20T11:18:05Z","title":"Comparative Analysis of Audio Feature Extraction for Real-Time Talking Portrait Synthesis"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":0,"verified_fuzzy":27},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 0 inbound Pith citation observations for arXiv:2411.13209."}