{"as_of":"2026-08-17T18:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fdab0a0be67266a85fa2e48b54bf9558e8022817f1275d5830ccd6b178ca3821","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T10:13:51.479518Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2504.18810/citation-record","integrity":"/paper/2504.18810/integrity","json":"/paper/2504.18810/citation-record.json","paper":"/paper/2504.18810"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:13:52.258499Z","title":null,"venue":null,"work_id":"16a4f14e-b220-4a96-828b-cc97e6564014","year":2016},"citing_paper":{"arxiv_id":"2504.18810","last_updated":"2025-04-26T05:45:38Z","snapshot_observed_at":"2026-08-17T16:38:56.352067Z","submitted_at":"2025-04-26T05:45:38Z","title":"Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:51.300579Z"},"links":{"citing_paper":"/paper/2504.18810"},"observation_digest":"sha256:dbbc78b39be2922935cc6530c4c8e19cef21df89c40fc6895a3fc029fdd16694","observation_id":"16df40c3-522a-4ceb-bf75-0c0fb6c68518","resolution":{"observed_at":"2026-08-16T10:13:52.261935Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:13:51.304868Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2504.18810","last_updated":"2025-04-26T05:45:38Z","snapshot_observed_at":"2026-08-17T16:38:56.352067Z","submitted_at":"2025-04-26T05:45:38Z","title":"Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:51.304868Z"},"links":{"citing_paper":"/paper/2504.18810"},"observation_digest":"sha256:7f0a06c7505d76fb9fc1a5596e3f18393ad5919f71ef074be1ebd41cb36e9962","observation_id":"45705385-f7d9-4667-9222-49259956271a","resolution":{"observed_at":"2026-08-16T10:13:51.304868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:13:52.241625Z","title":null,"venue":null,"work_id":"ef7987cf-7b97-49a4-a8c7-514b9908b760","year":2023},"citing_paper":{"arxiv_id":"2504.18810","last_updated":"2025-04-26T05:45:38Z","snapshot_observed_at":"2026-08-17T16:38:56.352067Z","submitted_at":"2025-04-26T05:45:38Z","title":"Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:51.308195Z"},"links":{"citing_paper":"/paper/2504.18810"},"observation_digest":"sha256:c28833794001745f6f9264a886e41fb06742f7a2606bf3006e82eaf11faa292f","observation_id":"67a747be-0268-44d6-b001-81d588414894","resolution":{"observed_at":"2026-08-16T10:13:52.245399Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:13:52.231123Z","title":null,"venue":null,"work_id":"e64d5ed8-4e88-4b7f-8ecb-9d8374b3a1fc","year":2024},"citing_paper":{"arxiv_id":"2504.18810","last_updated":"2025-04-26T05:45:38Z","snapshot_observed_at":"2026-08-17T16:38:56.352067Z","submitted_at":"2025-04-26T05:45:38Z","title":"Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:51.311588Z"},"links":{"citing_paper":"/paper/2504.18810"},"observation_digest":"sha256:4e30d36934ff841e595e0b9a9d5d24db6c73b3c2349b7f5b485ae3a043114423","observation_id":"8f3b15fb-dae4-48b2-aabd-3d268f4ceae7","resolution":{"observed_at":"2026-08-16T10:13:52.234554Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:13:51.315657Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.18810","last_updated":"2025-04-26T05:45:38Z","snapshot_observed_at":"2026-08-17T16:38:56.352067Z","submitted_at":"2025-04-26T05:45:38Z","title":"Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:51.315657Z"},"links":{"citing_paper":"/paper/2504.18810"},"observation_digest":"sha256:fcce044a4a781e75698252224a898115e491a87a6b22f90077d8f9e418417180","observation_id":"fabfd0ea-926e-49b8-b6e3-12ddfbbf091b","resolution":{"observed_at":"2026-08-16T10:13:51.315657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:13:52.214162Z","title":null,"venue":null,"work_id":"d4d1677f-074a-4730-8d76-e4baeacdc35b","year":2023},"citing_paper":{"arxiv_id":"2504.18810","last_updated":"2025-04-26T05:45:38Z","snapshot_observed_at":"2026-08-17T16:38:56.352067Z","submitted_at":"2025-04-26T05:45:38Z","title":"Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:51.319243Z"},"links":{"citing_paper":"/paper/2504.18810"},"observation_digest":"sha256:cd179fc19c5981779185cb13ea02589526d633fa8e046ab3143b628355776256","observation_id":"71805121-b836-438a-9d49-4d77bd75077c","resolution":{"observed_at":"2026-08-16T10:13:52.217654Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:13:52.203537Z","title":null,"venue":null,"work_id":"a7d89a13-4a92-4e04-adb4-d787205a4f59","year":2022},"citing_paper":{"arxiv_id":"2504.18810","last_updated":"2025-04-26T05:45:38Z","snapshot_observed_at":"2026-08-17T16:38:56.352067Z","submitted_at":"2025-04-26T05:45:38Z","title":"Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:51.322805Z"},"links":{"citing_paper":"/paper/2504.18810"},"observation_digest":"sha256:dfbf687a9fcc2f955a2b86cf73a91dc2fdc4499e240397ac6c2dcb65ced059a3","observation_id":"b402c793-348e-4688-bff9-1a6ad9bb6e13","resolution":{"observed_at":"2026-08-16T10:13:52.207155Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:13:52.192224Z","title":"dissimilar","venue":null,"work_id":"98ff9c25-15cf-4add-b018-79ad0f5e944d","year":2023},"citing_paper":{"arxiv_id":"2504.18810","last_updated":"2025-04-26T05:45:38Z","snapshot_observed_at":"2026-08-17T16:38:56.352067Z","submitted_at":"2025-04-26T05:45:38Z","title":"Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:51.326305Z"},"links":{"citing_paper":"/paper/2504.18810"},"observation_digest":"sha256:33096739af50285bdfd96ba93c9ac556ca9be52a658d6611d984da5fa76738f8","observation_id":"66589dbd-0f2f-407d-aff6-b07c877ee554","resolution":{"observed_at":"2026-08-16T10:13:52.196428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:13:51.329340Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.18810","last_updated":"2025-04-26T05:45:38Z","snapshot_observed_at":"2026-08-17T16:38:56.352067Z","submitted_at":"2025-04-26T05:45:38Z","title":"Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:51.329340Z"},"links":{"citing_paper":"/paper/2504.18810"},"observation_digest":"sha256:7a4c0a374f4c78b79373c5661bc975a6cee7e2c032de085c4fa12a45632810d8","observation_id":"a1a6f737-2f2c-42df-b41c-d6d1c6322574","resolution":{"observed_at":"2026-08-16T10:13:51.329340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:13:52.174196Z","title":null,"venue":null,"work_id":"6315d7c5-e916-433b-a9c5-45069e9573d0","year":2020},"citing_paper":{"arxiv_id":"2504.18810","last_updated":"2025-04-26T05:45:38Z","snapshot_observed_at":"2026-08-17T16:38:56.352067Z","submitted_at":"2025-04-26T05:45:38Z","title":"Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:51.332728Z"},"links":{"citing_paper":"/paper/2504.18810"},"observation_digest":"sha256:6c629349fbc85753e7120dfa58ec4698e70ca941b360616c4bb579355055bec7","observation_id":"9af30399-62cf-4e2e-9596-2f86876cbc75","resolution":{"observed_at":"2026-08-16T10:13:52.177655Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16357","last_updated":"2025-03-20T17:16:03Z","snapshot_observed_at":"2026-08-16T12:48:11.721315Z","submitted_at":"2025-03-20T17:16:03Z","title":"UniSync: A Unified Framework for Audio-Visual Synchronization","version":1},"cited_work":{"arxiv_id":"2503.16357","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.16357","snapshot_observed_at":"2026-08-16T10:13:51.738618Z","title":"UniSync: A Unified Framework for Audio-Visual Synchronization","venue":"cs.CV","work_id":"819ef0e3-8390-40bb-aeef-6a0f19750bb1","year":2025},"citing_paper":{"arxiv_id":"2504.18810","last_updated":"2025-04-26T05:45:38Z","snapshot_observed_at":"2026-08-17T16:38:56.352067Z","submitted_at":"2025-04-26T05:45:38Z","title":"Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:51.335679Z"},"links":{"cited_paper":"/paper/2503.16357","citing_paper":"/paper/2504.18810"},"observation_digest":"sha256:3cbf4b3d7ecead2c8c3fb8ae54a880241e99fc6b8b74e38da176a56c019a320f","observation_id":"53ab1532-00a0-4dc5-92a7-b6e09e64e46b","resolution":{"observed_at":"2026-08-16T10:13:51.743098Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16989","last_updated":"2025-03-21T09:55:31Z","snapshot_observed_at":"2026-08-16T12:48:01.053063Z","submitted_at":"2025-03-21T09:55:31Z","title":"STFTCodec: High-Fidelity Audio Compression through Time-Frequency Domain Representation","version":1},"cited_work":{"arxiv_id":"2503.16989","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.16989","snapshot_observed_at":"2026-08-16T10:13:51.721766Z","title":"STFTCodec: High-Fidelity Audio Compression through Time-Frequency Domain Representation","venue":"cs.SD","work_id":"f934f6e1-e4ce-4be8-b24c-0136574bd5d2","year":2025},"citing_paper":{"arxiv_id":"2504.18810","last_updated":"2025-04-26T05:45:38Z","snapshot_observed_at":"2026-08-17T16:38:56.352067Z","submitted_at":"2025-04-26T05:45:38Z","title":"Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:51.339246Z"},"links":{"cited_paper":"/paper/2503.16989","citing_paper":"/paper/2504.18810"},"observation_digest":"sha256:7e9922636bc5710e4ae0480f3b83237aac11550c838d12f685da82490efe2630","observation_id":"3ddeb315-2f1b-49d7-92c0-1e369f0b8277","resolution":{"observed_at":"2026-08-16T10:13:51.726946Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:13:51.342920Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.18810","last_updated":"2025-04-26T05:45:38Z","snapshot_observed_at":"2026-08-17T16:38:56.352067Z","submitted_at":"2025-04-26T05:45:38Z","title":"Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:51.342920Z"},"links":{"citing_paper":"/paper/2504.18810"},"observation_digest":"sha256:ba329a5664c3b4c450719dae8ac15afa2edc9dc3d99744f8d2774473783e24ea","observation_id":"91db16ca-4c0c-4d77-b5b1-3ec58f0aff1c","resolution":{"observed_at":"2026-08-16T10:13:51.342920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:13:51.349348Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.18810","last_updated":"2025-04-26T05:45:38Z","snapshot_observed_at":"2026-08-17T16:38:56.352067Z","submitted_at":"2025-04-26T05:45:38Z","title":"Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:51.349348Z"},"links":{"citing_paper":"/paper/2504.18810"},"observation_digest":"sha256:97dfe71270d00e42ccbeb78b79ad3e9277b49a6d2d884677f354000292dcd37a","observation_id":"340b4e47-26c4-4e55-b233-6f2c7c15e2ad","resolution":{"observed_at":"2026-08-16T10:13:51.349348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.06610","last_updated":"2021-08-04T23:30:03Z","snapshot_observed_at":"2026-08-16T19:13:46.311575Z","submitted_at":"2020-10-13T18:05:13Z","title":"Training independent subnetworks for robust prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.06610","snapshot_observed_at":"2026-08-16T10:13:51.355944Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.18810","last_updated":"2025-04-26T05:45:38Z","snapshot_observed_at":"2026-08-17T16:38:56.352067Z","submitted_at":"2025-04-26T05:45:38Z","title":"Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:51.355944Z"},"links":{"cited_paper":"/paper/2010.06610","citing_paper":"/paper/2504.18810"},"observation_digest":"sha256:271037116316ccff6c5d89c50a74f8739950fd150a8cc680c6e8d55e35c7bc80","observation_id":"6ac6c837-2ed1-48d2-b77a-db493db57ec3","resolution":{"observed_at":"2026-08-16T10:13:51.355944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:13:51.359420Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.18810","last_updated":"2025-04-26T05:45:38Z","snapshot_observed_at":"2026-08-17T16:38:56.352067Z","submitted_at":"2025-04-26T05:45:38Z","title":"Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:51.359420Z"},"links":{"citing_paper":"/paper/2504.18810"},"observation_digest":"sha256:d9812473d5ca71c7aa82b11edf4f82693f689bcc9d8f637a098ff3f57d53d438","observation_id":"a0051823-4792-4979-a8df-c79b299916a8","resolution":{"observed_at":"2026-08-16T10:13:51.359420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:13:51.362867Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.18810","last_updated":"2025-04-26T05:45:38Z","snapshot_observed_at":"2026-08-17T16:38:56.352067Z","submitted_at":"2025-04-26T05:45:38Z","title":"Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:51.362867Z"},"links":{"citing_paper":"/paper/2504.18810"},"observation_digest":"sha256:9cff2bb52c8d4f511ef60026e1763dbb5c5a25e38c763cf9165abdef737c4ee5","observation_id":"f5c6e227-38c8-451c-8f96-7b1673a8d6f3","resolution":{"observed_at":"2026-08-16T10:13:51.362867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:13:52.125194Z","title":null,"venue":null,"work_id":"1f2c644c-7c63-421a-8b78-d83868486445","year":2018},"citing_paper":{"arxiv_id":"2504.18810","last_updated":"2025-04-26T05:45:38Z","snapshot_observed_at":"2026-08-17T16:38:56.352067Z","submitted_at":"2025-04-26T05:45:38Z","title":"Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:51.366365Z"},"links":{"citing_paper":"/paper/2504.18810"},"observation_digest":"sha256:d9b8c72f700f5ec1719cf4fe8c07d1c005de76363f2d54847e533def961c8419","observation_id":"f5f20bf9-d1ed-486c-9e28-7f2986ac5c8c","resolution":{"observed_at":"2026-08-16T10:13:52.129145Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:13:52.115085Z","title":null,"venue":null,"work_id":"6686a798-5df4-4164-8565-3cf4719fffa2","year":2022},"citing_paper":{"arxiv_id":"2504.18810","last_updated":"2025-04-26T05:45:38Z","snapshot_observed_at":"2026-08-17T16:38:56.352067Z","submitted_at":"2025-04-26T05:45:38Z","title":"Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:51.369804Z"},"links":{"citing_paper":"/paper/2504.18810"},"observation_digest":"sha256:8081bd1a6bd64053a316f1c287e13741f06e83ef415d768bef1b0b64825b7f77","observation_id":"35265188-8b1f-4bb5-859e-56a6024d9ec6","resolution":{"observed_at":"2026-08-16T10:13:52.118542Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:13:52.104884Z","title":null,"venue":null,"work_id":"d8613e57-ca53-43eb-b58b-2f785d9bc07b","year":2021},"citing_paper":{"arxiv_id":"2504.18810","last_updated":"2025-04-26T05:45:38Z","snapshot_observed_at":"2026-08-17T16:38:56.352067Z","submitted_at":"2025-04-26T05:45:38Z","title":"Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:51.373112Z"},"links":{"citing_paper":"/paper/2504.18810"},"observation_digest":"sha256:4bbe920f94a817c6d93c3df3fae56e40964c4389ae4f592d28168c4ae8cd646e","observation_id":"bb3151b5-b541-49c6-a2b8-e15d695eaf51","resolution":{"observed_at":"2026-08-16T10:13:52.108326Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:13:52.093930Z","title":null,"venue":null,"work_id":"191371be-fefe-42b8-8d50-cf080d63131a","year":2023},"citing_paper":{"arxiv_id":"2504.18810","last_updated":"2025-04-26T05:45:38Z","snapshot_observed_at":"2026-08-17T16:38:56.352067Z","submitted_at":"2025-04-26T05:45:38Z","title":"Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:51.376275Z"},"links":{"citing_paper":"/paper/2504.18810"},"observation_digest":"sha256:204c46b072b70278bf277fc77aa2850fcefd55a1eb2088aecba0901dfae88752","observation_id":"00052c17-d9d8-498f-9064-f543c98df49d","resolution":{"observed_at":"2026-08-16T10:13:52.097338Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:13:52.083384Z","title":null,"venue":null,"work_id":"25479657-115c-463a-84ca-5cd163ef44fa","year":2017},"citing_paper":{"arxiv_id":"2504.18810","last_updated":"2025-04-26T05:45:38Z","snapshot_observed_at":"2026-08-17T16:38:56.352067Z","submitted_at":"2025-04-26T05:45:38Z","title":"Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:51.379419Z"},"links":{"citing_paper":"/paper/2504.18810"},"observation_digest":"sha256:eae2e749ec1126296e99426f2a7122c762d97d73465ec54033feac20237efde2","observation_id":"80955c73-bc9e-4952-a5c4-3b80b1178c52","resolution":{"observed_at":"2026-08-16T10:13:52.087061Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-14T18:51:16.666127Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-16T10:13:51.382510Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2504.18810","last_updated":"2025-04-26T05:45:38Z","snapshot_observed_at":"2026-08-17T16:38:56.352067Z","submitted_at":"2025-04-26T05:45:38Z","title":"Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:51.382510Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2504.18810"},"observation_digest":"sha256:473d8e71feff61c995eb92440c7cdefc4eed24f889d7e3a34e99033a029b3486","observation_id":"d489ed4f-8b9c-4f66-9692-bfb7ddd6d2ac","resolution":{"observed_at":"2026-08-16T10:13:51.382510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:13:51.385917Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.18810","last_updated":"2025-04-26T05:45:38Z","snapshot_observed_at":"2026-08-17T16:38:56.352067Z","submitted_at":"2025-04-26T05:45:38Z","title":"Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:51.385917Z"},"links":{"citing_paper":"/paper/2504.18810"},"observation_digest":"sha256:ae852e608457e4298e1ab9c0bae87b49fc45029ba793abd13cbc5041cd35edaa","observation_id":"d61bff9d-dad2-44ff-8513-b15ef16923e1","resolution":{"observed_at":"2026-08-16T10:13:51.385917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2210.09184","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:13:51.666980Z","title":null,"venue":null,"work_id":"89cfc7a8-4691-48a0-b45d-cecd39fa9cd6","year":2022},"citing_paper":{"arxiv_id":"2504.18810","last_updated":"2025-04-26T05:45:38Z","snapshot_observed_at":"2026-08-17T16:38:56.352067Z","submitted_at":"2025-04-26T05:45:38Z","title":"Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:51.389011Z"},"links":{"citing_paper":"/paper/2504.18810"},"observation_digest":"sha256:ac5d0557ad061e2138fd18024f227d1f133ccd3b3567f49108be68f4e9a4d8c1","observation_id":"3b42c149-22f2-4df5-8067-6f05c1f52485","resolution":{"observed_at":"2026-08-16T10:13:51.673584Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:13:52.064658Z","title":null,"venue":null,"work_id":"651befee-d4c7-4726-b761-357c15cc085c","year":2023},"citing_paper":{"arxiv_id":"2504.18810","last_updated":"2025-04-26T05:45:38Z","snapshot_observed_at":"2026-08-17T16:38:56.352067Z","submitted_at":"2025-04-26T05:45:38Z","title":"Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:51.392087Z"},"links":{"citing_paper":"/paper/2504.18810"},"observation_digest":"sha256:579f22ff853b8aa453376661e83ae82aecc89658b6f474e598973907113e1a63","observation_id":"9d60baf3-4e4e-4ce1-a926-a9bd2cdfa7c6","resolution":{"observed_at":"2026-08-16T10:13:52.068961Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:13:51.396288Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.18810","last_updated":"2025-04-26T05:45:38Z","snapshot_observed_at":"2026-08-17T16:38:56.352067Z","submitted_at":"2025-04-26T05:45:38Z","title":"Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:51.396288Z"},"links":{"citing_paper":"/paper/2504.18810"},"observation_digest":"sha256:56910afcfc4a25bc6dbd913449ea412d69f25248ba9241d024a16bd2ccebb44d","observation_id":"f0b263c7-7f01-4b0a-b8ab-586ba77145e7","resolution":{"observed_at":"2026-08-16T10:13:51.396288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:13:52.054671Z","title":null,"venue":null,"work_id":"d4291b5f-4332-460d-8f1e-172fd2f11279","year":2024},"citing_paper":{"arxiv_id":"2504.18810","last_updated":"2025-04-26T05:45:38Z","snapshot_observed_at":"2026-08-17T16:38:56.352067Z","submitted_at":"2025-04-26T05:45:38Z","title":"Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:51.399473Z"},"links":{"citing_paper":"/paper/2504.18810"},"observation_digest":"sha256:99b6423d73d504d95d9297380a711cf9d9c999969395ada7e31f63919b679900","observation_id":"109cdc67-2615-4edf-aba9-ac214cfacf9d","resolution":{"observed_at":"2026-08-16T10:13:52.057907Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.07116","last_updated":"2024-12-10T02:06:10Z","snapshot_observed_at":"2026-08-16T04:07:17.817596Z","submitted_at":"2024-12-10T02:06:10Z","title":"A Review of Human Emotion Synthesis Based on Generative Technology","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07116","snapshot_observed_at":"2026-08-16T10:13:51.402896Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18810","last_updated":"2025-04-26T05:45:38Z","snapshot_observed_at":"2026-08-17T16:38:56.352067Z","submitted_at":"2025-04-26T05:45:38Z","title":"Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:51.402896Z"},"links":{"cited_paper":"/paper/2412.07116","citing_paper":"/paper/2504.18810"},"observation_digest":"sha256:14aebec8611fd4d5e41df7b7f48bcf9c24b472ce143739d0465165327570559d","observation_id":"292b2625-5879-462d-8979-ace679d1e5a1","resolution":{"observed_at":"2026-08-16T10:13:51.402896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:13:52.044067Z","title":null,"venue":null,"work_id":"cda7cd50-7976-42a8-88dd-b2665a14522c","year":2024},"citing_paper":{"arxiv_id":"2504.18810","last_updated":"2025-04-26T05:45:38Z","snapshot_observed_at":"2026-08-17T16:38:56.352067Z","submitted_at":"2025-04-26T05:45:38Z","title":"Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:51.406275Z"},"links":{"citing_paper":"/paper/2504.18810"},"observation_digest":"sha256:b0ab12d5d277ca061b48c85f275d8557b3b122df7591cd89c76f8ee72fb2566b","observation_id":"4e3a4581-c58d-449c-9d24-7c658929b33a","resolution":{"observed_at":"2026-08-16T10:13:52.047402Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09767","last_updated":"2024-08-10T09:37:55Z","snapshot_observed_at":"2026-08-16T14:34:25.780879Z","submitted_at":"2023-12-15T13:15:42Z","title":"DreamTalk: When Emotional Talking Head Generation Meets Diffusion Probabilistic Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09767","snapshot_observed_at":"2026-08-16T10:13:51.409332Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18810","last_updated":"2025-04-26T05:45:38Z","snapshot_observed_at":"2026-08-17T16:38:56.352067Z","submitted_at":"2025-04-26T05:45:38Z","title":"Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:51.409332Z"},"links":{"cited_paper":"/paper/2312.09767","citing_paper":"/paper/2504.18810"},"observation_digest":"sha256:37b980a9120447e42dfe351810b314499418b6a58b783dcf7123f8172727f8d0","observation_id":"b536ef1a-c65d-4611-a939-d9188636237c","resolution":{"observed_at":"2026-08-16T10:13:51.409332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:13:52.033655Z","title":null,"venue":null,"work_id":"b6c9cf8d-7647-49b2-8b43-e5033ac7fcf6","year":1992},"citing_paper":{"arxiv_id":"2504.18810","last_updated":"2025-04-26T05:45:38Z","snapshot_observed_at":"2026-08-17T16:38:56.352067Z","submitted_at":"2025-04-26T05:45:38Z","title":"Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:51.412690Z"},"links":{"citing_paper":"/paper/2504.18810"},"observation_digest":"sha256:09215ad04e9e541ebdcaeb9a2291e86ee46dbe872b540d3c5e56758bc107bdbb","observation_id":"e2cce236-6e9c-416d-81d4-d8165f220c2b","resolution":{"observed_at":"2026-08-16T10:13:52.037295Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:13:51.912398Z","title":null,"venue":null,"work_id":"4c118b31-2754-48e6-aad1-07131ca9a8ba","year":2017},"citing_paper":{"arxiv_id":"2504.18810","last_updated":"2025-04-26T05:45:38Z","snapshot_observed_at":"2026-08-17T16:38:56.352067Z","submitted_at":"2025-04-26T05:45:38Z","title":"Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:51.415771Z"},"links":{"citing_paper":"/paper/2504.18810"},"observation_digest":"sha256:1b56e7765b741833d65281cd6c11d72de5d9464eb5ff3056909812ad11b32301","observation_id":"31c6a44b-662d-4150-8eaa-f274064c9459","resolution":{"observed_at":"2026-08-16T10:13:52.026214Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:13:51.418917Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.18810","last_updated":"2025-04-26T05:45:38Z","snapshot_observed_at":"2026-08-17T16:38:56.352067Z","submitted_at":"2025-04-26T05:45:38Z","title":"Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:51.418917Z"},"links":{"citing_paper":"/paper/2504.18810"},"observation_digest":"sha256:70fc46d283d3a6b8b82dd502b81e9507c3aba4593bfed49dfce897ea10f2f781","observation_id":"49e4702b-c452-47fd-b805-1f3a76f8d2d3","resolution":{"observed_at":"2026-08-16T10:13:51.418917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:13:51.422229Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.18810","last_updated":"2025-04-26T05:45:38Z","snapshot_observed_at":"2026-08-17T16:38:56.352067Z","submitted_at":"2025-04-26T05:45:38Z","title":"Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:51.422229Z"},"links":{"citing_paper":"/paper/2504.18810"},"observation_digest":"sha256:5d63b2a349ebd1a89ea8efe1d9aef7c37737e7a00e40092daf3ac2e3dae51ac9","observation_id":"d9252752-492a-429f-a1b7-dc3e4856730a","resolution":{"observed_at":"2026-08-16T10:13:51.422229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:13:51.886890Z","title":null,"venue":null,"work_id":"b32fc5f0-4c70-4179-849e-92d1ea1c8e3b","year":2024},"citing_paper":{"arxiv_id":"2504.18810","last_updated":"2025-04-26T05:45:38Z","snapshot_observed_at":"2026-08-17T16:38:56.352067Z","submitted_at":"2025-04-26T05:45:38Z","title":"Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:51.426150Z"},"links":{"citing_paper":"/paper/2504.18810"},"observation_digest":"sha256:24065eb942628ebb29fb8045c3d159d1e8caa88dd0a7f8c1e9eebbbbe8a7a3ac","observation_id":"46f4db27-e7af-46f9-8301-27e7541f62ac","resolution":{"observed_at":"2026-08-16T10:13:51.890241Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:13:51.876321Z","title":null,"venue":null,"work_id":"f045a0f5-c368-4d09-bee8-69e6f7b5d681","year":2020},"citing_paper":{"arxiv_id":"2504.18810","last_updated":"2025-04-26T05:45:38Z","snapshot_observed_at":"2026-08-17T16:38:56.352067Z","submitted_at":"2025-04-26T05:45:38Z","title":"Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:51.429787Z"},"links":{"citing_paper":"/paper/2504.18810"},"observation_digest":"sha256:1ab71377bf574d7ac39ec9f17fc2830135e7e60fe7cac05fb5f6b34ee3e7f95b","observation_id":"a3413a7f-a71a-4033-9fea-76f97ab190d4","resolution":{"observed_at":"2026-08-16T10:13:51.880188Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:13:51.433187Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.18810","last_updated":"2025-04-26T05:45:38Z","snapshot_observed_at":"2026-08-17T16:38:56.352067Z","submitted_at":"2025-04-26T05:45:38Z","title":"Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:51.433187Z"},"links":{"citing_paper":"/paper/2504.18810"},"observation_digest":"sha256:145a2bba8f87001f314afd5f66245b57621b8f52953eb63165dcf27e4beef124","observation_id":"dec2ef34-4f35-4a0f-8609-e3026bdbb34d","resolution":{"observed_at":"2026-08-16T10:13:51.433187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:13:51.847049Z","title":null,"venue":null,"work_id":"3c80fcb7-3c8f-4f43-b46a-8aff6a9f257b","year":2023},"citing_paper":{"arxiv_id":"2504.18810","last_updated":"2025-04-26T05:45:38Z","snapshot_observed_at":"2026-08-17T16:38:56.352067Z","submitted_at":"2025-04-26T05:45:38Z","title":"Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:51.439910Z"},"links":{"citing_paper":"/paper/2504.18810"},"observation_digest":"sha256:7372adb3117786003eb24fb58b3309d94683d551e6622f05eef71410905f6f84","observation_id":"b2cdbc24-7fb4-4774-a22d-cae0ddcb8283","resolution":{"observed_at":"2026-08-16T10:13:51.850702Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1556","last_updated":"2015-04-10T16:25:04Z","snapshot_observed_at":"2026-08-14T23:20:42.336514Z","submitted_at":"2014-09-04T19:48:04Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.1556","snapshot_observed_at":"2026-08-16T10:13:51.443063Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2504.18810","last_updated":"2025-04-26T05:45:38Z","snapshot_observed_at":"2026-08-17T16:38:56.352067Z","submitted_at":"2025-04-26T05:45:38Z","title":"Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:51.443063Z"},"links":{"cited_paper":"/paper/1409.1556","citing_paper":"/paper/2504.18810"},"observation_digest":"sha256:9436ecb4d30c97430299616d59e9aaefd249918a75fd920d0a2356ec18703ada","observation_id":"405b4be0-ddd6-4ae3-8dae-531aa94b061d","resolution":{"observed_at":"2026-08-16T10:13:51.443063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.12368","last_updated":"2022-11-22T16:03:11Z","snapshot_observed_at":"2026-08-17T16:38:11.327285Z","submitted_at":"2022-11-22T16:03:11Z","title":"Real-time Neural Radiance Talking Portrait Synthesis via Audio-spatial Decomposition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.12368","snapshot_observed_at":"2026-08-16T10:13:51.446358Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.18810","last_updated":"2025-04-26T05:45:38Z","snapshot_observed_at":"2026-08-17T16:38:56.352067Z","submitted_at":"2025-04-26T05:45:38Z","title":"Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:51.446358Z"},"links":{"cited_paper":"/paper/2211.12368","citing_paper":"/paper/2504.18810"},"observation_digest":"sha256:9d8134725cc9b859035db1c25c8dfd54a0d9aa99f049f960dfd4d30dbe08e475","observation_id":"2aa2d67b-9a45-4fee-bb23-121f824df879","resolution":{"observed_at":"2026-08-16T10:13:51.446358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17485","last_updated":"2024-08-08T03:48:38Z","snapshot_observed_at":"2026-08-16T14:14:55.263652Z","submitted_at":"2024-02-27T13:10:11Z","title":"EMO: Emote Portrait Alive -- Generating Expressive Portrait Videos with Audio2Video Diffusion Model under Weak Conditions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17485","snapshot_observed_at":"2026-08-16T10:13:51.449998Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18810","last_updated":"2025-04-26T05:45:38Z","snapshot_observed_at":"2026-08-17T16:38:56.352067Z","submitted_at":"2025-04-26T05:45:38Z","title":"Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:51.449998Z"},"links":{"cited_paper":"/paper/2402.17485","citing_paper":"/paper/2504.18810"},"observation_digest":"sha256:5e51abb178130434b0bd3f63e9093c94583defc6363617ac6c8ab51f04247312","observation_id":"a7e5dcf2-7c56-4899-91c6-f8a24cf31518","resolution":{"observed_at":"2026-08-16T10:13:51.449998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:13:51.836092Z","title":null,"venue":null,"work_id":"f59bffc9-10e4-4b65-ac20-dc301fcdbede","year":2023},"citing_paper":{"arxiv_id":"2504.18810","last_updated":"2025-04-26T05:45:38Z","snapshot_observed_at":"2026-08-17T16:38:56.352067Z","submitted_at":"2025-04-26T05:45:38Z","title":"Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:51.453503Z"},"links":{"citing_paper":"/paper/2504.18810"},"observation_digest":"sha256:af9fa3aa275a11b345cfb2366ebd8cb6255ca20d5366a62e267516b675a4d234","observation_id":"04b00413-e3ca-4162-91c8-815fbedfb8b5","resolution":{"observed_at":"2026-08-16T10:13:51.839919Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:13:51.825125Z","title":null,"venue":null,"work_id":"9a0de520-a705-444a-9452-4f9323d671b6","year":2020},"citing_paper":{"arxiv_id":"2504.18810","last_updated":"2025-04-26T05:45:38Z","snapshot_observed_at":"2026-08-17T16:38:56.352067Z","submitted_at":"2025-04-26T05:45:38Z","title":"Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:51.456689Z"},"links":{"citing_paper":"/paper/2504.18810"},"observation_digest":"sha256:075bab6dd6874a23c5253cc22821fe18ac2e7a46893d149db8136d9ee3de22d0","observation_id":"d2d18f25-c112-4056-9fe0-67b9dfcb28d4","resolution":{"observed_at":"2026-08-16T10:13:51.828541Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:13:51.814386Z","title":null,"venue":null,"work_id":"f7f42036-a032-4784-acdd-7e2ef548778c","year":2025},"citing_paper":{"arxiv_id":"2504.18810","last_updated":"2025-04-26T05:45:38Z","snapshot_observed_at":"2026-08-17T16:38:56.352067Z","submitted_at":"2025-04-26T05:45:38Z","title":"Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:51.459835Z"},"links":{"citing_paper":"/paper/2504.18810"},"observation_digest":"sha256:838e80b49a08e2605b4532c702ffffd789f646358ea72e0d983a93da64231eb7","observation_id":"eb605189-8c3c-4df9-a473-1660a2cd2fe6","resolution":{"observed_at":"2026-08-16T10:13:51.817819Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:13:51.463003Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.18810","last_updated":"2025-04-26T05:45:38Z","snapshot_observed_at":"2026-08-17T16:38:56.352067Z","submitted_at":"2025-04-26T05:45:38Z","title":"Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:51.463003Z"},"links":{"citing_paper":"/paper/2504.18810"},"observation_digest":"sha256:b5d429553815eb658fb905ab12f4b38278875bacf33b1b31486377a47130951d","observation_id":"36ba1735-845d-45bd-8552-0f676ea72dae","resolution":{"observed_at":"2026-08-16T10:13:51.463003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:13:51.783917Z","title":null,"venue":null,"work_id":"9e8499fc-b516-4c94-985d-ea0f509aa2ad","year":2023},"citing_paper":{"arxiv_id":"2504.18810","last_updated":"2025-04-26T05:45:38Z","snapshot_observed_at":"2026-08-17T16:38:56.352067Z","submitted_at":"2025-04-26T05:45:38Z","title":"Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:51.470000Z"},"links":{"citing_paper":"/paper/2504.18810"},"observation_digest":"sha256:85c74b95c76c3afa0ed6e003ba0216cb9db9ed510c7b8e88edb5b0a8ad58659d","observation_id":"54c7a176-7ee0-4fae-95a5-7917034cb3a0","resolution":{"observed_at":"2026-08-16T10:13:51.787566Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:13:51.772988Z","title":null,"venue":null,"work_id":"9a19306d-f0fe-488a-a01e-31c07e104ef8","year":2021},"citing_paper":{"arxiv_id":"2504.18810","last_updated":"2025-04-26T05:45:38Z","snapshot_observed_at":"2026-08-17T16:38:56.352067Z","submitted_at":"2025-04-26T05:45:38Z","title":"Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:51.473135Z"},"links":{"citing_paper":"/paper/2504.18810"},"observation_digest":"sha256:48a8c7bc4c569a8aeb51b3a7fe1d38d8a66d26f547314035e8649c5513f7dd4b","observation_id":"718e1367-41b9-465c-8600-b4738fb59dac","resolution":{"observed_at":"2026-08-16T10:13:51.776447Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:13:51.762149Z","title":null,"venue":null,"work_id":"82afd22c-fca2-41c4-bb2a-95984f4ef209","year":2023},"citing_paper":{"arxiv_id":"2504.18810","last_updated":"2025-04-26T05:45:38Z","snapshot_observed_at":"2026-08-17T16:38:56.352067Z","submitted_at":"2025-04-26T05:45:38Z","title":"Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:51.476592Z"},"links":{"citing_paper":"/paper/2504.18810"},"observation_digest":"sha256:191d28b4accb4cdd6aef323d5e09b99a22039543d98efa0e5ba69fb171bd7ef1","observation_id":"31501a68-d9b0-40d7-b2ad-e6573b7663cf","resolution":{"observed_at":"2026-08-16T10:13:51.765642Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:13:51.750946Z","title":null,"venue":null,"work_id":"acfcbac4-329d-4b97-bf2d-a3761d753728","year":2022},"citing_paper":{"arxiv_id":"2504.18810","last_updated":"2025-04-26T05:45:38Z","snapshot_observed_at":"2026-08-17T16:38:56.352067Z","submitted_at":"2025-04-26T05:45:38Z","title":"Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:51.479518Z"},"links":{"citing_paper":"/paper/2504.18810"},"observation_digest":"sha256:2c48a95cfca4cd31bab53717f3051a497efce4ba0eb06a894608727c5975f5ab","observation_id":"83239bbb-fca3-4ba1-b881-630a65f4a9d1","resolution":{"observed_at":"2026-08-16T10:13:51.754827Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.5567","last_updated":"2014-12-19T21:36:13Z","snapshot_observed_at":"2026-08-14T23:07:07.038301Z","submitted_at":"2014-12-17T20:39:45Z","title":"Deep Speech: Scaling up end-to-end speech recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.5567","snapshot_observed_at":"2026-08-16T10:13:51.352550Z","title":"arXiv preprint arXiv:1412.5567 (2014)","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2504.18810","last_updated":"2025-04-26T05:45:38Z","snapshot_observed_at":"2026-08-17T16:38:56.352067Z","submitted_at":"2025-04-26T05:45:38Z","title":"Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:51.352550Z"},"links":{"cited_paper":"/paper/1412.5567","citing_paper":"/paper/2504.18810"},"observation_digest":"sha256:bd7132b31bd668ff1c8f0a66e9e9d23ca55f1518ca2b211e84de360dc3bf2e5b","observation_id":"c00f0a30-35c8-4ca0-9321-0e264a4f9712","resolution":{"observed_at":"2026-08-16T10:13:51.352550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:13:51.795859Z","title":"In Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"3f610ea9-6f07-4392-9200-e64ca6af2dc7","year":2025},"citing_paper":{"arxiv_id":"2504.18810","last_updated":"2025-04-26T05:45:38Z","snapshot_observed_at":"2026-08-17T16:38:56.352067Z","submitted_at":"2025-04-26T05:45:38Z","title":"Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:51.466510Z"},"links":{"citing_paper":"/paper/2504.18810"},"observation_digest":"sha256:92793ec4af039cf0258d42a9f32df412aebcc782785b9b8d489a68f44e2530ee","observation_id":"481776d9-c8db-40c9-90be-dc43fca57295","resolution":{"observed_at":"2026-08-16T10:13:51.799784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:13:51.857945Z","title":"In Proceedings of the 28th ACM International Conference on Multimedia","venue":null,"work_id":"9b9cf1ff-849e-44de-a01d-3da6e5d2e7b7","year":null},"citing_paper":{"arxiv_id":"2504.18810","last_updated":"2025-04-26T05:45:38Z","snapshot_observed_at":"2026-08-17T16:38:56.352067Z","submitted_at":"2025-04-26T05:45:38Z","title":"Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:51.436663Z"},"links":{"citing_paper":"/paper/2504.18810"},"observation_digest":"sha256:19b927e0a0ea63a1d87df1a8153f3930316880c4b5df8d765d703b23b67854ce","observation_id":"c453ccd9-48a2-458a-abf8-6815a3634170","resolution":{"observed_at":"2026-08-16T10:13:51.861699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:13:52.155337Z","title":"In Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":"03dddf85-7b67-45e9-991e-bb20dc0af855","year":null},"citing_paper":{"arxiv_id":"2504.18810","last_updated":"2025-04-26T05:45:38Z","snapshot_observed_at":"2026-08-17T16:38:56.352067Z","submitted_at":"2025-04-26T05:45:38Z","title":"Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-16T10:13:51.346103Z"},"links":{"citing_paper":"/paper/2504.18810"},"observation_digest":"sha256:27ce430e5ecaac426c0dd433da0c132f866d20338412ee0c4f31b6a1b9eb4356","observation_id":"87cd657d-9f4b-487e-ba10-784653c52333","resolution":{"observed_at":"2026-08-16T10:13:52.159068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.18810","last_updated":"2025-04-26T05:45:38Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T16:38:56.352067Z","submitted_at":"2025-04-26T05:45:38Z","title":"Audio-Driven Talking Face Video Generation with Joint Uncertainty Learning"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":47,"verified_exact":3,"verified_fuzzy":4},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 0 inbound Pith citation observations for arXiv:2504.18810."}