{"as_of":"2026-08-10T22:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:85fc3e29d0a8d9f16cf19a6a69bf2130292492eb48fce872d127f208a73de320","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":4,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":4,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T16:50:43.735052Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T08:03:13.799275Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.05844","last_updated":"2024-12-28T12:31:01Z","snapshot_observed_at":"2026-07-06T16:45:32.248661Z","submitted_at":"2023-09-25T13:46:00Z","title":"Face-StyleSpeech: Enhancing Zero-shot Speech Synthesis from Face Images with Improved Face-to-Speech Mapping","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05844","snapshot_observed_at":"2026-08-09T16:50:43.735052Z","title":"Face-stylespeech: Improved face-to-voice latent mapping for natural zero-shot speech synthesis from a face image","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01046","last_updated":"2025-02-03T04:48:50Z","snapshot_observed_at":"2026-08-10T13:41:00.834317Z","submitted_at":"2025-02-03T04:48:50Z","title":"Emotional Face-to-Speech","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-09T16:50:43.735052Z"},"links":{"cited_paper":"/paper/2311.05844","citing_paper":"/paper/2502.01046"},"observation_digest":"sha256:244f633fe553c7e37ef2cef92f390ce2dcbf14a9f6996a5566946f214c70b8e3","observation_id":"e6f77063-e505-4adc-bede-bbd5ddb52ac3","resolution":{"observed_at":"2026-08-09T16:50:43.735052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05844","last_updated":"2024-12-28T12:31:01Z","snapshot_observed_at":"2026-07-06T16:45:32.248661Z","submitted_at":"2023-09-25T13:46:00Z","title":"Face-StyleSpeech: Enhancing Zero-shot Speech Synthesis from Face Images with Improved Face-to-Speech Mapping","version":2},"cited_work":{"arxiv_id":"2311.05844","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.05844","snapshot_observed_at":"2026-06-29T08:03:13.799275Z","title":"Face- StyleSpeech: Improved face-to-voice latent mapping for nat- ural zero-shot speech synthesis from a face image.arXiv preprint:2311.05844","venue":null,"work_id":"6105bb41-a585-4aa5-912f-db3c6447b9b5","year":2023},"citing_paper":{"arxiv_id":"2604.15923","last_updated":"2026-04-17T10:28:21Z","snapshot_observed_at":"2026-07-06T23:03:21.422544Z","submitted_at":"2026-04-17T10:28:21Z","title":"Hierarchical Codec Diffusion for Video-to-Speech Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T08:12:01.260833Z"},"links":{"cited_paper":"/paper/2311.05844","citing_paper":"/paper/2604.15923"},"observation_digest":"sha256:312c6ce1f97f44eb94502536a29c43a008d09fc3e997515bffdd0f8b43d630ec","observation_id":"2a049e5f-6024-4dd4-bd81-5397f65638c4","resolution":{"observed_at":"2026-05-10T08:12:26.280862Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05844","last_updated":"2024-12-28T12:31:01Z","snapshot_observed_at":"2026-07-06T16:45:32.248661Z","submitted_at":"2023-09-25T13:46:00Z","title":"Face-StyleSpeech: Enhancing Zero-shot Speech Synthesis from Face Images with Improved Face-to-Speech Mapping","version":2},"cited_work":{"arxiv_id":"2311.05844","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.05844","snapshot_observed_at":"2026-06-29T08:03:13.799275Z","title":"Face- StyleSpeech: Improved face-to-voice latent mapping for nat- ural zero-shot speech synthesis from a face image.arXiv preprint:2311.05844","venue":null,"work_id":"6105bb41-a585-4aa5-912f-db3c6447b9b5","year":2023},"citing_paper":{"arxiv_id":"2605.30311","last_updated":"2026-05-28T17:53:27Z","snapshot_observed_at":"2026-07-06T23:39:38.845840Z","submitted_at":"2026-05-28T17:53:27Z","title":"Archon: A Unified Multimodal Model for Holistic Digital Human Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-29T08:03:04.294439Z"},"links":{"cited_paper":"/paper/2311.05844","citing_paper":"/paper/2605.30311"},"observation_digest":"sha256:7127b58a8d540949692daf999674c9208372254bd332ff1a1d879d88cb72a53a","observation_id":"5f749fed-affe-415a-b68e-ac1693998c52","resolution":{"observed_at":"2026-06-29T08:03:13.802213Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05844","last_updated":"2024-12-28T12:31:01Z","snapshot_observed_at":"2026-07-06T16:45:32.248661Z","submitted_at":"2023-09-25T13:46:00Z","title":"Face-StyleSpeech: Enhancing Zero-shot Speech Synthesis from Face Images with Improved Face-to-Speech Mapping","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05844","snapshot_observed_at":"2026-07-30T22:26:14.487391Z","title":"Face-StyleSpeech: Enhancing zero-shot speech synthesis from face images with improved face- to-speech mapping,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26742","last_updated":"2026-07-29T10:33:56Z","snapshot_observed_at":"2026-08-08T02:45:02.694487Z","submitted_at":"2026-07-29T10:33:56Z","title":"Zero-Shot Face-to-Speech Synthesis via Latent Space Adaptation of a Style-Diffusion TTS Model","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-30T22:26:14.487391Z"},"links":{"cited_paper":"/paper/2311.05844","citing_paper":"/paper/2607.26742"},"observation_digest":"sha256:3c8cadee888cf76a4d474c92e6bf4e282d9758272bb04bfa9609a0df70be80bd","observation_id":"45865aae-bcaa-474c-9591-061f402bae24","resolution":{"observed_at":"2026-07-30T22:26:14.487391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2311.05844/citation-record","integrity":"/paper/2311.05844/integrity","json":"/paper/2311.05844/citation-record.json","paper":"/paper/2311.05844"},"outbound":[],"paper":{"arxiv_id":"2311.05844","last_updated":"2024-12-28T12:31:01Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T16:45:32.248661Z","submitted_at":"2023-09-25T13:46:00Z","title":"Face-StyleSpeech: Enhancing Zero-shot Speech Synthesis from Face Images with Improved Face-to-Speech Mapping"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 4 inbound Pith citation observations for arXiv:2311.05844."}