{"as_of":"2026-08-15T23:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4284abbe163a5324625734126d0b11413cc617a45137dc404e47184b53035c21","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":3,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":3,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T14:36:19.516344Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T20:51:14.556839Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.03706","last_updated":"2024-06-06T03:06:45Z","snapshot_observed_at":"2026-08-12T23:49:09.817469Z","submitted_at":"2024-06-06T03:06:45Z","title":"Improving Audio Codec-based Zero-Shot Text-to-Speech Synthesis with Multi-Modal Context and Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03706","snapshot_observed_at":"2026-08-10T14:36:19.516344Z","title":"Improving audio codec- based zero-shot text-to-speech synthesis with multi-modal context and large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.15177","last_updated":"2026-07-03T16:46:09Z","snapshot_observed_at":"2026-08-14T01:27:57.341623Z","submitted_at":"2025-01-25T11:15:06Z","title":"Audio-Language Models for Audio-Centric Tasks: A Systematic Survey","version":3},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-10T14:36:19.516344Z"},"links":{"cited_paper":"/paper/2406.03706","citing_paper":"/paper/2501.15177"},"observation_digest":"sha256:e1551365ad4893292390b465c47ebe7bd2a6e5514687ca05dcc3befb8c2d2f40","observation_id":"8c711961-8b0e-4533-a395-969bcc99c33e","resolution":{"observed_at":"2026-08-10T14:36:19.516344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03706","last_updated":"2024-06-06T03:06:45Z","snapshot_observed_at":"2026-08-12T23:49:09.817469Z","submitted_at":"2024-06-06T03:06:45Z","title":"Improving Audio Codec-based Zero-Shot Text-to-Speech Synthesis with Multi-Modal Context and Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03706","snapshot_observed_at":"2026-08-03T12:02:02.177500Z","title":"Im- proving audio codec-based zero-shot text-to-speech synthesis with multi-modal context and large lan- guage model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.06199","last_updated":"2026-06-01T03:39:22Z","snapshot_observed_at":"2026-08-15T17:09:58.548655Z","submitted_at":"2026-01-08T07:46:03Z","title":"FastSLM: Hierarchical Temporal Abstraction for Efficient Long-Form Speech Adaptation","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T12:02:02.177500Z"},"links":{"cited_paper":"/paper/2406.03706","citing_paper":"/paper/2601.06199"},"observation_digest":"sha256:47d9a67f1f8a20d808c653e5734dc01d268c94031dcfd96825c8650c09d91b52","observation_id":"03d36624-e966-4979-8ccd-4bb90c3a5453","resolution":{"observed_at":"2026-08-03T12:02:02.177500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03706","last_updated":"2024-06-06T03:06:45Z","snapshot_observed_at":"2026-08-12T23:49:09.817469Z","submitted_at":"2024-06-06T03:06:45Z","title":"Improving Audio Codec-based Zero-Shot Text-to-Speech Synthesis with Multi-Modal Context and Large Language Model","version":1},"cited_work":{"arxiv_id":"2406.03706","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.03706","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improving audio codec-based zero-shot text-to-speech synthesis with multi-modal context and large language model","venue":null,"work_id":"2ca44f92-c77f-434a-b954-7f88ea938d35","year":2024},"citing_paper":{"arxiv_id":"2604.24794","last_updated":"2026-04-25T23:17:26Z","snapshot_observed_at":"2026-08-11T08:43:29.054192Z","submitted_at":"2026-04-25T23:17:26Z","title":"V.O.I.C.E (Voice, Ownership, Identity, Control, Expression): Risk Taxonomy of Synthetic Voice Generation From Empirical Data","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-08T07:46:23.931059Z"},"links":{"cited_paper":"/paper/2406.03706","citing_paper":"/paper/2604.24794"},"observation_digest":"sha256:f81942a29b5293e6605ae7c196232e04abb23b83c959b14d9eb7bb6d44a71bdd","observation_id":"8088390c-92a5-4a6b-8160-de067ec4270f","resolution":{"observed_at":"2026-05-11T20:51:14.559658Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2406.03706/citation-record","integrity":"/paper/2406.03706/integrity","json":"/paper/2406.03706/citation-record.json","paper":"/paper/2406.03706"},"outbound":[],"paper":{"arxiv_id":"2406.03706","last_updated":"2024-06-06T03:06:45Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-12T23:49:09.817469Z","submitted_at":"2024-06-06T03:06:45Z","title":"Improving Audio Codec-based Zero-Shot Text-to-Speech Synthesis with Multi-Modal Context and Large Language Model"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 3 inbound Pith citation observations for arXiv:2406.03706."}