{"as_of":"2026-08-08T09:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:34fc3e58219e5734cd58750bd4be3085d539f9833617e72f8d73924ca293bced","coverage":[{"denominator":18,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:16:32.475093Z","state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.02997/citation-record","integrity":"/paper/2506.02997/integrity","json":"/paper/2506.02997/citation-record.json","paper":"/paper/2506.02997"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:16:34.352915Z","title":"Prompttts: Controllable text-to-speech with text descriptions,","venue":null,"work_id":"6042df41-dee1-4943-81bb-8d1f416e280b","year":2023},"citing_paper":{"arxiv_id":"2506.02997","last_updated":"2025-06-03T15:31:16Z","snapshot_observed_at":"2026-08-07T11:08:47.051366Z","submitted_at":"2025-06-03T15:31:16Z","title":"Controllable Text-to-Speech Synthesis with Masked-Autoencoded Style-Rich Representation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:31.033516Z"},"links":{"citing_paper":"/paper/2506.02997"},"observation_digest":"sha256:7ec90152bf991f3ce5822e351d6acf456a63fa24d6ce81d5e97eec2f71580791","observation_id":"98ee0846-7ee5-4696-a363-c8518914cb4d","resolution":{"observed_at":"2026-08-07T11:16:34.432358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02285","last_updated":"2023-10-12T03:05:36Z","snapshot_observed_at":"2026-08-01T15:11:32.829718Z","submitted_at":"2023-09-05T14:45:27Z","title":"PromptTTS 2: Describing and Generating Voices with Text Prompt","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02285","snapshot_observed_at":"2026-08-07T11:16:31.114971Z","title":"Prompttts 2: Describing and generating voices with text prompt,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02997","last_updated":"2025-06-03T15:31:16Z","snapshot_observed_at":"2026-08-07T11:08:47.051366Z","submitted_at":"2025-06-03T15:31:16Z","title":"Controllable Text-to-Speech Synthesis with Masked-Autoencoded Style-Rich Representation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:31.114971Z"},"links":{"cited_paper":"/paper/2309.02285","citing_paper":"/paper/2506.02997"},"observation_digest":"sha256:72048a46af74303e54f44b8e9118509f63415082a4c06117ecfb3d5fad76ea8a","observation_id":"43e8d4ab-718e-47cb-bf3e-fabe5fd92d5d","resolution":{"observed_at":"2026-08-07T11:16:31.114971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:16:34.168918Z","title":"Textrolspeech: A text style control speech corpus with codec language text-to-speech models,","venue":null,"work_id":"505ce205-4d2d-48ad-8a4d-278eec5c2940","year":2024},"citing_paper":{"arxiv_id":"2506.02997","last_updated":"2025-06-03T15:31:16Z","snapshot_observed_at":"2026-08-07T11:08:47.051366Z","submitted_at":"2025-06-03T15:31:16Z","title":"Controllable Text-to-Speech Synthesis with Masked-Autoencoded Style-Rich Representation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:31.233871Z"},"links":{"citing_paper":"/paper/2506.02997"},"observation_digest":"sha256:50b1db62ef560a6ebe47a3ee0d02e9ec356611f8cbbb73fdfd832bcd2e457fbe","observation_id":"01f03004-b063-4a86-81c5-1c4eb5d14d2c","resolution":{"observed_at":"2026-08-07T11:16:34.257590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:16:33.964625Z","title":"Instructtts: Modelling expressive tts in discrete latent space with natural language style prompt,","venue":null,"work_id":"249a3cd3-8b97-4944-ae12-a7092e161a55","year":2024},"citing_paper":{"arxiv_id":"2506.02997","last_updated":"2025-06-03T15:31:16Z","snapshot_observed_at":"2026-08-07T11:08:47.051366Z","submitted_at":"2025-06-03T15:31:16Z","title":"Controllable Text-to-Speech Synthesis with Masked-Autoencoded Style-Rich Representation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:31.305771Z"},"links":{"citing_paper":"/paper/2506.02997"},"observation_digest":"sha256:59e3e68526b2973130daca2db5c3a0003ae3e16868053cb3e4ccb40505f43131","observation_id":"9d2bd77f-ec90-4f34-8bdb-9bbeb17e9ad7","resolution":{"observed_at":"2026-08-07T11:16:34.065052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15676","last_updated":"2024-08-28T09:57:17Z","snapshot_observed_at":"2026-07-06T19:07:03.089243Z","submitted_at":"2024-08-28T09:57:17Z","title":"VoxInstruct: Expressive Human Instruction-to-Speech Generation with Unified Multilingual Codec Language Modelling","version":1},"cited_work":{"arxiv_id":"2408.15676","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.15676","snapshot_observed_at":"2026-08-07T11:16:32.858872Z","title":"VoxInstruct: Expressive Human Instruction-to-Speech Generation with Unified Multilingual Codec Language Modelling","venue":"cs.SD","work_id":"39f66466-678b-41a1-95f7-71b85a625c61","year":2024},"citing_paper":{"arxiv_id":"2506.02997","last_updated":"2025-06-03T15:31:16Z","snapshot_observed_at":"2026-08-07T11:08:47.051366Z","submitted_at":"2025-06-03T15:31:16Z","title":"Controllable Text-to-Speech Synthesis with Masked-Autoencoded Style-Rich Representation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:31.421450Z"},"links":{"cited_paper":"/paper/2408.15676","citing_paper":"/paper/2506.02997"},"observation_digest":"sha256:2b9f76d61fad1da0dec2faa8d5e8eb94b4cbf22501a758f7111019bfc3d23974","observation_id":"4274f1ba-67a4-4902-ae9d-8cb9510965e3","resolution":{"observed_at":"2026-08-07T11:16:32.936942Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:16:33.753934Z","title":"Prosody-tts: Improving prosody with masked autoencoder and conditional diffusion model for expressive text-to-speech,","venue":null,"work_id":"59b9cc20-e2d8-48de-83a5-69888b052a39","year":2023},"citing_paper":{"arxiv_id":"2506.02997","last_updated":"2025-06-03T15:31:16Z","snapshot_observed_at":"2026-08-07T11:08:47.051366Z","submitted_at":"2025-06-03T15:31:16Z","title":"Controllable Text-to-Speech Synthesis with Masked-Autoencoded Style-Rich Representation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:31.520970Z"},"links":{"citing_paper":"/paper/2506.02997"},"observation_digest":"sha256:2583590c594ae0b4bbee63c2bb5f8666e9163e1978ee14cb9f15c516c5569cea","observation_id":"36e3e659-0c81-48b7-8ddc-5fbf05c4dd55","resolution":{"observed_at":"2026-08-07T11:16:33.848661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:16:33.513756Z","title":"Uniaudio: Towards universal audio generation with large language models,","venue":null,"work_id":"95a1340b-5716-478d-851a-11281f05b287","year":null},"citing_paper":{"arxiv_id":"2506.02997","last_updated":"2025-06-03T15:31:16Z","snapshot_observed_at":"2026-08-07T11:08:47.051366Z","submitted_at":"2025-06-03T15:31:16Z","title":"Controllable Text-to-Speech Synthesis with Masked-Autoencoded Style-Rich Representation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:31.600517Z"},"links":{"citing_paper":"/paper/2506.02997"},"observation_digest":"sha256:8a66241a8073525ad431bf53d04384c46108a87a3a8e4163f86add4b7f4a65bf","observation_id":"7fc73b80-3143-46a8-8b40-71a6b50a205b","resolution":{"observed_at":"2026-08-07T11:16:33.625603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:16:31.676312Z","title":"Classifier-free diffusion guidance,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02997","last_updated":"2025-06-03T15:31:16Z","snapshot_observed_at":"2026-08-07T11:08:47.051366Z","submitted_at":"2025-06-03T15:31:16Z","title":"Controllable Text-to-Speech Synthesis with Masked-Autoencoded Style-Rich Representation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:31.676312Z"},"links":{"citing_paper":"/paper/2506.02997"},"observation_digest":"sha256:c5eed77fac7a690024cc626af58c6521d272ce9a637e0c7aa43ef5a0ada8d58f","observation_id":"71595cf2-7d84-4261-bb37-a801c98d8cf4","resolution":{"observed_at":"2026-08-07T11:16:31.676312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-07T15:49:16.814852Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-07T11:16:31.762687Z","title":"Gigaspeech: An evolving, multi- domain asr corpus with 10,000 hours of transcribed audio,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02997","last_updated":"2025-06-03T15:31:16Z","snapshot_observed_at":"2026-08-07T11:08:47.051366Z","submitted_at":"2025-06-03T15:31:16Z","title":"Controllable Text-to-Speech Synthesis with Masked-Autoencoded Style-Rich Representation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:31.762687Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2506.02997"},"observation_digest":"sha256:e50e962d34ebc43c3aaf9495c96647f2f7261c047d9ef3f0a4477fac8d4f1c53","observation_id":"2c4cdf49-992a-4d22-a6ff-09981ad38bb5","resolution":{"observed_at":"2026-08-07T11:16:31.762687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:16:31.849446Z","title":"Librispeech: an asr corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.02997","last_updated":"2025-06-03T15:31:16Z","snapshot_observed_at":"2026-08-07T11:08:47.051366Z","submitted_at":"2025-06-03T15:31:16Z","title":"Controllable Text-to-Speech Synthesis with Masked-Autoencoded Style-Rich Representation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:31.849446Z"},"links":{"citing_paper":"/paper/2506.02997"},"observation_digest":"sha256:e0687fc57fe4e3ff9c6e0123132fa8378bd8f9b6bc54e592935b730d87257810","observation_id":"827789aa-6c87-4b25-b9ce-1b1bc304e76f","resolution":{"observed_at":"2026-08-07T11:16:31.849446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.02882","last_updated":"2019-04-05T06:05:00Z","snapshot_observed_at":"2026-08-07T13:32:24.356336Z","submitted_at":"2019-04-05T06:05:00Z","title":"LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.02882","snapshot_observed_at":"2026-08-07T11:16:31.921256Z","title":"Libritts: A corpus derived from librispeech for text-to-speech,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2506.02997","last_updated":"2025-06-03T15:31:16Z","snapshot_observed_at":"2026-08-07T11:08:47.051366Z","submitted_at":"2025-06-03T15:31:16Z","title":"Controllable Text-to-Speech Synthesis with Masked-Autoencoded Style-Rich Representation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:31.921256Z"},"links":{"cited_paper":"/paper/1904.02882","citing_paper":"/paper/2506.02997"},"observation_digest":"sha256:8953dce6985b6192526c2118724661452712475ba1c04b5285ac85c31b152587","observation_id":"fb796082-112f-4c2d-b715-ee251fdd9099","resolution":{"observed_at":"2026-08-07T11:16:31.921256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:16:33.321766Z","title":"Dailytalk: Spoken dialogue dataset for conversational text-to-speech,","venue":null,"work_id":"fa428d1c-5420-47d0-bed2-24dc9faab777","year":2023},"citing_paper":{"arxiv_id":"2506.02997","last_updated":"2025-06-03T15:31:16Z","snapshot_observed_at":"2026-08-07T11:08:47.051366Z","submitted_at":"2025-06-03T15:31:16Z","title":"Controllable Text-to-Speech Synthesis with Masked-Autoencoded Style-Rich Representation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:31.993650Z"},"links":{"citing_paper":"/paper/2506.02997"},"observation_digest":"sha256:03015447a58b352438468ab6be060ba48e0d29d07d4714b50b6bae2692b5db69","observation_id":"6af88a1a-5f9a-498a-b07e-3a8ffabb8bc3","resolution":{"observed_at":"2026-08-07T11:16:33.382842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02152","last_updated":"2022-06-29T13:42:05Z","snapshot_observed_at":"2026-08-04T06:18:23.412967Z","submitted_at":"2022-04-05T12:23:51Z","title":"UTMOS: UTokyo-SaruLab System for VoiceMOS Challenge 2022","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02152","snapshot_observed_at":"2026-08-07T11:16:32.057240Z","title":"Utmos: Utokyo-sarulab system for voicemos challenge 2022,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02997","last_updated":"2025-06-03T15:31:16Z","snapshot_observed_at":"2026-08-07T11:08:47.051366Z","submitted_at":"2025-06-03T15:31:16Z","title":"Controllable Text-to-Speech Synthesis with Masked-Autoencoded Style-Rich Representation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:32.057240Z"},"links":{"cited_paper":"/paper/2204.02152","citing_paper":"/paper/2506.02997"},"observation_digest":"sha256:2227dca12f9b831d17cff05cf8fb3486848efae31cab8fefda663334ec0b68ae","observation_id":"f3069eef-0cf1-4c51-be97-96203ce4197e","resolution":{"observed_at":"2026-08-07T11:16:32.057240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-07T11:16:32.166827Z","title":"Robust speech recognition via large-scale weak super- vision. arxiv 2022,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02997","last_updated":"2025-06-03T15:31:16Z","snapshot_observed_at":"2026-08-07T11:08:47.051366Z","submitted_at":"2025-06-03T15:31:16Z","title":"Controllable Text-to-Speech Synthesis with Masked-Autoencoded Style-Rich Representation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:32.166827Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2506.02997"},"observation_digest":"sha256:e8aa32f42c4f3943b60e556812ef179b2d8e3c93bf110ea19f60944362fb5c70","observation_id":"c89fd632-0615-417d-824b-23b60a90d21b","resolution":{"observed_at":"2026-08-07T11:16:32.166827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-03T16:47:47.192907Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-07T11:16:32.279195Z","title":"High fidelity neural audio compression,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02997","last_updated":"2025-06-03T15:31:16Z","snapshot_observed_at":"2026-08-07T11:08:47.051366Z","submitted_at":"2025-06-03T15:31:16Z","title":"Controllable Text-to-Speech Synthesis with Masked-Autoencoded Style-Rich Representation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:32.279195Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2506.02997"},"observation_digest":"sha256:a1eb64cb9ace58652f67b60b4a8c2668ea276d18b3c1638d819be0312eeda673","observation_id":"1d45114f-5714-4f3e-a082-87767117d8d6","resolution":{"observed_at":"2026-08-07T11:16:32.279195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:16:33.103890Z","title":"Yourtts: Towards zero-shot multi-speaker tts and zero-shot voice conversion for everyone,","venue":null,"work_id":"1fc373de-fba4-4ab0-ba0b-d163dcc3082c","year":2022},"citing_paper":{"arxiv_id":"2506.02997","last_updated":"2025-06-03T15:31:16Z","snapshot_observed_at":"2026-08-07T11:08:47.051366Z","submitted_at":"2025-06-03T15:31:16Z","title":"Controllable Text-to-Speech Synthesis with Masked-Autoencoded Style-Rich Representation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:32.337391Z"},"links":{"citing_paper":"/paper/2506.02997"},"observation_digest":"sha256:610f48a03def2f1ee5eb27e2d60b6a4d88e7a719e98864d8481a21a9f8255e17","observation_id":"27a2671c-87a4-4c6d-a93e-23daa4105847","resolution":{"observed_at":"2026-08-07T11:16:33.190288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-06T13:29:11.244845Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-08-07T11:16:32.422722Z","title":"Xtts: a massively multilin- gual zero-shot text-to-speech model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02997","last_updated":"2025-06-03T15:31:16Z","snapshot_observed_at":"2026-08-07T11:08:47.051366Z","submitted_at":"2025-06-03T15:31:16Z","title":"Controllable Text-to-Speech Synthesis with Masked-Autoencoded Style-Rich Representation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:32.422722Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2506.02997"},"observation_digest":"sha256:e33af9649e9ec0909d0945eb382a633ba97654f12102055f27761aec5cb8e9bb","observation_id":"975c135b-5556-4155-bad1-0e7301bc06e9","resolution":{"observed_at":"2026-08-07T11:16:32.422722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:16:32.475093Z","title":"Wespeaker: A research and production oriented speaker embedding learning toolkit,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02997","last_updated":"2025-06-03T15:31:16Z","snapshot_observed_at":"2026-08-07T11:08:47.051366Z","submitted_at":"2025-06-03T15:31:16Z","title":"Controllable Text-to-Speech Synthesis with Masked-Autoencoded Style-Rich Representation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:16:32.475093Z"},"links":{"citing_paper":"/paper/2506.02997"},"observation_digest":"sha256:44afa2babb46a3de0dc89f3b58b3880bcc7559509d223cd705ceb99f6a5badd8","observation_id":"b4d329d4-8d54-4a05-b4da-311e7867885a","resolution":{"observed_at":"2026-08-07T11:16:32.475093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.02997","last_updated":"2025-06-03T15:31:16Z","latest_version":1,"primary_category":"cs.MM","snapshot_observed_at":"2026-08-07T11:08:47.051366Z","submitted_at":"2025-06-03T15:31:16Z","title":"Controllable Text-to-Speech Synthesis with Masked-Autoencoded Style-Rich Representation"},"reference_resolution":{"displayed":18,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":1,"verified_fuzzy":7},"total_outbound_references":18},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 18 of 18 outbound references and 0 inbound Pith citation observations for arXiv:2506.02997."}