{"as_of":"2026-08-07T16:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:67b286457b83bd5ac3a376ad980e0ea112760e62d667fb9b7936b6aee59441ea","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T20:04:51.686582Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T10:28:18.202974Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-10T12:15:01.137692Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-07T04:02:54.878172Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"cited_work":{"arxiv_id":"2508.11326","doi":"10.48550/arxiv.2508.11326","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.11326","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Moe-tts: Enhancing out-of-domain text understanding for description-based TTS via mixture-of-experts,","venue":null,"work_id":"7069e87a-9607-4df6-b66e-fcf2c140fba0","year":2025},"citing_paper":{"arxiv_id":"2605.28063","last_updated":"2026-05-27T07:15:35Z","snapshot_observed_at":"2026-08-06T20:35:40.532245Z","submitted_at":"2026-05-27T07:15:35Z","title":"Unified Synthesis of Compositional Speech and Sound from Free-Form Text Prompts","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T10:28:18.202974Z"},"links":{"cited_paper":"/paper/2508.11326","citing_paper":"/paper/2605.28063"},"observation_digest":"sha256:6f1e8d8c717ded4e5e0be1122a322683b77f1a061e767d31627bbde4c08b54a8","observation_id":"5c51c5e4-1523-44d3-a286-74cf8ac7a6d0","resolution":{"observed_at":"2026-06-29T10:33:17.871334Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.11326/citation-record","integrity":"/paper/2508.11326/integrity","json":"/paper/2508.11326/citation-record.json","paper":"/paper/2508.11326"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:04:55.689013Z","title":"URL https://elevenlabs.io/","venue":null,"work_id":"637c59cf-05b0-4b59-9fae-2df34837c1bf","year":null},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-07T04:02:54.878172Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:47.469156Z"},"links":{"citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:5dfb4a477103e272d80660cf6181106a13e93ffececedf4a9ba8dadf4650a5f9","observation_id":"9738eb00-04f2-48bf-92c0-b27cd17b3e05","resolution":{"observed_at":"2026-08-05T20:04:55.748254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:04:55.516355Z","title":"URL https://www.minimaxi.com/","venue":null,"work_id":"d77c48dd-8cbe-46dc-abf1-e426d3ed6241","year":null},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-07T04:02:54.878172Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:47.565640Z"},"links":{"citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:ef877df2599284ee8d46698ab8c68257ca02a7ffdf213b94829e7ee1cc1ac805","observation_id":"ce9e6f66-ac65-4b5c-9169-07ff32a861b1","resolution":{"observed_at":"2026-08-05T20:04:55.589041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:04:55.309505Z","title":"Prompttts: Controllable text-to-speech with text descriptions","venue":null,"work_id":"ece45a85-96d7-4ffb-919c-5b892ac4f2ad","year":2023},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-07T04:02:54.878172Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:47.689717Z"},"links":{"citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:35489ed44ef55b6aaab12a4577fa39aabd588da9f4a884f5d391baa494a564cd","observation_id":"89f4c621-ff5f-4dcc-822d-b331d18b5808","resolution":{"observed_at":"2026-08-05T20:04:55.428810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:04:48.027737Z","title":"Textrolspeech: A text style control speech corpus with codec language text-to-speech models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-07T04:02:54.878172Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:48.027737Z"},"links":{"citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:f4aafea6d42034199c29cf99adcd8a89e89e99f6de7b12aeb7af1b82afe00405","observation_id":"8c8023d0-3447-4634-b9fe-92b3eadf8ecc","resolution":{"observed_at":"2026-08-05T20:04:48.027737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:04:55.167287Z","title":"Prompttts 2: Describing and generating voices with text prompt","venue":null,"work_id":"89ba0ea5-8d92-42a6-adf6-7eeac739d839","year":2024},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-07T04:02:54.878172Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:48.124723Z"},"links":{"citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:59b5b6663913b5f48aa87971f3e921e350b07ff297ac05f8359b1c040d9f8e58","observation_id":"e089af01-3335-4723-9b80-2e7ee8217d75","resolution":{"observed_at":"2026-08-05T20:04:55.245317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:04:48.227297Z","title":"Libritts-p: A corpus with speaking style and speaker identity prompts for text- to-speech and style captioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-07T04:02:54.878172Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:48.227297Z"},"links":{"citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:e1c3377b7940b5490f8e313860c8d638ad7b8cd37b8f5c57c7f4b6e4d95e61f9","observation_id":"1bdee4dd-a422-45a5-97ce-36ccaa271d3e","resolution":{"observed_at":"2026-08-05T20:04:48.227297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:04:48.356380Z","title":"Speechcraft: A fine-grained expressive speech dataset with natural language description","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-07T04:02:54.878172Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:48.356380Z"},"links":{"citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:1701741894e4c4e1364377ed39162c9d04ed142cb84577d5ee7ebea87afa2758","observation_id":"7fc63fbb-c694-47ce-96fa-7e5e5aa45525","resolution":{"observed_at":"2026-08-05T20:04:48.356380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01912","last_updated":"2024-02-02T21:29:34Z","snapshot_observed_at":"2026-07-06T17:24:41.012207Z","submitted_at":"2024-02-02T21:29:34Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01912","snapshot_observed_at":"2026-08-05T20:04:48.453562Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-07T04:02:54.878172Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:48.453562Z"},"links":{"cited_paper":"/paper/2402.01912","citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:c1ceb1875282589eda890625bb8a07acca4097e8a6b0320afe8a50b512baddbc","observation_id":"604d43fb-5ff3-4590-b857-a3b1e3df899f","resolution":{"observed_at":"2026-08-05T20:04:48.453562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2503.04713","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:04:52.506721Z","title":"Scaling rich style-prompted text-to-speech datasets","venue":null,"work_id":"bbbc9f48-ef11-4553-9bb0-b4b6309172ef","year":2025},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-07T04:02:54.878172Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:48.511222Z"},"links":{"citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:aa805016eb277c77b591cdd0726138b9878551adb474df506ab37351f3863a3a","observation_id":"ad880798-f23f-401c-86a7-7da9281cad6e","resolution":{"observed_at":"2026-08-05T20:04:52.561894Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T20:04:48.592233Z","title":"GPT-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-07T04:02:54.878172Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:48.592233Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:bc198a5bd01f6de5c7f6559f99778bf58e662c681e4dc3bee848396a527f1418","observation_id":"da4489d1-bfb3-4e5a-88bc-db1fc786b8b6","resolution":{"observed_at":"2026-08-05T20:04:48.592233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T20:04:48.684230Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-07T04:02:54.878172Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:48.684230Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:970a9e22f4ab3e43d3b2265732539a47e4ae31035cd48355eea7d3e90f22d257","observation_id":"b68494d3-07d7-4dba-a3df-bf733c33b7f2","resolution":{"observed_at":"2026-08-05T20:04:48.684230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:04:55.039733Z","title":null,"venue":null,"work_id":"4ee53b57-f386-44e2-b1cc-c6e8c453be31","year":2020},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-07T04:02:54.878172Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:48.772419Z"},"links":{"citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:efaabd8c0d2091ae2d0898ef4a95035c4d5a6bd185c94b6cb71833707d918938","observation_id":"f0be7c83-54b5-4e2c-b38c-2317bd581025","resolution":{"observed_at":"2026-08-05T20:04:55.112183Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-07T06:02:40.568271Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-05T20:04:48.852163Z","title":"Cosyvoice 2: Scalable streaming speech synthesis with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-07T04:02:54.878172Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:48.852163Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:99815ac8be6a480c5dc79ee1e8e62c17a145d75e2ae27a1f11014d1c455a62f3","observation_id":"971ec484-d792-4683-9284-c4dd997917f3","resolution":{"observed_at":"2026-08-05T20:04:48.852163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12867","last_updated":"2025-08-13T11:23:57Z","snapshot_observed_at":"2026-08-07T16:01:29.916688Z","submitted_at":"2025-04-17T11:50:04Z","title":"EmoVoice: LLM-based Emotional Text-To-Speech Model with Freestyle Text Prompting","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12867","snapshot_observed_at":"2026-08-05T20:04:48.933028Z","title":"Emovoice: Llm-based emotional text-to-speech model with freestyle text prompting","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-07T04:02:54.878172Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:48.933028Z"},"links":{"cited_paper":"/paper/2504.12867","citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:4d1ea22c892826f28c2d715b35ba8758313358b3be68e9c7e2bc92ca34e28a41","observation_id":"e8030ec9-5c4e-4c8b-b9de-b51f1d09328a","resolution":{"observed_at":"2026-08-05T20:04:48.933028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-05T20:04:49.009853Z","title":"Qwen3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-07T04:02:54.878172Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:49.009853Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:bd06494523d41fc45d83880f23ccd967f63e78a43b84c06592b4ee4e4f17ab55","observation_id":"cf596226-53b9-4921-ab0f-3282f7c3cfe8","resolution":{"observed_at":"2026-08-05T20:04:49.009853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10313","last_updated":"2023-12-05T08:59:33Z","snapshot_observed_at":"2026-07-06T16:20:21.258653Z","submitted_at":"2023-09-19T04:51:13Z","title":"Investigating the Catastrophic Forgetting in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10313","snapshot_observed_at":"2026-08-05T20:04:49.104039Z","title":"Investi- gating the catastrophic forgetting in multimodal large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-07T04:02:54.878172Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:49.104039Z"},"links":{"cited_paper":"/paper/2309.10313","citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:583ef3d39b97d9fa1ac9a7aa45f0fdeac21edf806c6d3b6c64fbcc61419a3382","observation_id":"bf9a4a57-a755-4743-aae5-8ba47bbd97e6","resolution":{"observed_at":"2026-08-05T20:04:49.104039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:04:54.833915Z","title":"Mono-internvl: Pushing the boundaries of monolithic multimodal large language models with endogenous visual pre-training","venue":null,"work_id":"fff52c82-754d-48d2-91a1-6d2f219aa527","year":2025},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-07T04:02:54.878172Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:49.260735Z"},"links":{"citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:ad0901cbd5205baacab7abc8fab0a035e4d39dda6d15d2b16a6673b12a60b64a","observation_id":"d8fb27d0-048f-43b8-8811-f6ae30b3d965","resolution":{"observed_at":"2026-08-05T20:04:54.957933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10313","last_updated":"2023-12-05T08:59:33Z","snapshot_observed_at":"2026-07-06T16:20:21.258653Z","submitted_at":"2023-09-19T04:51:13Z","title":"Investigating the Catastrophic Forgetting in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10313","snapshot_observed_at":"2026-08-05T20:04:49.161915Z","title":"URL https://doi.org/10.48550/arXiv.2309","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-07T04:02:54.878172Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:49.161915Z"},"links":{"cited_paper":"/paper/2309.10313","citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:9ccf3a0d47222037023a118ee590f6cb0376c012e211bab24569c540c8c944a7","observation_id":"8b2ff2d1-6018-4309-95ab-bf44defa8f83","resolution":{"observed_at":"2026-08-05T20:04:49.161915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:04:54.630495Z","title":"Vlmo: Unified vision- language pre-training with mixture-of-modality-experts","venue":null,"work_id":"6d4c6951-3472-4e2a-b507-365dbb140114","year":2022},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-07T04:02:54.878172Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:49.447667Z"},"links":{"citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:473f2af551fedafd09594849d3d0a8033de6106b71d367db5ab9056d5b123d8e","observation_id":"43dfd901-5a48-435a-97c5-6aa2d561ba95","resolution":{"observed_at":"2026-08-05T20:04:54.706910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-07-06T20:34:11.407726Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06788","snapshot_observed_at":"2026-08-05T20:04:49.342135Z","title":"Evev2: Improved baselines for encoder-free vision- language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-07T04:02:54.878172Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:49.342135Z"},"links":{"cited_paper":"/paper/2502.06788","citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:6749147f6b56864e67e43259b5033d6d73f56050498dd8de0c826b201a0382c7","observation_id":"6313292f-a74b-4422-952c-043a5e25126a","resolution":{"observed_at":"2026-08-05T20:04:49.342135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:04:54.401062Z","title":"Simbert: Integrating retrieval and generation into bert","venue":null,"work_id":"5f6bab19-4fc5-4405-bf1a-c19743c0d165","year":2020},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-07T04:02:54.878172Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:49.727665Z"},"links":{"citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:59e0680978e18c5b33605ce40d6aea3037b39199539d37435f5ec974d706a2d9","observation_id":"b0af524c-c2bd-43bc-b1e0-e4d2c969f240","resolution":{"observed_at":"2026-08-05T20:04:54.508410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.10442","last_updated":"2022-08-31T02:26:45Z","snapshot_observed_at":"2026-07-06T13:44:15.000595Z","submitted_at":"2022-08-22T16:55:04Z","title":"Image as a Foreign Language: BEiT Pretraining for All Vision and Vision-Language Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.10442","snapshot_observed_at":"2026-08-05T20:04:49.511799Z","title":"Image as a foreign language: Beit pretraining for all vision and vision-language tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-07T04:02:54.878172Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:49.511799Z"},"links":{"cited_paper":"/paper/2208.10442","citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:571d6608b39f92bd99702f83a584173759d9357569b088231541443d15fc9173","observation_id":"813005c5-8fe4-4834-b72a-2f5f23fc6ff8","resolution":{"observed_at":"2026-08-05T20:04:49.511799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:04:54.059491Z","title":"Fastspeech: Fast, robust and controllable text to speech","venue":null,"work_id":"b9257022-c71e-4614-9fd1-10a4485f5e7e","year":2019},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-07T04:02:54.878172Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:49.987765Z"},"links":{"citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:4bff0d98879525023ea0476012f2e9f0da8c147f43d960c7477580f25b5b0899","observation_id":"695d6b7c-a62b-4a93-bf27-bbd25450c258","resolution":{"observed_at":"2026-08-05T20:04:54.168169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-05T20:04:50.064063Z","title":"Neural codec language models are zero-shot text to speech synthesizers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-07T04:02:54.878172Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:50.064063Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:6b2bef6ada38fdeebb61a857c5aa4936a4340242877dbf7ed13820db985ca6ac","observation_id":"faa15446-d0e2-479a-84e9-03b0b46f337b","resolution":{"observed_at":"2026-08-05T20:04:50.064063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:04:54.322190Z","title":"BERT: pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":"86180dbb-e375-4c6a-afc3-8d4d2b224e1f","year":2019},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-07T04:02:54.878172Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:49.809205Z"},"links":{"citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:934f5428be0bd6e1e78ff499162e7ca315350f44c371b7f39c2fd25eece219a6","observation_id":"ac9cca37-f696-416f-8db7-12761b0f7f4a","resolution":{"observed_at":"2026-08-05T20:04:54.327115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07916","last_updated":"2025-05-12T14:25:20Z","snapshot_observed_at":"2026-08-07T15:47:51.144825Z","submitted_at":"2025-05-12T14:25:20Z","title":"MiniMax-Speech: Intrinsic Zero-Shot Text-to-Speech with a Learnable Speaker Encoder","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07916","snapshot_observed_at":"2026-08-05T20:04:50.260659Z","title":"Minimax-speech: Intrinsic zero-shot text-to-speech with a learnable speaker encoder","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-07T04:02:54.878172Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:50.260659Z"},"links":{"cited_paper":"/paper/2505.07916","citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:c1e6e56fc4467dfe65a33abbb7046cfcf5233a004d47c0a9e185617d969e6566","observation_id":"2c2df928-bc5f-48f1-b625-13fb9153f588","resolution":{"observed_at":"2026-08-05T20:04:50.260659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.findings-emnlp.758","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:04:51.972568Z","title":"Scaling vision-language models with sparse mixture of experts","venue":null,"work_id":"20d30a70-1ac9-4d00-a52e-74ffaf1db1e3","year":2023},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-07T04:02:54.878172Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:50.387922Z"},"links":{"citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:88a0bd25c8c57bbe0c3b8751533e38f3387e26567e39d05a2125afdbad7119c3","observation_id":"88f43fff-0582-44ed-bff3-0f42b3fb910a","resolution":{"observed_at":"2026-08-05T20:04:52.080129Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04128","last_updated":"2025-02-22T11:32:13Z","snapshot_observed_at":"2026-08-07T14:58:56.953797Z","submitted_at":"2025-02-06T15:04:00Z","title":"Llasa: Scaling Train-Time and Inference-Time Compute for Llama-based Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04128","snapshot_observed_at":"2026-08-05T20:04:50.463688Z","title":"Llasa: Scaling train-time and inference-time compute for llama-based speech synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-07T04:02:54.878172Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:50.463688Z"},"links":{"cited_paper":"/paper/2502.04128","citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:5264bc5e90721a4ff2cbedec8a44ac23b7a12b5c5cf9c8524b515a0c05615c25","observation_id":"dae82b05-3ee8-421c-9566-a108eea12dd3","resolution":{"observed_at":"2026-08-05T20:04:50.463688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T20:04:50.143999Z","title":"Seed-tts: A family of high-quality versatile speech generation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-07T04:02:54.878172Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:50.143999Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:7e7d00e936c43654350062d69fb789ddcdec0782988614dbf41b3ce5847cfa35","observation_id":"653e739d-550c-4d36-abff-8a836d6e1634","resolution":{"observed_at":"2026-08-05T20:04:50.143999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-05T20:04:50.680474Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-07T04:02:54.878172Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:50.680474Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:0f0de33a2256cd8a1eab8370dacbc36c37503a62cf191d4f9a64a99449a9f8c9","observation_id":"2bc8c221-afe1-4c67-97d8-90be3bb98c38","resolution":{"observed_at":"2026-08-05T20:04:50.680474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:04:53.939732Z","title":"Orpheus tts: Towards human-sounding tts","venue":null,"work_id":"33d9e767-5aa0-4d13-b3a4-55a3c2d19f5a","year":2025},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-07T04:02:54.878172Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:50.781373Z"},"links":{"citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:99b148668e1e1562a8fa58817d273176e00b56fb7a19a2c7d0231915d012abeb","observation_id":"d17d0c2a-3b7c-4648-827f-3ffda6d2e73f","resolution":{"observed_at":"2026-08-05T20:04:53.997908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:04:53.821157Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units","venue":null,"work_id":"b9430469-5526-4f26-ae4a-a74b4efd1704","year":null},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-07T04:02:54.878172Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:50.872744Z"},"links":{"citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:f09fac0ebfefa35102af594277a409cb40ec3729a98969a16361fa4b2002e6b8","observation_id":"fe17e825-4a1a-4234-a1b4-7f458d45e298","resolution":{"observed_at":"2026-08-05T20:04:53.870799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15383","last_updated":"2025-01-26T03:47:25Z","snapshot_observed_at":"2026-07-31T01:49:29.562668Z","submitted_at":"2025-01-26T03:47:25Z","title":"Qwen2.5-1M Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15383","snapshot_observed_at":"2026-08-05T20:04:50.570486Z","title":"Qwen2.5-1m technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-07T04:02:54.878172Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:50.570486Z"},"links":{"cited_paper":"/paper/2501.15383","citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:4bbf444f50d8743f4d01e4fc19ce9b1a49239f240a3a188f4772246ed78210f1","observation_id":"cf0c18c0-5f8a-4972-b220-3ebce6c1707b","resolution":{"observed_at":"2026-08-05T20:04:50.570486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:04:53.501481Z","title":"Neural discrete representation learning","venue":null,"work_id":"86a0853a-801a-4e07-b89a-c80b5081794e","year":2017},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-07T04:02:54.878172Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:51.113315Z"},"links":{"citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:f40a50087e4a8d891c0c60d9fbac7f6be18822012f96c0604a13884ebc446fb7","observation_id":"66e3afe6-3357-4c14-8fde-7939efa6c934","resolution":{"observed_at":"2026-08-05T20:04:53.559273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:04:51.210481Z","title":"Soundstream: An end-to-end neural audio codec","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-07T04:02:54.878172Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:51.210481Z"},"links":{"citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:7ce3aea77923f3df61d5b32abc4f1cfd803f03b29fd1789ef33c52f95493050e","observation_id":"dc0ecd74-90e6-4083-b7bc-ac851aba7832","resolution":{"observed_at":"2026-08-05T20:04:51.210481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:04:53.394185Z","title":"High-fidelity audio compression with improved RVQGAN","venue":null,"work_id":"308a926b-5b5e-42c6-ba9f-3ce99b89526e","year":2023},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-07T04:02:54.878172Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:51.289926Z"},"links":{"citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:d00d055467a38cdd57787bffe6118ef02bbfc1024b134cbe1bc32e87839d0b32","observation_id":"4ed51057-2fdc-4987-a663-7e456b2448e6","resolution":{"observed_at":"2026-08-05T20:04:53.446296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-05T20:04:51.369330Z","title":"Spark-tts: An efficient llm-based text-to- speech model with single-stream decoupled speech tokens","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-07T04:02:54.878172Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:51.369330Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:825d2ba47b41148f2a33ed41e57de40117cf2c97de1588b972bbc313f652fcd9","observation_id":"9accb710-3a08-439c-b5ad-e7e7fbbba6c0","resolution":{"observed_at":"2026-08-05T20:04:51.369330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:04:53.686152Z","title":"Self-supervised learning with random-projection quantizer for speech recognition","venue":null,"work_id":"37685eda-9502-45c1-9787-cee334c81e78","year":2022},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-07T04:02:54.878172Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:51.037030Z"},"links":{"citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:afe43e2f41921b4e54208b3e917de92935f951b0b1aabfc476ca4d0e107bbf9e","observation_id":"bdc1c6f7-2d9a-4f7d-9bd7-3bf548064f4d","resolution":{"observed_at":"2026-08-05T20:04:53.769779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:04:51.505861Z","title":"Parker, CJ Carr, Zack Zukowski, Josiah Taylor, and Jordi Pons","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-07T04:02:54.878172Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:51.505861Z"},"links":{"citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:e9c98e84f7ad97092809abafcf83a88ff3ef55f15690044d3c2960f3ddd1ac51","observation_id":"ecd9b8f4-018b-449c-80fd-7bc44ad28dfb","resolution":{"observed_at":"2026-08-05T20:04:51.505861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:04:51.590164Z","title":"Albergo, Nicholas M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-07T04:02:54.878172Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:51.590164Z"},"links":{"citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:800a8a38f2fb19d6d485c65396c9a7a23f6f14a1d2c0a15edb5e3c4b7d43d652","observation_id":"4dc488d9-eef8-4a29-9e0e-fef17261ee57","resolution":{"observed_at":"2026-08-05T20:04:51.590164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:04:51.686582Z","title":"Emilia: A large-scale, extensive, multilingual, and diverse dataset for speech generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-07T04:02:54.878172Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:51.686582Z"},"links":{"citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:11d0a0e12718faebae279d5df187546d0a5012494898e5ffd3c07a0bf88e9da8","observation_id":"a6b3cc7b-26e8-46e9-9a56-07636ec06f1b","resolution":{"observed_at":"2026-08-05T20:04:51.686582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:04:53.271134Z","title":"Elucidating the de- sign space of diffusion-based generative models","venue":null,"work_id":"f3a08470-ccb4-431c-8b3d-7a0cd07b728f","year":2022},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-07T04:02:54.878172Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:51.448310Z"},"links":{"citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:53700988b67cbe19bdc95c22b8b7c424cc87166eedef0e80c66057acd298ede9","observation_id":"be96fe05-0c7d-4492-9fbe-fc61f0d13e93","resolution":{"observed_at":"2026-08-05T20:04:53.311325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:04:50.973979Z","title":"URL https://doi.org/10.1109/TASLP.2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-07T04:02:54.878172Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:50.973979Z"},"links":{"citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:f343db353429cb665cbcc98a9b4bfd9d55e3a32a852d6600b7fb6cf2534c0ffc","observation_id":"8854b402-7093-4e14-9a29-82a68a516603","resolution":{"observed_at":"2026-08-05T20:04:50.973979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.10442","last_updated":"2022-08-31T02:26:45Z","snapshot_observed_at":"2026-07-06T13:44:15.000595Z","submitted_at":"2022-08-22T16:55:04Z","title":"Image as a Foreign Language: BEiT Pretraining for All Vision and Vision-Language Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.10442","snapshot_observed_at":"2026-08-05T20:04:49.612420Z","title":"URL https://doi.org/10.48550/arXiv.2208","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-07T04:02:54.878172Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:49.612420Z"},"links":{"cited_paper":"/paper/2208.10442","citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:fd0d73a37ccd243e7e451be555287f0b17ed465f2103460d2ecf5086952bc69a","observation_id":"5d35de97-2743-4564-959d-2c91eed98a3a","resolution":{"observed_at":"2026-08-05T20:04:49.612420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:04:47.813576Z","title":"URL https://doi.org/10.1109/ ICASSP49357.2023.10096285","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-07T04:02:54.878172Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:47.813576Z"},"links":{"citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:046a54a6d0e69279f450888d104a6cae668fd10320e8cd7766d071c4c111ad58","observation_id":"1a804652-6dfb-4a4a-9f30-ad5deddc4abd","resolution":{"observed_at":"2026-08-05T20:04:47.813576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:04:49.884453Z","title":"doi: 10.18653/V1/N19-1423","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-07T04:02:54.878172Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":4186,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:49.884453Z"},"links":{"citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:b71dad06363eacb92a5e46b8861f251b789f9c5cf94e197c7c0cf9894faafb0c","observation_id":"e5145ede-99f9-4cef-bc1e-8e700f33f581","resolution":{"observed_at":"2026-08-05T20:04:49.884453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-07T04:02:54.878172Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":2,"verified_fuzzy":15},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 1 inbound Pith citation observation for arXiv:2508.11326."}