{"as_of":"2026-08-07T18:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:85d9c4364993d2fbb0b2074206e594e7a92f6e6e1fbadb20583e3720c100496e","coverage":[{"denominator":195,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:59:32.450042Z","state":"measured"},{"denominator":106,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":106,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:17:47.141942Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23009","snapshot_observed_at":"2026-08-07T10:17:47.141942Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10019","last_updated":"2025-06-06T11:09:46Z","snapshot_observed_at":"2026-08-07T10:10:45.315025Z","submitted_at":"2025-06-06T11:09:46Z","title":"A Survey of Automatic Evaluation Methods on Text, Visual and Speech Generations","version":1},"reference_index":252,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:47.141942Z"},"links":{"cited_paper":"/paper/2505.23009","citing_paper":"/paper/2506.10019"},"observation_digest":"sha256:4868eefa1da465c8c09a89c1b488b526ee135b14fd3a3be6569bfab5e1779988","observation_id":"1720360c-be05-4b3c-8acb-315ef8069e53","resolution":{"observed_at":"2026-08-07T10:17:47.141942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23009","snapshot_observed_at":"2026-08-06T13:07:28.375424Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20987","last_updated":"2025-07-29T04:13:25Z","snapshot_observed_at":"2026-08-07T10:51:48.454717Z","submitted_at":"2025-07-28T16:47:44Z","title":"JWB-DH-V1: Benchmark for Joint Whole-Body Talking Avatar and Speech Generation Version 1","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T13:07:28.375424Z"},"links":{"cited_paper":"/paper/2505.23009","citing_paper":"/paper/2507.20987"},"observation_digest":"sha256:05122e8c65a1ef34a71e8e2d14066b2de465fc99c4df3761fff032648ef33f6c","observation_id":"493cbbe6-407d-4264-9cb9-17e1b0a7a46d","resolution":{"observed_at":"2026-08-06T13:07:28.375424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"cited_work":{"arxiv_id":"2505.23009","doi":"10.48550/arxiv.2505.23009","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23009","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emergenttts- eval: Evaluating tts models on complex prosodic, expressiveness, and linguistic challenges using model-as-a-judge,","venue":"ArXiv.org","work_id":"ea15d52c-a0db-42aa-9892-ebedf7cccdef","year":2025},"citing_paper":{"arxiv_id":"2604.17958","last_updated":"2026-04-20T08:39:55Z","snapshot_observed_at":"2026-07-06T23:04:55.190916Z","submitted_at":"2026-04-20T08:39:55Z","title":"MINT-Bench: A Comprehensive Multilingual Benchmark for Instruction-Following Text-to-Speech","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T04:03:38.919545Z"},"links":{"cited_paper":"/paper/2505.23009","citing_paper":"/paper/2604.17958"},"observation_digest":"sha256:66ad8d395deee799039042882a709876a6b71d0113edded235be5a47eb4fc466","observation_id":"d0e91133-3db1-4960-854b-26a42633524b","resolution":{"observed_at":"2026-05-10T04:04:47.233152Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"cited_work":{"arxiv_id":"2505.23009","doi":"10.48550/arxiv.2505.23009","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23009","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emergenttts- eval: Evaluating tts models on complex prosodic, expressiveness, and linguistic challenges using model-as-a-judge,","venue":"ArXiv.org","work_id":"ea15d52c-a0db-42aa-9892-ebedf7cccdef","year":2025},"citing_paper":{"arxiv_id":"2606.31947","last_updated":"2026-07-02T16:10:55Z","snapshot_observed_at":"2026-08-06T15:05:46.315237Z","submitted_at":"2026-06-30T16:53:15Z","title":"LuxEmo: Expressive Text-to-Speech Corpus for Luxembourgish","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-01T05:38:16.224617Z"},"links":{"cited_paper":"/paper/2505.23009","citing_paper":"/paper/2606.31947"},"observation_digest":"sha256:ab06bd35f08827be0ae648a6713b7f31fa7c702d2936c27042ddafa661e564a3","observation_id":"47f0cad7-3779-472f-9023-bb7ba3939043","resolution":{"observed_at":"2026-07-01T10:15:45.044627Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"cited_work":{"arxiv_id":"2505.23009","doi":"10.48550/arxiv.2505.23009","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23009","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emergenttts- eval: Evaluating tts models on complex prosodic, expressiveness, and linguistic challenges using model-as-a-judge,","venue":"ArXiv.org","work_id":"ea15d52c-a0db-42aa-9892-ebedf7cccdef","year":2025},"citing_paper":{"arxiv_id":"2606.31947","last_updated":"2026-07-02T16:10:55Z","snapshot_observed_at":"2026-08-06T15:05:46.315237Z","submitted_at":"2026-06-30T16:53:15Z","title":"LuxEmo: Expressive Text-to-Speech Corpus for Luxembourgish","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-03T21:56:41.303269Z"},"links":{"cited_paper":"/paper/2505.23009","citing_paper":"/paper/2606.31947"},"observation_digest":"sha256:f6d2b64c32107b4f621af2c0ba60cd5771c0c38e78f5264075096f304186c896","observation_id":"d07e2531-2480-4c73-9dc0-07dc61c8b4c1","resolution":{"observed_at":"2026-07-03T21:58:58.317517Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23009","snapshot_observed_at":"2026-08-02T00:57:37.747884Z","title":"EmergentTTS-Eval: Evaluating TTS models on complex prosodic, expressiveness, and linguistic challenges using model-as-a-judge.arXiv preprint arXiv:2505.23009, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14846","last_updated":"2026-07-16T11:15:16Z","snapshot_observed_at":"2026-08-07T14:32:53.993332Z","submitted_at":"2026-07-16T11:15:16Z","title":"RW-Voice-EQ Bench: A Real World Benchmark for Evaluating Voice AI Systems","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T00:57:37.747884Z"},"links":{"cited_paper":"/paper/2505.23009","citing_paper":"/paper/2607.14846"},"observation_digest":"sha256:d654ccfa21b61aa2220bbb904c3e86e8912e189341636159baab804798ab1f3e","observation_id":"15e196c1-fbef-4c31-8ffd-053bb8c9b494","resolution":{"observed_at":"2026-08-02T00:57:37.747884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.23009/citation-record","integrity":"/paper/2505.23009/integrity","json":"/paper/2505.23009/citation-record.json","paper":"/paper/2505.23009"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:22.123813Z","title":"https://huggingface.co/openbmb/MiniCPM-o-2_6","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:22.123813Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:888c77a0f4faa30c1a1851405926477b0ad0f452d1564353f289a1fe0839fc64","observation_id":"7d460f25-18c0-4329-9174-9cf3247ae840","resolution":{"observed_at":"2026-08-07T12:59:22.123813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:22.355934Z","title":"https://github.com/suno-ai/bark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:22.355934Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:eea79a3e3d93ef1d7c779242b2bbc2b45914de47039206679dd2564e7fde75d1","observation_id":"176414f3-bc3c-437f-a44a-2f9f85b6a498","resolution":{"observed_at":"2026-08-07T12:59:22.355934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:22.464130Z","title":"https://github.com/neonbjb/tortoise-tts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:22.464130Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:9ae4ac2f6de7341a6a0dd984c606cb3420e239f151eec0709ab55c99b1fbd7b8","observation_id":"11bd66d3-2f8a-43c5-ac37-f34a81ba86a0","resolution":{"observed_at":"2026-08-07T12:59:22.464130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:22.598188Z","title":"https://github.com/wenet-e2e/WeTextProcessing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:22.598188Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:c24c4cf4e3f20686b3181959bf14e91ed1c68bc5eeeb188dacda333208f66b03","observation_id":"205fee0c-98cd-4066-8c0f-90393b0867ad","resolution":{"observed_at":"2026-08-07T12:59:22.598188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:22.693266Z","title":"https://huggingface.co/Zyphra/Zonos-v0.1-transformer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:22.693266Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:2f8425441169575a8405d837488748a283b6a311e2254a5df601225fc6c811fa","observation_id":"71cea248-dfa8-4a11-a6c1-89e155429b41","resolution":{"observed_at":"2026-08-07T12:59:22.693266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:22.786045Z","title":"Seed-tts: A family of high-quality versatile speech generation models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:22.786045Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:1da47fb7acfaf1bff2a68b713d18c662539c0769d8babe52cb06a89dd7b3792d","observation_id":"dca4f373-43c2-43b2-b8da-0eed141567e1","resolution":{"observed_at":"2026-08-07T12:59:22.786045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:22.903641Z","title":"Hifi++: A unified framework for bandwidth extension and speech enhancement","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:22.903641Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:e417ead393dd99c4979b1f9fb24704fefa923bf05963e3382733d2b73c42f97a","observation_id":"0cc3aa6f-a4f7-4cf6-bce4-5376fbf511d6","resolution":{"observed_at":"2026-08-07T12:59:22.903641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:23.021512Z","title":"Deep learning-based expressive speech synthesis: a systematic review of approaches, challenges, and resources","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:23.021512Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:7f047ec0e88a3965f6c48fed74e832bc46dc634c79880ee525d02e66764e942d","observation_id":"1219e962-6254-4cb4-a3d6-ffb802aac7e0","resolution":{"observed_at":"2026-08-07T12:59:23.021512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:23.142124Z","title":"Orpheus-tts","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:23.142124Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:468c4c51a668640fd274ed0ef3b0ad723174d04332b957d8ad796c86d5902d2b","observation_id":"25f6b129-e257-4dd4-90f3-c6e970419d49","resolution":{"observed_at":"2026-08-07T12:59:23.142124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:23.225020Z","title":"Audio large language models can be descriptive speech quality evaluators","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:23.225020Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:2c57e00803cf232c3f1e651a21407f271c1fe6dddec72932bc635466b2ac814a","observation_id":"9573afaa-fdaa-40fd-bd92-325d8626ffce","resolution":{"observed_at":"2026-08-07T12:59:23.225020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:23.364616Z","title":"SANE-TTS: Stable and natural end-to-end multilingual text-to-speech","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:23.364616Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:59f11495eea7188ff498b428a89d9525487387956465f6db040b627a3385455b","observation_id":"39b992d5-7897-4cfb-83ea-73292e43ac8c","resolution":{"observed_at":"2026-08-07T12:59:23.364616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:23.494815Z","title":"Qwen-audio: Advancing universal audio understanding via unified large-scale audio-language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:23.494815Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:b84a6729e7c3d2d051f06c07098e8c0b92ec5e5fead80a66b551de36c8a78edc","observation_id":"56a54051-a366-48b9-862e-615c720327c4","resolution":{"observed_at":"2026-08-07T12:59:23.494815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:23.590194Z","title":"Deepseek-R1: Incentivizing reasoning capability in llms via reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:23.590194Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:97cf5f64e6772e222dac0a3b14d9a0f57a1bae4cb576a3ff24bd0fdb1e8f1919","observation_id":"5047b16f-a4b8-4120-a823-05751a391966","resolution":{"observed_at":"2026-08-07T12:59:23.590194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:23.715236Z","title":"Cosyvoice: A scalable multilingual zero-shot text-to-speech synthesizer based on supervised semantic tokens, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:23.715236Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:d3b909c9531f2c34988f51e3f35ad985ea36ef9c5f4605101da56cfebb75f00b","observation_id":"06f49cbb-da56-49b4-9248-2dd786226f6f","resolution":{"observed_at":"2026-08-07T12:59:23.715236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:23.847705Z","title":"Wavllm: Towards robust and adaptive speech large language model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:23.847705Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:19c362066397a781e3015963872a0b9cb11be63527b71c65861b7399ac90cce2","observation_id":"3812c265-737b-45e2-b200-f1e471dd9f28","resolution":{"observed_at":"2026-08-07T12:59:23.847705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:23.943571Z","title":"Zezario, Tomoki Toda, Hsin-Min Wang, Junichi Yamagishi, and Yu Tsao","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:23.943571Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:f841fcd3f0fc0881643d94c8af9f9043cc377b918c41bef5ab68b53a18cd0901","observation_id":"804fcd4e-c745-4e92-87df-30b7af093e2b","resolution":{"observed_at":"2026-08-07T12:59:23.943571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:24.041125Z","title":"Wavreward: Spoken dialogue models with generalist reward evaluators, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:24.041125Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:33354e8d27871d65d07a31e0fcb0784216fc1f41a1489a951ea03b4b0ce6448f","observation_id":"9bdaf572-7d40-484f-932b-605afea9cd2c","resolution":{"observed_at":"2026-08-07T12:59:24.041125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08093","last_updated":"2024-02-15T18:57:26Z","snapshot_observed_at":"2026-07-06T17:29:13.310354Z","submitted_at":"2024-02-12T22:21:30Z","title":"BASE TTS: Lessons from building a billion-parameter Text-to-Speech model on 100K hours of data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08093","snapshot_observed_at":"2026-08-07T12:59:24.161122Z","title":"BASE TTS: Lessons from building a billion-parameter text-to-speech model on 100k hours of data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:24.161122Z"},"links":{"cited_paper":"/paper/2402.08093","citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:3ab9b15e9c8bc907d2f20355f6d2e6b656ff818c0a3343d5aefa533b3a89ae70","observation_id":"a0b577b6-d7ec-4def-ad2e-7ef96c4077be","resolution":{"observed_at":"2026-08-07T12:59:24.161122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:24.282631Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:24.282631Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:f41cbb1c7df5c79f68f1aa514d1a6f45024ca72baa8bbbcd16676ab0b977e803","observation_id":"225e90b0-357b-47a4-8dcf-8518578642d9","resolution":{"observed_at":"2026-08-07T12:59:24.282631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:24.420902Z","title":"The Application of Speech Synthesis in Car Warning System, pages 657–662","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:24.420902Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:4627169a187f0ddd52334e0a1cdc579bdc949f835e5e98d530215fe6f5a8c68a","observation_id":"08ecea3b-720a-4266-9a1d-f1f0f65feb4b","resolution":{"observed_at":"2026-08-07T12:59:24.420902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:24.521051Z","title":"Inference-time scaling for generalist reward modeling, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:24.521051Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:0cee21fef87c5322932413b18cbf78518b358c2230fd3cb43dcaf682f985e18f","observation_id":"02998162-fed0-4d2e-a154-109f23891f60","resolution":{"observed_at":"2026-08-07T12:59:24.521051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:24.611021Z","title":"Generalized multilingual text-to-speech generation with language-aware style adaptation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:24.611021Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:08339f19bac7806f8a82d4e765fbfbb76d4e4b24cbb9ada07bbb5e4ac03bf0ac","observation_id":"220e2358-44db-4470-9ef0-1db34854ae26","resolution":{"observed_at":"2026-08-07T12:59:24.611021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:24.707740Z","title":"Somos: The samsung open mos dataset for the evaluation of neural text-to-speech synthesis","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:24.707740Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:9826cf772b4cadc96a547b5fa45f7f57babf5b826dfa9d64173d9c82022eb76c","observation_id":"c50c5376-b576-4454-92f1-b54e576b8816","resolution":{"observed_at":"2026-08-07T12:59:24.707740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:24.780715Z","title":"Youth disability: Adopting text-to-speech and screen reader technologies for library and information services","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:24.780715Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:5e0489025b6c396353387ddec193f75bcae8c9283ccab5e2baeaeb66f9faee26","observation_id":"3fff9e79-0d00-47d1-b06b-4cdbb79b3d04","resolution":{"observed_at":"2026-08-07T12:59:24.780715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:24.880672Z","title":"Applications of voice quality technology in virtual assistants and call centers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:24.880672Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:43143dbfe65c01bdcf8f99ab7d0feef9c93da1ec61eabe8bbd583c3ed8333a10","observation_id":"77fcdec5-a860-46eb-b800-0db6f90b69cf","resolution":{"observed_at":"2026-08-07T12:59:24.880672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:24.981542Z","title":"Prosody analysis of audiobooks, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:24.981542Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:fe289c7c4df71a98a149a5880ede0156edd3a3f9057ce624d165da8095478299","observation_id":"d39c6652-fea0-45fe-bac4-724212e43122","resolution":{"observed_at":"2026-08-07T12:59:24.981542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:25.067775Z","title":"Robust speech recognition via large-scale weak supervision, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:25.067775Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:2edcbc9bbbf51c649fb557f453f5cc031eebd89890c91be20b8ecf2d995f00a3","observation_id":"4b662415-ad37-4e82-a618-3137101bb7c6","resolution":{"observed_at":"2026-08-07T12:59:25.067775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:25.115166Z","title":"Text-to-speech software and reading comprehension: The impact for students with learning disabilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:25.115166Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:b4567dad789b5cb897d3b75edf38cd1d0d5dd79e6e6dd5f0c86f4517b1780bec","observation_id":"3f907a15-6d7c-4901-a202-182d1d49f7c4","resolution":{"observed_at":"2026-08-07T12:59:25.115166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:25.186851Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:25.186851Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:edbbbcdc27e8c1941bfb96e27ee4c5517b9cb4fbcd8d25706cf49b4c00a63498","observation_id":"ccaee203-f3f2-47ed-971c-bdff8ca04546","resolution":{"observed_at":"2026-08-07T12:59:25.186851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:25.232231Z","title":"Mmau: A massive multi-task audio understanding and reasoning benchmark, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:25.232231Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:4a5567805cefd5f9fe49b1eaaf90d38d4ef7b7b42ce3a11db398fb954003920b","observation_id":"06b7c93c-9bb8-4859-9815-b9943bb563e2","resolution":{"observed_at":"2026-08-07T12:59:25.232231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19168","last_updated":"2024-10-24T21:20:10Z","snapshot_observed_at":"2026-07-06T19:39:23.839070Z","submitted_at":"2024-10-24T21:20:10Z","title":"MMAU: A Massive Multi-Task Audio Understanding and Reasoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.19168","snapshot_observed_at":"2026-08-07T12:59:25.279897Z","title":"MMAU: A massive multi-task audio understanding and reasoning benchmark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:25.279897Z"},"links":{"cited_paper":"/paper/2410.19168","citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:ab69c6f097ffa166c43f4a361cbb3a74e90baf155d905d4982998f2a0422b003","observation_id":"ce95ec3c-8843-4b13-9fc3-9731dad368bb","resolution":{"observed_at":"2026-08-07T12:59:25.279897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:25.341168Z","title":"Parikh, and Jason Riesa","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:25.341168Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:45c4c75305a7ae086b0fc53ea8618475d7a22ea2628ab22476b426e781dd287a","observation_id":"4fedfc3c-0909-4d36-ad68-1fc6c9150207","resolution":{"observed_at":"2026-08-07T12:59:25.341168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:25.396915Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:25.396915Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:edf1b2ac1718af9aec9cab3e8a57f02e3a2d271bc75c3eed0bc83e506e811b39","observation_id":"8764040b-11e9-4bd1-a8ac-19766a69ce11","resolution":{"observed_at":"2026-08-07T12:59:25.396915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:25.464461Z","title":"Salmonn: Towards generic hearing abilities for large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:25.464461Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:87a54c7a771bd55243b4150e34a463692814033eab2ba81acc4de656572e38d0","observation_id":"c3841355-056b-4b48-8d46-b2b8cf3cc79b","resolution":{"observed_at":"2026-08-07T12:59:25.464461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:25.532648Z","title":"Gemini: A family of highly capable multimodal models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:25.532648Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:ef408a73d0f7acef201a4bb38e68c49f09e14c9952c093f492f5287b59f9178c","observation_id":"d44b5ea1-3526-4997-8794-7eb30d365729","resolution":{"observed_at":"2026-08-07T12:59:25.532648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:25.625324Z","title":"Speech recognition challenges in the car navigation industry","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:25.625324Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:3ea11f575f76569be9bca580270242f07f54156b359cc6cda724bd0e880a14b8","observation_id":"0e9ff48b-22c2-4d19-b40c-ad3de0ec1f1b","resolution":{"observed_at":"2026-08-07T12:59:25.625324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:25.682024Z","title":"Freeman, and Markus Weimer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:25.682024Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:0ac4612173e6439e212775f3b2d35a73ec1dc4745e61a7b37f53023fce223cbb","observation_id":"a94b5756-767f-4225-97dd-ce33f2d74e80","resolution":{"observed_at":"2026-08-07T12:59:25.682024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:25.748602Z","title":"Evaluating text-to-speech synthesis from a large discrete token-based speech language model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:25.748602Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:db19d1efe96a40167406ae4c340a425b4e54759c4b75c20aceedb07773765be5","observation_id":"6f411fbb-90d1-4790-b96c-c251c41d86ae","resolution":{"observed_at":"2026-08-07T12:59:25.748602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:25.836674Z","title":"Enabling auditory large language models for automatic speech quality evaluation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:25.836674Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:4e21072afd99c0759ee820f0d090afe6faa97b4aed78c4be442b5e9592e0b798","observation_id":"f7022443-a363-47e2-a468-4f476e080456","resolution":{"observed_at":"2026-08-07T12:59:25.836674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:25.920779Z","title":"Spark-tts: An efficient llm-based text-to-speech model with single-stream decoupled speech tokens, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:25.920779Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:ce0c507e36fb9bc5fbd4e57f4bb81e9ba2603b24f90a0854680c22021d71e2a8","observation_id":"0b08332e-dd81-4e60-b141-fc9aac8937d1","resolution":{"observed_at":"2026-08-07T12:59:25.920779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:25.972618Z","title":"The iscslp 2024 conversational voice clone (covoc) challenge: Tasks, results and findings, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:25.972618Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:83005b65817b26ca5901e657a7538bf5d2146ddf60822a6ec5af626043542910","observation_id":"836b5a4e-c5f4-4ab7-a3b0-8dbc892069a1","resolution":{"observed_at":"2026-08-07T12:59:25.972618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.12244","last_updated":"2025-05-27T06:49:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-24T16:31:06Z","title":"WizardLM: Empowering large pre-trained language models to follow complex instructions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.12244","snapshot_observed_at":"2026-08-07T12:59:26.035027Z","title":"Wizardlm: Empowering large language models to follow complex instructions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:26.035027Z"},"links":{"cited_paper":"/paper/2304.12244","citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:a21a5a7d78408e26e94b6f097a9be2c24496ec93ca2edcddff56643833afb502","observation_id":"debefcb3-c5e9-4b3f-a07e-524e1b50360f","resolution":{"observed_at":"2026-08-07T12:59:26.035027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:26.073783Z","title":"text_to_synthesize","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:26.073783Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:1903cdfa30ae4cf41750d6c862953f16f48f2dc90019eccf2dafa6a1f3405b55","observation_id":"33d7b041-cf1c-4322-8a0b-1f635b6f3629","resolution":{"observed_at":"2026-08-07T12:59:26.073783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:26.161264Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:26.161264Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:c089a5794e8d924a20ed678e35b9fe19c483e0f6d080b2a68da19aeecec55dc1","observation_id":"35c5e7d3-918a-4f7c-a261-3eceb2c75a1b","resolution":{"observed_at":"2026-08-07T12:59:26.161264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:26.206382Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:26.206382Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:09cb831da7b50a7f390b2e5b6c0d953e68df6ec72301197ac71f2cb9fe1ade3a","observation_id":"1d987801-33ba-464b-96e5-703975a92a9a","resolution":{"observed_at":"2026-08-07T12:59:26.206382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:26.282646Z","title":"14 The main goals for the set are:","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:26.282646Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:187cd71cb3bf1150930a458891326c126f59cba4738f95fe2210210637d34ec7","observation_id":"dd9bf107-fe39-43f5-ada9-aeeda5173772","resolution":{"observed_at":"2026-08-07T12:59:26.282646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:26.353017Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:26.353017Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:b290b1ad92acebe52fff58577d1f1ff702a437637e6f3083f1e92b6e56f13171","observation_id":"c710b730-9660-4ff2-b29d-a405f6b5d19a","resolution":{"observed_at":"2026-08-07T12:59:26.353017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:26.491815Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:26.491815Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:fb5b718685d1d448589c98bc75cf563366e9320ab336c79a5f0cd78e79f977b0","observation_id":"b03ca92b-1cd0-4d77-91d6-088758653038","resolution":{"observed_at":"2026-08-07T12:59:26.491815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:26.573584Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:26.573584Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:8cc2e33a6f74881d48536a8cacafb18d9ee0a5add8251dc53585385ea92a7c59","observation_id":"aed2c966-d6a2-47ca-a9ec-270e912f45e0","resolution":{"observed_at":"2026-08-07T12:59:26.573584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:26.635309Z","title":"\"\" You are evolving a **text_to_synthesize** sample belonging to the","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:26.635309Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:ede48ec7e15bb09e61e0b9dc25b93a45e208966b2b0e0ef8379095015f334c47","observation_id":"a111fa93-839e-4f90-b15f-e6a2809163ea","resolution":{"observed_at":"2026-08-07T12:59:26.635309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:26.715583Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:26.715583Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:df0c12970ebc73bbb6a0215b9983abc6eb8819b88308435c1006238983ca8097","observation_id":"5d49c281-d494-455c-93db-b5a69eceac19","resolution":{"observed_at":"2026-08-07T12:59:26.715583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:26.792318Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:26.792318Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:02afe6efc62f0c4331c867ee15b04adf0beebf744f528d90308356222cfcb4b7","observation_id":"f929fd24-fbf1-47fb-af6f-48aa39202da0","resolution":{"observed_at":"2026-08-07T12:59:26.792318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:26.846421Z","title":"Then, **add one** related, grammatically complete question *immediately following* the modified text","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:26.846421Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:2867a06be317b3c58c34fbc175233234ce1e265a8732416fde46753691412fc2","observation_id":"543f222a-f4d2-4bfd-b76d-01f1b0ed60cd","resolution":{"observed_at":"2026-08-07T12:59:26.846421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:26.919989Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:26.919989Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:d972898f8b91819a51013bdf2a7b820136c32e5f0c83091eabae172e97905924","observation_id":"dcb6d042-9ce0-46cd-b610-71ca305cd175","resolution":{"observed_at":"2026-08-07T12:59:26.919989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:26.973562Z","title":"to be\" is replace with","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:26.973562Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:ab2b19a08e4d544a1bfd9b54d8abebf4b7c9bcd2d47a626c27cea5c066e6bdff","observation_id":"c0e415e7-6f73-4935-9847-edd856cb5c86","resolution":{"observed_at":"2026-08-07T12:59:26.973562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:27.030998Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:27.030998Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:6ce13f353d07ff5fd0794b54768275a39900ed908f0d4de373d9414fd4afe18b","observation_id":"30ac59cc-7920-4ada-8d77-b2e57f6cceb1","resolution":{"observed_at":"2026-08-07T12:59:27.030998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:27.086258Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:27.086258Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:f5176d9ef0c7dbbb16590fdf990446cd88baebcdbf8f0e756f1b70ccb6935f10","observation_id":"d0565783-dcda-4219-acc0-5c6007727da4","resolution":{"observed_at":"2026-08-07T12:59:27.086258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:27.198739Z","title":"Ensure that each language has atleast 1 foreign phrase","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:27.198739Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:f28ba48e31aac0ae76527bf800ba97c8c6d85bbe33fe4022d291833c33def2bc","observation_id":"e271a5e9-b6aa-43d6-add7-1c9afd96eaef","resolution":{"observed_at":"2026-08-07T12:59:27.198739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:27.292209Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:27.292209Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:1101cca66ac2a943052c0d625c0e018db841229e425f05b30d80d67f7e1842c8","observation_id":"9fa272ac-c5d6-4d88-a2a7-0d86d180d2e5","resolution":{"observed_at":"2026-08-07T12:59:27.292209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:27.467276Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:27.467276Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:21d5f41ba4fe3b27058df94c5ee019870c56ded431b75d46d50f5228c3792a77","observation_id":"6d9746e4-2927-4936-8bbf-8ee8475a7442","resolution":{"observed_at":"2026-08-07T12:59:27.467276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:27.624271Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:27.624271Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:b83ae509cc0034cb6297d252e1210cbf6942e2195e04a21c34106fd4dc717c3e","observation_id":"32ad117d-61fc-4d78-b296-27be04880419","resolution":{"observed_at":"2026-08-07T12:59:27.624271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:27.745718Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:27.745718Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:6012758edc106e449263a92e8d12d96024f491ad42b02858227071ce35093371","observation_id":"f40ed726-ba8b-45af-805f-3cc8f18be4aa","resolution":{"observed_at":"2026-08-07T12:59:27.745718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:27.894566Z","title":"All foreign words **MUST** not be duplicated","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:27.894566Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:977d76f8c7bcca8e1a869e1d8cddf4b17071077b71c4162f9798992a50abf52a","observation_id":"41121d68-b659-4905-bf8d-54906bef987f","resolution":{"observed_at":"2026-08-07T12:59:27.894566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:28.177302Z","title":"AT THE SAME TIME, do not use very obscure words that don’t exist in the modern vocabulary, we want to create natural day-to-day sentences that bi- lingual speakers will speak**","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:28.177302Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:15bb67279ed9412ccc95b78d34e62914efa2e702b9dbd36edf4216b39fe3e0e2","observation_id":"243e118a-0065-476d-a402-873f629b6994","resolution":{"observed_at":"2026-08-07T12:59:28.177302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:28.285440Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:28.285440Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:f7c0800ab8ca8a25d6508acd08fcdf0aa66dabeddb8268e1422d4933f07fb23e","observation_id":"b38f60da-9773-4580-ae79-7661842875cf","resolution":{"observed_at":"2026-08-07T12:59:28.285440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:28.432064Z","title":"misc\" field, add a new key","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:28.432064Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:1037c0a639b601db5d68372aa60d239981bd0a790ddc63f4e3218eea13aac9cc","observation_id":"c5c6a5f0-cdff-4316-b5ad-f9ef20036179","resolution":{"observed_at":"2026-08-07T12:59:28.432064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:28.565040Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:28.565040Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:fa24641023bac77c9d869fc52fc97de641681edd3b2ce7c3e788e0482719bcf1","observation_id":"c4834ec5-e4ba-42db-8704-0cabcaed7b8c","resolution":{"observed_at":"2026-08-07T12:59:28.565040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:28.727127Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:28.727127Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:e6db6a00922ebddb30609c05df813d81e7f50cad90c4bd15ae2760628abfa4f0","observation_id":"ec22d491-1d67-4d98-9418-2ff6adef3e98","resolution":{"observed_at":"2026-08-07T12:59:28.727127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:28.874003Z","title":"Mention how this **DOES NOT** make the text syntactically awkward","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:28.874003Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:4a3640639f513ad9faa73c38bf75a89d4e5e37027caf3e413fea630e0a801c2b","observation_id":"e601e8ff-beab-40e2-add8-1d56f1b3cf40","resolution":{"observed_at":"2026-08-07T12:59:28.874003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:28.949777Z","title":"**For Approach 2, state the original short phrase, the absorbed English words, and the resulting longer foreign segment with its word count.**","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:28.949777Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:8c543189ac694fd5d66250cf3f5dea7cbafc8a1f55af88507c63961e18970653","observation_id":"88da4798-9a24-4e77-b28a-468d9cd03249","resolution":{"observed_at":"2026-08-07T12:59:28.949777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:29.040989Z","title":"**For Approach 2, emphasize the challenge of sustained foreign language synthesis and grammatical integration.**","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:29.040989Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:3cbf93254283f67400fc8962c883c656e7aad021727acadb2ebda4f6e1c3300c","observation_id":"169fe26c-aa56-422b-9329-90c2919897ea","resolution":{"observed_at":"2026-08-07T12:59:29.040989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:29.136251Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:29.136251Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:bb88f71945d2b11a96763a23ca01ce375f6687fadd765b99e44ad4c84798bc8e","observation_id":"4540adda-36e9-4873-a938-1a8ab66ec053","resolution":{"observed_at":"2026-08-07T12:59:29.136251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:29.222566Z","title":"7.2 Restructure, paraphrase and edit the text grammatically to ensure **NO AWKWARDNESS** in the text","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:29.222566Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:81c1640e7f9dc9bb7a9f23735e9c2280021f3e1d8dbb89f00483ac51cb427b87","observation_id":"8332f690-7b54-4320-92fa-122401ab0c7f","resolution":{"observed_at":"2026-08-07T12:59:29.222566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:29.362145Z","title":"\"\" A.3 Category 3: Paralinguistics Figure 7: Example depth-refinement for paralinguisitcs category. Starting with just one cue","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:29.362145Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:5db1d4348871b270d57e436ea13a39aa62c0b1643fe02879aa551ae9f1a44ed5","observation_id":"9e3f6aee-df8c-49ac-923a-65d3d8e5cf25","resolution":{"observed_at":"2026-08-07T12:59:29.362145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:29.467472Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:29.467472Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:cf89a88b4f1ad0ff362a8cb16f0fa5c71ddd74c1856bcaf0d7192f73ec03ed25","observation_id":"09ca8552-41f1-4f9b-8b42-8d6c5dabbd12","resolution":{"observed_at":"2026-08-07T12:59:29.467472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:29.571387Z","title":"Uh\", \"Uhmm","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:29.571387Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:e20e0e2fb2e48f66cffd4df1cc84ec5dc209c341dc12ec427078fe3106fd2dd3","observation_id":"6a6cf1f2-b8eb-4453-af8e-d5469828e5c8","resolution":{"observed_at":"2026-08-07T12:59:29.571387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:29.813008Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:29.813008Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:911293e1dba7c3be4519a2ccceab5e85b4a8e1425fc6822abec38e1e2ba232b4","observation_id":"8b59f380-e9cc-4dce-a65f-d4e0a0a5b720","resolution":{"observed_at":"2026-08-07T12:59:29.813008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:29.957462Z","title":"These should be sounds that humans can produce well based on the textual cue.**","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:29.957462Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:a22a46c4fbc3cebeadadd2c9944a9aac288567e34c9727c2dbc2215176bc003c","observation_id":"d357c59a-ccb0-4335-9dd4-cb0afbb05791","resolution":{"observed_at":"2026-08-07T12:59:29.957462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:30.031457Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:30.031457Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:2e1747a8c37db8d8ac3ee59e0ca6a87ead663c8b6149b878fc04ee84d173e5d9","observation_id":"8cdd50da-ab9f-44c1-8672-78dca6eef352","resolution":{"observed_at":"2026-08-07T12:59:30.031457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:30.094257Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:30.094257Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:556692e8a96b173cc9af671a18e865f0fd5e77626fd4bf1a58376a102bd70b06","observation_id":"4ab87708-898f-4623-8e0d-a537c1033c9a","resolution":{"observed_at":"2026-08-07T12:59:30.094257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:30.225119Z","title":"\"\" You are tasked with enhancing the paralinguistic complexity of the provided ** text_to_synthesize**, which belongs to the","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:30.225119Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:b3f6371f2e2cd3fd249769eb6d66af465184d56fe6ccf93397b85578f82c91e4","observation_id":"2d0f7291-9fda-437e-8624-9a06a4eb00cd","resolution":{"observed_at":"2026-08-07T12:59:30.225119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:30.364305Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:30.364305Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:d9efc11e97e2bb1f86ee4bad52bc61727cf86564ff1656415048efee86370b16","observation_id":"8d9ce7d6-1488-4ebb-b0fc-bb48fa7f0e23","resolution":{"observed_at":"2026-08-07T12:59:30.364305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:30.487507Z","title":"Wow !\",","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:30.487507Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:1ccf27f4665751e454abe7b96eb2c95eddc66bdb0d920cb193b7016c7f08674d","observation_id":"24727f29-47b2-46a7-9a93-1d568378acf1","resolution":{"observed_at":"2026-08-07T12:59:30.487507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:30.594796Z","title":"Focus only on cues the TTS would encounter in the direct text-to-be- synthesized","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:30.594796Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:c4753526daa1f22a87d9c3fc7f743e1d0057108825b96122c12219fbdaa6f036","observation_id":"f03cf393-e0c0-4fbf-b2ab-151d1e96b2f5","resolution":{"observed_at":"2026-08-07T12:59:30.594796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:30.704923Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:30.704923Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:1f6f8220e0690b2db7f03194215cfa64508c514575a8c70539de716fe18c67a1","observation_id":"28520f57-556c-463f-b365-b4c7c009dcc3","resolution":{"observed_at":"2026-08-07T12:59:30.704923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:30.808239Z","title":"* It must **NOT** sound forced, nonsensical, overly exaggerated beyond plausibility, or contain cues that contradict each other","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:30.808239Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:6ba1d10dc33c36948583f82a0d80019c95b36d70903b19454f2af1ad28f123c6","observation_id":"5c44beae-ec06-48a0-b417-c6bb3026b638","resolution":{"observed_at":"2026-08-07T12:59:30.808239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:30.930508Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:30.930508Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:833fdf56bf047e2961363ab71bac6edabcdce317e7e37b13e337baa8a295da21","observation_id":"e49f29be-416b-4239-8ebb-3234e85c6faa","resolution":{"observed_at":"2026-08-07T12:59:30.930508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:31.014314Z","title":"You can choose to add one or two cues","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:31.014314Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:e7b7101227a071e5cfb82169a4fd5e01dfce6184cd4a015de596cd626f961fc4","observation_id":"bd5f39c7-82a0-47e5-b052-e528720b64c1","resolution":{"observed_at":"2026-08-07T12:59:31.014314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:31.102992Z","title":"Novel cues are preferred but not required","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:31.102992Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:44c9e5c46ff949cd4af959b7af3b132bf247d1a32bd1e96be26508fd1724a957","observation_id":"1858efc9-911b-4ab5-b37c-765be498ba55","resolution":{"observed_at":"2026-08-07T12:59:31.102992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:31.254564Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:31.254564Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:031343e3b830db6e112e397f673ab64ffe0685858350444bd31218086172ee58","observation_id":"f67d7969-9178-494d-9f0b-9aaccde3ca9e","resolution":{"observed_at":"2026-08-07T12:59:31.254564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:31.348771Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:31.348771Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:5cd2514e330fda17ce46dcdb9f20729546667b7aae43748a6c45f78d7e5e5db2","observation_id":"be46df3a-8210-4036-b6ff-fe2477a8631e","resolution":{"observed_at":"2026-08-07T12:59:31.348771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:31.455382Z","title":"Emotions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:31.455382Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:4c531a5bade2e4fa148e2a98b888f67ffb7deb11a369fbea83d994332aec902b","observation_id":"6d52ea3c-92b3-462d-bfe4-ed5cf0beed83","resolution":{"observed_at":"2026-08-07T12:59:31.455382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:31.525274Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:31.525274Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:4ecae726935046e16d525f1e397c43c7f053b4d534bc7ae7874af4681d48dd3f","observation_id":"e63bf173-1c7e-4182-8758-33248d42e2ba","resolution":{"observed_at":"2026-08-07T12:59:31.525274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:31.621426Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:31.621426Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:9d19fd986791ce1c605084c6630295bd5e87e402df00fc69581a78a4ae9e8b6b","observation_id":"9031e647-fa41-4c74-b652-45290ba6fafc","resolution":{"observed_at":"2026-08-07T12:59:31.621426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:31.721052Z","title":"24 The main goals for the set are:","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:31.721052Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:c5baad4b60f767ea02d011aa29f2937b8b83df056847f623eae36968fc2b44d7","observation_id":"ae44ed3c-3996-4870-989b-19228291633b","resolution":{"observed_at":"2026-08-07T12:59:31.721052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:31.890385Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:31.890385Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:b6876f0e18e6de7f2979977c88a41ed86b14cc662cd892ef738a9644daf75514","observation_id":"379279bb-1331-4267-a387-cb229366b3d3","resolution":{"observed_at":"2026-08-07T12:59:31.890385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:32.018235Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:32.018235Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:8e1a673040e2ee67b5ea1bf093bfd68c7878e9a6316695e5717402aeabdf6414","observation_id":"bdb7ddf5-6f8b-430b-9cbb-9497568f9ca8","resolution":{"observed_at":"2026-08-07T12:59:32.018235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:32.134190Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:32.134190Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:dadb702b0e3e5850c5e29b986773f97705edfee7796004e0bf9a02b9af250e5c","observation_id":"5c323fcf-5f3e-4d01-a271-85252a4d8d4c","resolution":{"observed_at":"2026-08-07T12:59:32.134190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:32.308858Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:32.308858Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:89869e6f48727608f89618088f6e5e1fad3e17978361859e930ebc52a54d897b","observation_id":"9a3c38c9-0dcb-44fd-b6f1-0be4796b789b","resolution":{"observed_at":"2026-08-07T12:59:32.308858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:59:32.450042Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge","version":1},"reference_index":104,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:32.450042Z"},"links":{"citing_paper":"/paper/2505.23009"},"observation_digest":"sha256:fb4fdc68ce1bcf00e5e63d5974473bc618905646b015a8e64a814f10c8c3ddd8","observation_id":"9f6c2e27-0f66-4f69-8bd8-ec35d2275932","resolution":{"observed_at":"2026-08-07T12:59:32.450042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.23009","last_updated":"2025-05-29T02:36:24Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T12:53:12.968138Z","submitted_at":"2025-05-29T02:36:24Z","title":"EmergentTTS-Eval: Evaluating TTS Models on Complex Prosodic, Expressiveness, and Linguistic Challenges Using Model-as-a-Judge"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":195},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 100 of 195 outbound references and 6 inbound Pith citation observations for arXiv:2505.23009."}