{"as_of":"2026-08-19T14:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:25f37c4037b65c1a75496f54d02e80b0be51aa98e3da9f6c49a89626609439b9","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T23:42:53.805578Z","state":"measured"},{"denominator":72,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":72,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-01T03:50:26.873406Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2505.04113","doi":"10.48550/arxiv.2505.04113","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.04113","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2505.04113 , year=","venue":"ArXiv.org","work_id":"ebd983c0-0fa9-4971-af41-14b4353ef811","year":null},"citing_paper":{"arxiv_id":"2606.11219","last_updated":"2026-05-11T20:27:40Z","snapshot_observed_at":"2026-08-05T20:46:41.277498Z","submitted_at":"2026-05-11T20:27:40Z","title":"Afrispeech Semantics: Evaluating Audio Semantic Reasoning in Spoken Language Models Across Domains and Accents","version":1},"reference_index":160,"source":"arxiv_source","source_observed_at":"2026-06-30T22:11:44.891731Z"},"links":{"cited_paper":"/paper/2505.04113","citing_paper":"/paper/2606.11219"},"observation_digest":"sha256:eda50835cbc0651e3ff7082552bfc9ef78bb82cb1589de12d71e51653396d103","observation_id":"b719acc5-8566-4fb8-a1e6-94edf174f7f8","resolution":{"observed_at":"2026-06-30T22:15:05.542666Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"cited_work":{"arxiv_id":"2505.04113","doi":"10.48550/arxiv.2505.04113","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.04113","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2505.04113 , year=","venue":"ArXiv.org","work_id":"ebd983c0-0fa9-4971-af41-14b4353ef811","year":null},"citing_paper":{"arxiv_id":"2606.31247","last_updated":"2026-06-30T07:24:10Z","snapshot_observed_at":"2026-08-13T09:35:09.713263Z","submitted_at":"2026-06-30T07:24:10Z","title":"FlexiSLM: A Dynamic and Controllable Frame Rate Spoken Language Model","version":1},"reference_index":237,"source":"arxiv_source","source_observed_at":"2026-07-01T03:50:26.873406Z"},"links":{"cited_paper":"/paper/2505.04113","citing_paper":"/paper/2606.31247"},"observation_digest":"sha256:874cd0105b97223f75a7383effa6eaa255145d0ba8492dab9ce86699c04d4741","observation_id":"d3e9bbc8-f5f1-4916-948d-b4831abe5629","resolution":{"observed_at":"2026-07-01T11:55:42.266206Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.04113/citation-record","integrity":"/paper/2505.04113/integrity","json":"/paper/2505.04113/citation-record.json","paper":"/paper/2505.04113"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-17T03:25:04.404839Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-15T23:42:53.382881Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.382881Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:f07b94c5a56fdde3438817f06cf06f21658ea02be9d5be02ac0e82bacf3cd9a9","observation_id":"1a7df6e4-fbf8-4191-8a8a-c79b921f0ec1","resolution":{"observed_at":"2026-08-15T23:42:53.382881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-08-15T11:55:32.600679Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-15T23:42:53.429120Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.429120Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:7cf5126958100da6d987a5e1ffbaf3a81df46b856dc71cdfb1b37982fc60c4ca","observation_id":"4e61aeb9-fa24-4000-8acd-1f5de6c1e587","resolution":{"observed_at":"2026-08-15T23:42:53.429120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-12T13:38:15.911519Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-15T23:42:53.435184Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.435184Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:60cd48134e5cb2f42714a0f28630b44466311013ec7eb296aba247fe59922fc4","observation_id":"0fec1e81-ec53-4289-8fb0-9aeafa1c6848","resolution":{"observed_at":"2026-08-15T23:42:53.435184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-15T23:42:53.440665Z","title":"Brown, Jack Clark, Sam McCandlish, Chris Olah, Benjamin Mann, and Jared Kaplan","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.440665Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:5246a407ee96e6cdfc4ff04d82e3e674e6e2dde6dd6bf13c6c43d3ef56a73c43","observation_id":"c054b9b9-5f4f-40f6-8551-940fe0138671","resolution":{"observed_at":"2026-08-15T23:42:53.440665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:42:55.085832Z","title":null,"venue":null,"work_id":"39cae41e-2de3-4d39-9c1c-d9dece087f84","year":2023},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.446506Z"},"links":{"citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:4d817aa958f4b2715275de9a56fa299e0626c90ffde875ec35ca373726fbd3dc","observation_id":"4a136a66-6ecf-46cf-aa10-4af35ee3b71c","resolution":{"observed_at":"2026-08-15T23:42:55.090896Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09636","last_updated":"2023-05-16T17:41:25Z","snapshot_observed_at":"2026-08-19T12:40:58.936874Z","submitted_at":"2023-05-16T17:41:25Z","title":"SoundStorm: Efficient Parallel Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.09636","snapshot_observed_at":"2026-08-15T23:42:53.451504Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.451504Z"},"links":{"cited_paper":"/paper/2305.09636","citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:17f90c793e019f541cda28f35aef5f2334a25eeb0f2eb9a037b99a3f28804625","observation_id":"8a4fdccd-eb9b-4ad5-81a9-c3a33c7f376e","resolution":{"observed_at":"2026-08-15T23:42:53.451504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:42:55.069746Z","title":null,"venue":null,"work_id":"8e370a04-4193-4448-bcfe-6f96b8c7c703","year":2024},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.457377Z"},"links":{"citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:cb459dac5e0310dbab7e184620b46ad4e2397f6757fab838bd805676eae2f200","observation_id":"8d8b4098-e038-4e14-9b6a-916c39232cf1","resolution":{"observed_at":"2026-08-15T23:42:55.074759Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00654","last_updated":"2024-06-02T07:54:33Z","snapshot_observed_at":"2026-08-16T13:47:03.288626Z","submitted_at":"2024-06-02T07:54:33Z","title":"Enhancing Zero-shot Text-to-Speech Synthesis with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00654","snapshot_observed_at":"2026-08-15T23:42:53.462636Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.462636Z"},"links":{"cited_paper":"/paper/2406.00654","citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:bbe83f7b6ba2296d1192e0cb95834d7867362cbbf58b7f1bbe5a64db4a9328f7","observation_id":"08898a01-1af3-4201-a8ae-8b94ada6e9b9","resolution":{"observed_at":"2026-08-15T23:42:53.462636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14632","last_updated":"2024-11-15T20:10:29Z","snapshot_observed_at":"2026-08-18T20:07:39.602221Z","submitted_at":"2024-05-23T14:39:35Z","title":"DLPO: Diffusion Model Loss-Guided Reinforcement Learning for Fine-Tuning Text-to-Speech Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14632","snapshot_observed_at":"2026-08-15T23:42:53.468382Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.468382Z"},"links":{"cited_paper":"/paper/2405.14632","citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:14a33208c821436a2e5bb0edb4ccbcadd455f3f9ce7f891bea908deafb3f40aa","observation_id":"550ed16d-b6da-440e-87b5-8eb46b30387d","resolution":{"observed_at":"2026-08-15T23:42:53.468382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:42:53.473616Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.473616Z"},"links":{"citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:7c7c98d3dd06133e64f66333ee97b5ea51fc7e955fe4513e7d046e08cd262f82","observation_id":"3f7da104-808d-4685-a7f4-e6cbb78ac27c","resolution":{"observed_at":"2026-08-15T23:42:53.473616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-16T05:58:47.061997Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06885","snapshot_observed_at":"2026-08-15T23:42:53.478975Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.478975Z"},"links":{"cited_paper":"/paper/2410.06885","citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:9f91cb2ea21cfae0577e66ffe051d433da4e72c44dd8fee755b3696ddcec2fbf","observation_id":"0b384649-ebfd-481b-aa21-a76293ff8383","resolution":{"observed_at":"2026-08-15T23:42:53.478975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:42:55.042640Z","title":null,"venue":null,"work_id":"26801b00-741f-4269-aa41-9cffff2be4fa","year":2024},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.484988Z"},"links":{"citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:da970bda1bfaa7514220b16aec159d5fab177172f3769ca7297b7593a5e2d419","observation_id":"9c450d1e-8039-4c40-a742-23278d67cec3","resolution":{"observed_at":"2026-08-15T23:42:55.047622Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:42:53.489615Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.489615Z"},"links":{"citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:87c33d7d9b5bcdcbeeaa53413f620df0a5ab24a0790cd66a81b828d8179acb66","observation_id":"4193e79f-63bf-4d06-b964-160b40e1f1d4","resolution":{"observed_at":"2026-08-15T23:42:53.489615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:42:55.015559Z","title":null,"venue":null,"work_id":"14274f33-6e40-4f34-b9db-338c916d22b7","year":2025},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.508501Z"},"links":{"citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:c578c05fa8479027c7f632d371a68919e8acc9defe49d3d7cddc20ae3da16b83","observation_id":"adaeb182-26eb-4d52-8343-0b7745adbe83","resolution":{"observed_at":"2026-08-15T23:42:55.020747Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-18T18:18:37.449517Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-15T23:42:53.515086Z","title":"Zhang, Han Bao, Hanwei Xu, Haocheng Wang, Haowei Zhang, Honghui Ding, Huajian Xin, Huazuo Gao, Hui Li, Hui Qu, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.515086Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:7cbe21a259b836a4d5fe5429e09ec7e1d3fe38066e5f44088891a581156a4edc","observation_id":"227841fa-f122-4f82-a3c6-48375cb356ea","resolution":{"observed_at":"2026-08-15T23:42:53.515086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:42:54.999590Z","title":null,"venue":null,"work_id":"49ec6c59-1ded-4afa-adc3-5d102367fe5a","year":2023},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.519735Z"},"links":{"citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:97c889f531cd3f84b55a6856b6d927c6f61ee4af0aa72f513243f2f9633c4cbe","observation_id":"bc12a36a-9d15-4775-ba5b-8aec19a18020","resolution":{"observed_at":"2026-08-15T23:42:55.004563Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-08-10T17:49:50.848957Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-15T23:42:53.525148Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.525148Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:effed821239ed5be37c3fc9de9709b50336066f41f0b05d9a2ccd234bf93266d","observation_id":"4b9d0206-f088-47d9-b4de-4fc0bb4b75d1","resolution":{"observed_at":"2026-08-15T23:42:53.525148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-16T06:25:22.037199Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-15T23:42:53.531276Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.531276Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:9c21d38b101a836a66d60610d6f56c7338fef4b74b2fdedd8a973e43faa1ebdb","observation_id":"b974ab77-f39f-4698-aa0a-3819e789bd47","resolution":{"observed_at":"2026-08-15T23:42:53.531276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-15T23:42:53.536759Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.536759Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:7423478163f2e337cf56778f02c3c730797d8af00bcffbf4ea9891fea7d8f6d3","observation_id":"548bbc03-0ef8-4a2a-8ffa-0f6d91197ae8","resolution":{"observed_at":"2026-08-15T23:42:53.536759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:42:54.984589Z","title":null,"venue":null,"work_id":"52d8abae-c002-47d4-b426-84aff6ef570a","year":2024},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.542162Z"},"links":{"citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:3f8bffca875572bda3b993f3924ba33a31864f165cb4fa2971d821d01e5dfe81","observation_id":"cabe3b75-9f3d-4e20-b3e4-bf3f270eb961","resolution":{"observed_at":"2026-08-15T23:42:54.989490Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04734","last_updated":"2025-02-24T22:15:33Z","snapshot_observed_at":"2026-08-16T13:12:03.878698Z","submitted_at":"2024-10-07T04:00:22Z","title":"TLDR: Token-Level Detective Reward Model for Large Vision Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04734","snapshot_observed_at":"2026-08-15T23:42:53.547349Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.547349Z"},"links":{"cited_paper":"/paper/2410.04734","citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:fba4769e5e4577c9650a1627b251ac2d1ff4d404a529c52ea30eedd35c23e0ca","observation_id":"8dd4a8ed-5495-406d-a597-ff41b1f19ef2","resolution":{"observed_at":"2026-08-15T23:42:53.547349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10157","last_updated":"2024-09-16T10:41:36Z","snapshot_observed_at":"2026-08-18T15:54:25.810801Z","submitted_at":"2024-09-16T10:41:36Z","title":"Emo-DPO: Controllable Emotional Speech Synthesis through Direct Preference Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10157","snapshot_observed_at":"2026-08-15T23:42:53.552909Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.552909Z"},"links":{"cited_paper":"/paper/2409.10157","citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:d2c9b31b8dc0e95c24f3a0a072d00bf363e85a804fa68383cac8628af1831341","observation_id":"b4a844c4-906c-45a7-835b-d867ddb0714e","resolution":{"observed_at":"2026-08-15T23:42:53.552909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:42:54.968328Z","title":null,"venue":null,"work_id":"8c710b19-61fd-4081-99cf-d91ff2775bfd","year":2023},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.559248Z"},"links":{"citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:1b0c88e3dae1e93e83496b4d1081199c60cbe1524a829d98e98b5cfd1ed529d3","observation_id":"c374b99a-d696-4c37-92a7-28badd20c2da","resolution":{"observed_at":"2026-08-15T23:42:54.973191Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:42:54.952110Z","title":null,"venue":null,"work_id":"89fc84f2-89ef-4b0d-a485-5428442ab13c","year":2022},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.564993Z"},"links":{"citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:9ffa88a5dd65124ca9b1373c8de185644ec8a6be3044d654ba44fbe3f83bbe29","observation_id":"f7d061ae-9426-4c05-9c45-c5d549e87bed","resolution":{"observed_at":"2026-08-15T23:42:54.957150Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-08-19T09:44:27.064800Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-08-15T23:42:53.570692Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.570692Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:c56b045d9c271d87d431305dc6ecbd44edd1311fe746335aef7e5ecc580c9525","observation_id":"10f9e75e-9f22-4a58-99ac-41179a7d52cd","resolution":{"observed_at":"2026-08-15T23:42:53.570692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:42:54.936768Z","title":null,"venue":null,"work_id":"0a992b12-fef9-463b-84f8-68dbc28537ca","year":2021},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.576247Z"},"links":{"citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:1fd5444b47ebd45d1c689c0e7f50cd44a4095a7e1a49881627a57bd76568eee0","observation_id":"fd9dc5b2-1d60-4564-a35a-0034003851e0","resolution":{"observed_at":"2026-08-15T23:42:54.941613Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:42:54.920610Z","title":null,"venue":null,"work_id":"fe2921c3-8622-42bb-ba81-b629c6ad9d60","year":2024},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.581917Z"},"links":{"citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:ae398cd8cffff52f7b85b0f3dcd5e35c763f3f981b478c6f373ea2a6b216e36b","observation_id":"f3450993-6148-4fad-91e6-89f8786619ea","resolution":{"observed_at":"2026-08-15T23:42:54.925550Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:42:53.587276Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.587276Z"},"links":{"citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:9636adad1a6c17d4ba6136c0e70579b050923645a44c6f83361b52244a684852","observation_id":"400dfd54-299e-4dba-825a-95e6c4df6a19","resolution":{"observed_at":"2026-08-15T23:42:53.587276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02243","last_updated":"2024-07-02T13:04:04Z","snapshot_observed_at":"2026-08-16T13:37:45.320757Z","submitted_at":"2024-07-02T13:04:04Z","title":"Robust Zero-Shot Text-to-Speech Synthesis with Reverse Inference Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02243","snapshot_observed_at":"2026-08-15T23:42:53.592249Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.592249Z"},"links":{"cited_paper":"/paper/2407.02243","citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:ab7e353826aebcb48e4ba48233bebf157267af689bd7dd4004023a279e21a134","observation_id":"089ac67b-246b-4415-813f-8e7d7cc319da","resolution":{"observed_at":"2026-08-15T23:42:53.592249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05236","last_updated":"2025-07-22T21:32:13Z","snapshot_observed_at":"2026-08-16T02:03:06.649495Z","submitted_at":"2025-02-07T06:47:11Z","title":"Koel-TTS: Enhancing LLM based Speech Generation with Preference Alignment and Classifier Free Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05236","snapshot_observed_at":"2026-08-15T23:42:53.597794Z","title":"Desta, Roy Fejgin, Rafael Valle, and Jason Li","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.597794Z"},"links":{"cited_paper":"/paper/2502.05236","citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:0b2ca5b92a706c157c3983ad8ea7a8346c771e76b6ad74a651eda28ccb239401","observation_id":"f49712de-77ee-4112-ba43-b53ef2517a5e","resolution":{"observed_at":"2026-08-15T23:42:53.597794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:42:54.904986Z","title":null,"venue":null,"work_id":"13e70687-ead1-4718-a105-5b83370d8d03","year":2024},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.602750Z"},"links":{"citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:c10ca81dc685d4b6f719174177776cbc0b05e782d1cc115b774a44fdafebb57f","observation_id":"d3b2ccae-7020-4ddd-acfd-201b60c0d5ef","resolution":{"observed_at":"2026-08-15T23:42:54.909712Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:42:54.888233Z","title":null,"venue":null,"work_id":"ad2ae5a5-6de6-4f5c-8b67-bff83fc12d60","year":2020},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.607183Z"},"links":{"citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:03a87b3908feba60d360c7fc66bd41f78fba7d964f1cbb8c504f4d1704b1a652","observation_id":"e9c17c1b-7f1f-4802-a957-c16d7ebf814f","resolution":{"observed_at":"2026-08-15T23:42:54.893366Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:42:54.870761Z","title":null,"venue":null,"work_id":"069245f8-2117-49f7-86b6-be4bee9c0f2b","year":2023},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.612006Z"},"links":{"citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:193cd13cba1c0d57a1496fa751a1a76993096c671a3e528bfbd576783921a4fb","observation_id":"03548c78-377f-4458-afc5-2db73b8d1b13","resolution":{"observed_at":"2026-08-15T23:42:54.876839Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:42:54.854309Z","title":null,"venue":null,"work_id":"05974429-4941-42cc-9058-876e2c2ccc79","year":2025},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.616509Z"},"links":{"citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:eb237515186d85013155af30123e5c2e18db2b105dd7c7a340fee3c033fb84d0","observation_id":"bdb722d8-41d7-492d-acb8-b1e44dd4a63c","resolution":{"observed_at":"2026-08-15T23:42:54.859191Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-08-19T01:21:28.929963Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15442","snapshot_observed_at":"2026-08-15T23:42:53.621398Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.621398Z"},"links":{"cited_paper":"/paper/2501.15442","citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:edb4b365967dcf60951b35d83db5d281de3126eaaf9d5a6dee9fe231ac80bc70","observation_id":"e2abf169-c2ff-415a-a94e-9440f8ff8bed","resolution":{"observed_at":"2026-08-15T23:42:53.621398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:42:54.836641Z","title":null,"venue":null,"work_id":"0edb2b39-b2dc-49e2-b1b0-c47f1731f218","year":2024},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.627729Z"},"links":{"citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:ef947fef8312b4127507649060c8993f5151fa7f63c879839b92034ffef1db52","observation_id":"c4d66328-e242-42d8-bfc4-c8d92eee597e","resolution":{"observed_at":"2026-08-15T23:42:54.842209Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:42:54.818890Z","title":null,"venue":null,"work_id":"a0916c0a-abb1-4ec6-b06c-ff78998d8ad6","year":2024},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.633521Z"},"links":{"citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:956e6683484cd826f5ae6c37f7f4d28ca1289184b541b1cc7b115b4fa89d3ea3","observation_id":"feb0c688-75ec-4004-9c61-584a25c57995","resolution":{"observed_at":"2026-08-15T23:42:54.823771Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:42:54.802699Z","title":null,"venue":null,"work_id":"04067381-8752-4157-8b86-ffe02cfabaef","year":2024},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.639014Z"},"links":{"citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:43c89727c63908d36d00cecfa47b67a8129abe30a7e06114e1bbfa8fe5393527","observation_id":"a2782b34-7f3c-4f5c-aaf6-ea0c4c459a6e","resolution":{"observed_at":"2026-08-15T23:42:54.807908Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:42:54.786719Z","title":null,"venue":null,"work_id":"d95d805b-97c4-4bb2-a3bc-dba38eeb87fa","year":2023},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.644218Z"},"links":{"citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:ff4e3c39cc6b8c56eede48f01ce6f2e7b4479705887f9ceb9809f20858a0c52c","observation_id":"90679bdc-6143-4dc5-863f-534d97529010","resolution":{"observed_at":"2026-08-15T23:42:54.791659Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:42:54.771021Z","title":null,"venue":null,"work_id":"cccd08f6-344c-40d7-96fa-b696c2495086","year":2024},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.649412Z"},"links":{"citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:9810116bbe660c5af1877b5395ba64a69103e7a9ee88b7f94a741a786b45fccd","observation_id":"2e67078e-9dbf-48ae-b7fc-11c2a8cf29d0","resolution":{"observed_at":"2026-08-15T23:42:54.775959Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:42:54.753536Z","title":null,"venue":null,"work_id":"a678064f-a538-413c-be5e-46ff16364528","year":2024},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.654555Z"},"links":{"citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:22335378f045b4465c2eaac9111906a233f3ef6dac2cb77c1c838265d96e01f2","observation_id":"fe585f51-30b8-4557-ac6b-81cd3419d739","resolution":{"observed_at":"2026-08-15T23:42:54.758884Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:42:53.659510Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.659510Z"},"links":{"citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:d73e0a9d5ca7a24cb8d0620dd7063b51c512848c70a70ab5c583b693e9b72908","observation_id":"39689887-aefa-408b-9359-f2cfac8868eb","resolution":{"observed_at":"2026-08-15T23:42:53.659510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:42:53.664978Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.664978Z"},"links":{"citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:ac6455265ced4f647044c6df41ce748b0dca041adec6d2f614c5b22b629c2669","observation_id":"c96d2b90-d07b-408b-80bd-4d0e5ec3e0af","resolution":{"observed_at":"2026-08-15T23:42:53.664978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16973","last_updated":"2024-06-14T00:29:46Z","snapshot_observed_at":"2026-08-18T04:44:05.593401Z","submitted_at":"2024-03-25T17:38:32Z","title":"VoiceCraft: Zero-Shot Speech Editing and Text-to-Speech in the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16973","snapshot_observed_at":"2026-08-15T23:42:53.670578Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.670578Z"},"links":{"cited_paper":"/paper/2403.16973","citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:6a964f036d2ef3274275fcf72cf2748d8e02817a96df84ee2217f99560002d6d","observation_id":"479152ae-c86a-4608-990d-c04855847f0b","resolution":{"observed_at":"2026-08-15T23:42:53.670578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:42:53.677136Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.677136Z"},"links":{"citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:80cd15add59bf97381c5564d5c0a50fe3c77d2a4fad1c9c034b8b85d6c545e12","observation_id":"440dfa31-0be3-409f-b196-f0a88836e22b","resolution":{"observed_at":"2026-08-15T23:42:53.677136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:42:53.682470Z","title":"Manning, Stefano Ermon, and Chelsea Finn","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.682470Z"},"links":{"citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:e0a343ea82a2973edff86caf3bb2c899832f505e669edfdb8b0c85d0ee6ae92f","observation_id":"e7219b7a-c1e8-4a69-bf7a-79d6ed03e093","resolution":{"observed_at":"2026-08-15T23:42:53.682470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:42:54.693980Z","title":null,"venue":null,"work_id":"06503e0d-c98a-4766-b8bb-841d4fb80f55","year":2022},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.687405Z"},"links":{"citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:bf99e05423ff516782465fdb0ade1d7665c992d26e40925e045c408110ad5b9d","observation_id":"a4a24be6-86ce-4818-bf2e-2667107f0043","resolution":{"observed_at":"2026-08-15T23:42:54.698960Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:42:54.675015Z","title":null,"venue":null,"work_id":"c0ae663c-2568-4e06-adbf-0d79fc636c2b","year":2024},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.692676Z"},"links":{"citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:e43ae7af03886d44ebfb360e6821ec718078252379421bcc745d842f74938ae1","observation_id":"7b849058-daaf-4820-93e2-2be380a934c7","resolution":{"observed_at":"2026-08-15T23:42:54.680850Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:42:54.658104Z","title":null,"venue":null,"work_id":"b6a51ba9-001e-4a6c-858d-f4c90da5b8dd","year":2024},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.697796Z"},"links":{"citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:cf96c5c93e3198e88ad4993eaf77f15e53bacc7e6bb083d7cea69f0aac21b6c0","observation_id":"e6a42e10-03c9-4faf-8a9e-96841871c8e9","resolution":{"observed_at":"2026-08-15T23:42:54.663032Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:42:54.641818Z","title":null,"venue":null,"work_id":"c36c55c2-b85d-4d4c-b9ab-2a682b91d2af","year":2022},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.702994Z"},"links":{"citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:827cab77e1e1b314eb99a8d292a823357d1d820769297984d779b7aad97d22bc","observation_id":"4778406c-3704-4c23-a49d-c691c86f6bb8","resolution":{"observed_at":"2026-08-15T23:42:54.647101Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:42:54.626322Z","title":null,"venue":null,"work_id":"3d41b7f6-4aef-42e8-9914-20095b0a2bad","year":2023},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.708270Z"},"links":{"citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:9c4ba17e2d2713427639edd95c75fb8edd01a590d6167879b4c881818c453d34","observation_id":"ac7cc6b3-b93d-415c-ae03-2e4ea62851af","resolution":{"observed_at":"2026-08-15T23:42:54.631142Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12403","last_updated":"2024-09-19T01:58:19Z","snapshot_observed_at":"2026-08-16T13:17:19.941639Z","submitted_at":"2024-09-19T01:58:19Z","title":"Preference Alignment Improves Language Model-Based TTS","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12403","snapshot_observed_at":"2026-08-15T23:42:53.713408Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.713408Z"},"links":{"cited_paper":"/paper/2409.12403","citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:630e8635876d7b2a2a46c2efa4d42a01278d7d88eedfe7618fc79a878666a46c","observation_id":"1f5076a4-30fc-41fd-9eb9-160db611f4c9","resolution":{"observed_at":"2026-08-15T23:42:53.713408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:42:54.610664Z","title":null,"venue":null,"work_id":"a5d8b190-7506-475f-a68c-5b8897d84767","year":2024},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.718479Z"},"links":{"citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:2a8e1044223d1c997aadc2a816b129318792a441ac20e3f804abea5281a0f89f","observation_id":"5472b71c-30cc-4302-8aa7-a70f2d34de2a","resolution":{"observed_at":"2026-08-15T23:42:54.615562Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-15T23:42:53.723565Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.723565Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:18dcd3e1fa1b13675eedd91d1226f2e587083a30f130593abd0ee24ae58a767e","observation_id":"f2993fc9-7472-4e96-87e7-c7adc9d5e8b2","resolution":{"observed_at":"2026-08-15T23:42:53.723565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:42:54.594831Z","title":null,"venue":null,"work_id":"358b59f0-5f8a-4f87-95c5-13dd47052dfd","year":2025},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.729052Z"},"links":{"citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:21c2eb264c234dc0c8be5e5ce2364676af377c2bb8846a825efb5d421ffd5fdd","observation_id":"07b4463b-47b6-46e3-89e5-055217e8dce1","resolution":{"observed_at":"2026-08-15T23:42:54.599497Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03128","last_updated":"2025-02-05T12:36:21Z","snapshot_observed_at":"2026-08-18T17:13:14.270187Z","submitted_at":"2025-02-05T12:36:21Z","title":"Metis: A Foundation Speech Generation Model with Masked Generative Pre-training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03128","snapshot_observed_at":"2026-08-15T23:42:53.733849Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.733849Z"},"links":{"cited_paper":"/paper/2502.03128","citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:a2e647413a74fca348615ca82485c6993983116cf46f749bc3b29519597182da","observation_id":"448c2c86-a5cb-4783-bbc0-b612765e4522","resolution":{"observed_at":"2026-08-15T23:42:53.733849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:42:53.739056Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.739056Z"},"links":{"citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:9a400dd85b8bd1ae9b3dafe5ccf36e8f110614f8582554c63372e2a0f5b799a0","observation_id":"8737ed2e-2e1e-4492-bac2-4446a732a009","resolution":{"observed_at":"2026-08-15T23:42:53.739056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:42:54.568439Z","title":null,"venue":null,"work_id":"d4241255-90df-497a-b77b-14906d71355a","year":2024},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.744411Z"},"links":{"citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:eee6ec332adea394a57ea07777b6b108502309f07616c0b8643838af8b96d341","observation_id":"2fdcfe42-5cb4-448a-961c-a2f136e1253a","resolution":{"observed_at":"2026-08-15T23:42:54.573360Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:42:54.552685Z","title":null,"venue":null,"work_id":"372f4f10-5031-4fb5-9a83-2d1577cbdc75","year":2023},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.749155Z"},"links":{"citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:4ef53b77d163ba1f4849dc40535bd274cbf57516bf763027b456cc7b63458304","observation_id":"a01d4a64-ce51-4701-ba2b-85d3e5b7c7bc","resolution":{"observed_at":"2026-08-15T23:42:54.557479Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-08-17T11:08:48.802438Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-15T23:42:53.754630Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.754630Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:8e7fbc6588f60e198bb4d80c5bcc6a6834683ef37861948bc91c5e7cdfe2979f","observation_id":"eceea7f9-6814-4320-ad10-83d7f16dc911","resolution":{"observed_at":"2026-08-15T23:42:53.754630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-15T23:42:53.759449Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.759449Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:4641857c1d79a2b28ac880c0b54ad4be2a63d5d610f6caa5e8bd0359c555a87b","observation_id":"a2e45ab6-71ea-43e4-834e-d74a9a321df3","resolution":{"observed_at":"2026-08-15T23:42:53.759449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:42:53.764204Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.764204Z"},"links":{"citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:eb0bca8b2e16b148f8a799c8d5093fb9a5de8dd584e69e7308167a87ab9d6973","observation_id":"2b37bf12-725d-486b-9c8b-11c6521e5cb4","resolution":{"observed_at":"2026-08-15T23:42:53.764204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:42:53.768989Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.768989Z"},"links":{"citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:478c1ba4e82429b3885d842f19e3d6efba04713bd6e766ee3be8ee5fc222fbe9","observation_id":"065e654a-1738-4839-844a-b7ec9c4832b8","resolution":{"observed_at":"2026-08-15T23:42:53.768989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:42:54.526579Z","title":null,"venue":null,"work_id":"46f10964-3618-4554-9209-cbc629019f2e","year":2024},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.774266Z"},"links":{"citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:23c0896e1869cf57722418fe1e20940dc0afd7ef23868f135a5a55c7ea6a99f9","observation_id":"6fc6d839-8263-4e84-a789-1b169e45c526","resolution":{"observed_at":"2026-08-15T23:42:54.531673Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05868","last_updated":"2024-10-10T22:00:41Z","snapshot_observed_at":"2026-07-06T17:57:27.510162Z","submitted_at":"2024-04-08T21:05:42Z","title":"Negative Preference Optimization: From Catastrophic Collapse to Effective Unlearning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05868","snapshot_observed_at":"2026-08-15T23:42:53.779240Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.779240Z"},"links":{"cited_paper":"/paper/2404.05868","citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:f3893008c20cca1239847197110f9926ba5efb95a48df6cb6de42a414bfe3578","observation_id":"1bcea1b1-1a04-429e-a40c-5ebef4a0ce7f","resolution":{"observed_at":"2026-08-15T23:42:53.779240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:42:54.510987Z","title":null,"venue":null,"work_id":"ad789277-a14f-4855-82e0-ac7b2790c0c5","year":2024},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.784486Z"},"links":{"citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:1ebb3694f8704483ab414c45b879b92b9c4e5b4faeb6090e9c2646dfcb9664fc","observation_id":"2186a10a-f63c-4d32-8698-d5870c802a3d","resolution":{"observed_at":"2026-08-15T23:42:54.515708Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:42:54.495248Z","title":null,"venue":null,"work_id":"d00e66e1-fd2a-41c3-a719-6527871f91c0","year":2025},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.789633Z"},"links":{"citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:2e5d51b38bc325c0afefecb119ecf72c9f8b21f389025a901f3d0c0ede66fdd3","observation_id":"c79f1747-c83a-41f8-b5a5-7e6cb985cebc","resolution":{"observed_at":"2026-08-15T23:42:54.499871Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:42:54.478357Z","title":null,"venue":null,"work_id":"e97a9263-c609-4c93-a894-e982aeca65d7","year":2024},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.795052Z"},"links":{"citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:8df46f161b024b63099235daf590501251bbc4edf755db65d1853c45ad8432f9","observation_id":"b80548c6-48ef-4bf0-84f1-aaadf282322c","resolution":{"observed_at":"2026-08-15T23:42:54.483979Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:42:53.800202Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.800202Z"},"links":{"citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:13c82b6e72f59f2ca5d16b8655a57121a86f721cc5e832f507d63567201b0ec8","observation_id":"f78a5245-eab7-4d94-bb44-e49322bd21d1","resolution":{"observed_at":"2026-08-15T23:42:53.800202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:42:53.805578Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-15T23:42:53.805578Z"},"links":{"citing_paper":"/paper/2505.04113"},"observation_digest":"sha256:df6ea7c3dd1ccd6c59086d4a9f11fccbcbcc08de26015a51d376e142765e9ae2","observation_id":"70d85a7e-1406-4e45-af06-e32a602b289d","resolution":{"observed_at":"2026-08-15T23:42:53.805578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.04113","last_updated":"2025-06-06T06:26:44Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-17T18:27:10.838413Z","submitted_at":"2025-05-07T04:04:31Z","title":"Advancing Zero-shot Text-to-Speech Intelligibility across Diverse Domains via Preference Alignment"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":70,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 2 inbound Pith citation observations for arXiv:2505.04113."}