{"as_of":"2026-08-14T19:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e37845e33ccea89bf6e4bdca932a9e946e3bfee33e814056c17a7f66d5d9e5de","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T13:24:34.291292Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T13:24:34.127489Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T23:39:03.102169Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.00685","last_updated":"2025-08-31T03:57:42Z","snapshot_observed_at":"2026-08-07T02:37:09.798161Z","submitted_at":"2025-08-31T03:57:42Z","title":"MPO: Multidimensional Preference Optimization for Language Model-based Text-to-Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.00685","snapshot_observed_at":"2026-08-05T13:24:34.127489Z","title":"Several works in the speech community have explored in- tegrating human evaluation into LM-based TTS optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00685","last_updated":"2025-08-31T03:57:42Z","snapshot_observed_at":"2026-08-07T02:37:09.798161Z","submitted_at":"2025-08-31T03:57:42Z","title":"MPO: Multidimensional Preference Optimization for Language Model-based Text-to-Speech","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T13:24:34.127489Z"},"links":{"cited_paper":"/paper/2509.00685","citing_paper":"/paper/2509.00685"},"observation_digest":"sha256:3f4d2d3cf1b45b66f22a7df28f5a32c2b26a32ae0eaa934063040883c5c85857","observation_id":"a4029945-90a5-4bdd-bf1a-6fef626d8fd9","resolution":{"observed_at":"2026-08-05T13:24:34.127489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00685","last_updated":"2025-08-31T03:57:42Z","snapshot_observed_at":"2026-08-07T02:37:09.798161Z","submitted_at":"2025-08-31T03:57:42Z","title":"MPO: Multidimensional Preference Optimization for Language Model-based Text-to-Speech","version":1},"cited_work":{"arxiv_id":"2509.00685","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.00685","snapshot_observed_at":"2026-07-03T23:39:03.102169Z","title":"MPO: Multidimensional preference optimization for language model-based text-to-speech,","venue":null,"work_id":"4bb95aac-f1e7-48d8-9078-b75492f88897","year":2025},"citing_paper":{"arxiv_id":"2606.15313","last_updated":"2026-07-02T14:38:44Z","snapshot_observed_at":"2026-08-08T22:19:08.235689Z","submitted_at":"2026-06-13T14:09:06Z","title":"DDPO-VC: Speaker De-Identification via Diffusion Denoising Policy Optimization","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-03T23:35:59.957825Z"},"links":{"cited_paper":"/paper/2509.00685","citing_paper":"/paper/2606.15313"},"observation_digest":"sha256:75e1b9cc20a0b8cd700eab1976d14b0ce60ed7dc093d50dacc29925ae32b6f6f","observation_id":"ce65c129-29fa-4979-8e1e-73b6d3e69823","resolution":{"observed_at":"2026-07-03T23:39:03.104994Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2509.00685/citation-record","integrity":"/paper/2509.00685/integrity","json":"/paper/2509.00685/citation-record.json","paper":"/paper/2509.00685"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:34.882871Z","title":"LM-based TTS systems convert speech waveforms into sequences of discrete tokens using neural audio codecs [1, 2, 3, 4, 5] and operate in a discrete space [6, 7]","venue":null,"work_id":"c4ac5357-8552-48f4-bfc5-2b5966796ca2","year":null},"citing_paper":{"arxiv_id":"2509.00685","last_updated":"2025-08-31T03:57:42Z","snapshot_observed_at":"2026-08-07T02:37:09.798161Z","submitted_at":"2025-08-31T03:57:42Z","title":"MPO: Multidimensional Preference Optimization for Language Model-based Text-to-Speech","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T13:24:34.122679Z"},"links":{"citing_paper":"/paper/2509.00685"},"observation_digest":"sha256:c98b3ba6a4b9f521f8e6d1c371cd1f747d0997865090aab2344cf58c1e60c97c","observation_id":"c1474778-faef-41c8-8129-2ccfac66fa38","resolution":{"observed_at":"2026-08-05T13:24:34.888239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:34.867762Z","title":"Preference Alignment Preference alignment is often formatted as a reinforcement learning problem","venue":null,"work_id":"bea2ba47-dcf7-4c7f-9829-85a2e9e28839","year":null},"citing_paper":{"arxiv_id":"2509.00685","last_updated":"2025-08-31T03:57:42Z","snapshot_observed_at":"2026-08-07T02:37:09.798161Z","submitted_at":"2025-08-31T03:57:42Z","title":"MPO: Multidimensional Preference Optimization for Language Model-based Text-to-Speech","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T13:24:34.132737Z"},"links":{"citing_paper":"/paper/2509.00685"},"observation_digest":"sha256:759a35393c2cee79b5636428a1a72545641b610722c16da0b6e0b4442b0a3eb1","observation_id":"38e3ca5f-8b4e-4350-8104-c02830c7d831","resolution":{"observed_at":"2026-08-05T13:24:34.872374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:34.852888Z","title":"MPO involves constructing a multidi- mensional preference dataset and incorporating additional reg- ularization during training to prevent model degradation","venue":null,"work_id":"fb7a356e-5c65-42ad-b155-f4e35356f95e","year":null},"citing_paper":{"arxiv_id":"2509.00685","last_updated":"2025-08-31T03:57:42Z","snapshot_observed_at":"2026-08-07T02:37:09.798161Z","submitted_at":"2025-08-31T03:57:42Z","title":"MPO: Multidimensional Preference Optimization for Language Model-based Text-to-Speech","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T13:24:34.137462Z"},"links":{"citing_paper":"/paper/2509.00685"},"observation_digest":"sha256:addce40c07b33f79f7dd04377563d42b09e8b60affc8adaf5da18fee5b4ad721","observation_id":"96266f2d-f5fc-4393-93df-12378db3151d","resolution":{"observed_at":"2026-08-05T13:24:34.857606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:34.839195Z","title":null,"venue":null,"work_id":"f157d931-fba2-49bf-930b-e366cf4082a8","year":2000},"citing_paper":{"arxiv_id":"2509.00685","last_updated":"2025-08-31T03:57:42Z","snapshot_observed_at":"2026-08-07T02:37:09.798161Z","submitted_at":"2025-08-31T03:57:42Z","title":"MPO: Multidimensional Preference Optimization for Language Model-based Text-to-Speech","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T13:24:34.142629Z"},"links":{"citing_paper":"/paper/2509.00685"},"observation_digest":"sha256:8ca09ce879636fed628bd1cb8ea98cb0c6a22eb3121bd549b653547065959b14","observation_id":"8a2a5532-4b7e-4db1-b97d-9796034dec0d","resolution":{"observed_at":"2026-08-05T13:24:34.843343Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:34.796907Z","title":null,"venue":null,"work_id":"82efa727-dd3d-4606-8057-f0fcd591fd9f","year":null},"citing_paper":{"arxiv_id":"2509.00685","last_updated":"2025-08-31T03:57:42Z","snapshot_observed_at":"2026-08-07T02:37:09.798161Z","submitted_at":"2025-08-31T03:57:42Z","title":"MPO: Multidimensional Preference Optimization for Language Model-based Text-to-Speech","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T13:24:34.156929Z"},"links":{"citing_paper":"/paper/2509.00685"},"observation_digest":"sha256:69fa8c97aa69ebd2f4bce069d03f80020fabc0ddf25c8f73a1bf2acbad02d700","observation_id":"4ef14480-6bc2-4ddc-bf8e-f8dc453829ba","resolution":{"observed_at":"2026-08-05T13:24:34.801594Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-05T13:24:34.185099Z","title":"Neural codec language models are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00685","last_updated":"2025-08-31T03:57:42Z","snapshot_observed_at":"2026-08-07T02:37:09.798161Z","submitted_at":"2025-08-31T03:57:42Z","title":"MPO: Multidimensional Preference Optimization for Language Model-based Text-to-Speech","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T13:24:34.185099Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2509.00685"},"observation_digest":"sha256:d9c08f522c276d122ed350f0bfcab88c53cd97ddda9fc21f40f12023cf579029","observation_id":"801c9947-2627-41c8-acd0-93c70e48918f","resolution":{"observed_at":"2026-08-05T13:24:34.185099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07725","last_updated":"2024-06-11T21:08:47Z","snapshot_observed_at":"2026-08-12T23:45:06.763778Z","submitted_at":"2024-06-11T21:08:47Z","title":"The Interspeech 2024 Challenge on Speech Processing Using Discrete Units","version":1},"cited_work":{"arxiv_id":"2406.07725","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.07725","snapshot_observed_at":"2026-08-05T13:24:34.493539Z","title":"The Interspeech 2024 Challenge on Speech Processing Using Discrete Units","venue":"cs.SD","work_id":"0b3cc8dd-5fa5-4e21-bb6b-6383c2a8da41","year":2024},"citing_paper":{"arxiv_id":"2509.00685","last_updated":"2025-08-31T03:57:42Z","snapshot_observed_at":"2026-08-07T02:37:09.798161Z","submitted_at":"2025-08-31T03:57:42Z","title":"MPO: Multidimensional Preference Optimization for Language Model-based Text-to-Speech","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T13:24:34.189566Z"},"links":{"cited_paper":"/paper/2406.07725","citing_paper":"/paper/2509.00685"},"observation_digest":"sha256:223365d1c685050377455c41d8603c18927685e4632e298a8026537f421ab92f","observation_id":"d77f167f-eacc-4b15-befe-d7600d999574","resolution":{"observed_at":"2026-08-05T13:24:34.500670Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08093","last_updated":"2024-02-15T18:57:26Z","snapshot_observed_at":"2026-08-13T04:20:12.197716Z","submitted_at":"2024-02-12T22:21:30Z","title":"BASE TTS: Lessons from building a billion-parameter Text-to-Speech model on 100K hours of data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08093","snapshot_observed_at":"2026-08-05T13:24:34.194579Z","title":"BASE TTS: lessons from building a billion-parameter text-to-speech model on 100k hours of data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00685","last_updated":"2025-08-31T03:57:42Z","snapshot_observed_at":"2026-08-07T02:37:09.798161Z","submitted_at":"2025-08-31T03:57:42Z","title":"MPO: Multidimensional Preference Optimization for Language Model-based Text-to-Speech","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T13:24:34.194579Z"},"links":{"cited_paper":"/paper/2402.08093","citing_paper":"/paper/2509.00685"},"observation_digest":"sha256:6f004ed1e0dd8251c9566138bf0f1550b88c7919489d7cc67954a238e373386d","observation_id":"cc4a7448-e733-4358-ac93-788c0a435def","resolution":{"observed_at":"2026-08-05T13:24:34.194579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:34.782808Z","title":"Soundstream: An end-to-end neural audio codec,","venue":null,"work_id":"5642b845-56bf-4531-8320-578b57bccf27","year":2022},"citing_paper":{"arxiv_id":"2509.00685","last_updated":"2025-08-31T03:57:42Z","snapshot_observed_at":"2026-08-07T02:37:09.798161Z","submitted_at":"2025-08-31T03:57:42Z","title":"MPO: Multidimensional Preference Optimization for Language Model-based Text-to-Speech","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T13:24:34.162131Z"},"links":{"citing_paper":"/paper/2509.00685"},"observation_digest":"sha256:a73b00381006fe766106236a36b92e675f3dd84ed7e353318aa1b25f40b0b3f4","observation_id":"7474ce0d-c671-43e8-ba9e-1894bebeb606","resolution":{"observed_at":"2026-08-05T13:24:34.787102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:34.768827Z","title":"High fidelity neural audio compression,","venue":null,"work_id":"3a1c9249-de5e-48d1-b1ae-606ecec08613","year":2023},"citing_paper":{"arxiv_id":"2509.00685","last_updated":"2025-08-31T03:57:42Z","snapshot_observed_at":"2026-08-07T02:37:09.798161Z","submitted_at":"2025-08-31T03:57:42Z","title":"MPO: Multidimensional Preference Optimization for Language Model-based Text-to-Speech","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T13:24:34.166865Z"},"links":{"citing_paper":"/paper/2509.00685"},"observation_digest":"sha256:ead9b14f0c9b4ed50dd7190ec62d49c6e533f40d1332702373377350d9fe814f","observation_id":"d467e4ce-079c-4266-8cfc-768027922cbc","resolution":{"observed_at":"2026-08-05T13:24:34.772980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:34.753747Z","title":"Funcodec: A funda- mental, reproducible and integrable open-source toolkit for neural speech codec,","venue":null,"work_id":"c4c77fbc-e124-4f97-8079-3c629f415b6b","year":2024},"citing_paper":{"arxiv_id":"2509.00685","last_updated":"2025-08-31T03:57:42Z","snapshot_observed_at":"2026-08-07T02:37:09.798161Z","submitted_at":"2025-08-31T03:57:42Z","title":"MPO: Multidimensional Preference Optimization for Language Model-based Text-to-Speech","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T13:24:34.171218Z"},"links":{"citing_paper":"/paper/2509.00685"},"observation_digest":"sha256:74efebccec7ff8d440897d9e9faeccd5db1635ed1a7f7ddd45ccac0fe1ab2377","observation_id":"a34a4908-4f10-4779-af63-17074227dd82","resolution":{"observed_at":"2026-08-05T13:24:34.758699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:34.735976Z","title":"Speechtok- enizer: Unified speech tokenizer for speech language models,","venue":null,"work_id":"ed742432-e78f-4236-838b-a4a5e8eabcb0","year":2024},"citing_paper":{"arxiv_id":"2509.00685","last_updated":"2025-08-31T03:57:42Z","snapshot_observed_at":"2026-08-07T02:37:09.798161Z","submitted_at":"2025-08-31T03:57:42Z","title":"MPO: Multidimensional Preference Optimization for Language Model-based Text-to-Speech","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T13:24:34.175646Z"},"links":{"citing_paper":"/paper/2509.00685"},"observation_digest":"sha256:19e39d42b396ad9c2cb6cb95c83c33636764c8daa56fff2d4d4be565f5b3b89a","observation_id":"aef01163-c347-47e7-98ce-39d5fe2a0876","resolution":{"observed_at":"2026-08-05T13:24:34.740531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:34.720100Z","title":"Single-codec: Single-codebook speech codec towards high-performance speech generation,","venue":null,"work_id":"826c8459-fba1-4d57-9398-6c5c24ca3058","year":2024},"citing_paper":{"arxiv_id":"2509.00685","last_updated":"2025-08-31T03:57:42Z","snapshot_observed_at":"2026-08-07T02:37:09.798161Z","submitted_at":"2025-08-31T03:57:42Z","title":"MPO: Multidimensional Preference Optimization for Language Model-based Text-to-Speech","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T13:24:34.180968Z"},"links":{"citing_paper":"/paper/2509.00685"},"observation_digest":"sha256:1d000bbc6b858ac7b6e533297dae1316290933f4e8940d0574c69206b137f470","observation_id":"e8a331b1-aeb0-4d71-9d8b-05979977370d","resolution":{"observed_at":"2026-08-05T13:24:34.725039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T13:24:34.223367Z","title":"GPT-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00685","last_updated":"2025-08-31T03:57:42Z","snapshot_observed_at":"2026-08-07T02:37:09.798161Z","submitted_at":"2025-08-31T03:57:42Z","title":"MPO: Multidimensional Preference Optimization for Language Model-based Text-to-Speech","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T13:24:34.223367Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2509.00685"},"observation_digest":"sha256:7daf0e5defb77942a3f1d7c4079791e37da1a059fea55fe6708fcbf0947053eb","observation_id":"09c8a629-f739-4481-b3c8-32a1a3d5b399","resolution":{"observed_at":"2026-08-05T13:24:34.223367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:34.660265Z","title":"Simpo: Simple preference opti- mization with a reference-free reward,","venue":null,"work_id":"a535089c-7b2a-4650-9386-676b133107c7","year":2024},"citing_paper":{"arxiv_id":"2509.00685","last_updated":"2025-08-31T03:57:42Z","snapshot_observed_at":"2026-08-07T02:37:09.798161Z","submitted_at":"2025-08-31T03:57:42Z","title":"MPO: Multidimensional Preference Optimization for Language Model-based Text-to-Speech","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T13:24:34.227798Z"},"links":{"citing_paper":"/paper/2509.00685"},"observation_digest":"sha256:bfec97ff6d6357adf9520d5162cb99871db200a83b13a1c42b51de90232d3444","observation_id":"83ec8996-46a1-4a65-8e85-d84b6076b1aa","resolution":{"observed_at":"2026-08-05T13:24:34.664942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00685","last_updated":"2025-08-31T03:57:42Z","snapshot_observed_at":"2026-08-07T02:37:09.798161Z","submitted_at":"2025-08-31T03:57:42Z","title":"MPO: Multidimensional Preference Optimization for Language Model-based Text-to-Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.00685","snapshot_observed_at":"2026-08-05T13:24:34.127489Z","title":"Several works in the speech community have explored in- tegrating human evaluation into LM-based TTS optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00685","last_updated":"2025-08-31T03:57:42Z","snapshot_observed_at":"2026-08-07T02:37:09.798161Z","submitted_at":"2025-08-31T03:57:42Z","title":"MPO: Multidimensional Preference Optimization for Language Model-based Text-to-Speech","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T13:24:34.127489Z"},"links":{"cited_paper":"/paper/2509.00685","citing_paper":"/paper/2509.00685"},"observation_digest":"sha256:3f4d2d3cf1b45b66f22a7df28f5a32c2b26a32ae0eaa934063040883c5c85857","observation_id":"a4029945-90a5-4bdd-bf1a-6fef626d8fd9","resolution":{"observed_at":"2026-08-05T13:24:34.127489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:34.704587Z","title":"V oice- craft: Zero-shot speech editing and text-to-speech in the wild,","venue":null,"work_id":"d735123a-2eab-455b-bcc7-3d3512774b6f","year":2024},"citing_paper":{"arxiv_id":"2509.00685","last_updated":"2025-08-31T03:57:42Z","snapshot_observed_at":"2026-08-07T02:37:09.798161Z","submitted_at":"2025-08-31T03:57:42Z","title":"MPO: Multidimensional Preference Optimization for Language Model-based Text-to-Speech","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T13:24:34.199300Z"},"links":{"citing_paper":"/paper/2509.00685"},"observation_digest":"sha256:a18d592ec89128b20db81f8a3b080856180bf9b64dec544abb6c47900ea1b48e","observation_id":"5e241448-ffe0-4bc6-a5e5-a40fb9a69705","resolution":{"observed_at":"2026-08-05T13:24:34.709223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T13:24:34.204193Z","title":"Seed-tts: A family of high-quality versatile speech generation models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00685","last_updated":"2025-08-31T03:57:42Z","snapshot_observed_at":"2026-08-07T02:37:09.798161Z","submitted_at":"2025-08-31T03:57:42Z","title":"MPO: Multidimensional Preference Optimization for Language Model-based Text-to-Speech","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T13:24:34.204193Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2509.00685"},"observation_digest":"sha256:52e16aa106ade5b888f8945a86869c1e699c6b78617a80acb6d4f3ed5a5a3605","observation_id":"f8d55cdd-b927-4d12-b893-ac9fee5a77e7","resolution":{"observed_at":"2026-08-05T13:24:34.204193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04128","last_updated":"2025-02-22T11:32:13Z","snapshot_observed_at":"2026-08-08T23:22:17.610458Z","submitted_at":"2025-02-06T15:04:00Z","title":"Llasa: Scaling Train-Time and Inference-Time Compute for Llama-based Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04128","snapshot_observed_at":"2026-08-05T13:24:34.208839Z","title":"Llasa: Scaling train-time and inference-time compute for llama-based speech synthesis,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00685","last_updated":"2025-08-31T03:57:42Z","snapshot_observed_at":"2026-08-07T02:37:09.798161Z","submitted_at":"2025-08-31T03:57:42Z","title":"MPO: Multidimensional Preference Optimization for Language Model-based Text-to-Speech","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T13:24:34.208839Z"},"links":{"cited_paper":"/paper/2502.04128","citing_paper":"/paper/2509.00685"},"observation_digest":"sha256:ee381e7d4c7bdb86ac76797280706e3725ece79134e0dcaaf86588bb8b648a75","observation_id":"c9d6e5a8-229c-4010-ab08-c9020fe60d4e","resolution":{"observed_at":"2026-08-05T13:24:34.208839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:34.689138Z","title":"Training language models to follow instructions with human feedback,","venue":null,"work_id":"b2b319e2-ca0a-4460-9ee6-7c118de0e60b","year":2022},"citing_paper":{"arxiv_id":"2509.00685","last_updated":"2025-08-31T03:57:42Z","snapshot_observed_at":"2026-08-07T02:37:09.798161Z","submitted_at":"2025-08-31T03:57:42Z","title":"MPO: Multidimensional Preference Optimization for Language Model-based Text-to-Speech","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T13:24:34.213556Z"},"links":{"citing_paper":"/paper/2509.00685"},"observation_digest":"sha256:02aa6c32148e606521cc0f355854ace66a1bf15e6a49f4f3c2808c062f1bca22","observation_id":"2ccaec03-6510-4a97-9f6b-eec943eeb06d","resolution":{"observed_at":"2026-08-05T13:24:34.694020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:34.674693Z","title":"Model alignment as prospect theoretic optimization,","venue":null,"work_id":"d4a30b9e-f006-4123-874c-6dbabed3301b","year":2024},"citing_paper":{"arxiv_id":"2509.00685","last_updated":"2025-08-31T03:57:42Z","snapshot_observed_at":"2026-08-07T02:37:09.798161Z","submitted_at":"2025-08-31T03:57:42Z","title":"MPO: Multidimensional Preference Optimization for Language Model-based Text-to-Speech","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T13:24:34.218517Z"},"links":{"citing_paper":"/paper/2509.00685"},"observation_digest":"sha256:ceb20605442bee04fc371b98679c6b8d3040bf9096ef82391b61c151e8670e6b","observation_id":"605e7fe9-3802-4c3f-a11e-f5307488ef54","resolution":{"observed_at":"2026-08-05T13:24:34.679116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:34.259985Z","title":"Rank analysis of incomplete block designs: I. the method of paired comparisons,","venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2509.00685","last_updated":"2025-08-31T03:57:42Z","snapshot_observed_at":"2026-08-07T02:37:09.798161Z","submitted_at":"2025-08-31T03:57:42Z","title":"MPO: Multidimensional Preference Optimization for Language Model-based Text-to-Speech","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T13:24:34.259985Z"},"links":{"citing_paper":"/paper/2509.00685"},"observation_digest":"sha256:baf016ed7b959135d38e9bc1d11c2856184f92d25c89e7ce0d8debc020abce4d","observation_id":"dbc466ba-c57f-495e-83fb-6dc2ed89498c","resolution":{"observed_at":"2026-08-05T13:24:34.259985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:34.606805Z","title":"Wenetspeech4tts: A 12,800-hour mandarin tts corpus for large speech generation model bench- mark,","venue":null,"work_id":"5c6533b8-da3a-422d-b1c3-49a554b2bcdd","year":2024},"citing_paper":{"arxiv_id":"2509.00685","last_updated":"2025-08-31T03:57:42Z","snapshot_observed_at":"2026-08-07T02:37:09.798161Z","submitted_at":"2025-08-31T03:57:42Z","title":"MPO: Multidimensional Preference Optimization for Language Model-based Text-to-Speech","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T13:24:34.264903Z"},"links":{"citing_paper":"/paper/2509.00685"},"observation_digest":"sha256:44dde46e4b218eeeb3ed46d1ec8abd1289b9757bd7ffd044a1f296bbbc0f92ae","observation_id":"c5981849-b668-4319-8159-8d5f58ab9545","resolution":{"observed_at":"2026-08-05T13:24:34.611695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:34.644035Z","title":"Direct preference optimization: Your language model is secretly a reward model,","venue":null,"work_id":"fbf7e227-5cbb-4c12-a712-985f81cea057","year":2023},"citing_paper":{"arxiv_id":"2509.00685","last_updated":"2025-08-31T03:57:42Z","snapshot_observed_at":"2026-08-07T02:37:09.798161Z","submitted_at":"2025-08-31T03:57:42Z","title":"MPO: Multidimensional Preference Optimization for Language Model-based Text-to-Speech","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T13:24:34.232766Z"},"links":{"citing_paper":"/paper/2509.00685"},"observation_digest":"sha256:d001ffc4a0fca4fd33d14eb6e1364a73b4c11843146cfe0625a81b1c042e4276","observation_id":"c8dba464-44dd-4ca3-a11e-fea4c77780e1","resolution":{"observed_at":"2026-08-05T13:24:34.648710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:34.825276Z","title":"This fine-tuned model serves as the baseline for our experiments","venue":null,"work_id":"729d0c62-feef-4e5b-a74c-20e96d3b8b46","year":null},"citing_paper":{"arxiv_id":"2509.00685","last_updated":"2025-08-31T03:57:42Z","snapshot_observed_at":"2026-08-07T02:37:09.798161Z","submitted_at":"2025-08-31T03:57:42Z","title":"MPO: Multidimensional Preference Optimization for Language Model-based Text-to-Speech","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T13:24:34.147812Z"},"links":{"citing_paper":"/paper/2509.00685"},"observation_digest":"sha256:a98d6fca505ada1e696d6530ae24ae916e90c8319a7d0739955a40c1b8ee0988","observation_id":"a986b73c-56d6-4262-83eb-83801e5a483d","resolution":{"observed_at":"2026-08-05T13:24:34.829916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:34.237058Z","title":"Speechalign: Aligning speech generation to human preferences,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00685","last_updated":"2025-08-31T03:57:42Z","snapshot_observed_at":"2026-08-07T02:37:09.798161Z","submitted_at":"2025-08-31T03:57:42Z","title":"MPO: Multidimensional Preference Optimization for Language Model-based Text-to-Speech","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T13:24:34.237058Z"},"links":{"citing_paper":"/paper/2509.00685"},"observation_digest":"sha256:9637c4a18c750f082223d1c5d7ca88351aaa1a1de2ca5d9bc076450f79468fcf","observation_id":"d36b11b8-b95d-4739-8938-71b33d34de74","resolution":{"observed_at":"2026-08-05T13:24:34.237058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00654","last_updated":"2024-06-02T07:54:33Z","snapshot_observed_at":"2026-08-13T16:07:28.259490Z","submitted_at":"2024-06-02T07:54:33Z","title":"Enhancing Zero-shot Text-to-Speech Synthesis with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00654","snapshot_observed_at":"2026-08-05T13:24:34.241314Z","title":"En- hancing zero-shot text-to-speech synthesis with human feedback,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00685","last_updated":"2025-08-31T03:57:42Z","snapshot_observed_at":"2026-08-07T02:37:09.798161Z","submitted_at":"2025-08-31T03:57:42Z","title":"MPO: Multidimensional Preference Optimization for Language Model-based Text-to-Speech","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T13:24:34.241314Z"},"links":{"cited_paper":"/paper/2406.00654","citing_paper":"/paper/2509.00685"},"observation_digest":"sha256:f9c3eb5603418e741374bdf917d54e047b46cd9ff5d767647de15a6dc7b73557","observation_id":"d4cf35e4-5319-4912-bffc-3276d6180c0d","resolution":{"observed_at":"2026-08-05T13:24:34.241314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02243","last_updated":"2024-07-02T13:04:04Z","snapshot_observed_at":"2026-08-12T23:30:26.059993Z","submitted_at":"2024-07-02T13:04:04Z","title":"Robust Zero-Shot Text-to-Speech Synthesis with Reverse Inference Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02243","snapshot_observed_at":"2026-08-05T13:24:34.245816Z","title":"Robust zero- shot text-to-speech synthesis with reverse inference optimization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00685","last_updated":"2025-08-31T03:57:42Z","snapshot_observed_at":"2026-08-07T02:37:09.798161Z","submitted_at":"2025-08-31T03:57:42Z","title":"MPO: Multidimensional Preference Optimization for Language Model-based Text-to-Speech","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T13:24:34.245816Z"},"links":{"cited_paper":"/paper/2407.02243","citing_paper":"/paper/2509.00685"},"observation_digest":"sha256:6b3945de0f54c4a1ed5b545433635b8929e2501e8ce8afab935a8439c62559a3","observation_id":"35f7e82a-5545-42ae-8daf-d8ba21770135","resolution":{"observed_at":"2026-08-05T13:24:34.245816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:34.811207Z","title":"Dynamic time warping is employed to align the generated and reference speech features of different sequential lengths, following the evaluation script in ESPnet [29]","venue":null,"work_id":"3da87efb-7293-4e0b-bc4b-51d90ed57794","year":null},"citing_paper":{"arxiv_id":"2509.00685","last_updated":"2025-08-31T03:57:42Z","snapshot_observed_at":"2026-08-07T02:37:09.798161Z","submitted_at":"2025-08-31T03:57:42Z","title":"MPO: Multidimensional Preference Optimization for Language Model-based Text-to-Speech","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T13:24:34.152451Z"},"links":{"citing_paper":"/paper/2509.00685"},"observation_digest":"sha256:ce7ec31f2e60a4e8ba30ab2987218d0140ff5cfd9dd5cb46011e9dda104708e1","observation_id":"0d9a4cfd-7c26-4547-84b5-c8a37e367c2a","resolution":{"observed_at":"2026-08-05T13:24:34.816105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12403","last_updated":"2024-09-19T01:58:19Z","snapshot_observed_at":"2026-08-12T22:42:04.839848Z","submitted_at":"2024-09-19T01:58:19Z","title":"Preference Alignment Improves Language Model-Based TTS","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12403","snapshot_observed_at":"2026-08-05T13:24:34.250279Z","title":"Preference alignment improves language model-based TTS,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00685","last_updated":"2025-08-31T03:57:42Z","snapshot_observed_at":"2026-08-07T02:37:09.798161Z","submitted_at":"2025-08-31T03:57:42Z","title":"MPO: Multidimensional Preference Optimization for Language Model-based Text-to-Speech","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T13:24:34.250279Z"},"links":{"cited_paper":"/paper/2409.12403","citing_paper":"/paper/2509.00685"},"observation_digest":"sha256:c54fcf5c0f77be221df11be51f8080e9cbfbf9ff4389eb9af6dfceec731c7183","observation_id":"ecaaff75-c909-468a-8a05-64daf778a292","resolution":{"observed_at":"2026-08-05T13:24:34.250279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19316","last_updated":"2025-03-03T08:22:25Z","snapshot_observed_at":"2026-08-12T23:54:55.785946Z","submitted_at":"2024-05-29T17:39:48Z","title":"Robust Preference Optimization through Reward Model Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19316","snapshot_observed_at":"2026-08-05T13:24:34.255346Z","title":"Robust preference op- timization through reward model distillation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00685","last_updated":"2025-08-31T03:57:42Z","snapshot_observed_at":"2026-08-07T02:37:09.798161Z","submitted_at":"2025-08-31T03:57:42Z","title":"MPO: Multidimensional Preference Optimization for Language Model-based Text-to-Speech","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T13:24:34.255346Z"},"links":{"cited_paper":"/paper/2405.19316","citing_paper":"/paper/2509.00685"},"observation_digest":"sha256:092d69fbad537b4a8b5e48b9d1b48e0cdd672862d62a5a2db768090dd2d50bfa","observation_id":"8134630d-ed0f-48c1-b116-42f1f1a20d78","resolution":{"observed_at":"2026-08-05T13:24:34.255346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:34.591193Z","title":"Libriheavy: A 50, 000 hours ASR corpus with punctuation casing and context,","venue":null,"work_id":"1f87603f-8255-4a93-837b-0413d8159248","year":2024},"citing_paper":{"arxiv_id":"2509.00685","last_updated":"2025-08-31T03:57:42Z","snapshot_observed_at":"2026-08-07T02:37:09.798161Z","submitted_at":"2025-08-31T03:57:42Z","title":"MPO: Multidimensional Preference Optimization for Language Model-based Text-to-Speech","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T13:24:34.269278Z"},"links":{"citing_paper":"/paper/2509.00685"},"observation_digest":"sha256:2d50f47725091fdad392069462e65c88fd6e5b85082cde63a29c4f9db4607143","observation_id":"0f67ff59-a87c-4426-aeda-8256a16813fe","resolution":{"observed_at":"2026-08-05T13:24:34.595842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:34.576253Z","title":"The ISCSLP 2024 con- versational voice clone (covoc) challenge: Tasks, results and find- ings,","venue":null,"work_id":"af5750bf-3f7d-4b2e-9dc1-01709bc9699c","year":2024},"citing_paper":{"arxiv_id":"2509.00685","last_updated":"2025-08-31T03:57:42Z","snapshot_observed_at":"2026-08-07T02:37:09.798161Z","submitted_at":"2025-08-31T03:57:42Z","title":"MPO: Multidimensional Preference Optimization for Language Model-based Text-to-Speech","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T13:24:34.273751Z"},"links":{"citing_paper":"/paper/2509.00685"},"observation_digest":"sha256:5236716bbfe2c6d1ba15d7617aca9b5a5cce512a372964efaed25fe8fde5547f","observation_id":"26dd2f97-3dae-4597-922b-cb06a62ab168","resolution":{"observed_at":"2026-08-05T13:24:34.580999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T13:24:34.278020Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00685","last_updated":"2025-08-31T03:57:42Z","snapshot_observed_at":"2026-08-07T02:37:09.798161Z","submitted_at":"2025-08-31T03:57:42Z","title":"MPO: Multidimensional Preference Optimization for Language Model-based Text-to-Speech","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T13:24:34.278020Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2509.00685"},"observation_digest":"sha256:504a1d3efeed359759d2d48d50e3726eecde9196836c36af32f45c5d5aad443f","observation_id":"8aa513c0-2240-4aff-a744-0d9fe6ed5c15","resolution":{"observed_at":"2026-08-05T13:24:34.278020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:34.561169Z","title":"Paraformer: Fast and accurate parallel transformer for non-autoregressive end-to- end speech recognition,","venue":null,"work_id":"734a5ad9-60ab-46d9-9f4d-39f33a7ce7e3","year":2022},"citing_paper":{"arxiv_id":"2509.00685","last_updated":"2025-08-31T03:57:42Z","snapshot_observed_at":"2026-08-07T02:37:09.798161Z","submitted_at":"2025-08-31T03:57:42Z","title":"MPO: Multidimensional Preference Optimization for Language Model-based Text-to-Speech","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T13:24:34.282319Z"},"links":{"citing_paper":"/paper/2509.00685"},"observation_digest":"sha256:3e57125c355b7ef8b687c2a53658d5c6d16feb19f12161dacbd98d322a4861c2","observation_id":"9bfd8375-19f8-4303-a044-ce387eba3bae","resolution":{"observed_at":"2026-08-05T13:24:34.565726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:24:34.546238Z","title":"Large-scale self-supervised speech representation learning for automatic speaker verification,","venue":null,"work_id":"fa29900a-9a94-4cf3-8656-cb5c7b1bda90","year":2022},"citing_paper":{"arxiv_id":"2509.00685","last_updated":"2025-08-31T03:57:42Z","snapshot_observed_at":"2026-08-07T02:37:09.798161Z","submitted_at":"2025-08-31T03:57:42Z","title":"MPO: Multidimensional Preference Optimization for Language Model-based Text-to-Speech","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T13:24:34.286950Z"},"links":{"citing_paper":"/paper/2509.00685"},"observation_digest":"sha256:67e7efeebd3ddc69905fe459b7c2ccbdfae47b883b561841fd5793833c4c02a3","observation_id":"16509b4a-4dd7-4961-a565-588a3a90e487","resolution":{"observed_at":"2026-08-05T13:24:34.550700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.07840","last_updated":"2021-10-15T03:27:45Z","snapshot_observed_at":"2026-08-13T17:52:45.989658Z","submitted_at":"2021-10-15T03:27:45Z","title":"ESPnet2-TTS: Extending the Edge of TTS Research","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.07840","snapshot_observed_at":"2026-08-05T13:24:34.291292Z","title":"Espnet2-tts: Extending the edge of TTS research,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.00685","last_updated":"2025-08-31T03:57:42Z","snapshot_observed_at":"2026-08-07T02:37:09.798161Z","submitted_at":"2025-08-31T03:57:42Z","title":"MPO: Multidimensional Preference Optimization for Language Model-based Text-to-Speech","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T13:24:34.291292Z"},"links":{"cited_paper":"/paper/2110.07840","citing_paper":"/paper/2509.00685"},"observation_digest":"sha256:fb83a82c5c1d352069cb509fd58645f3b6f924f7628731aad7e11d1d30ef2c1d","observation_id":"aaa69b3d-f608-476b-b123-6fa3bc4dbe28","resolution":{"observed_at":"2026-08-05T13:24:34.291292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.00685","last_updated":"2025-08-31T03:57:42Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-07T02:37:09.798161Z","submitted_at":"2025-08-31T03:57:42Z","title":"MPO: Multidimensional Preference Optimization for Language Model-based Text-to-Speech"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":1,"verified_fuzzy":20},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 2 inbound Pith citation observations for arXiv:2509.00685."}