{"as_of":"2026-08-12T07:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f6e066181f1ac279b2ad2c47b766a7139094db77680bb70b46cfc219a207414a","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:48:24.646239Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T19:19:36.427337Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-18T19:21:48.097349Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"cited_work":{"arxiv_id":"2507.14988","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.14988","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dmospeech 2: Reinforcement learning for duration prediction in metric-optimized speech synthesis","venue":null,"work_id":"e93a5822-9432-49cf-bacc-10ff697fec61","year":2025},"citing_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"reference_index":263,"source":"pdf_text","source_observed_at":"2026-05-18T19:19:36.427337Z"},"links":{"cited_paper":"/paper/2507.14988","citing_paper":"/paper/2509.02547"},"observation_digest":"sha256:e372130af89f7bd9929d6ea026ebbacb39206cb7ee8481846d34c3c796ab4720","observation_id":"ec6fbd44-3fa9-4e9a-be4e-7a90b42d0953","resolution":{"observed_at":"2026-05-18T19:21:48.100163Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.14988/citation-record","integrity":"/paper/2507.14988/integrity","json":"/paper/2507.14988/citation-record.json","paper":"/paper/2507.14988"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:31.501244Z","title":"Naturalspeech: End-to-end text-to-speech synthesis with human-level quality","venue":null,"work_id":"3d285c6a-6c94-46b5-8c4f-6b837fa0f7c5","year":2024},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:19.733560Z"},"links":{"citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:e7d6f8717a3bbd220f5fe4a5cd702a2aad1f20021f0e06a57b4d16f5dd440476","observation_id":"e6bf2c79-2fd0-478e-99f2-f47e54e9c85f","resolution":{"observed_at":"2026-08-06T15:48:31.639139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:31.224763Z","title":"Styletts 2: Towards human-level text-to-speech through style diffusion and adversarial training with large speech language models","venue":null,"work_id":"2b958dad-42f2-4720-9c1a-45430ed21936","year":2024},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:19.789105Z"},"links":{"citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:a4294817696b1ee03d167dc0e0a84c65491a63abe0b3ef8fc36e49c2e4663b38","observation_id":"0a90a7c8-d495-4e6d-ba73-9f4d7631ddf4","resolution":{"observed_at":"2026-08-06T15:48:31.364146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03100","last_updated":"2024-04-23T08:38:03Z","snapshot_observed_at":"2026-08-10T22:41:15.281948Z","submitted_at":"2024-03-05T16:35:25Z","title":"NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03100","snapshot_observed_at":"2026-08-06T15:48:19.866141Z","title":"Naturalspeech 3: Zero-shot speech synthesis with factorized codec and diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:19.866141Z"},"links":{"cited_paper":"/paper/2403.03100","citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:50e97dd7dc496c12c42e10f81fba951fcad303e9b207b7a36285562c10672ce7","observation_id":"6790d590-3fb0-49b3-9ce4-c95510e3ae4f","resolution":{"observed_at":"2026-08-06T15:48:19.866141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00654","last_updated":"2024-06-02T07:54:33Z","snapshot_observed_at":"2026-08-09T11:16:05.714394Z","submitted_at":"2024-06-02T07:54:33Z","title":"Enhancing Zero-shot Text-to-Speech Synthesis with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00654","snapshot_observed_at":"2026-08-06T15:48:19.939041Z","title":"Enhancing zero-shot text-to-speech synthesis with human feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:19.939041Z"},"links":{"cited_paper":"/paper/2406.00654","citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:8654927b135c23e684a8a33ef7cf63dc5e3cf77682b3e7a758876850d5549f04","observation_id":"85822a91-7e9e-4dcf-bcd2-6c853645dff4","resolution":{"observed_at":"2026-08-06T15:48:19.939041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05600","last_updated":"2024-04-08T15:21:17Z","snapshot_observed_at":"2026-08-05T11:57:00.393189Z","submitted_at":"2024-04-08T15:21:17Z","title":"SpeechAlign: Aligning Speech Generation to Human Preferences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05600","snapshot_observed_at":"2026-08-06T15:48:19.994804Z","title":"Speechalign: Aligning speech generation to human preferences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:19.994804Z"},"links":{"cited_paper":"/paper/2404.05600","citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:03ea7f0a743d64c8ddcd2ac8f0b9f88361da5144dde90ce212afe4aad778ce2f","observation_id":"a6ef7c61-4fb3-480a-a09d-9f6dfc26b888","resolution":{"observed_at":"2026-08-06T15:48:19.994804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:30.982028Z","title":"Emo-dpo: Con- trollable emotional speech synthesis through direct preference optimization","venue":null,"work_id":"364235fb-c1df-451f-90f3-6b38d01b0e60","year":2025},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:20.065138Z"},"links":{"citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:c3d165919d8359b5491a976c21b5b20ccfc7b2e191e66aeb1cf6e49c32a854ff","observation_id":"bfcbbabe-5463-4063-8e98-a35ab3e4c91d","resolution":{"observed_at":"2026-08-06T15:48:31.081647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:30.741678Z","title":"Preference alignment improves language model-based tts","venue":null,"work_id":"a4ccfa18-4821-4b1b-905e-87399d2a6677","year":2025},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:20.157944Z"},"links":{"citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:152d0259297a53369c4af351b4b69d6f7f293715702f6fbfaee88dc33f9b29ca","observation_id":"cd0dc393-7380-4d9b-86b1-41727b768a4f","resolution":{"observed_at":"2026-08-06T15:48:30.861946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05236","last_updated":"2025-07-22T21:32:13Z","snapshot_observed_at":"2026-08-08T21:47:45.872410Z","submitted_at":"2025-02-07T06:47:11Z","title":"Koel-TTS: Enhancing LLM based Speech Generation with Preference Alignment and Classifier Free Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05236","snapshot_observed_at":"2026-08-06T15:48:20.224849Z","title":"Koel-tts: Enhancing llm based speech generation with preference alignment and classifier free guidance","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:20.224849Z"},"links":{"cited_paper":"/paper/2502.05236","citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:5c90c4144bd04dd67dc702517a0900a25f6e83fa0be0bfedbe5f339da2dd87f1","observation_id":"ca2867c0-d3af-4cd2-835f-d9016de33486","resolution":{"observed_at":"2026-08-06T15:48:20.224849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12668","last_updated":"2025-02-18T09:18:02Z","snapshot_observed_at":"2026-08-11T22:30:38.974919Z","submitted_at":"2025-02-18T09:18:02Z","title":"Evaluation of Best-of-N Sampling Strategies for Language Model Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12668","snapshot_observed_at":"2026-08-06T15:48:20.282544Z","title":"Evaluation of best-of-n sampling strategies for language model alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:20.282544Z"},"links":{"cited_paper":"/paper/2502.12668","citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:aa67ff9e7e35502a43cf95b36ebcc7c4fc838b5716ba0344443f5ffa0994140d","observation_id":"99b7574c-8814-4de6-bddd-7803eb02cd7a","resolution":{"observed_at":"2026-08-06T15:48:20.282544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-06T15:48:20.353019Z","title":"Neural codec language models are zero-shot text to speech synthesizers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:20.353019Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:5150698e2635634b2f008400139f8c37863a7730155fd12d21d9918dc6b8e278","observation_id":"af530fdd-197d-40be-94d1-7c92f2be9d9a","resolution":{"observed_at":"2026-08-06T15:48:20.353019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16973","last_updated":"2024-06-14T00:29:46Z","snapshot_observed_at":"2026-07-06T17:50:18.017647Z","submitted_at":"2024-03-25T17:38:32Z","title":"VoiceCraft: Zero-Shot Speech Editing and Text-to-Speech in the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16973","snapshot_observed_at":"2026-08-06T15:48:20.428168Z","title":"V oice- craft: Zero-shot speech editing and text-to-speech in the wild","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:20.428168Z"},"links":{"cited_paper":"/paper/2403.16973","citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:f6fd379d2c1fde4874469ba57899ecb08ab048663733b170c825e1a33dea0c00","observation_id":"529d8da5-bbd3-4a32-acf6-9eec08dbacfa","resolution":{"observed_at":"2026-08-06T15:48:20.428168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05370","last_updated":"2024-06-17T04:39:08Z","snapshot_observed_at":"2026-08-08T07:23:06.245954Z","submitted_at":"2024-06-08T06:31:03Z","title":"VALL-E 2: Neural Codec Language Models are Human Parity Zero-Shot Text to Speech Synthesizers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05370","snapshot_observed_at":"2026-08-06T15:48:20.513937Z","title":"Vall-e 2: Neural codec language models are human parity zero-shot text to speech synthesizers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:20.513937Z"},"links":{"cited_paper":"/paper/2406.05370","citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:aeac94e7e8d446f0d987c748348cd14e864486aae0a82c91186f94bb8f49cd7c","observation_id":"c8be1b90-e219-4d50-826e-65bebd9db008","resolution":{"observed_at":"2026-08-06T15:48:20.513937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-10T13:38:17.384356Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-08-06T15:48:20.576312Z","title":"Maskgct: Zero-shot text-to-speech with masked generative codec transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:20.576312Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:3ee1be44e80383fb3a27956523904e90bd07b4727a83c1a730611efdddbfa9c9","observation_id":"b3cbe4af-0b4a-4535-b907-5547b8ff3d60","resolution":{"observed_at":"2026-08-06T15:48:20.576312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-08-10T17:49:50.848957Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-06T15:48:20.644717Z","title":"Cosyvoice: A scalable multilingual zero-shot text-to-speech synthesizer based on supervised semantic tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:20.644717Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:7899a133f9582a8876b3bf5d53255184f90914cbad489a68e788eaa1600bac0e","observation_id":"5fe3355e-f1d1-41e3-862e-94f5a87894c6","resolution":{"observed_at":"2026-08-06T15:48:20.644717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:30.443540Z","title":"Vall-t: Decoder-only generative transducer for robust and decoding- controllable text-to-speech","venue":null,"work_id":"be612457-2eac-4e02-8270-c8bc4ee3076e","year":2025},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:20.694493Z"},"links":{"citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:def2570c35d4520860730927b9e1209424bacb9cb5fa820000fdfea46e2581ab","observation_id":"9b4ef9cb-c92d-4bf7-85b4-3b9d025929a2","resolution":{"observed_at":"2026-08-06T15:48:30.585461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-09T04:36:59.879757Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-06T15:48:20.763920Z","title":"Cosyvoice 2: Scalable streaming speech synthesis with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:20.763920Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:ee10b8a849f7a2951e63e55a4fe734886ae394eabcc72b001db06f28164ba709","observation_id":"d9c95b5b-4da3-4d66-b6fc-52980ababa41","resolution":{"observed_at":"2026-08-06T15:48:20.763920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:20.825000Z","title":"Autoregressive speech synthesis with next-distribution prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:20.825000Z"},"links":{"citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:19e77910dcdb1eff3ce6ec586089e240e18a668a2e54cf0c2dfcaa3695ccf964","observation_id":"90256e37-c7f1-4c17-ae37-b363e025ac24","resolution":{"observed_at":"2026-08-06T15:48:20.825000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-06T15:48:20.918034Z","title":"Spark-tts: An efficient llm-based text-to-speech model with single-stream decoupled speech tokens","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:20.918034Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:533f0fd26fdc5916c941fb73b123956331fd1d148753dc924a8adc0ad5875f79","observation_id":"e4ebd70e-7347-4e0b-897d-2364e7a2b092","resolution":{"observed_at":"2026-08-06T15:48:20.918034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08237","last_updated":"2024-12-12T10:01:11Z","snapshot_observed_at":"2026-08-11T18:00:24.977636Z","submitted_at":"2024-12-11T09:38:50Z","title":"TouchTTS: An Embarrassingly Simple TTS Framework that Everyone Can Touch","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08237","snapshot_observed_at":"2026-08-06T15:48:20.978975Z","title":"Touchtts: An embarrassingly simple tts framework that everyone can touch","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:20.978975Z"},"links":{"cited_paper":"/paper/2412.08237","citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:8c3f7546d5b9c067ed51016757f2d630054a1ecdaf09d99b2377123c4a8ecce2","observation_id":"4b5bb2d7-2828-4156-b580-53b0b7c92847","resolution":{"observed_at":"2026-08-06T15:48:20.978975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04128","last_updated":"2025-02-22T11:32:13Z","snapshot_observed_at":"2026-08-08T23:22:17.610458Z","submitted_at":"2025-02-06T15:04:00Z","title":"Llasa: Scaling Train-Time and Inference-Time Compute for Llama-based Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04128","snapshot_observed_at":"2026-08-06T15:48:21.077843Z","title":"Llasa: Scaling train-time and inference-time compute for llama-based speech synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:21.077843Z"},"links":{"cited_paper":"/paper/2502.04128","citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:c9d7843b29d4a4d5c6bdcca06288bfe6fa66bc30bfb999349fe2c977711c6f33","observation_id":"6ffaf0fb-3276-448b-a359-aea5a05b0e7f","resolution":{"observed_at":"2026-08-06T15:48:21.077843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:30.169090Z","title":"V oicebox: Text-guided multilin- gual universal speech generation at scale","venue":null,"work_id":"c19e3042-42fa-47dd-848e-efa6d1f7767f","year":2024},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:21.126247Z"},"links":{"citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:3f85507c3203a375e7a37c9c467bcaa95d2cab056bb49a5d91283272b3823320","observation_id":"99216364-feee-44e5-8711-18a96f4a7f90","resolution":{"observed_at":"2026-08-06T15:48:30.331261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09116","last_updated":"2023-05-30T16:09:10Z","snapshot_observed_at":"2026-08-10T21:40:21.888962Z","submitted_at":"2023-04-18T16:31:59Z","title":"NaturalSpeech 2: Latent Diffusion Models are Natural and Zero-Shot Speech and Singing Synthesizers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.09116","snapshot_observed_at":"2026-08-06T15:48:21.184511Z","title":"Naturalspeech 2: Latent diffusion models are natural and zero-shot speech and singing synthesizers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:21.184511Z"},"links":{"cited_paper":"/paper/2304.09116","citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:4890af62f364a5261700c6b6a0358a8fd7a584c13033f8f85dfded850edf9f4d","observation_id":"a96b3cfc-3d52-47d9-b621-0ef2835b38f1","resolution":{"observed_at":"2026-08-06T15:48:21.184511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10058","last_updated":"2024-09-16T07:39:58Z","snapshot_observed_at":"2026-07-06T19:15:52.640101Z","submitted_at":"2024-09-16T07:39:58Z","title":"StyleTTS-ZS: Efficient High-Quality Zero-Shot Text-to-Speech Synthesis with Distilled Time-Varying Style Diffusion","version":1},"cited_work":{"arxiv_id":"2409.10058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.10058","snapshot_observed_at":"2026-08-06T15:48:26.139431Z","title":"StyleTTS-ZS: Efficient High-Quality Zero-Shot Text-to-Speech Synthesis with Distilled Time-Varying Style Diffusion","venue":"eess.AS","work_id":"d907e384-c31d-4af8-933c-19b1a0e037cf","year":2024},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:21.255061Z"},"links":{"cited_paper":"/paper/2409.10058","citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:bee3c240de08fe2b7a8083c1916a3fe935f728496c5063d012489c9bf646f090","observation_id":"658aac14-d570-47f6-b978-9161804f311e","resolution":{"observed_at":"2026-08-06T15:48:26.218116Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18009","last_updated":"2024-09-12T17:45:37Z","snapshot_observed_at":"2026-08-04T03:12:21.293095Z","submitted_at":"2024-06-26T01:38:37Z","title":"E2 TTS: Embarrassingly Easy Fully Non-Autoregressive Zero-Shot TTS","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18009","snapshot_observed_at":"2026-08-06T15:48:21.292062Z","title":"E2 tts: Embarrassingly easy fully non-autoregressive zero-shot tts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:21.292062Z"},"links":{"cited_paper":"/paper/2406.18009","citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:4461d844fcc0128fe8c7e428056ea71fb18f8ecf3ba0ce5b2ede68f698bd3bb2","observation_id":"6a85a2f9-0209-44fd-b840-7bb86963c6e9","resolution":{"observed_at":"2026-08-06T15:48:21.292062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13893","last_updated":"2024-08-28T07:16:37Z","snapshot_observed_at":"2026-07-31T16:15:52.677226Z","submitted_at":"2024-08-25T17:07:39Z","title":"SimpleSpeech 2: Towards Simple and Efficient Text-to-Speech with Flow-based Scalar Latent Transformer Diffusion Models","version":2},"cited_work":{"arxiv_id":"2408.13893","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.13893","snapshot_observed_at":"2026-08-06T15:48:25.826113Z","title":"SimpleSpeech 2: Towards Simple and Efficient Text-to-Speech with Flow-based Scalar Latent Transformer Diffusion Models","venue":"cs.SD","work_id":"0ae7d75b-1d08-42c2-bde8-893fc4002ad0","year":2024},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:21.342231Z"},"links":{"cited_paper":"/paper/2408.13893","citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:77612dcb726d0f33be4ad21ede27bc31892be08a2cfa2ff3a4384ef098a06fb1","observation_id":"622d2823-e56a-4b2f-b553-fbff7e28ba02","resolution":{"observed_at":"2026-08-06T15:48:25.980592Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11427","last_updated":"2025-02-17T17:34:45Z","snapshot_observed_at":"2026-08-11T04:08:45.754586Z","submitted_at":"2024-06-17T11:25:57Z","title":"DiTTo-TTS: Diffusion Transformers for Scalable Text-to-Speech without Domain-Specific Factors","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11427","snapshot_observed_at":"2026-08-06T15:48:21.419026Z","title":"Ditto-tts: Efficient and scalable zero-shot text-to-speech with diffusion transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:21.419026Z"},"links":{"cited_paper":"/paper/2406.11427","citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:d2f93e35f84bc3eaeb7a82529abe33a1128026e18c3ada98ff16f11243bfeb5a","observation_id":"b3eef67e-c8b2-4d44-a2e5-8e5a1da552c8","resolution":{"observed_at":"2026-08-06T15:48:21.419026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-01T23:52:25.071174Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06885","snapshot_observed_at":"2026-08-06T15:48:21.515476Z","title":"F5-tts: A fairytaler that fakes fluent and faithful speech with flow matching","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:21.515476Z"},"links":{"cited_paper":"/paper/2410.06885","citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:c1097e5ac3c85124593cef590708dff9d2751143e0ffbd17abe18c764d82e9d1","observation_id":"83257d1b-2c04-450a-a881-9b1e45af6008","resolution":{"observed_at":"2026-08-06T15:48:21.515476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11097","last_updated":"2025-02-20T02:07:55Z","snapshot_observed_at":"2026-07-06T19:33:30.263638Z","submitted_at":"2024-10-14T21:17:58Z","title":"DMOSpeech: Direct Metric Optimization via Distilled Diffusion Model in Zero-Shot Speech Synthesis","version":2},"cited_work":{"arxiv_id":"2410.11097","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11097","snapshot_observed_at":"2026-08-06T15:48:25.551119Z","title":"DMOSpeech: Direct Metric Optimization via Distilled Diffusion Model in Zero-Shot Speech Synthesis","venue":"eess.AS","work_id":"ff9711dc-7231-41b7-b579-77f6608fa072","year":2024},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:21.591183Z"},"links":{"cited_paper":"/paper/2410.11097","citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:e079a87ec02e3c9be74a69c9c6cb1d306b44eb26b7e8407537c41f8eef0094ef","observation_id":"5014061c-b215-40d4-b96a-38023f01d708","resolution":{"observed_at":"2026-08-06T15:48:25.669295Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:29.905839Z","title":"One-step diffusion with distribution matching distillation","venue":null,"work_id":"4ed34c72-8d85-4347-b760-dc614cdf4f87","year":2024},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:21.679831Z"},"links":{"citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:73d66881423e1a4c3a0c675d772396e9f2c918ce55fce39b1b71e331899b027d","observation_id":"c2d8318d-4d3b-409b-a075-ba6024e82095","resolution":{"observed_at":"2026-08-06T15:48:30.024351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:29.632520Z","title":"Yourtts: Towards zero-shot multi-speaker tts and zero-shot voice conversion for everyone","venue":null,"work_id":"c2b43c03-bdd1-48e6-90f7-31ee571b0eec","year":2022},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:21.742937Z"},"links":{"citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:d55aa9f21587669288091a78c55598e4aec26d485da482fd34c0b79036955c5d","observation_id":"cb28080d-6f40-4ad9-9895-eb0438988ac9","resolution":{"observed_at":"2026-08-06T15:48:29.772307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.05557","last_updated":"2021-06-15T22:19:50Z","snapshot_observed_at":"2026-08-09T23:59:13.777492Z","submitted_at":"2021-04-02T22:31:45Z","title":"SC-GlowTTS: an Efficient Zero-Shot Multi-Speaker Text-To-Speech Model","version":2},"cited_work":{"arxiv_id":"2104.05557","doi":null,"metadata_source":"pith","pith_arxiv_id":"2104.05557","snapshot_observed_at":"2026-08-06T15:48:25.311345Z","title":"SC-GlowTTS: an Efficient Zero-Shot Multi-Speaker Text-To-Speech Model","venue":"eess.AS","work_id":"43472885-c5ed-4353-9b1e-3d989994cb40","year":2021},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:21.812155Z"},"links":{"cited_paper":"/paper/2104.05557","citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:24e7e84944884a6e6839eee997de061cbb7a650ed039fec1da9742bb3314256a","observation_id":"0784fa1d-a261-4485-823e-b268b951316b","resolution":{"observed_at":"2026-08-06T15:48:25.406941Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.00436","last_updated":"2022-04-01T13:47:44Z","snapshot_observed_at":"2026-07-06T12:55:42.060550Z","submitted_at":"2022-04-01T13:47:44Z","title":"AdaSpeech 4: Adaptive Text to Speech in Zero-Shot Scenarios","version":1},"cited_work":{"arxiv_id":"2204.00436","doi":null,"metadata_source":"pith","pith_arxiv_id":"2204.00436","snapshot_observed_at":"2026-08-06T15:48:25.040852Z","title":"AdaSpeech 4: Adaptive Text to Speech in Zero-Shot Scenarios","venue":"eess.AS","work_id":"7c8afda3-72be-4b3b-b493-21cf11bc89db","year":2022},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:21.866669Z"},"links":{"cited_paper":"/paper/2204.00436","citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:a47f0e228740ecb110583ae587fcb568db0db374e7993125cd567100e1a4a955","observation_id":"29eec92c-be00-43ab-9150-773dc27e258b","resolution":{"observed_at":"2026-08-06T15:48:25.182680Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:29.366538Z","title":"Hierspeech: Bridging the gap between text and speech by hierarchical variational inference using self-supervised representations for speech synthesis","venue":null,"work_id":"bcb1523a-f8b6-406c-b3c6-36541cdab5cc","year":2022},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:21.938505Z"},"links":{"citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:0efe6c6d5fc314ca2231ec83ad4462122883e5fc7d7fd141650e0b27337fb15c","observation_id":"a5878af4-9419-4991-9343-afa0a734da01","resolution":{"observed_at":"2026-08-06T15:48:29.499117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:29.090632Z","title":"Meta-stylespeech: Multi- speaker adaptive text-to-speech generation","venue":null,"work_id":"2c1cbab2-5e1b-4249-877f-dfe18a46ca14","year":2021},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:21.998568Z"},"links":{"citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:c76da8b5a60e0ddb6e26985909c0b1f0c2f714ef01d656401b6138b625db0516","observation_id":"30f650b0-ab7f-4b22-aef8-e708754981bc","resolution":{"observed_at":"2026-08-06T15:48:29.215543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15439","last_updated":"2023-11-20T04:31:13Z","snapshot_observed_at":"2026-07-06T13:15:39.751387Z","submitted_at":"2022-05-30T21:34:40Z","title":"StyleTTS: A Style-Based Generative Model for Natural and Diverse Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15439","snapshot_observed_at":"2026-08-06T15:48:22.067217Z","title":"Styletts: A style-based generative model for natural and diverse text-to-speech synthesis","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:22.067217Z"},"links":{"cited_paper":"/paper/2205.15439","citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:9dcc64fc50fc17fd12f6f08b75e228d83a33665b128c405cae34ed2b6f4b2c09","observation_id":"c4d5860e-7b97-4dcc-9c27-e2996a404932","resolution":{"observed_at":"2026-08-06T15:48:22.067217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09407","last_updated":"2022-11-17T08:29:57Z","snapshot_observed_at":"2026-08-10T03:58:33.951837Z","submitted_at":"2022-11-17T08:29:57Z","title":"NANSY++: Unified Voice Synthesis with Neural Analysis and Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09407","snapshot_observed_at":"2026-08-06T15:48:22.157083Z","title":"Nansy++: Unified voice synthesis with neural analysis and synthesis","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:22.157083Z"},"links":{"cited_paper":"/paper/2211.09407","citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:6d79d08bd44b9d09a82901c53d6748299a8a76f864e0db5cf1d672cb91de43e2","observation_id":"d0a08099-a6fe-422f-88f9-48959baf15ae","resolution":{"observed_at":"2026-08-06T15:48:22.157083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14632","last_updated":"2024-11-15T20:10:29Z","snapshot_observed_at":"2026-07-06T18:18:39.093732Z","submitted_at":"2024-05-23T14:39:35Z","title":"DLPO: Diffusion Model Loss-Guided Reinforcement Learning for Fine-Tuning Text-to-Speech Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14632","snapshot_observed_at":"2026-08-06T15:48:22.252443Z","title":"Reinforcement learning for fine-tuning text-to-speech diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:22.252443Z"},"links":{"cited_paper":"/paper/2405.14632","citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:7fd85bd5614bfb59074297a7c31e7cd8329e0e23636a18bb141d1fda5a1841fe","observation_id":"43874f57-cbcf-41ca-b2b2-6953c5ccbe0c","resolution":{"observed_at":"2026-08-06T15:48:22.252443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02407","last_updated":"2025-04-22T10:49:31Z","snapshot_observed_at":"2026-08-07T16:12:09.990112Z","submitted_at":"2025-04-03T08:57:15Z","title":"F5R-TTS: Improving Flow-Matching based Text-to-Speech with Group Relative Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02407","snapshot_observed_at":"2026-08-06T15:48:22.347437Z","title":"F5r-tts: Improving flow matching based text-to-speech with group relative policy optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:22.347437Z"},"links":{"cited_paper":"/paper/2504.02407","citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:e28cb2be72b9aacb9490afed3db360b50aaf30f09bfd56dff078217a1eba8d57","observation_id":"3de44fb7-35b5-40b1-8310-b586fe374102","resolution":{"observed_at":"2026-08-06T15:48:22.347437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00814","last_updated":"2024-05-29T14:21:47Z","snapshot_observed_at":"2026-08-08T02:04:12.090464Z","submitted_at":"2023-06-01T15:40:32Z","title":"Vocos: Closing the gap between time-domain and Fourier-based neural vocoders for high-quality audio synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00814","snapshot_observed_at":"2026-08-06T15:48:22.435245Z","title":"V ocos: Closing the gap between time-domain and fourier-based neural vocoders for high-quality audio synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:22.435245Z"},"links":{"cited_paper":"/paper/2306.00814","citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:65fc8776b2f1d011de9ff9e99bce96bd42b0aa2432a788a85137d369fb35f274","observation_id":"676782b7-0ac9-4013-aa6c-2f897b0f37d4","resolution":{"observed_at":"2026-08-06T15:48:22.435245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14867","last_updated":"2024-05-24T17:08:32Z","snapshot_observed_at":"2026-08-05T03:51:41.162350Z","submitted_at":"2024-05-23T17:59:49Z","title":"Improved Distribution Matching Distillation for Fast Image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14867","snapshot_observed_at":"2026-08-06T15:48:22.532258Z","title":"Improved distribution matching distillation for fast image synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:22.532258Z"},"links":{"cited_paper":"/paper/2405.14867","citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:fcec62873f5a1624d9c2291ef3846c94ddaf1cf432a99228d7ec87e7a7448378","observation_id":"04e21841-37ab-4286-b335-9f8e8d6b4e2d","resolution":{"observed_at":"2026-08-06T15:48:22.532258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T15:48:22.624809Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:22.624809Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:4b22f436f0b35a81e592353b35fd100c8f520cb17ef4472091322951dfe7de08","observation_id":"b2280739-c13a-4d94-b749-3a0dfca648b6","resolution":{"observed_at":"2026-08-06T15:48:22.624809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02152","last_updated":"2022-06-29T13:42:05Z","snapshot_observed_at":"2026-08-04T06:18:23.412967Z","submitted_at":"2022-04-05T12:23:51Z","title":"UTMOS: UTokyo-SaruLab System for VoiceMOS Challenge 2022","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02152","snapshot_observed_at":"2026-08-06T15:48:22.709549Z","title":"Utmos: Utokyo-sarulab system for voicemos challenge 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:22.709549Z"},"links":{"cited_paper":"/paper/2204.02152","citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:ebb4c156af66a68f56999739fa10e6914924f87c102c999459b665bfc8d0a721","observation_id":"b0826a8e-d10e-490f-883c-d8a246018847","resolution":{"observed_at":"2026-08-06T15:48:22.709549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:28.804108Z","title":"Emilia: An extensive, multilingual, and diverse speech dataset for large-scale speech generation","venue":null,"work_id":"d84898ff-39fe-4b51-8194-fa03fd3f95a7","year":2024},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:22.772891Z"},"links":{"citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:836105b4c8a95b63d747f2c0d8fac5168d60b3f80575864fe8008614fcbb30fd","observation_id":"93fe65ff-4cfc-4fb0-8797-154f58472b5f","resolution":{"observed_at":"2026-08-06T15:48:28.966603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-06T15:48:22.884960Z","title":"Seed-tts: A family of high-quality versatile speech generation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:22.884960Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:c2f2be1b722f27ae00c1084a429fa5d9ebb1655ba33ab12ee903d82611837b32","observation_id":"49409248-3195-4e3d-b17a-5e25c7bb2263","resolution":{"observed_at":"2026-08-06T15:48:22.884960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-05T11:17:11.092255Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-06T15:48:22.974182Z","title":"Common voice: A massively-multilingual speech corpus","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:22.974182Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:29aeaac4436673af2983fe396010bd9a089968a0eef8b03ff2ab564dc0c10077","observation_id":"1c8bd800-123e-4fda-8558-b0dd1ccf24ed","resolution":{"observed_at":"2026-08-06T15:48:22.974182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:28.535934Z","title":"Didispeech: A large scale mandarin speech corpus","venue":null,"work_id":"32d14b78-0210-421b-b5ae-a70cb6e57add","year":2021},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:23.060690Z"},"links":{"citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:331dfce48e420e1319308b23f93039d4b6e11982038d4ce0afa071c298375b1e","observation_id":"ebc01169-ea41-4a73-8179-04fa94037182","resolution":{"observed_at":"2026-08-06T15:48:28.666445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:28.280371Z","title":"Fixing Weight Decay Regularization in Adam, 2018","venue":null,"work_id":"7166fe2c-f86a-4103-a60f-10d82311987a","year":2018},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:23.185093Z"},"links":{"citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:c0033f3425a8626d391c88d172ee6f3644eea1bbeb7d3b34d41ae23eb4a29f8a","observation_id":"606d3b08-2ae2-41f0-9ea0-a39daca8ac6c","resolution":{"observed_at":"2026-08-06T15:48:28.380022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:23.288864Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:23.288864Z"},"links":{"citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:e9dffb5a72db3dc47e0ab0ad27fba8dc68968aaa9b1d7b80b646b5627cc9587c","observation_id":"82368ccc-fcac-4ca8-b7f8-17edf5268a33","resolution":{"observed_at":"2026-08-06T15:48:23.288864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11013","last_updated":"2023-05-18T14:45:09Z","snapshot_observed_at":"2026-08-08T00:35:10.506000Z","submitted_at":"2023-05-18T14:45:09Z","title":"FunASR: A Fundamental End-to-End Speech Recognition Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11013","snapshot_observed_at":"2026-08-06T15:48:23.415106Z","title":"Funasr: A fundamental end-to-end speech recognition toolkit","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:23.415106Z"},"links":{"cited_paper":"/paper/2305.11013","citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:dd31791978e8e47752a3fe95a5ac2d5dee603b9d5fd0544ebb4ddeec0db73f22","observation_id":"5bf1f8fd-29cf-44d3-b2d5-a4c8a7b6e62e","resolution":{"observed_at":"2026-08-06T15:48:23.415106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:28.052115Z","title":"Wavlm: Large-scale self-supervised pre- training for full stack speech processing","venue":null,"work_id":"51242986-0305-46d1-8af8-aed149380a6f","year":2022},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:23.616993Z"},"links":{"citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:b7bd0031f000e184b8ac41effec3f7fe3df75c7ea854f28e4d8a08a7ccd83295","observation_id":"77cee763-0d59-4476-95e4-694a2bb62951","resolution":{"observed_at":"2026-08-06T15:48:28.170855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:23.719566Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:23.719566Z"},"links":{"citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:422da6baa1a2d9d599e0a47b23ff09f63d7f7a6afd1a901119ff2473328b6aa6","observation_id":"6f572e7a-fc9e-4d19-beec-832cc732b043","resolution":{"observed_at":"2026-08-06T15:48:23.719566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:23.802869Z","title":"Murphy, and Tim Salimans","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:23.802869Z"},"links":{"citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:768dcf61ad87cdab429c13c5912de4b83374ebbfb4e58b9612b05eda8d44d3d0","observation_id":"f3027e3a-81de-4530-a0a3-088acc48b096","resolution":{"observed_at":"2026-08-06T15:48:23.802869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05551","last_updated":"2024-06-08T18:57:13Z","snapshot_observed_at":"2026-07-06T18:27:36.903877Z","submitted_at":"2024-06-08T18:57:13Z","title":"Autoregressive Diffusion Transformer for Text-to-Speech Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05551","snapshot_observed_at":"2026-08-06T15:48:23.922139Z","title":"Autoregressive diffusion transformer for text-to-speech synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:23.922139Z"},"links":{"cited_paper":"/paper/2406.05551","citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:eb4c8fe4c5bb1ce53f695fb74d0bd6e92d54da22faa90566e7ac15416eabbd3e","observation_id":"9a8e6f38-969d-4cdd-bd82-df9d885b2315","resolution":{"observed_at":"2026-08-06T15:48:23.922139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:27.732785Z","title":"Wespeaker: A research and production oriented speaker embedding learning toolkit","venue":null,"work_id":"e67fd077-6b78-4d32-819b-2993ef67a461","year":2023},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:24.092300Z"},"links":{"citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:7992d7d26943cc546916561a23c1b57f29a6cf3eff20a4d2f6c5d86c6983fbb9","observation_id":"eee60b90-8877-4d7e-b9bd-fb896a34889c","resolution":{"observed_at":"2026-08-06T15:48:27.875223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:27.460260Z","title":"Audio 1\" and","venue":null,"work_id":"b08d04f9-bcad-4e7a-bffb-4a00bbc6593f","year":null},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:24.233956Z"},"links":{"citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:e6df9b5095f0e007e89cdf440435a05e88fa7ef720a977a75533c4fb228647a1","observation_id":"28fe12df-87a1-4804-ae77-4c38a942c1c5","resolution":{"observed_at":"2026-08-06T15:48:27.566891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:27.194093Z","title":null,"venue":null,"work_id":"36a46124-85b9-4abb-9ba3-bd3c2f2a7d4c","year":null},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:24.359674Z"},"links":{"citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:6e62a5def187b5aa041629b909e26b4fd50ebe7d07c63b67c0ccddba955a7522","observation_id":"bc29348e-d938-487c-bdb5-4faa341c8391","resolution":{"observed_at":"2026-08-06T15:48:27.301734Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:26.972850Z","title":null,"venue":null,"work_id":"129e686d-2d03-4976-b073-19ce48fb6cb7","year":null},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:24.480897Z"},"links":{"citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:9ae3ef7498e36f37fc495ca33c4ea78b972454cc2a834d6b471a741c5bc3b5c0","observation_id":"faca40a1-ebba-4799-a019-4c2fc8c16c09","resolution":{"observed_at":"2026-08-06T15:48:27.093620Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:48:26.750298Z","title":null,"venue":null,"work_id":"1e3bfb99-fe7a-415c-83d4-51fa99b4068f","year":null},"citing_paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T15:48:24.646239Z"},"links":{"citing_paper":"/paper/2507.14988"},"observation_digest":"sha256:4f7ff2c5c8f594d78d21f3e6ed070d0c848437adab74bba4bccf947ea49221b7","observation_id":"4af1368f-b726-4c67-8405-54479b81822a","resolution":{"observed_at":"2026-08-06T15:48:26.837349Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.14988","last_updated":"2025-07-20T14:48:48Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-11T00:57:14.977496Z","submitted_at":"2025-07-20T14:48:48Z","title":"DMOSpeech 2: Reinforcement Learning for Duration Prediction in Metric-Optimized Speech Synthesis"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":5,"verified_fuzzy":16},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 1 inbound Pith citation observation for arXiv:2507.14988."}