{"as_of":"2026-08-08T02:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1f5741f843f5afab9c13852a0249613312882abdefb3ba81c75a5870bf7a67b5","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:21:04.007502Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:21:03.907098Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T03:27:34.881668Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.05911","last_updated":"2025-07-08T11:57:16Z","snapshot_observed_at":"2026-08-07T07:17:41.212038Z","submitted_at":"2025-07-08T11:57:16Z","title":"Differentiable Reward Optimization for LLM based TTS system","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05911","snapshot_observed_at":"2026-08-06T19:21:03.907098Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.05911","last_updated":"2025-07-08T11:57:16Z","snapshot_observed_at":"2026-08-07T07:17:41.212038Z","submitted_at":"2025-07-08T11:57:16Z","title":"Differentiable Reward Optimization for LLM based TTS system","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:03.907098Z"},"links":{"cited_paper":"/paper/2507.05911","citing_paper":"/paper/2507.05911"},"observation_digest":"sha256:977b0b195dac69f99ae8fde83d34cbcf1837facaa03583df7d33f30c2760c7e5","observation_id":"a8c3ba41-ce94-48ce-9281-c1dc4798c9f2","resolution":{"observed_at":"2026-08-06T19:21:03.907098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05911","last_updated":"2025-07-08T11:57:16Z","snapshot_observed_at":"2026-08-07T07:17:41.212038Z","submitted_at":"2025-07-08T11:57:16Z","title":"Differentiable Reward Optimization for LLM based TTS system","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05911","snapshot_observed_at":"2026-08-03T06:36:32.240560Z","title":"Differentiable reward optimization for llm based tts system.arXiv preprint arXiv:2507.05911, 2025a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.22661","last_updated":"2026-05-27T18:10:43Z","snapshot_observed_at":"2026-08-05T03:41:49.406487Z","submitted_at":"2026-01-30T07:27:48Z","title":"Evaluating and Rewarding LALMs for Expressive Role-Play TTS via Mean Continuation Log-Probability","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:32.240560Z"},"links":{"cited_paper":"/paper/2507.05911","citing_paper":"/paper/2601.22661"},"observation_digest":"sha256:f49e1dc177e3a77570836147a5a2604c9bc784b436c271c73df880efeff545ac","observation_id":"5669cd96-e95c-4b59-a58c-f0a29b7d705e","resolution":{"observed_at":"2026-08-03T06:36:32.240560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05911","last_updated":"2025-07-08T11:57:16Z","snapshot_observed_at":"2026-08-07T07:17:41.212038Z","submitted_at":"2025-07-08T11:57:16Z","title":"Differentiable Reward Optimization for LLM based TTS system","version":1},"cited_work":{"arxiv_id":"2507.05911","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.05911","snapshot_observed_at":"2026-07-03T03:27:34.881668Z","title":"Differentiable reward optimization for llm based tts system","venue":null,"work_id":"1d1155c9-12ad-45fe-9947-ab5f3295c151","year":2025},"citing_paper":{"arxiv_id":"2606.09234","last_updated":"2026-06-08T09:07:23Z","snapshot_observed_at":"2026-08-05T17:27:24.038541Z","submitted_at":"2026-06-08T09:07:23Z","title":"End-to-End Training for Discrete Token LLM based TTS System","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T15:22:06.893507Z"},"links":{"cited_paper":"/paper/2507.05911","citing_paper":"/paper/2606.09234"},"observation_digest":"sha256:04ce7ca94976b4c6d94a5cf76d7801090320c1156819e459d27345ba50f9492a","observation_id":"58bb72f7-cbef-49ea-b7a7-b0098ae6e966","resolution":{"observed_at":"2026-07-03T03:27:34.883195Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.05911/citation-record","integrity":"/paper/2507.05911/integrity","json":"/paper/2507.05911/citation-record.json","paper":"/paper/2507.05911"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:21:04.284583Z","title":null,"venue":null,"work_id":"1b7d81c4-d5b3-4563-8a12-e555d5211441","year":null},"citing_paper":{"arxiv_id":"2507.05911","last_updated":"2025-07-08T11:57:16Z","snapshot_observed_at":"2026-08-07T07:17:41.212038Z","submitted_at":"2025-07-08T11:57:16Z","title":"Differentiable Reward Optimization for LLM based TTS system","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:03.903629Z"},"links":{"citing_paper":"/paper/2507.05911"},"observation_digest":"sha256:7e154deaa38184a2d420844e04370581496f4a5fcb3eec0bd7952b65c358e06e","observation_id":"af6f0ba1-e714-474d-85b0-3c6f96591e36","resolution":{"observed_at":"2026-08-06T19:21:04.287642Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05911","last_updated":"2025-07-08T11:57:16Z","snapshot_observed_at":"2026-08-07T07:17:41.212038Z","submitted_at":"2025-07-08T11:57:16Z","title":"Differentiable Reward Optimization for LLM based TTS system","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05911","snapshot_observed_at":"2026-08-06T19:21:03.907098Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.05911","last_updated":"2025-07-08T11:57:16Z","snapshot_observed_at":"2026-08-07T07:17:41.212038Z","submitted_at":"2025-07-08T11:57:16Z","title":"Differentiable Reward Optimization for LLM based TTS system","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:03.907098Z"},"links":{"cited_paper":"/paper/2507.05911","citing_paper":"/paper/2507.05911"},"observation_digest":"sha256:977b0b195dac69f99ae8fde83d34cbcf1837facaa03583df7d33f30c2760c7e5","observation_id":"a8c3ba41-ce94-48ce-9281-c1dc4798c9f2","resolution":{"observed_at":"2026-08-06T19:21:03.907098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:21:04.276139Z","title":"Figure 1 shows the difference between the DiffRO and the existing RL method like DPO","venue":null,"work_id":"716dfac0-d023-4775-843f-0c5b4264494d","year":null},"citing_paper":{"arxiv_id":"2507.05911","last_updated":"2025-07-08T11:57:16Z","snapshot_observed_at":"2026-08-07T07:17:41.212038Z","submitted_at":"2025-07-08T11:57:16Z","title":"Differentiable Reward Optimization for LLM based TTS system","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:03.910576Z"},"links":{"citing_paper":"/paper/2507.05911"},"observation_digest":"sha256:1de742915d06779dbed49ad6643a9dccaff1949cbf4d966435e30b4ca4965a20","observation_id":"d759b234-f61b-440c-a3a8-0414f5eaaf81","resolution":{"observed_at":"2026-08-06T19:21:04.279359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:21:04.266940Z","title":"Experimental Setup","venue":null,"work_id":"cd1830aa-34a0-422f-93fe-4f41f7b62ce8","year":null},"citing_paper":{"arxiv_id":"2507.05911","last_updated":"2025-07-08T11:57:16Z","snapshot_observed_at":"2026-08-07T07:17:41.212038Z","submitted_at":"2025-07-08T11:57:16Z","title":"Differentiable Reward Optimization for LLM based TTS system","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:03.913744Z"},"links":{"citing_paper":"/paper/2507.05911"},"observation_digest":"sha256:58de656727ad4960ffbe5c446a715ec44cd26f00325c3b41883f98fa4a187de7","observation_id":"3143c8d2-3fda-4e26-be7a-c317c3a78512","resolution":{"observed_at":"2026-08-06T19:21:04.270240Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:21:04.258238Z","title":"Compared to other reinforcement learning methods, DiffRO is capable of directly predicting reward scores from speech tokens rather than from synthesized audio","venue":null,"work_id":"1fe07c84-6ae8-4d14-a5e7-ab554a6f05a7","year":null},"citing_paper":{"arxiv_id":"2507.05911","last_updated":"2025-07-08T11:57:16Z","snapshot_observed_at":"2026-08-07T07:17:41.212038Z","submitted_at":"2025-07-08T11:57:16Z","title":"Differentiable Reward Optimization for LLM based TTS system","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:03.917226Z"},"links":{"citing_paper":"/paper/2507.05911"},"observation_digest":"sha256:6e6ab20a79777c9a719045136ce100ca721397c4dbc17694be703b1c1fb6c0ae","observation_id":"e98d9252-e536-4fa8-936f-e4197d2273fe","resolution":{"observed_at":"2026-08-06T19:21:04.261574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:21:04.249938Z","title":"Denoising diffusion probabilistic models,","venue":null,"work_id":"8a434659-0e18-4759-9ff2-bd2524c07f78","year":2020},"citing_paper":{"arxiv_id":"2507.05911","last_updated":"2025-07-08T11:57:16Z","snapshot_observed_at":"2026-08-07T07:17:41.212038Z","submitted_at":"2025-07-08T11:57:16Z","title":"Differentiable Reward Optimization for LLM based TTS system","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:03.920367Z"},"links":{"citing_paper":"/paper/2507.05911"},"observation_digest":"sha256:db98ec230c1765445111ad6a70049ef8d9eed01d43a55cc1725593c5a4e6f268","observation_id":"fa37fdba-494b-4665-b948-5dbc05bc8b34","resolution":{"observed_at":"2026-08-06T19:21:04.252926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:21:04.240019Z","title":"Neural codec language models are zero-shot text to speech synthesizers,","venue":null,"work_id":"a9c505b5-dd86-4ce0-992c-66e1cdaa6ff2","year":2025},"citing_paper":{"arxiv_id":"2507.05911","last_updated":"2025-07-08T11:57:16Z","snapshot_observed_at":"2026-08-07T07:17:41.212038Z","submitted_at":"2025-07-08T11:57:16Z","title":"Differentiable Reward Optimization for LLM based TTS system","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:03.923447Z"},"links":{"citing_paper":"/paper/2507.05911"},"observation_digest":"sha256:052858ea34095c65edac737541e6d6d484f6e30b98b5888aca88c0569295ff90","observation_id":"db4d6f1f-e8d5-424b-bbba-0311e1c1fef5","resolution":{"observed_at":"2026-08-06T19:21:04.243318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03926","last_updated":"2023-03-07T14:31:55Z","snapshot_observed_at":"2026-08-06T04:55:08.186019Z","submitted_at":"2023-03-07T14:31:55Z","title":"Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03926","snapshot_observed_at":"2026-08-06T19:21:03.927154Z","title":"Speak foreign languages with your own voice: Cross-lingual neural codec language modeling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05911","last_updated":"2025-07-08T11:57:16Z","snapshot_observed_at":"2026-08-07T07:17:41.212038Z","submitted_at":"2025-07-08T11:57:16Z","title":"Differentiable Reward Optimization for LLM based TTS system","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:03.927154Z"},"links":{"cited_paper":"/paper/2303.03926","citing_paper":"/paper/2507.05911"},"observation_digest":"sha256:b93e3304b61f809c431db918b0ced63a970eb06c3b6b369096302671719580c9","observation_id":"b87f9175-72f9-4052-ba6c-4c17668cba53","resolution":{"observed_at":"2026-08-06T19:21:03.927154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-06T19:21:03.930674Z","title":"Fine-tuning language models from human preferences,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.05911","last_updated":"2025-07-08T11:57:16Z","snapshot_observed_at":"2026-08-07T07:17:41.212038Z","submitted_at":"2025-07-08T11:57:16Z","title":"Differentiable Reward Optimization for LLM based TTS system","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:03.930674Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2507.05911"},"observation_digest":"sha256:bb085f626ab97bb698fbd37704b84406918b7d7036837cd151e9525cf60e2763","observation_id":"3419c96d-06ef-4023-9f1f-7aa98617f27a","resolution":{"observed_at":"2026-08-06T19:21:03.930674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00744","last_updated":"2024-02-01T16:39:47Z","snapshot_observed_at":"2026-07-06T17:23:47.717199Z","submitted_at":"2024-02-01T16:39:47Z","title":"BATON: Aligning Text-to-Audio Model with Human Preference Feedback","version":1},"cited_work":{"arxiv_id":"2402.00744","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.00744","snapshot_observed_at":"2026-08-06T19:21:04.129234Z","title":"BATON: Aligning Text-to-Audio Model with Human Preference Feedback","venue":"cs.SD","work_id":"917e7af6-9f29-42c9-ada1-2e03e53acb6e","year":2024},"citing_paper":{"arxiv_id":"2507.05911","last_updated":"2025-07-08T11:57:16Z","snapshot_observed_at":"2026-08-07T07:17:41.212038Z","submitted_at":"2025-07-08T11:57:16Z","title":"Differentiable Reward Optimization for LLM based TTS system","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:03.933807Z"},"links":{"cited_paper":"/paper/2402.00744","citing_paper":"/paper/2507.05911"},"observation_digest":"sha256:333bb8f37fde8a8aa9ca69ab7829ad91b5e98cb78a4b9b8566b2521fc941cdcf","observation_id":"0ca2a934-9b4e-4e91-b437-ec4e5b423d9a","resolution":{"observed_at":"2026-08-06T19:21:04.134137Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00654","last_updated":"2024-06-02T07:54:33Z","snapshot_observed_at":"2026-07-06T18:23:57.071938Z","submitted_at":"2024-06-02T07:54:33Z","title":"Enhancing Zero-shot Text-to-Speech Synthesis with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00654","snapshot_observed_at":"2026-08-06T19:21:03.937201Z","title":"Enhancing Zero-shot Text-to-Speech Synthesis with Human Feedback,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05911","last_updated":"2025-07-08T11:57:16Z","snapshot_observed_at":"2026-08-07T07:17:41.212038Z","submitted_at":"2025-07-08T11:57:16Z","title":"Differentiable Reward Optimization for LLM based TTS system","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:03.937201Z"},"links":{"cited_paper":"/paper/2406.00654","citing_paper":"/paper/2507.05911"},"observation_digest":"sha256:6296bf6cd8f74899b0e189f256f4d320b4f3e9e78a2bf2da49c5b3d2d893f94f","observation_id":"ae14a623-b5bc-4baa-b660-2e36555c476f","resolution":{"observed_at":"2026-08-06T19:21:03.937201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:21:04.230751Z","title":"Robust zero- shot text-to-speech synthesis with reverse inference optimization,","venue":null,"work_id":"8792f033-8fe3-446c-87f3-7cce359239ce","year":null},"citing_paper":{"arxiv_id":"2507.05911","last_updated":"2025-07-08T11:57:16Z","snapshot_observed_at":"2026-08-07T07:17:41.212038Z","submitted_at":"2025-07-08T11:57:16Z","title":"Differentiable Reward Optimization for LLM based TTS system","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:03.940391Z"},"links":{"citing_paper":"/paper/2507.05911"},"observation_digest":"sha256:4a15badeaafcc87a6d67efbf6c5ad54996000c424248c694db2e1ec1feb95815","observation_id":"ad003da6-0d82-4a6f-ae68-dc40dcb6d347","resolution":{"observed_at":"2026-08-06T19:21:04.234285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:21:04.212909Z","title":"Cosyvoice 2: Scalable streaming speech synthesis with large language models,","venue":null,"work_id":"68237793-5f50-456c-8279-b5d53644b61b","year":null},"citing_paper":{"arxiv_id":"2507.05911","last_updated":"2025-07-08T11:57:16Z","snapshot_observed_at":"2026-08-07T07:17:41.212038Z","submitted_at":"2025-07-08T11:57:16Z","title":"Differentiable Reward Optimization for LLM based TTS system","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:03.961084Z"},"links":{"citing_paper":"/paper/2507.05911"},"observation_digest":"sha256:451fa95e3d9842b0e7152a7b1027f2612e55c41f703debf18a60a021e588d22c","observation_id":"24b90341-4162-4efd-b4e5-185aefe70570","resolution":{"observed_at":"2026-08-06T19:21:04.216021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-06T19:21:03.946996Z","title":"Seed- TTS: A Family of High-Quality Versatile Speech Generation Models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05911","last_updated":"2025-07-08T11:57:16Z","snapshot_observed_at":"2026-08-07T07:17:41.212038Z","submitted_at":"2025-07-08T11:57:16Z","title":"Differentiable Reward Optimization for LLM based TTS system","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:03.946996Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2507.05911"},"observation_digest":"sha256:870cf86bab53ee5827d23d35950499eb765434b264ff276cdc1e51fbdcbc0fcb","observation_id":"0b63ce8a-c9bf-4023-b1e3-db6397667678","resolution":{"observed_at":"2026-08-06T19:21:03.946996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10157","last_updated":"2024-09-16T10:41:36Z","snapshot_observed_at":"2026-08-08T00:25:52.904385Z","submitted_at":"2024-09-16T10:41:36Z","title":"Emo-DPO: Controllable Emotional Speech Synthesis through Direct Preference Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10157","snapshot_observed_at":"2026-08-06T19:21:03.949976Z","title":"Emo-DPO: Controllable Emotional Speech Synthesis through Direct Preference Optimization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05911","last_updated":"2025-07-08T11:57:16Z","snapshot_observed_at":"2026-08-07T07:17:41.212038Z","submitted_at":"2025-07-08T11:57:16Z","title":"Differentiable Reward Optimization for LLM based TTS system","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:03.949976Z"},"links":{"cited_paper":"/paper/2409.10157","citing_paper":"/paper/2507.05911"},"observation_digest":"sha256:b70ccc9a07b579fb4038d03b54e9d1d512ed84030d16b3cff35e555706eb71b6","observation_id":"6d68e9d5-2e5e-40cd-92bd-32082180c84d","resolution":{"observed_at":"2026-08-06T19:21:03.949976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T19:21:03.952970Z","title":"Proximal Policy Optimization Algorithms,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.05911","last_updated":"2025-07-08T11:57:16Z","snapshot_observed_at":"2026-08-07T07:17:41.212038Z","submitted_at":"2025-07-08T11:57:16Z","title":"Differentiable Reward Optimization for LLM based TTS system","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:03.952970Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2507.05911"},"observation_digest":"sha256:c7199357e50f0630528ebe19a77b74d5a2f80602dfb35ca5c0bcc5b0dddc9ac8","observation_id":"0c62705d-c203-4ba0-a71a-92f75d48aa4b","resolution":{"observed_at":"2026-08-06T19:21:03.952970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-06T19:21:03.955658Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05911","last_updated":"2025-07-08T11:57:16Z","snapshot_observed_at":"2026-08-07T07:17:41.212038Z","submitted_at":"2025-07-08T11:57:16Z","title":"Differentiable Reward Optimization for LLM based TTS system","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:03.955658Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2507.05911"},"observation_digest":"sha256:73325a35bc53e0e815780b99ba8776dd57353e2470e84c8920aab641f5daa1c9","observation_id":"0c36fff5-d410-4ec5-8f65-8e207496bd0e","resolution":{"observed_at":"2026-08-06T19:21:03.955658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:21:04.221491Z","title":"Asq: An ultra-low bit rate asr-oriented speech quantization method,","venue":null,"work_id":"81e24c79-e25f-466d-abbe-a2a7e9d37904","year":2024},"citing_paper":{"arxiv_id":"2507.05911","last_updated":"2025-07-08T11:57:16Z","snapshot_observed_at":"2026-08-07T07:17:41.212038Z","submitted_at":"2025-07-08T11:57:16Z","title":"Differentiable Reward Optimization for LLM based TTS system","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:03.958481Z"},"links":{"citing_paper":"/paper/2507.05911"},"observation_digest":"sha256:4c91d655f7e1f2bd0336ccf1735d4f2d18c38059f122df9eda6ed9e035569c8c","observation_id":"39a0bd8d-5ab3-46b2-920b-5f6e1f5668db","resolution":{"observed_at":"2026-08-06T19:21:04.225241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13102","last_updated":"2025-07-24T02:12:07Z","snapshot_observed_at":"2026-08-05T07:12:58.429173Z","submitted_at":"2024-12-17T17:15:21Z","title":"AIR-Bench: Automated Heterogeneous Information Retrieval Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13102","snapshot_observed_at":"2026-08-06T19:21:03.983187Z","title":"Air-bench: Automated heterogeneous information retrieval benchmark,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05911","last_updated":"2025-07-08T11:57:16Z","snapshot_observed_at":"2026-08-07T07:17:41.212038Z","submitted_at":"2025-07-08T11:57:16Z","title":"Differentiable Reward Optimization for LLM based TTS system","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:03.983187Z"},"links":{"cited_paper":"/paper/2412.13102","citing_paper":"/paper/2507.05911"},"observation_digest":"sha256:c8af986f078c4558c05a743420618ffe03f380548f198cf8381eee123749dc9f","observation_id":"82b8e870-57a9-4240-8ada-7202285ac39e","resolution":{"observed_at":"2026-08-06T19:21:03.983187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-07T06:02:40.568271Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-06T19:21:03.964399Z","title":"Available: https://arxiv.org/abs/2412.10117","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05911","last_updated":"2025-07-08T11:57:16Z","snapshot_observed_at":"2026-08-07T07:17:41.212038Z","submitted_at":"2025-07-08T11:57:16Z","title":"Differentiable Reward Optimization for LLM based TTS system","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:03.964399Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2507.05911"},"observation_digest":"sha256:9055783421c7f9a92ff1010dc1379d6364553e145d3fd7db2100933dea3a7672","observation_id":"dafd7893-1b29-45a3-af82-fb00420edb9a","resolution":{"observed_at":"2026-08-06T19:21:03.964399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:21:04.203922Z","title":"Torchaudio-squim: Reference-less speech quality and intelligibility measures in torchaudio,","venue":null,"work_id":"a88139c6-0661-4f98-b33c-e3a101fb76c3","year":2023},"citing_paper":{"arxiv_id":"2507.05911","last_updated":"2025-07-08T11:57:16Z","snapshot_observed_at":"2026-08-07T07:17:41.212038Z","submitted_at":"2025-07-08T11:57:16Z","title":"Differentiable Reward Optimization for LLM based TTS system","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:03.967235Z"},"links":{"citing_paper":"/paper/2507.05911"},"observation_digest":"sha256:f300aa13c64e3be6228e79df8fb01d276b47ca80bfdd5d142af9b78f98c42970","observation_id":"3b9ce675-5e3d-4150-8ae2-dc62834e45d7","resolution":{"observed_at":"2026-08-06T19:21:04.207339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:21:04.194660Z","title":"Panns: Large-scale pretrained audio neural networks for audio pattern recognition,","venue":null,"work_id":"0abd2243-217d-48a0-b694-febb299de7fa","year":2019},"citing_paper":{"arxiv_id":"2507.05911","last_updated":"2025-07-08T11:57:16Z","snapshot_observed_at":"2026-08-07T07:17:41.212038Z","submitted_at":"2025-07-08T11:57:16Z","title":"Differentiable Reward Optimization for LLM based TTS system","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:03.969868Z"},"links":{"citing_paper":"/paper/2507.05911"},"observation_digest":"sha256:1a1c3204c53f83956bc5b645f79e6da9068fc828180496a06e6aae884c2b4dad","observation_id":"9cf9a8d5-836e-4f85-a99a-afb1b4a17279","resolution":{"observed_at":"2026-08-06T19:21:04.198504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:21:03.972402Z","title":"Common voice: A massively-multilingual speech corpus,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.05911","last_updated":"2025-07-08T11:57:16Z","snapshot_observed_at":"2026-08-07T07:17:41.212038Z","submitted_at":"2025-07-08T11:57:16Z","title":"Differentiable Reward Optimization for LLM based TTS system","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:03.972402Z"},"links":{"citing_paper":"/paper/2507.05911"},"observation_digest":"sha256:e416825eb87ba4782b2b8846232eb5e3c1c922264f4a184c20df416b0c1510d8","observation_id":"433206e1-8cd7-4efd-9f85-458541ea8b18","resolution":{"observed_at":"2026-08-06T19:21:03.972402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:21:04.181827Z","title":"The voicemos challenge 2022,","venue":null,"work_id":"5a28317a-5531-4e35-a917-a71ea91057e4","year":2022},"citing_paper":{"arxiv_id":"2507.05911","last_updated":"2025-07-08T11:57:16Z","snapshot_observed_at":"2026-08-07T07:17:41.212038Z","submitted_at":"2025-07-08T11:57:16Z","title":"Differentiable Reward Optimization for LLM based TTS system","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:03.975942Z"},"links":{"citing_paper":"/paper/2507.05911"},"observation_digest":"sha256:a7f33d7da98e708c1eb6efe1d7da3d4857b27112ff8b5c0bf2ec44bc77360c34","observation_id":"07aae18e-a3e3-4cc6-811e-2c7ab260765d","resolution":{"observed_at":"2026-08-06T19:21:04.184689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:21:03.979488Z","title":"Iemocap: Interactive emotional dyadic motion capture database,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2507.05911","last_updated":"2025-07-08T11:57:16Z","snapshot_observed_at":"2026-08-07T07:17:41.212038Z","submitted_at":"2025-07-08T11:57:16Z","title":"Differentiable Reward Optimization for LLM based TTS system","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:03.979488Z"},"links":{"citing_paper":"/paper/2507.05911"},"observation_digest":"sha256:8a3560b696201fedf2c721120367af189173a8e514719384239bb3ca4035f4a3","observation_id":"7ab4b5bd-b48f-4fee-9fda-fd0ec86dea26","resolution":{"observed_at":"2026-08-06T19:21:03.979488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-06T19:21:04.004618Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.05911","last_updated":"2025-07-08T11:57:16Z","snapshot_observed_at":"2026-08-07T07:17:41.212038Z","submitted_at":"2025-07-08T11:57:16Z","title":"Differentiable Reward Optimization for LLM based TTS system","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:04.004618Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2507.05911"},"observation_digest":"sha256:db7370d767e69c46baee6955344f946b30fef833705db4ae51e13ef3d3df0b71","observation_id":"5f89e426-80c3-4f7b-889d-7f0670e5d05c","resolution":{"observed_at":"2026-08-06T19:21:04.004618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04051","last_updated":"2024-07-11T02:08:35Z","snapshot_observed_at":"2026-08-06T00:42:36.144034Z","submitted_at":"2024-07-04T16:49:02Z","title":"FunAudioLLM: Voice Understanding and Generation Foundation Models for Natural Interaction Between Humans and LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04051","snapshot_observed_at":"2026-08-06T19:21:03.987118Z","title":"Funaudiollm: V oice understanding and generation foundation models for natural interaction between humans and llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05911","last_updated":"2025-07-08T11:57:16Z","snapshot_observed_at":"2026-08-07T07:17:41.212038Z","submitted_at":"2025-07-08T11:57:16Z","title":"Differentiable Reward Optimization for LLM based TTS system","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:03.987118Z"},"links":{"cited_paper":"/paper/2407.04051","citing_paper":"/paper/2507.05911"},"observation_digest":"sha256:8eca020c61e9c6a704266b3e53c1dc973a26aadae3ab03185f5f7d7c5344a577","observation_id":"a397a2aa-8407-4328-8ff1-11f688955eb5","resolution":{"observed_at":"2026-08-06T19:21:03.987118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:21:04.169132Z","title":"Dnsmos p.835: A non- intrusive perceptual objective speech quality metric to evaluate noise suppressors,","venue":null,"work_id":"26fa7d5d-7cb3-4ca9-8c44-fd3a357015bc","year":2022},"citing_paper":{"arxiv_id":"2507.05911","last_updated":"2025-07-08T11:57:16Z","snapshot_observed_at":"2026-08-07T07:17:41.212038Z","submitted_at":"2025-07-08T11:57:16Z","title":"Differentiable Reward Optimization for LLM based TTS system","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:03.989942Z"},"links":{"citing_paper":"/paper/2507.05911"},"observation_digest":"sha256:5610cdcb9489ec5a8d716c4b085255467fe727ab50105bf34cd1933697d93c8e","observation_id":"036ae5c2-1986-4023-a598-1804bcc8cea9","resolution":{"observed_at":"2026-08-06T19:21:04.172299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07162","last_updated":"2024-06-11T11:12:51Z","snapshot_observed_at":"2026-08-06T08:12:49.540745Z","submitted_at":"2024-06-11T11:12:51Z","title":"EmoBox: Multilingual Multi-corpus Speech Emotion Recognition Toolkit and Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07162","snapshot_observed_at":"2026-08-06T19:21:03.992535Z","title":"Emobox: Multilingual multi-corpus speech emotion recognition toolkit and benchmark,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05911","last_updated":"2025-07-08T11:57:16Z","snapshot_observed_at":"2026-08-07T07:17:41.212038Z","submitted_at":"2025-07-08T11:57:16Z","title":"Differentiable Reward Optimization for LLM based TTS system","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:03.992535Z"},"links":{"cited_paper":"/paper/2406.07162","citing_paper":"/paper/2507.05911"},"observation_digest":"sha256:bdd967352d7a64ced106f1cd1a2bfc93300c1822a685ee517c327db89d848798","observation_id":"a913a405-6aa8-4709-99b5-ba60796d5be2","resolution":{"observed_at":"2026-08-06T19:21:03.992535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-06T19:21:03.995596Z","title":"Qwen-audio: Advancing universal audio understand- ing via unified large-scale audio-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05911","last_updated":"2025-07-08T11:57:16Z","snapshot_observed_at":"2026-08-07T07:17:41.212038Z","submitted_at":"2025-07-08T11:57:16Z","title":"Differentiable Reward Optimization for LLM based TTS system","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:03.995596Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2507.05911"},"observation_digest":"sha256:7f220cc40f724dcff0082464fa2a74b29284004cade749a2ad5855899909a7be","observation_id":"19dc18b0-34b9-4b54-9d08-4ceb984b145e","resolution":{"observed_at":"2026-08-06T19:21:03.995596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06282","last_updated":"2025-01-10T15:55:27Z","snapshot_observed_at":"2026-08-03T15:49:21.622478Z","submitted_at":"2025-01-10T15:55:27Z","title":"MinMo: A Multimodal Large Language Model for Seamless Voice Interaction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06282","snapshot_observed_at":"2026-08-06T19:21:03.998457Z","title":"Minmo: A multimodal large language model for seamless voice interaction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.05911","last_updated":"2025-07-08T11:57:16Z","snapshot_observed_at":"2026-08-07T07:17:41.212038Z","submitted_at":"2025-07-08T11:57:16Z","title":"Differentiable Reward Optimization for LLM based TTS system","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:03.998457Z"},"links":{"cited_paper":"/paper/2501.06282","citing_paper":"/paper/2507.05911"},"observation_digest":"sha256:8d5efcf0570a6672413a8e02981140e33ff3ff2199827202b3f7d7ad246942cc","observation_id":"9690060e-f981-4df2-969d-edbf34cee12c","resolution":{"observed_at":"2026-08-06T19:21:03.998457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:21:04.160549Z","title":"Paraformer: Fast and accurate parallel transformer for non-autoregressive end-to- end speech recognition,","venue":null,"work_id":"c1efca04-ba7b-41a5-bc7a-d825c1af7852","year":2022},"citing_paper":{"arxiv_id":"2507.05911","last_updated":"2025-07-08T11:57:16Z","snapshot_observed_at":"2026-08-07T07:17:41.212038Z","submitted_at":"2025-07-08T11:57:16Z","title":"Differentiable Reward Optimization for LLM based TTS system","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:04.002036Z"},"links":{"citing_paper":"/paper/2507.05911"},"observation_digest":"sha256:90ec8907d5b3f59e76738697bfbf1928f67d804b31698473c1c96c5a1ceeac54","observation_id":"2cddfe44-4ecd-431a-a4b1-c23c24355f13","resolution":{"observed_at":"2026-08-06T19:21:04.163819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-01T23:52:25.071174Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06885","snapshot_observed_at":"2026-08-06T19:21:04.007502Z","title":"F5-tts: A fairytaler that fakes fluent and faithful speech with flow matching,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05911","last_updated":"2025-07-08T11:57:16Z","snapshot_observed_at":"2026-08-07T07:17:41.212038Z","submitted_at":"2025-07-08T11:57:16Z","title":"Differentiable Reward Optimization for LLM based TTS system","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:04.007502Z"},"links":{"cited_paper":"/paper/2410.06885","citing_paper":"/paper/2507.05911"},"observation_digest":"sha256:86ba5d8ab030c1b2c68e98046fa87044afa2a7997acaf2165508b6a3145ed94e","observation_id":"1db4b377-e5fd-4c35-b9b2-d12bf1683ce2","resolution":{"observed_at":"2026-08-06T19:21:04.007502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02243","last_updated":"2024-07-02T13:04:04Z","snapshot_observed_at":"2026-08-07T02:35:48.901547Z","submitted_at":"2024-07-02T13:04:04Z","title":"Robust Zero-Shot Text-to-Speech Synthesis with Reverse Inference Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02243","snapshot_observed_at":"2026-08-06T19:21:03.943678Z","title":"Available: https://arxiv.org/abs/2407.02243","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.05911","last_updated":"2025-07-08T11:57:16Z","snapshot_observed_at":"2026-08-07T07:17:41.212038Z","submitted_at":"2025-07-08T11:57:16Z","title":"Differentiable Reward Optimization for LLM based TTS system","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T19:21:03.943678Z"},"links":{"cited_paper":"/paper/2407.02243","citing_paper":"/paper/2507.05911"},"observation_digest":"sha256:2b52b0b6a98d6fa38506afae5655bc0e05b362c5915aa6817edecd98d8dc08bd","observation_id":"9f700fc2-640f-4295-a63f-959c6af2aac1","resolution":{"observed_at":"2026-08-06T19:21:03.943678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.05911","last_updated":"2025-07-08T11:57:16Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T07:17:41.212038Z","submitted_at":"2025-07-08T11:57:16Z","title":"Differentiable Reward Optimization for LLM based TTS system"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":1,"verified_fuzzy":12},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 3 inbound Pith citation observations for arXiv:2507.05911."}