{"as_of":"2026-08-23T07:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5afa972d006a568d9c1c183c44e65eb5f9dedf81419a1aacf8e4b982dd11dd3d","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T06:36:33.887146Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2601.22661/citation-record","integrity":"/paper/2601.22661/integrity","json":"/paper/2601.22661/citation-record.json","paper":"/paper/2601.22661"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.21138","last_updated":"2025-07-22T23:57:11Z","snapshot_observed_at":"2026-08-09T08:43:35.449807Z","submitted_at":"2025-07-22T23:57:11Z","title":"TTS-1 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.21138","snapshot_observed_at":"2026-08-03T06:36:31.523597Z","title":"Tts-1 technical report.arXiv preprint arXiv:2507.21138,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22661","last_updated":"2026-05-27T18:10:43Z","snapshot_observed_at":"2026-08-13T04:26:16.591748Z","submitted_at":"2026-01-30T07:27:48Z","title":"Evaluating and Rewarding LALMs for Expressive Role-Play TTS via Mean Continuation Log-Probability","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:31.523597Z"},"links":{"cited_paper":"/paper/2507.21138","citing_paper":"/paper/2601.22661"},"observation_digest":"sha256:2474b2ab69bf0140efe544a13ea122474cbf7382225815bc79a69de4bf173382","observation_id":"64fed19a-4d58-49a6-867f-8977988efecd","resolution":{"observed_at":"2026-08-03T06:36:31.523597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-16T06:25:22.037199Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-03T06:36:32.017309Z","title":"Cosyvoice 2: Scalable streaming speech synthesis with large language models.arXiv preprint arXiv:2412.10117,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22661","last_updated":"2026-05-27T18:10:43Z","snapshot_observed_at":"2026-08-13T04:26:16.591748Z","submitted_at":"2026-01-30T07:27:48Z","title":"Evaluating and Rewarding LALMs for Expressive Role-Play TTS via Mean Continuation Log-Probability","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:32.017309Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2601.22661"},"observation_digest":"sha256:b71294272925daf9658451fd0e041f8d24e0c720b9184df63685872c0c611b18","observation_id":"187d4839-c0fb-4345-b711-fafa91a4708a","resolution":{"observed_at":"2026-08-03T06:36:32.017309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05911","last_updated":"2025-07-08T11:57:16Z","snapshot_observed_at":"2026-08-17T16:00:58.356596Z","submitted_at":"2025-07-08T11:57:16Z","title":"Differentiable Reward Optimization for LLM based TTS system","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05911","snapshot_observed_at":"2026-08-03T06:36:32.240560Z","title":"Differentiable reward optimization for llm based tts system.arXiv preprint arXiv:2507.05911, 2025a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.22661","last_updated":"2026-05-27T18:10:43Z","snapshot_observed_at":"2026-08-13T04:26:16.591748Z","submitted_at":"2026-01-30T07:27:48Z","title":"Evaluating and Rewarding LALMs for Expressive Role-Play TTS via Mean Continuation Log-Probability","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:32.240560Z"},"links":{"cited_paper":"/paper/2507.05911","citing_paper":"/paper/2601.22661"},"observation_digest":"sha256:dfb375cf6c0a9d0110c8e0a65480ec45530cdf5779a456f6b015900f290aa21e","observation_id":"5669cd96-e95c-4b59-a58c-f0a29b7d705e","resolution":{"observed_at":"2026-08-03T06:36:32.240560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:36:32.326580Z","title":"Prompttts: Controllable text-to-speech with text descriptions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.22661","last_updated":"2026-05-27T18:10:43Z","snapshot_observed_at":"2026-08-13T04:26:16.591748Z","submitted_at":"2026-01-30T07:27:48Z","title":"Evaluating and Rewarding LALMs for Expressive Role-Play TTS via Mean Continuation Log-Probability","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:32.326580Z"},"links":{"citing_paper":"/paper/2601.22661"},"observation_digest":"sha256:e074485bf065925c3a76fc6f3abef1aa8fe4a4d8c00a4032547da4ecaeed574d","observation_id":"38d72d7a-b07b-4921-b6cc-eb25bd3d5477","resolution":{"observed_at":"2026-08-03T06:36:32.326580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.15621","last_updated":"2026-01-22T03:51:43Z","snapshot_observed_at":"2026-08-13T01:33:42.158497Z","submitted_at":"2026-01-22T03:51:43Z","title":"Qwen3-TTS Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.15621","snapshot_observed_at":"2026-08-03T06:36:32.393867Z","title":"Qwen3-tts technical report.arXiv preprint arXiv:2601.15621, 2026a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22661","last_updated":"2026-05-27T18:10:43Z","snapshot_observed_at":"2026-08-13T04:26:16.591748Z","submitted_at":"2026-01-30T07:27:48Z","title":"Evaluating and Rewarding LALMs for Expressive Role-Play TTS via Mean Continuation Log-Probability","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:32.393867Z"},"links":{"cited_paper":"/paper/2601.15621","citing_paper":"/paper/2601.22661"},"observation_digest":"sha256:ce92a7f2ffd59462c1da9b8a448a6f794c819639075e81c48d0b0d8cb94f2f91","observation_id":"87f751dc-da9c-46cb-9382-42db3a39acff","resolution":{"observed_at":"2026-08-03T06:36:32.393867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:36:32.453974Z","title":"Speechrole: A large-scale dataset and benchmark for evaluating speech role-playing agents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22661","last_updated":"2026-05-27T18:10:43Z","snapshot_observed_at":"2026-08-13T04:26:16.591748Z","submitted_at":"2026-01-30T07:27:48Z","title":"Evaluating and Rewarding LALMs for Expressive Role-Play TTS via Mean Continuation Log-Probability","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:32.453974Z"},"links":{"citing_paper":"/paper/2601.22661"},"observation_digest":"sha256:ff5fd354d2114f48440554132ce0b140f203147961ff4068b48d95a8b07b15fc","observation_id":"7a67601c-c652-4d21-ab6c-cf428f010520","resolution":{"observed_at":"2026-08-03T06:36:32.453974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02285","last_updated":"2023-10-12T03:05:36Z","snapshot_observed_at":"2026-08-18T18:30:27.003087Z","submitted_at":"2023-09-05T14:45:27Z","title":"PromptTTS 2: Describing and Generating Voices with Text Prompt","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02285","snapshot_observed_at":"2026-08-03T06:36:32.513360Z","title":"Prompttts 2: Describing and generating voices with text prompt.arXiv preprint arXiv:2309.02285,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22661","last_updated":"2026-05-27T18:10:43Z","snapshot_observed_at":"2026-08-13T04:26:16.591748Z","submitted_at":"2026-01-30T07:27:48Z","title":"Evaluating and Rewarding LALMs for Expressive Role-Play TTS via Mean Continuation Log-Probability","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:32.513360Z"},"links":{"cited_paper":"/paper/2309.02285","citing_paper":"/paper/2601.22661"},"observation_digest":"sha256:cfc0be88ee662d76ffbf799773f555bab9a5e29e709cd11033fad03b3f3b19bf","observation_id":"41bc5a40-4de2-4557-a59c-22cda5da7818","resolution":{"observed_at":"2026-08-03T06:36:32.513360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.23435","last_updated":"2026-04-08T07:25:36Z","snapshot_observed_at":"2026-08-15T20:03:54.990068Z","submitted_at":"2025-09-27T18:08:51Z","title":"AudioRole: An Audio Dataset for Character Role-Playing in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.23435","snapshot_observed_at":"2026-08-03T06:36:32.600302Z","title":"Au- diorole: An audio dataset for character role-playing in large language models.arXiv preprint arXiv:2509.23435,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22661","last_updated":"2026-05-27T18:10:43Z","snapshot_observed_at":"2026-08-13T04:26:16.591748Z","submitted_at":"2026-01-30T07:27:48Z","title":"Evaluating and Rewarding LALMs for Expressive Role-Play TTS via Mean Continuation Log-Probability","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:32.600302Z"},"links":{"cited_paper":"/paper/2509.23435","citing_paper":"/paper/2601.22661"},"observation_digest":"sha256:2eb595753f6acc0f0fe4ec477e96e7f4d01a1e1d106d2e63020c5744842b3c47","observation_id":"7f05627a-4879-44d3-83b5-c725b6760a3d","resolution":{"observed_at":"2026-08-03T06:36:32.600302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01408","last_updated":"2021-06-14T02:14:11Z","snapshot_observed_at":"2026-08-21T04:08:49.403772Z","submitted_at":"2021-04-03T13:52:47Z","title":"Reinforcement Learning for Emotional Text-to-Speech Synthesis with Improved Emotion Discriminability","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01408","snapshot_observed_at":"2026-08-03T06:36:32.668134Z","title":"Reinforcement learning for emotional text-to-speech synthesis with improved emo- tion discriminability.arXiv preprint arXiv:2104.01408,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22661","last_updated":"2026-05-27T18:10:43Z","snapshot_observed_at":"2026-08-13T04:26:16.591748Z","submitted_at":"2026-01-30T07:27:48Z","title":"Evaluating and Rewarding LALMs for Expressive Role-Play TTS via Mean Continuation Log-Probability","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:32.668134Z"},"links":{"cited_paper":"/paper/2104.01408","citing_paper":"/paper/2601.22661"},"observation_digest":"sha256:9b38b0394dc02309a1e92757f24a1d0a741d9a7814d7868e26f62be9afdffbbd","observation_id":"8c2c6535-9aa0-4a03-8ede-cde0e03d33f1","resolution":{"observed_at":"2026-08-03T06:36:32.668134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:36:32.814773Z","title":"Hybrid transform- ers for music source separation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2601.22661","last_updated":"2026-05-27T18:10:43Z","snapshot_observed_at":"2026-08-13T04:26:16.591748Z","submitted_at":"2026-01-30T07:27:48Z","title":"Evaluating and Rewarding LALMs for Expressive Role-Play TTS via Mean Continuation Log-Probability","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:32.814773Z"},"links":{"citing_paper":"/paper/2601.22661"},"observation_digest":"sha256:73e1d9e7f362c61d7b9d8947f7b38ddcd9fca7ea7e2fbf9df1231c55af2c77fd","observation_id":"15b907bd-a0de-4e76-a710-3cdf41b45d8d","resolution":{"observed_at":"2026-08-03T06:36:32.814773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-03T06:36:32.939198Z","title":"Deepseekmath: Push- ing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22661","last_updated":"2026-05-27T18:10:43Z","snapshot_observed_at":"2026-08-13T04:26:16.591748Z","submitted_at":"2026-01-30T07:27:48Z","title":"Evaluating and Rewarding LALMs for Expressive Role-Play TTS via Mean Continuation Log-Probability","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:32.939198Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2601.22661"},"observation_digest":"sha256:42b725fb3ef8bc5b02a60a0ae9b1fb1ea67cc9419a67ef5c190367506a9bb039","observation_id":"924b277b-9b4b-4a20-8414-1fb637b15a98","resolution":{"observed_at":"2026-08-03T06:36:32.939198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:36:33.055238Z","title":"Speech-drame: A frame- work for human-aligned benchmarks in speech role-play","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22661","last_updated":"2026-05-27T18:10:43Z","snapshot_observed_at":"2026-08-13T04:26:16.591748Z","submitted_at":"2026-01-30T07:27:48Z","title":"Evaluating and Rewarding LALMs for Expressive Role-Play TTS via Mean Continuation Log-Probability","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:33.055238Z"},"links":{"citing_paper":"/paper/2601.22661"},"observation_digest":"sha256:4aef353590a99bdb011d52b43d287aed037494c99f386cfb858f9324e60448e5","observation_id":"75574330-b66f-4077-b7de-0e26c3cb36da","resolution":{"observed_at":"2026-08-03T06:36:33.055238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:36:33.244749Z","title":"Rrpo: Robust reward policy optimization for llm-based emotional tts.arXiv preprint arXiv:2512.04552,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22661","last_updated":"2026-05-27T18:10:43Z","snapshot_observed_at":"2026-08-13T04:26:16.591748Z","submitted_at":"2026-01-30T07:27:48Z","title":"Evaluating and Rewarding LALMs for Expressive Role-Play TTS via Mean Continuation Log-Probability","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:33.244749Z"},"links":{"citing_paper":"/paper/2601.22661"},"observation_digest":"sha256:42935297ed25d2a5d773563a942286468e90bc6e0dc5a75e9251898a816b7239","observation_id":"790dd417-4554-47a2-8075-15009e99c47e","resolution":{"observed_at":"2026-08-03T06:36:33.244749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16632","last_updated":"2025-08-27T16:42:11Z","snapshot_observed_at":"2026-08-13T23:38:52.637908Z","submitted_at":"2025-07-22T14:23:55Z","title":"Step-Audio 2 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.16632","snapshot_observed_at":"2026-08-03T06:36:33.364746Z","title":"Step-audio 2 technical report.arXiv preprint arXiv:2507.16632, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22661","last_updated":"2026-05-27T18:10:43Z","snapshot_observed_at":"2026-08-13T04:26:16.591748Z","submitted_at":"2026-01-30T07:27:48Z","title":"Evaluating and Rewarding LALMs for Expressive Role-Play TTS via Mean Continuation Log-Probability","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:33.364746Z"},"links":{"cited_paper":"/paper/2507.16632","citing_paper":"/paper/2601.22661"},"observation_digest":"sha256:ddfa12436b9a9f45b43d6eee0ce68c4e6cba5c1e19426f5c73a1c3a98ff0f3bf","observation_id":"2c2610fc-6b84-4fc3-a315-671642161b80","resolution":{"observed_at":"2026-08-03T06:36:33.364746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04128","last_updated":"2025-02-22T11:32:13Z","snapshot_observed_at":"2026-08-20T00:56:34.754853Z","submitted_at":"2025-02-06T15:04:00Z","title":"Llasa: Scaling Train-Time and Inference-Time Compute for Llama-based Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04128","snapshot_observed_at":"2026-08-03T06:36:33.475394Z","title":"Llasa: Scaling train-time and inference-time compute for llama-based speech synthesis.arXiv preprint arXiv:2502.04128,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22661","last_updated":"2026-05-27T18:10:43Z","snapshot_observed_at":"2026-08-13T04:26:16.591748Z","submitted_at":"2026-01-30T07:27:48Z","title":"Evaluating and Rewarding LALMs for Expressive Role-Play TTS via Mean Continuation Log-Probability","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:33.475394Z"},"links":{"cited_paper":"/paper/2502.04128","citing_paper":"/paper/2601.22661"},"observation_digest":"sha256:695b9e4843d078239d1b8944a8bba0ace84c1dd8d0b294f5a9a94c7a993a19a6","observation_id":"351a3903-35eb-426c-973b-757458d38f9f","resolution":{"observed_at":"2026-08-03T06:36:33.475394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:36:33.674758Z","title":"Wenetspeech: A 10000+ hours multi-domain mandarin corpus for speech recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.22661","last_updated":"2026-05-27T18:10:43Z","snapshot_observed_at":"2026-08-13T04:26:16.591748Z","submitted_at":"2026-01-30T07:27:48Z","title":"Evaluating and Rewarding LALMs for Expressive Role-Play TTS via Mean Continuation Log-Probability","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:33.674758Z"},"links":{"citing_paper":"/paper/2601.22661"},"observation_digest":"sha256:f1f81fbb809c9b4f49a8ddf18c1e267e870d40de19018b9265682bfcf50e3413","observation_id":"0a09d3b0-8e4b-48a4-8c89-aa5866e2b82a","resolution":{"observed_at":"2026-08-03T06:36:33.674758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:36:33.830007Z","title":"Mimo-audio: Audio language models are few-shot learners.arXiv preprint arXiv:2512.23808, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22661","last_updated":"2026-05-27T18:10:43Z","snapshot_observed_at":"2026-08-13T04:26:16.591748Z","submitted_at":"2026-01-30T07:27:48Z","title":"Evaluating and Rewarding LALMs for Expressive Role-Play TTS via Mean Continuation Log-Probability","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:33.830007Z"},"links":{"citing_paper":"/paper/2601.22661"},"observation_digest":"sha256:14cfd7e215856065001dc248ba195e8e77024d3bfde9ea2b106a805065390127","observation_id":"5f075c68-f66a-4551-bea9-ff9ec60c0b40","resolution":{"observed_at":"2026-08-03T06:36:33.830007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:36:33.887146Z","title":"drama_name","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2601.22661","last_updated":"2026-05-27T18:10:43Z","snapshot_observed_at":"2026-08-13T04:26:16.591748Z","submitted_at":"2026-01-30T07:27:48Z","title":"Evaluating and Rewarding LALMs for Expressive Role-Play TTS via Mean Continuation Log-Probability","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:33.887146Z"},"links":{"citing_paper":"/paper/2601.22661"},"observation_digest":"sha256:a19dee68de25a7767202521f69669052d1eb4e8ffe0d11fe51bbfac9b896b4f3","observation_id":"dde0822b-38ab-4c94-9f46-3701b307eb16","resolution":{"observed_at":"2026-08-03T06:36:33.887146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:36:32.729198Z","title":"Ov-instructtts: Towards open-vocabulary instruct text-to-speech.arXiv preprint arXiv:2601.01459,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22661","last_updated":"2026-05-27T18:10:43Z","snapshot_observed_at":"2026-08-13T04:26:16.591748Z","submitted_at":"2026-01-30T07:27:48Z","title":"Evaluating and Rewarding LALMs for Expressive Role-Play TTS via Mean Continuation Log-Probability","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:32.729198Z"},"links":{"citing_paper":"/paper/2601.22661"},"observation_digest":"sha256:605ed78307ee1ac1472462027178e4e8db2a0a6e4153bc119890de95e5f995c9","observation_id":"c7d6f970-913a-41b2-9fca-53b48d88bd28","resolution":{"observed_at":"2026-08-03T06:36:32.729198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-17T22:52:14.678531Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-03T06:36:33.115934Z","title":"Au- diobox: Unified audio generation with natural language prompts.arXiv preprint arXiv:2312.15821,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22661","last_updated":"2026-05-27T18:10:43Z","snapshot_observed_at":"2026-08-13T04:26:16.591748Z","submitted_at":"2026-01-30T07:27:48Z","title":"Evaluating and Rewarding LALMs for Expressive Role-Play TTS via Mean Continuation Log-Probability","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:33.115934Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2601.22661"},"observation_digest":"sha256:0589b74b6d52b905b0047dd83e612807bd76238d5cb2209320714a3366b753dd","observation_id":"78d2d6a9-4041-44da-9dfb-4a344fb57ac6","resolution":{"observed_at":"2026-08-03T06:36:33.115934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:36:31.747286Z","title":"Flexivoice: Enabling flexible style control in zero- shot tts with natural language instructions.arXiv preprint arXiv:2601.04656,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22661","last_updated":"2026-05-27T18:10:43Z","snapshot_observed_at":"2026-08-13T04:26:16.591748Z","submitted_at":"2026-01-30T07:27:48Z","title":"Evaluating and Rewarding LALMs for Expressive Role-Play TTS via Mean Continuation Log-Probability","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:31.747286Z"},"links":{"citing_paper":"/paper/2601.22661"},"observation_digest":"sha256:55598eb2c5855c309df8893656ad8ec79e537213e520a48e6cac3497fe2b3e2d","observation_id":"69053db0-0cbd-4e31-9b02-cea958287e84","resolution":{"observed_at":"2026-08-03T06:36:31.747286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17589","last_updated":"2025-05-27T07:48:34Z","snapshot_observed_at":"2026-08-16T06:12:24.457686Z","submitted_at":"2025-05-23T07:55:21Z","title":"CosyVoice 3: Towards In-the-wild Speech Generation via Scaling-up and Post-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17589","snapshot_observed_at":"2026-08-03T06:36:32.118897Z","title":"Cosyvoice 3: Towards in-the-wild speech generation via scaling-up and post-training.arXiv preprint arXiv:2505.17589,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22661","last_updated":"2026-05-27T18:10:43Z","snapshot_observed_at":"2026-08-13T04:26:16.591748Z","submitted_at":"2026-01-30T07:27:48Z","title":"Evaluating and Rewarding LALMs for Expressive Role-Play TTS via Mean Continuation Log-Probability","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:32.118897Z"},"links":{"cited_paper":"/paper/2505.17589","citing_paper":"/paper/2601.22661"},"observation_digest":"sha256:303b919c33eb72cb688c6dddb37d734bcad734810eb5a775b95fbd4c48665fee","observation_id":"013a0647-317f-4345-9b7f-f67b38f00c34","resolution":{"observed_at":"2026-08-03T06:36:32.118897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-17T13:26:10.378579Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-03T06:36:31.646881Z","title":"org/abs/2511.21631","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.22661","last_updated":"2026-05-27T18:10:43Z","snapshot_observed_at":"2026-08-13T04:26:16.591748Z","submitted_at":"2026-01-30T07:27:48Z","title":"Evaluating and Rewarding LALMs for Expressive Role-Play TTS via Mean Continuation Log-Probability","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:31.646881Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2601.22661"},"observation_digest":"sha256:2331b505e9d2b5693b1eea5f5e52fa52148760a6608d8b7f67dc06e3be564d64","observation_id":"11aa3de7-df12-4be4-9338-347592404301","resolution":{"observed_at":"2026-08-03T06:36:31.646881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05370","last_updated":"2024-06-17T04:39:08Z","snapshot_observed_at":"2026-08-19T20:01:24.492737Z","submitted_at":"2024-06-08T06:31:03Z","title":"VALL-E 2: Neural Codec Language Models are Human Parity Zero-Shot Text to Speech Synthesizers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05370","snapshot_observed_at":"2026-08-03T06:36:31.871558Z","title":"Vall-e 2: Neural codec lan- guage models are human parity zero-shot text to speech synthesizers.arXiv preprint arXiv:2406.05370,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22661","last_updated":"2026-05-27T18:10:43Z","snapshot_observed_at":"2026-08-13T04:26:16.591748Z","submitted_at":"2026-01-30T07:27:48Z","title":"Evaluating and Rewarding LALMs for Expressive Role-Play TTS via Mean Continuation Log-Probability","version":2},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:31.871558Z"},"links":{"cited_paper":"/paper/2406.05370","citing_paper":"/paper/2601.22661"},"observation_digest":"sha256:ec1a36ff40d189b11303c3f24643789cf3a41dc6606f7650931cf746e02de753","observation_id":"21fdd2b4-abf1-44b8-a7b8-baf9025ebf8e","resolution":{"observed_at":"2026-08-03T06:36:31.871558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2601.22661","last_updated":"2026-05-27T18:10:43Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-13T04:26:16.591748Z","submitted_at":"2026-01-30T07:27:48Z","title":"Evaluating and Rewarding LALMs for Expressive Role-Play TTS via Mean Continuation Log-Probability"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 0 inbound Pith citation observations for arXiv:2601.22661."}