{"as_of":"2026-08-06T22:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f648d75f990e954024e4068f0e26de0ebcfd7389692f87c29f1ab7ccbc19ad19","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T06:01:06.123832Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T02:05:46.290721Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-01T18:25:57.625215Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.13006","last_updated":"2026-06-11T07:42:38Z","snapshot_observed_at":"2026-08-05T05:54:49.499804Z","submitted_at":"2026-06-11T07:42:38Z","title":"Emo-LiPO: Listwise Preference Optimization for Fine-Grained Emotion Intensity Control in LLM-based Text-to-Speech","version":1},"cited_work":{"arxiv_id":"2606.13006","doi":null,"metadata_source":"pith","pith_arxiv_id":"2606.13006","snapshot_observed_at":"2026-07-01T18:25:57.625215Z","title":"Emo-LiPO: Listwise Preference Optimization for Fine-Grained Emotion Intensity Control in LLM-based Text-to-Speech","venue":"cs.SD","work_id":"d0233991-e231-46fb-81ae-3f58a9bfa62c","year":2026},"citing_paper":{"arxiv_id":"2606.28249","last_updated":"2026-06-26T16:35:48Z","snapshot_observed_at":"2026-08-02T17:24:03.159581Z","submitted_at":"2026-06-26T16:35:48Z","title":"HPRO: Hierarchical Progressive Reward Optimization via Preference Extraction for Emotional Text-to-Speech","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T02:05:46.290721Z"},"links":{"cited_paper":"/paper/2606.13006","citing_paper":"/paper/2606.28249"},"observation_digest":"sha256:a7c6b815499f6da99164646345f6ca6032ff9070bbfae38307b6e6459ba01175","observation_id":"719054ca-f69c-4db1-a36e-4f28ccc518e8","resolution":{"observed_at":"2026-07-01T18:25:57.626494Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2606.13006/citation-record","integrity":"/paper/2606.13006/integrity","json":"/paper/2606.13006/citation-record.json","paper":"/paper/2606.13006"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.07803","last_updated":"2024-11-04T21:39:21Z","snapshot_observed_at":"2026-07-06T18:29:17.280082Z","submitted_at":"2024-06-12T01:40:29Z","title":"EmoSphere-TTS: Emotional Style and Intensity Modeling via Spherical Emotion Vector for Controllable Emotional Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2406.07803","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.07803","snapshot_observed_at":"2026-07-03T16:08:37.822741Z","title":"Emosphere-tts: Emo- tional style and intensity modeling via spherical emotion vec- tor for controllable emotional text-to-speech","venue":null,"work_id":"e29f9e9f-cdc0-4e3f-90fe-3a0f11f45b68","year":2024},"citing_paper":{"arxiv_id":"2606.13006","last_updated":"2026-06-11T07:42:38Z","snapshot_observed_at":"2026-08-05T05:54:49.499804Z","submitted_at":"2026-06-11T07:42:38Z","title":"Emo-LiPO: Listwise Preference Optimization for Fine-Grained Emotion Intensity Control in LLM-based Text-to-Speech","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-27T06:01:06.123832Z"},"links":{"cited_paper":"/paper/2406.07803","citing_paper":"/paper/2606.13006"},"observation_digest":"sha256:a36138a364ed2e5d37c75bab1767a535147e7d294c7537cc9501ac772654ed6a","observation_id":"a0602683-3f44-4ad9-bf99-daf45befde38","resolution":{"observed_at":"2026-07-03T16:08:37.824383Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:01:06.123832Z","title":"Emosphere++: Emotion-controllable zero-shot text-to-speech via emotion-adaptive spherical vector.IEEE Transactions on Affective Computing,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.13006","last_updated":"2026-06-11T07:42:38Z","snapshot_observed_at":"2026-08-05T05:54:49.499804Z","submitted_at":"2026-06-11T07:42:38Z","title":"Emo-LiPO: Listwise Preference Optimization for Fine-Grained Emotion Intensity Control in LLM-based Text-to-Speech","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T06:01:06.123832Z"},"links":{"citing_paper":"/paper/2606.13006"},"observation_digest":"sha256:9456340836e082e1eb1dd25ab783b23b0505628c7123337e1d25f79c0ed704f7","observation_id":"1e3a42cb-96e3-42ee-ac61-55644710ba99","resolution":{"observed_at":"2026-06-27T06:01:06.123832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":"2407.05407","doi":"10.48550/arxiv.2407.05407","metadata_source":"pith","pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","venue":"cs.SD","work_id":"e5ad925a-4045-49b5-b301-208bcbf3eca8","year":2024},"citing_paper":{"arxiv_id":"2606.13006","last_updated":"2026-06-11T07:42:38Z","snapshot_observed_at":"2026-08-05T05:54:49.499804Z","submitted_at":"2026-06-11T07:42:38Z","title":"Emo-LiPO: Listwise Preference Optimization for Fine-Grained Emotion Intensity Control in LLM-based Text-to-Speech","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T06:01:06.123832Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2606.13006"},"observation_digest":"sha256:f9294c2c58b10c224031b474ad5492a4b5e88a22370b250f3a467cfddaebcc48","observation_id":"da3a1e5a-178e-4381-a343-edf0bda18470","resolution":{"observed_at":"2026-07-03T16:08:37.825991Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-07-06T20:06:30.732685Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":"2412.10117","doi":"10.48550/arxiv.2412.10117","metadata_source":"pith","pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","venue":"cs.SD","work_id":"3af84775-3b81-4078-b553-52739aae03ba","year":2024},"citing_paper":{"arxiv_id":"2606.13006","last_updated":"2026-06-11T07:42:38Z","snapshot_observed_at":"2026-08-05T05:54:49.499804Z","submitted_at":"2026-06-11T07:42:38Z","title":"Emo-LiPO: Listwise Preference Optimization for Fine-Grained Emotion Intensity Control in LLM-based Text-to-Speech","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-27T06:01:06.123832Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2606.13006"},"observation_digest":"sha256:b5924fe83c5129831446e93464314ccdfcc012a1aa95a668f814ec7f03195b7f","observation_id":"4204593c-fc9f-4124-8cdf-9f14e988a36f","resolution":{"observed_at":"2026-07-03T16:08:37.818515Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:49.998415+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:49.998415+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"cited_work":{"arxiv_id":"2402.01306","doi":"10.48550/arxiv.2402.01306","metadata_source":"pith","pith_arxiv_id":"2402.01306","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","venue":"cs.LG","work_id":"28f4db09-e48a-458a-967b-755399c7d663","year":2024},"citing_paper":{"arxiv_id":"2606.13006","last_updated":"2026-06-11T07:42:38Z","snapshot_observed_at":"2026-08-05T05:54:49.499804Z","submitted_at":"2026-06-11T07:42:38Z","title":"Emo-LiPO: Listwise Preference Optimization for Fine-Grained Emotion Intensity Control in LLM-based Text-to-Speech","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T06:01:06.123832Z"},"links":{"cited_paper":"/paper/2402.01306","citing_paper":"/paper/2606.13006"},"observation_digest":"sha256:5100638c5f9f1d58ee055aada3b28de60f94a4c9a7437ddb7411c4e100c99a16","observation_id":"c2ffcc77-b07d-4c7b-b7c3-0cda487bd762","resolution":{"observed_at":"2026-07-03T16:08:37.813471Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:01:06.123832Z","title":"Emo-dpo: Control- lable emotional speech synthesis through direct preference optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.13006","last_updated":"2026-06-11T07:42:38Z","snapshot_observed_at":"2026-08-05T05:54:49.499804Z","submitted_at":"2026-06-11T07:42:38Z","title":"Emo-LiPO: Listwise Preference Optimization for Fine-Grained Emotion Intensity Control in LLM-based Text-to-Speech","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-27T06:01:06.123832Z"},"links":{"citing_paper":"/paper/2606.13006"},"observation_digest":"sha256:5015abec231ac61caafda95d4f98987d6a5f4d9c180966bdfc29d84e1b7154af","observation_id":"ed1a0137-e1fb-4536-9d97-99db0e063b81","resolution":{"observed_at":"2026-06-27T06:01:06.123832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:01:06.123832Z","title":"Emodiff: Intensity controllable emotional text-to-speech with soft-label guidance","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.13006","last_updated":"2026-06-11T07:42:38Z","snapshot_observed_at":"2026-08-05T05:54:49.499804Z","submitted_at":"2026-06-11T07:42:38Z","title":"Emo-LiPO: Listwise Preference Optimization for Fine-Grained Emotion Intensity Control in LLM-based Text-to-Speech","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-27T06:01:06.123832Z"},"links":{"citing_paper":"/paper/2606.13006"},"observation_digest":"sha256:74819ef3238f12d0ae390a537a32be81d27d8afe7b31f09f2dd7a93fef3168c8","observation_id":"7034a4f5-78c3-4857-ab2b-29040c71e3ba","resolution":{"observed_at":"2026-06-27T06:01:06.123832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:01:06.123832Z","title":"Prompttts: Controllable text-to- speech with text descriptions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.13006","last_updated":"2026-06-11T07:42:38Z","snapshot_observed_at":"2026-08-05T05:54:49.499804Z","submitted_at":"2026-06-11T07:42:38Z","title":"Emo-LiPO: Listwise Preference Optimization for Fine-Grained Emotion Intensity Control in LLM-based Text-to-Speech","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T06:01:06.123832Z"},"links":{"citing_paper":"/paper/2606.13006"},"observation_digest":"sha256:16d73d3d9e99f157334a0b86f820510c3eabfea5a223054575c0a39ce505b65e","observation_id":"62678f1f-a044-42c1-aec6-f4b2dfff9dc1","resolution":{"observed_at":"2026-06-27T06:01:06.123832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:01:06.123832Z","title":"Emoq-tts: Emotion inten- sity quantization for fine-grained controllable emotional text-to-speech","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.13006","last_updated":"2026-06-11T07:42:38Z","snapshot_observed_at":"2026-08-05T05:54:49.499804Z","submitted_at":"2026-06-11T07:42:38Z","title":"Emo-LiPO: Listwise Preference Optimization for Fine-Grained Emotion Intensity Control in LLM-based Text-to-Speech","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T06:01:06.123832Z"},"links":{"citing_paper":"/paper/2606.13006"},"observation_digest":"sha256:df555cf7d084af3b12de490769a5ff96b5dd13840043066187e782e43644bfd5","observation_id":"77f0b187-0c9b-421c-a721-97fcaae5ee3d","resolution":{"observed_at":"2026-06-27T06:01:06.123832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:01:06.123832Z","title":"Msemotts: Multi-scale emotion transfer, pre- diction, and control for emotional speech synthesis","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.13006","last_updated":"2026-06-11T07:42:38Z","snapshot_observed_at":"2026-08-05T05:54:49.499804Z","submitted_at":"2026-06-11T07:42:38Z","title":"Emo-LiPO: Listwise Preference Optimization for Fine-Grained Emotion Intensity Control in LLM-based Text-to-Speech","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T06:01:06.123832Z"},"links":{"citing_paper":"/paper/2606.13006"},"observation_digest":"sha256:29efe7b17b48f5f9d19ceb2a8da1b621f87587f987dce617f284d631c710b98b","observation_id":"224a7794-ec69-4500-bbc4-ca45bddc7547","resolution":{"observed_at":"2026-06-27T06:01:06.123832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02285","last_updated":"2023-10-12T03:05:36Z","snapshot_observed_at":"2026-08-01T15:11:32.829718Z","submitted_at":"2023-09-05T14:45:27Z","title":"PromptTTS 2: Describing and Generating Voices with Text Prompt","version":2},"cited_work":{"arxiv_id":"2309.02285","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.02285","snapshot_observed_at":"2026-07-03T16:08:37.814595Z","title":"Prompttts 2: Describing and generating voices with text prompt","venue":null,"work_id":"44c9a29d-f3a1-4509-9a66-bbb857c46489","year":2023},"citing_paper":{"arxiv_id":"2606.13006","last_updated":"2026-06-11T07:42:38Z","snapshot_observed_at":"2026-08-05T05:54:49.499804Z","submitted_at":"2026-06-11T07:42:38Z","title":"Emo-LiPO: Listwise Preference Optimization for Fine-Grained Emotion Intensity Control in LLM-based Text-to-Speech","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-27T06:01:06.123832Z"},"links":{"cited_paper":"/paper/2309.02285","citing_paper":"/paper/2606.13006"},"observation_digest":"sha256:5fb9d5058a2926a341c0cf09957876b23a855945ecc134478f1f045cd27a5ede","observation_id":"9ab35441-594c-4a66-83ec-51761a191242","resolution":{"observed_at":"2026-07-03T16:08:37.816124Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:01:06.123832Z","title":"Remax: A simple, effective, and efficient reinforcement learning method for aligning large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.13006","last_updated":"2026-06-11T07:42:38Z","snapshot_observed_at":"2026-08-05T05:54:49.499804Z","submitted_at":"2026-06-11T07:42:38Z","title":"Emo-LiPO: Listwise Preference Optimization for Fine-Grained Emotion Intensity Control in LLM-based Text-to-Speech","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T06:01:06.123832Z"},"links":{"citing_paper":"/paper/2606.13006"},"observation_digest":"sha256:e420454741062fea2598ccfc2d91ec37a21b1ac54692aed12cf74d5182b45f1d","observation_id":"de575780-db0d-4bd7-9924-e1ba52d9c663","resolution":{"observed_at":"2026-06-27T06:01:06.123832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.05758","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T16:08:37.809428Z","title":"Emorl-tts: Reinforcement learning for fine-grained emotion control in llm-based tts","venue":null,"work_id":"3170037d-9265-4a3d-900c-06eb8eed8a63","year":2025},"citing_paper":{"arxiv_id":"2606.13006","last_updated":"2026-06-11T07:42:38Z","snapshot_observed_at":"2026-08-05T05:54:49.499804Z","submitted_at":"2026-06-11T07:42:38Z","title":"Emo-LiPO: Listwise Preference Optimization for Fine-Grained Emotion Intensity Control in LLM-based Text-to-Speech","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-27T06:01:06.123832Z"},"links":{"citing_paper":"/paper/2606.13006"},"observation_digest":"sha256:a19dc89dd6bb421244cb3a1657519c7c1f7c6094f625d024df7223a70cd0cf41","observation_id":"c4f1495d-9e6f-4f79-a3da-cda3d4d303cd","resolution":{"observed_at":"2026-07-03T16:08:37.810991Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:01:06.123832Z","title":"Ece-tts: A zero-shot emotion text-to- speech model with simplified and precise control.Applied Sciences, 15(9):5108,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.13006","last_updated":"2026-06-11T07:42:38Z","snapshot_observed_at":"2026-08-05T05:54:49.499804Z","submitted_at":"2026-06-11T07:42:38Z","title":"Emo-LiPO: Listwise Preference Optimization for Fine-Grained Emotion Intensity Control in LLM-based Text-to-Speech","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T06:01:06.123832Z"},"links":{"citing_paper":"/paper/2606.13006"},"observation_digest":"sha256:f5679f28e2dbcaa30024b8f70f24c9e4e24fd9e868a879565cc41dc0113c9ac0","observation_id":"6126ec2a-4d13-49ab-8417-b9a97cba858d","resolution":{"observed_at":"2026-06-27T06:01:06.123832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:01:06.123832Z","title":"Lipo: Listwise preference optimization through learning- to-rank","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.13006","last_updated":"2026-06-11T07:42:38Z","snapshot_observed_at":"2026-08-05T05:54:49.499804Z","submitted_at":"2026-06-11T07:42:38Z","title":"Emo-LiPO: Listwise Preference Optimization for Fine-Grained Emotion Intensity Control in LLM-based Text-to-Speech","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T06:01:06.123832Z"},"links":{"citing_paper":"/paper/2606.13006"},"observation_digest":"sha256:228708873e5d4791e8ea5e80a7a3a2d189f5bf72db653019185582dac7e2517c","observation_id":"cb0b45c3-20cb-4969-85a6-bfda3861fce0","resolution":{"observed_at":"2026-06-27T06:01:06.123832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.18928","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T16:08:37.803000Z","title":"Direct preference optimization for speech autoregressive diffusion models.arXiv preprint arXiv:2509.18928,","venue":null,"work_id":"75099fbc-cbf5-4150-a6e4-5bb172668cf5","year":null},"citing_paper":{"arxiv_id":"2606.13006","last_updated":"2026-06-11T07:42:38Z","snapshot_observed_at":"2026-08-05T05:54:49.499804Z","submitted_at":"2026-06-11T07:42:38Z","title":"Emo-LiPO: Listwise Preference Optimization for Fine-Grained Emotion Intensity Control in LLM-based Text-to-Speech","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T06:01:06.123832Z"},"links":{"citing_paper":"/paper/2606.13006"},"observation_digest":"sha256:d871dd3c2c7460724ba07b7368f3849bca968771c212b075773e2225f0d86943","observation_id":"8b230726-68d6-4a4f-9026-264d6c9f1f44","resolution":{"observed_at":"2026-07-03T16:08:37.804614Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:01:06.123832Z","title":"emotion2vec: Self-supervised pre-training for speech emotion representation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.13006","last_updated":"2026-06-11T07:42:38Z","snapshot_observed_at":"2026-08-05T05:54:49.499804Z","submitted_at":"2026-06-11T07:42:38Z","title":"Emo-LiPO: Listwise Preference Optimization for Fine-Grained Emotion Intensity Control in LLM-based Text-to-Speech","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-27T06:01:06.123832Z"},"links":{"citing_paper":"/paper/2606.13006"},"observation_digest":"sha256:2cb1c48efef170979ebb4e0ee5ccf7af6d5a02acf205df8cce3bd8f5300cf69c","observation_id":"874a12aa-4885-42fc-8957-705072b9090b","resolution":{"observed_at":"2026-06-27T06:01:06.123832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09494","last_updated":"2021-04-19T17:56:59Z","snapshot_observed_at":"2026-07-06T11:01:45.274067Z","submitted_at":"2021-04-19T17:56:59Z","title":"NISQA: A Deep CNN-Self-Attention Model for Multidimensional Speech Quality Prediction with Crowdsourced Datasets","version":1},"cited_work":{"arxiv_id":"2104.09494","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.09494","snapshot_observed_at":"2026-07-03T16:08:37.813294Z","title":"Nisqa: A deep cnn-self-attention model for multidimensional speech quality prediction with crowdsourced datasets.arXiv preprint arXiv:2104.09494","venue":null,"work_id":"d8870e91-cabb-4a77-9cf7-022f8b8412db","year":2021},"citing_paper":{"arxiv_id":"2606.13006","last_updated":"2026-06-11T07:42:38Z","snapshot_observed_at":"2026-08-05T05:54:49.499804Z","submitted_at":"2026-06-11T07:42:38Z","title":"Emo-LiPO: Listwise Preference Optimization for Fine-Grained Emotion Intensity Control in LLM-based Text-to-Speech","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-27T06:01:06.123832Z"},"links":{"cited_paper":"/paper/2104.09494","citing_paper":"/paper/2606.13006"},"observation_digest":"sha256:b41cc715b57ca5804a160131cda355f3057946b5af1c1814abfdfe56d747e463","observation_id":"c8922d62-d0fb-4c6a-990d-4c59296eed29","resolution":{"observed_at":"2026-07-03T16:08:37.814833Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:01:06.123832Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.13006","last_updated":"2026-06-11T07:42:38Z","snapshot_observed_at":"2026-08-05T05:54:49.499804Z","submitted_at":"2026-06-11T07:42:38Z","title":"Emo-LiPO: Listwise Preference Optimization for Fine-Grained Emotion Intensity Control in LLM-based Text-to-Speech","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T06:01:06.123832Z"},"links":{"citing_paper":"/paper/2606.13006"},"observation_digest":"sha256:bdeb248943289eb881ca2b91db5fe4f09801fa5f451710b7654e90811b368189","observation_id":"c2f77f61-7bcc-4689-aac1-114102dac8c6","resolution":{"observed_at":"2026-06-27T06:01:06.123832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:01:06.123832Z","title":"Direct preference optimization: Your lan- guage model is secretly a reward model.Advances in neural information processing systems, 36:53728–53741,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.13006","last_updated":"2026-06-11T07:42:38Z","snapshot_observed_at":"2026-08-05T05:54:49.499804Z","submitted_at":"2026-06-11T07:42:38Z","title":"Emo-LiPO: Listwise Preference Optimization for Fine-Grained Emotion Intensity Control in LLM-based Text-to-Speech","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T06:01:06.123832Z"},"links":{"citing_paper":"/paper/2606.13006"},"observation_digest":"sha256:c04bb3af7eef31607d4553a0663cf07240f6571a1dba4ccc5ebfe697041e6a13","observation_id":"d204d82d-de04-43a3-8567-414414c432fa","resolution":{"observed_at":"2026-06-27T06:01:06.123832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:01:06.123832Z","title":"Dnsmos: A non-intrusive perceptual objec- tive speech quality metric to evaluate noise suppressors","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.13006","last_updated":"2026-06-11T07:42:38Z","snapshot_observed_at":"2026-08-05T05:54:49.499804Z","submitted_at":"2026-06-11T07:42:38Z","title":"Emo-LiPO: Listwise Preference Optimization for Fine-Grained Emotion Intensity Control in LLM-based Text-to-Speech","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-27T06:01:06.123832Z"},"links":{"citing_paper":"/paper/2606.13006"},"observation_digest":"sha256:b9a977ce599db8ceb13b0dbc3d9c3b5c02885299bd1466c45328cfb05f0e42e3","observation_id":"986be545-38d1-4250-be13-a10340596702","resolution":{"observed_at":"2026-06-27T06:01:06.123832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02152","last_updated":"2022-06-29T13:42:05Z","snapshot_observed_at":"2026-08-04T06:18:23.412967Z","submitted_at":"2022-04-05T12:23:51Z","title":"UTMOS: UTokyo-SaruLab System for VoiceMOS Challenge 2022","version":2},"cited_work":{"arxiv_id":"2204.02152","doi":null,"metadata_source":"pith","pith_arxiv_id":"2204.02152","snapshot_observed_at":"2026-07-07T14:53:55.727508Z","title":"Utmos: Utokyo-sarulab system for voicemos challenge 2022","venue":"cs.SD","work_id":"672f99d7-62cc-4d7d-931c-4e7b0083fcd9","year":2022},"citing_paper":{"arxiv_id":"2606.13006","last_updated":"2026-06-11T07:42:38Z","snapshot_observed_at":"2026-08-05T05:54:49.499804Z","submitted_at":"2026-06-11T07:42:38Z","title":"Emo-LiPO: Listwise Preference Optimization for Fine-Grained Emotion Intensity Control in LLM-based Text-to-Speech","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T06:01:06.123832Z"},"links":{"cited_paper":"/paper/2204.02152","citing_paper":"/paper/2606.13006"},"observation_digest":"sha256:f0ae1b5e4050020243fead66bbb5525efe333e5093b1105384658b1d2b06926a","observation_id":"81729b71-9f35-464e-9ad1-d4821e72da85","resolution":{"observed_at":"2026-07-03T16:08:37.793689Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:01:06.123832Z","title":"Improving emotional tts with an emotion intensity input from unsupervised extraction","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.13006","last_updated":"2026-06-11T07:42:38Z","snapshot_observed_at":"2026-08-05T05:54:49.499804Z","submitted_at":"2026-06-11T07:42:38Z","title":"Emo-LiPO: Listwise Preference Optimization for Fine-Grained Emotion Intensity Control in LLM-based Text-to-Speech","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T06:01:06.123832Z"},"links":{"citing_paper":"/paper/2606.13006"},"observation_digest":"sha256:7227bf1045c4a6b4a6f0b777891a2addff1befaf5a37d25a6b585f80a11407c5","observation_id":"1404ad9b-7e31-4d19-ba85-61a37dd8bcb2","resolution":{"observed_at":"2026-06-27T06:01:06.123832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2606.13006","last_updated":"2026-06-11T07:42:38Z","snapshot_observed_at":"2026-08-05T05:54:49.499804Z","submitted_at":"2026-06-11T07:42:38Z","title":"Emo-LiPO: Listwise Preference Optimization for Fine-Grained Emotion Intensity Control in LLM-based Text-to-Speech","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T06:01:06.123832Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2606.13006"},"observation_digest":"sha256:cfe82051074f638a4f2e104a60ea85c80bbd7dd465dca61334b9fa870e5bbbe6","observation_id":"8080804c-5fde-4f1c-a321-3d8627b3349b","resolution":{"observed_at":"2026-07-03T16:08:37.823715Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:01:06.123832Z","title":"Preference ranking optimization for human alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.13006","last_updated":"2026-06-11T07:42:38Z","snapshot_observed_at":"2026-08-05T05:54:49.499804Z","submitted_at":"2026-06-11T07:42:38Z","title":"Emo-LiPO: Listwise Preference Optimization for Fine-Grained Emotion Intensity Control in LLM-based Text-to-Speech","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T06:01:06.123832Z"},"links":{"citing_paper":"/paper/2606.13006"},"observation_digest":"sha256:7ae37102d0b9441d71d6bd5a4c4e6df9285c64091d4c4d6c2912aa307ae1d83d","observation_id":"59dbf4f6-22fa-4c45-a421-c77e4add0e49","resolution":{"observed_at":"2026-06-27T06:01:06.123832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:01:06.123832Z","title":"Fine-grained emotional control of text- to-speech: Learning to rank inter-and intra-class emo- tion intensities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.13006","last_updated":"2026-06-11T07:42:38Z","snapshot_observed_at":"2026-08-05T05:54:49.499804Z","submitted_at":"2026-06-11T07:42:38Z","title":"Emo-LiPO: Listwise Preference Optimization for Fine-Grained Emotion Intensity Control in LLM-based Text-to-Speech","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-27T06:01:06.123832Z"},"links":{"citing_paper":"/paper/2606.13006"},"observation_digest":"sha256:407f4dee135b19cfaafd1ac2fff243b7957545f65266bbee566b368101a0217c","observation_id":"0c48d176-ef32-4487-9fa6-1bd0340d2ef1","resolution":{"observed_at":"2026-06-27T06:01:06.123832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:01:06.123832Z","title":"Laugh now cry later: Controlling time-varying emotional states of flow-matching-based zero-shot text-to-speech","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.13006","last_updated":"2026-06-11T07:42:38Z","snapshot_observed_at":"2026-08-05T05:54:49.499804Z","submitted_at":"2026-06-11T07:42:38Z","title":"Emo-LiPO: Listwise Preference Optimization for Fine-Grained Emotion Intensity Control in LLM-based Text-to-Speech","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T06:01:06.123832Z"},"links":{"citing_paper":"/paper/2606.13006"},"observation_digest":"sha256:28ca40f076f1c3a2986696f3cd46ee675dde2d94d3064fc81badc3068308f0a7","observation_id":"60a76dd7-ca4c-4cea-868b-4f588e4efb93","resolution":{"observed_at":"2026-06-27T06:01:06.123832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14628","last_updated":"2026-04-07T07:34:26Z","snapshot_observed_at":"2026-08-06T07:54:04.170594Z","submitted_at":"2025-10-16T12:40:37Z","title":"RLAIF-SPA: Structured AI Feedback for Semantic-Prosodic Alignment in Speech Synthesis","version":2},"cited_work":{"arxiv_id":"2510.14628","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.14628","snapshot_observed_at":"2026-07-03T16:08:37.797864Z","title":"RLAIF-SPA: Structured AI Feedback for Semantic-Prosodic Alignment in Speech Synthesis","venue":"cs.CL","work_id":"8460a3d9-0d96-4cc2-baff-8cb4d5fe5a35","year":2025},"citing_paper":{"arxiv_id":"2606.13006","last_updated":"2026-06-11T07:42:38Z","snapshot_observed_at":"2026-08-05T05:54:49.499804Z","submitted_at":"2026-06-11T07:42:38Z","title":"Emo-LiPO: Listwise Preference Optimization for Fine-Grained Emotion Intensity Control in LLM-based Text-to-Speech","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-27T06:01:06.123832Z"},"links":{"cited_paper":"/paper/2510.14628","citing_paper":"/paper/2606.13006"},"observation_digest":"sha256:4232f9248bd86cbe1eab6d677766464b361a01758ccd1b2e75678d189238efa2","observation_id":"60a3cf80-d631-49ed-a555-cec21c04858a","resolution":{"observed_at":"2026-07-03T16:08:37.799226Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:01:06.123832Z","title":"TS-align: A teacher-student collaborative framework for scalable iterative finetuning of large lan- guage models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.13006","last_updated":"2026-06-11T07:42:38Z","snapshot_observed_at":"2026-08-05T05:54:49.499804Z","submitted_at":"2026-06-11T07:42:38Z","title":"Emo-LiPO: Listwise Preference Optimization for Fine-Grained Emotion Intensity Control in LLM-based Text-to-Speech","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T06:01:06.123832Z"},"links":{"citing_paper":"/paper/2606.13006"},"observation_digest":"sha256:cafe0a9f61a17a5da3cef6a15e59fb95135bf4038613157c1c347380f88d0038","observation_id":"ecdfbf8e-7c56-42bc-8214-012bbc56dd42","resolution":{"observed_at":"2026-06-27T06:01:06.123832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06276","last_updated":"2025-01-10T12:10:30Z","snapshot_observed_at":"2026-08-04T10:49:27.576070Z","submitted_at":"2025-01-10T12:10:30Z","title":"PROEMO: Prompt-Driven Text-to-Speech Synthesis Based on Emotion and Intensity Control","version":1},"cited_work":{"arxiv_id":"2501.06276","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.06276","snapshot_observed_at":"2026-07-03T16:08:37.819812Z","title":"Zhang, A","venue":null,"work_id":"6e1619bf-f11e-4a19-9517-710d0878ae0d","year":2025},"citing_paper":{"arxiv_id":"2606.13006","last_updated":"2026-06-11T07:42:38Z","snapshot_observed_at":"2026-08-05T05:54:49.499804Z","submitted_at":"2026-06-11T07:42:38Z","title":"Emo-LiPO: Listwise Preference Optimization for Fine-Grained Emotion Intensity Control in LLM-based Text-to-Speech","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-27T06:01:06.123832Z"},"links":{"cited_paper":"/paper/2501.06276","citing_paper":"/paper/2606.13006"},"observation_digest":"sha256:09088aa1f4fad3a4f218cb855d94942d052b3d2f87370cec5e2316e8261af947","observation_id":"404d4c5d-a7f2-4f4c-8bca-76eff04cbb5a","resolution":{"observed_at":"2026-07-03T16:08:37.821400Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":"2305.10425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-07-04T11:09:46.433136Z","title":"Slic-hf: Sequence likelihood calibration with human feedback","venue":null,"work_id":"55e8e88f-3158-4c7f-bded-c50a36ffe46e","year":2023},"citing_paper":{"arxiv_id":"2606.13006","last_updated":"2026-06-11T07:42:38Z","snapshot_observed_at":"2026-08-05T05:54:49.499804Z","submitted_at":"2026-06-11T07:42:38Z","title":"Emo-LiPO: Listwise Preference Optimization for Fine-Grained Emotion Intensity Control in LLM-based Text-to-Speech","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-27T06:01:06.123832Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2606.13006"},"observation_digest":"sha256:43b70d0e63704c064c915667d7060ec23c111ce1d53e8353454de1443dd970a5","observation_id":"06574a1f-879b-48d7-b34f-95e68bfb9f58","resolution":{"observed_at":"2026-07-03T16:08:37.812263Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:01:06.123832Z","title":"Emoshift: Lightweight activation steering for enhanced emotion-aware speech synthesis","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.13006","last_updated":"2026-06-11T07:42:38Z","snapshot_observed_at":"2026-08-05T05:54:49.499804Z","submitted_at":"2026-06-11T07:42:38Z","title":"Emo-LiPO: Listwise Preference Optimization for Fine-Grained Emotion Intensity Control in LLM-based Text-to-Speech","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-27T06:01:06.123832Z"},"links":{"citing_paper":"/paper/2606.13006"},"observation_digest":"sha256:484d7015a61fb6a7e68e3ab05259beeae8f97ef3986c82b1a5e4b4d6e9b8c27e","observation_id":"9e6d83b0-6738-442d-88a5-4c6acddf9e09","resolution":{"observed_at":"2026-06-27T06:01:06.123832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.13006","last_updated":"2026-06-11T07:42:38Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-05T05:54:49.499804Z","submitted_at":"2026-06-11T07:42:38Z","title":"Emo-LiPO: Listwise Preference Optimization for Fine-Grained Emotion Intensity Control in LLM-based Text-to-Speech"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":19,"verified_exact":12,"verified_fuzzy":0},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 1 inbound Pith citation observation for arXiv:2606.13006."}