{"as_of":"2026-08-08T10:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:01e4fd43588711094aef09f44508918ca70628965231254efd5b98278c5a2aac","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:55:03.611900Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T15:21:28.820442Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-12T09:11:27.121428Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T04:12:16.442306Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"cited_work":{"arxiv_id":"2507.04349","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.04349","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tts-ctrlnet: Time varying emotion aligned text-to-speech generation with controlnet","venue":null,"work_id":"4c6754ed-b89b-4c8e-bc76-36244ea93b33","year":2025},"citing_paper":{"arxiv_id":"2604.26347","last_updated":"2026-07-22T04:43:04Z","snapshot_observed_at":"2026-08-02T15:21:28.271483Z","submitted_at":"2026-04-29T06:59:48Z","title":"The False Resonance: A Critical Examination of Emotion Embedding Similarity for Speech Generation Evaluation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-07T12:34:40.888089Z"},"links":{"cited_paper":"/paper/2507.04349","citing_paper":"/paper/2604.26347"},"observation_digest":"sha256:0b5bf6f5afdf020f02370aeb3aff6b991a7b1e159cb3ab1135dd3731f91accbf","observation_id":"440da532-b107-4cfc-b485-61e310bb88d9","resolution":{"observed_at":"2026-05-12T09:11:27.124142Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T04:12:16.442306Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.04349","snapshot_observed_at":"2026-08-02T15:21:28.820442Z","title":"Tts-ctrlnet: Time varying emotion aligned text-to-speech generation with controlnet,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.26347","last_updated":"2026-07-22T04:43:04Z","snapshot_observed_at":"2026-08-02T15:21:28.271483Z","submitted_at":"2026-04-29T06:59:48Z","title":"The False Resonance: A Critical Examination of Emotion Embedding Similarity for Speech Generation Evaluation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T15:21:28.820442Z"},"links":{"cited_paper":"/paper/2507.04349","citing_paper":"/paper/2604.26347"},"observation_digest":"sha256:0b12c39c5518b9aa98bcea310ef0245d0840bcb768a4f9aacb4f3ae46648c22b","observation_id":"a0b54a62-c850-489d-8430-cbcb74ef4ad6","resolution":{"observed_at":"2026-08-02T15:21:28.820442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.04349/citation-record","integrity":"/paper/2507.04349/integrity","json":"/paper/2507.04349/citation-record.json","paper":"/paper/2507.04349"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2302.05543","last_updated":"2023-11-26T22:26:12Z","snapshot_observed_at":"2026-08-04T15:27:22.366324Z","submitted_at":"2023-02-10T23:12:37Z","title":"Adding Conditional Control to Text-to-Image Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.05543","snapshot_observed_at":"2026-08-06T19:55:02.241628Z","title":"Adding conditional control to text-to-image diffusion models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T04:12:16.442306Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:02.241628Z"},"links":{"cited_paper":"/paper/2302.05543","citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:57a93f5b48a740d43fc83cbb842b097a51e9f2762e3639e31db18ca29770f12b","observation_id":"f5764825-324b-4fac-a39b-750df4887754","resolution":{"observed_at":"2026-08-06T19:55:02.241628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:04.327855Z","title":"An emotion speech synthesis method based on VITS","venue":null,"work_id":"06f8535f-1231-436c-a808-c37a5264cfab","year":2023},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T04:12:16.442306Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:02.318699Z"},"links":{"citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:ba8f9f2a2d0923044202699b56774d76f0c146fe5b390f9e0a57a7319e1b466c","observation_id":"e546cec3-0c0f-4291-8e58-d3284f1384f9","resolution":{"observed_at":"2026-08-06T19:55:04.445789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:04.255965Z","title":"V oiceBox: Text-guided multilingual universal speech generation at scale","venue":null,"work_id":"83252476-12f1-4c8d-9c5e-4c259b0dad00","year":2024},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T04:12:16.442306Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:02.438700Z"},"links":{"citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:5d124bd56c3e635e4b80f6f66b80ee92fccbab7340cb88f7e4c4864456010c29","observation_id":"208baeef-84d1-4e7c-9ac4-f08ed652bcc1","resolution":{"observed_at":"2026-08-06T19:55:04.309106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07383","last_updated":"2024-03-04T19:15:29Z","snapshot_observed_at":"2026-08-08T09:24:37.491001Z","submitted_at":"2024-02-12T02:58:10Z","title":"Making Flow-Matching-Based Zero-Shot Text-to-Speech Laugh as You Like","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07383","snapshot_observed_at":"2026-08-06T19:55:02.574535Z","title":"Making flow-matching-based zero-shot text-to-speech laugh as you like","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T04:12:16.442306Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:02.574535Z"},"links":{"cited_paper":"/paper/2402.07383","citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:6f45b635b8702eee188b642a148d11e9a8469f683968054b80d381af3737d950","observation_id":"c7f1d86e-2076-4a00-a0eb-69b5d39e2ef9","resolution":{"observed_at":"2026-08-06T19:55:02.574535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:04.098383Z","title":"E2 tts: Embarrass- ingly easy fully non-autoregressive zero-shot tts","venue":null,"work_id":"d2ec905a-b560-433b-a798-d7ed83fe6bb0","year":2024},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T04:12:16.442306Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:02.684793Z"},"links":{"citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:3509a723305e036d92afac9d0a67a25b08bce9c9302b02de8a6b66934abf9f0c","observation_id":"44608682-5498-460d-a2ca-1803573f58dd","resolution":{"observed_at":"2026-08-06T19:55:04.144160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-06T19:55:02.966453Z","title":"Cosyvoice: A scalable multilingual zero-shot text-to-speech synthesizer based on supervised semantic tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T04:12:16.442306Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:02.966453Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:88a16566e134e6886731557e270b071fc1a802eb3bb5cace529a4bb0b1655607","observation_id":"2c96ced3-fec9-4a79-bac3-b9a38325340c","resolution":{"observed_at":"2026-08-06T19:55:02.966453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1703.10135","last_updated":"2017-04-06T21:20:34Z","snapshot_observed_at":"2026-08-05T15:51:16.043022Z","submitted_at":"2017-03-29T16:55:13Z","title":"Tacotron: Towards End-to-End Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.10135","snapshot_observed_at":"2026-08-06T19:55:03.102660Z","title":"Tacotron: Towards end-to-end speech synthesis","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T04:12:16.442306Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.102660Z"},"links":{"cited_paper":"/paper/1703.10135","citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:7a6446ba72bfeda2ca2d373a3033bc0b58b5211d144bc8cc81b8fadb840e90e6","observation_id":"29734753-f174-4dcb-b602-7a45227fba33","resolution":{"observed_at":"2026-08-06T19:55:03.102660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:03.137493Z","title":"Fastspeech: Fast, robust and controllable text to speech","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T04:12:16.442306Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.137493Z"},"links":{"citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:99e0a768647c7ec63ac6dc4f2df776ab8aa04f76bc07fe101c3064315f7bf39a","observation_id":"9f6c56d8-d55d-4ea0-acde-d94a900578f6","resolution":{"observed_at":"2026-08-06T19:55:03.137493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08166","last_updated":"2024-01-16T07:13:16Z","snapshot_observed_at":"2026-08-06T00:01:14.217961Z","submitted_at":"2024-01-16T07:13:16Z","title":"ED-TTS: Multi-Scale Emotion Modeling using Cross-Domain Emotion Diarization for Emotional Speech Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08166","snapshot_observed_at":"2026-08-06T19:55:03.233086Z","title":"ED-TTS: Multi-scale emo- tion modeling using cross-domain emotion diarization for emotional speech synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T04:12:16.442306Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.233086Z"},"links":{"cited_paper":"/paper/2401.08166","citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:8481dcb80a1cdaaae0483df97e0c915f2501b2017b0b3933e4b06f80aa8d3ae5","observation_id":"300d42a3-b2bf-4d08-a03f-d3579d2f27cf","resolution":{"observed_at":"2026-08-06T19:55:03.233086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:04.083810Z","title":"EmoDiff: Intensity controllable emotional text-to-speech with soft-label guidance","venue":null,"work_id":"29a768de-48a6-4574-beb5-915416faf932","year":2023},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T04:12:16.442306Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.346441Z"},"links":{"citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:72ce90daa2ffce2fd7d84ac9bc78874b13ecc1d2c4cd6df55610c37dfbd52c18","observation_id":"b1df3dc2-cdee-42ec-a9e5-05ede80647d4","resolution":{"observed_at":"2026-08-06T19:55:04.086938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00648","last_updated":"2023-06-01T13:14:56Z","snapshot_observed_at":"2026-07-06T15:36:33.788201Z","submitted_at":"2023-06-01T13:14:56Z","title":"EmoMix: Emotion Mixing via Diffusion Models for Emotional Speech Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00648","snapshot_observed_at":"2026-08-06T19:55:03.419208Z","title":"EmoMix: Emotion mixing via diffusion models for emotional speech synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T04:12:16.442306Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.419208Z"},"links":{"cited_paper":"/paper/2306.00648","citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:1d1cb9f82220153f5298ec3c79e307cd4cfc3d7710962e8f27f8a71f71b3fd54","observation_id":"aa2deb88-4ce8-4e88-be3e-a9407cfa5235","resolution":{"observed_at":"2026-08-06T19:55:03.419208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:04.071263Z","title":"Speech synthesis with mixed emotions","venue":null,"work_id":"03e11889-733a-47fd-b96f-c86ade703874","year":2022},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T04:12:16.442306Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.483681Z"},"links":{"citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:dc93b5936cfef8e4844fbf2e62af1b79d8123e9f795be81aadeefcf432a68e20","observation_id":"366e1ecd-8c4f-4c60-a42c-bed69eb75c84","resolution":{"observed_at":"2026-08-06T19:55:04.076900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:04.059744Z","title":"QI-TTS: Questioning intonation control for emotional speech synthesis","venue":null,"work_id":"c116fd7d-0dad-4978-bf63-34b3b056b769","year":2023},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T04:12:16.442306Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.518055Z"},"links":{"citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:236631a33bf6e74bd7a948b851facad5b8be244354714b43d4ac643283c4c94a","observation_id":"26020b9b-e846-477d-b112-66bafcc54e32","resolution":{"observed_at":"2026-08-06T19:55:04.064363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:04.048728Z","title":"MsEmoTTS: Multi-scale emotion transfer, prediction, and control for emotional speech synthesis","venue":null,"work_id":"1945f16c-1ab2-45e1-b42a-af6bb33f05b2","year":2022},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T04:12:16.442306Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.523695Z"},"links":{"citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:9c8098b3720381649bf5c04623a89ec5f61b039f98230c36e59c123c3e750225","observation_id":"abe66048-9699-43e9-95d5-3f7a7d3ee0f5","resolution":{"observed_at":"2026-08-06T19:55:04.053177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.06000","last_updated":"2022-07-13T07:05:44Z","snapshot_observed_at":"2026-08-04T08:30:03.817075Z","submitted_at":"2022-07-13T07:05:44Z","title":"Text-driven Emotional Style Control and Cross-speaker Style Transfer in Neural TTS","version":1},"cited_work":{"arxiv_id":"2207.06000","doi":null,"metadata_source":"pith","pith_arxiv_id":"2207.06000","snapshot_observed_at":"2026-08-06T19:55:03.850763Z","title":"Text-driven Emotional Style Control and Cross-speaker Style Transfer in Neural TTS","venue":"cs.CL","work_id":"3a7dcf72-6f8f-47e3-9397-c9cce232d47d","year":2022},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T04:12:16.442306Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.526791Z"},"links":{"cited_paper":"/paper/2207.06000","citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:dc8390b541e7aa8550dc6283b6217917b9ee010bf0a3771070a72170dc627dae","observation_id":"ca31ec89-b39c-4d57-84fa-e2ae6f8c2ab1","resolution":{"observed_at":"2026-08-06T19:55:03.856194Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05447","last_updated":"2017-11-28T02:07:43Z","snapshot_observed_at":"2026-07-06T06:09:32.998168Z","submitted_at":"2017-11-15T08:27:35Z","title":"Emotional End-to-End Neural Speech Synthesizer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05447","snapshot_observed_at":"2026-08-06T19:55:03.529499Z","title":"Emotional end-to-end neural speech synthesizer","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T04:12:16.442306Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.529499Z"},"links":{"cited_paper":"/paper/1711.05447","citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:ad1f7e270dc0adf21838dd0fa99ded251c6267cfc631c8117785a6db5cec2d47","observation_id":"18355188-c91f-46cf-89a8-32016829c550","resolution":{"observed_at":"2026-08-06T19:55:03.529499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:04.038818Z","title":"Controllable emotion transfer for end-to-end speech synthesis","venue":null,"work_id":"75bad8cd-970d-480e-ad94-524748cc174d","year":2021},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T04:12:16.442306Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.532021Z"},"links":{"citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:0ac3ae4d27a49e47444f8ee82b875d8fc263a202785d954865ecff149626b558","observation_id":"6a73c16a-4189-4908-8f33-4f0f697b58cc","resolution":{"observed_at":"2026-08-06T19:55:04.043446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:04.025703Z","title":"Emotion controllable speech synthesis using emotion-unlabeled dataset with the assistance of cross-domain speech emotion recognition","venue":null,"work_id":"e22e5a10-9ca9-4512-92a0-8673dfeaf0da","year":2021},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T04:12:16.442306Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.534804Z"},"links":{"citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:2cd57d8056b0d98552d6fba639cb9f3441b41ff302f26fe36493043f3d672878","observation_id":"9b569e5c-3eaa-4f8d-be37-b62c236fe297","resolution":{"observed_at":"2026-08-06T19:55:04.032509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2024-398","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:03.654521Z","title":"Emosphere- tts: Emotional style and intensity modeling via spherical emotion vector for controllable emotional text-to-speech","venue":null,"work_id":"ab7912d0-c065-49f6-b0d7-c661ef4a816a","year":2024},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T04:12:16.442306Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.537283Z"},"links":{"citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:cb5a672f6675cda9a43380fa9dc2d9abab73f59128b1131039cf790e59311f61","observation_id":"cd5dac71-3209-466d-bf22-a250b1ae6ad1","resolution":{"observed_at":"2026-08-06T19:55:03.658196Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12229","last_updated":"2024-09-17T10:40:11Z","snapshot_observed_at":"2026-07-06T18:47:33.863041Z","submitted_at":"2024-07-17T00:54:15Z","title":"Laugh Now Cry Later: Controlling Time-Varying Emotional States of Flow-Matching-Based Zero-Shot Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2407.12229","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.12229","snapshot_observed_at":"2026-08-06T19:55:03.827977Z","title":"Laugh Now Cry Later: Controlling Time-Varying Emotional States of Flow-Matching-Based Zero-Shot Text-to-Speech","venue":"eess.AS","work_id":"7b68a14c-17ee-48b1-b381-a0f9f2d2dbf5","year":2024},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T04:12:16.442306Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.540269Z"},"links":{"cited_paper":"/paper/2407.12229","citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:b86b3f4281e3835cab8e9e3c573b7c12255a1aebf2ce6da69aece8007f068b41","observation_id":"24f69278-2478-400a-b62a-f7038cf8050b","resolution":{"observed_at":"2026-08-06T19:55:03.834991Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-01T23:52:25.071174Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06885","snapshot_observed_at":"2026-08-06T19:55:03.543011Z","title":"F5- tts: A fairytaler that fakes fluent and faithful speech with flow matching","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T04:12:16.442306Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.543011Z"},"links":{"cited_paper":"/paper/2410.06885","citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:5fac4c331ed311323b363d26f0d89c7b32e6f2822edf2079fd7151214b83fb2e","observation_id":"c28b31f1-ae99-4660-a07b-f6aba23591c0","resolution":{"observed_at":"2026-08-06T19:55:03.543011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:03.545404Z","title":"High-resolution image synthesis with latent diffusion models, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T04:12:16.442306Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.545404Z"},"links":{"citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:5249c0b43ae85bdbd2356a7e10930f2ca32715a033179848666d4caa3777508b","observation_id":"ae120038-da12-4821-b592-095af89548a3","resolution":{"observed_at":"2026-08-06T19:55:03.545404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.11477","last_updated":"2020-10-22T06:09:10Z","snapshot_observed_at":"2026-08-07T05:13:16.889179Z","submitted_at":"2020-06-20T02:35:02Z","title":"wav2vec 2.0: A Framework for Self-Supervised Learning of Speech Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.11477","snapshot_observed_at":"2026-08-06T19:55:03.548339Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T04:12:16.442306Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.548339Z"},"links":{"cited_paper":"/paper/2006.11477","citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:39e0d69169519b0e4ae9fa604a0f83956f440cd737a01c437e5c7ec6757e5d39","observation_id":"db240b9d-a81b-4cce-b5cb-3a8760823976","resolution":{"observed_at":"2026-08-06T19:55:03.548339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:03.553864Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T04:12:16.442306Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.553864Z"},"links":{"citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:e1d70c39819f66d147b1bce52b98c9029bac19d43f7bc2959252260d074627a1","observation_id":"74ab91bd-8e53-4437-8b1b-443cd01ffbdb","resolution":{"observed_at":"2026-08-06T19:55:03.553864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09748","last_updated":"2023-03-02T09:06:55Z","snapshot_observed_at":"2026-07-06T14:32:37.317828Z","submitted_at":"2022-12-19T18:59:58Z","title":"Scalable Diffusion Models with Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09748","snapshot_observed_at":"2026-08-06T19:55:03.556597Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T04:12:16.442306Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.556597Z"},"links":{"cited_paper":"/paper/2212.09748","citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:60a21074a9e406f8d392d8f0cbca781bfe10d6940a289db7353e44e5b2e14780","observation_id":"3aba256c-3a5c-46b0-bc54-58c020af47e5","resolution":{"observed_at":"2026-08-06T19:55:03.556597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:03.558680Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T04:12:16.442306Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.558680Z"},"links":{"citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:44e7f79025b409c79cc70a64da491f838ad99987cf3f6e80fc55aa7c5edfd157","observation_id":"dd543283-742f-407e-8f66-e0181482b3e6","resolution":{"observed_at":"2026-08-06T19:55:03.558680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03206","last_updated":"2024-03-05T18:45:39Z","snapshot_observed_at":"2026-07-06T17:40:01.975792Z","submitted_at":"2024-03-05T18:45:39Z","title":"Scaling Rectified Flow Transformers for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03206","snapshot_observed_at":"2026-08-06T19:55:03.561139Z","title":"Scaling rectified flow transformers for high-resolution image synthesis, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T04:12:16.442306Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.561139Z"},"links":{"cited_paper":"/paper/2403.03206","citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:0b540dc131fbf6f781054763e7332acfed1f6b2264a83c8fed1872e1a6443de7","observation_id":"4722960f-6b47-4504-8095-59584de4ba11","resolution":{"observed_at":"2026-08-06T19:55:03.561139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:03.563909Z","title":"Ip-adapter: Text compatible image prompt adapter for text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T04:12:16.442306Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.563909Z"},"links":{"citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:676f5e910b64e2d9c5f399f7af624aab885a2deacfbf4348d1310d712e1e941f","observation_id":"b47965bb-61e1-41ba-9435-633e28f772fd","resolution":{"observed_at":"2026-08-06T19:55:03.563909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14430","last_updated":"2025-03-15T21:25:56Z","snapshot_observed_at":"2026-08-03T14:25:47.372658Z","submitted_at":"2024-11-21T18:59:51Z","title":"Stable Flow: Vital Layers for Training-Free Image Editing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14430","snapshot_observed_at":"2026-08-06T19:55:03.566512Z","title":"Stable flow: Vital layers for training-free image editing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T04:12:16.442306Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.566512Z"},"links":{"cited_paper":"/paper/2411.14430","citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:08e2e444d49a720d598aaec0d7295c3a819fc648a900f145df4faf573f92466f","observation_id":"aca95d79-9e1d-4b04-a981-57869bda2470","resolution":{"observed_at":"2026-08-06T19:55:03.566512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:03.998489Z","title":null,"venue":null,"work_id":"748e757e-594e-49f5-ba0b-d2514992cf64","year":2023},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T04:12:16.442306Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.569359Z"},"links":{"citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:22ed52d270d5dab6195d5272ace5fc15c383405e6a67abe6d688c2337ffd0594","observation_id":"1cfc32c3-f63a-4151-ae45-23d83dec5180","resolution":{"observed_at":"2026-08-06T19:55:04.003235Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21437/interspeech.2017-1494","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:03.641558Z","title":"Jointly predicting arousal, valence and dominance with multi-task learning","venue":null,"work_id":"c23e53cf-c825-4e82-8756-8ea1fec3193c","year":2017},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T04:12:16.442306Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.572713Z"},"links":{"citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:7c7b6b1b0fee909fb7eaa2c36458c3bd385c9215ed5188d75aad18a27bb122b4","observation_id":"7c0a4d10-0711-41e7-9bcb-e6d557b03047","resolution":{"observed_at":"2026-08-06T19:55:03.647994Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:03.575345Z","title":"Automatic speech emotion recognition using recurrent neural networks with local attention","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T04:12:16.442306Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.575345Z"},"links":{"citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:e1f0a3c0be885e4cbe789313b511be10b70c9b5cc9d7966c2fd131dc53141c35","observation_id":"c0bef902-9eaf-4a1a-93a1-9fae01b79ccf","resolution":{"observed_at":"2026-08-06T19:55:03.575345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.11540","last_updated":"2019-08-30T05:44:24Z","snapshot_observed_at":"2026-08-06T12:48:13.189790Z","submitted_at":"2019-08-30T05:44:24Z","title":"DialogueGCN: A Graph Convolutional Neural Network for Emotion Recognition in Conversation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.11540","snapshot_observed_at":"2026-08-06T19:55:03.577522Z","title":"Dia- loguegcn: A graph convolutional neural network for emotion recognition in conversation, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T04:12:16.442306Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.577522Z"},"links":{"cited_paper":"/paper/1908.11540","citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:56e0af387980f2685c7c652b553c5cc982c65dd48decb018ce964fffbfdcef35","observation_id":"57d46f65-0a4c-4e40-8a49-541b498ce322","resolution":{"observed_at":"2026-08-06T19:55:03.577522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:03.986423Z","title":"Dawn of the transformer era in speech emotion recognition: Closing the valence gap","venue":null,"work_id":"aabfb440-b741-4ff0-bddd-5b592b7b39a9","year":2023},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T04:12:16.442306Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.580775Z"},"links":{"citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:1c63d6fc19ce532a7d5f07edfad7556a85b886f72e4b1cffd58df6dac3a59b7d","observation_id":"1c380437-f813-455d-95bc-6a23c1569fa7","resolution":{"observed_at":"2026-08-06T19:55:03.991773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:03.583254Z","title":"Emilia: An extensive, multilingual, and diverse speech dataset for large-scale speech generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T04:12:16.442306Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.583254Z"},"links":{"citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:ca4b2c4a252e61bb4b9058c6a8081b4f74791926f082520c96e3ca0e16bd2acb","observation_id":"f0c04121-3ed6-4d39-b2ef-27e9337b95c5","resolution":{"observed_at":"2026-08-06T19:55:03.583254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.02882","last_updated":"2019-04-05T06:05:00Z","snapshot_observed_at":"2026-08-07T13:32:24.356336Z","submitted_at":"2019-04-05T06:05:00Z","title":"LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.02882","snapshot_observed_at":"2026-08-06T19:55:03.585947Z","title":"Libritts: A corpus derived from librispeech for text-to-speech","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T04:12:16.442306Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.585947Z"},"links":{"cited_paper":"/paper/1904.02882","citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:a3da2632f1145cf3f1b1f88c95f7a41d6f3069d6e3ba0e89f18c6ae46415000e","observation_id":"2a13b751-60f8-42e4-b698-360ce9de2ead","resolution":{"observed_at":"2026-08-06T19:55:03.585947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:03.970842Z","title":"Building naturalistic emotionally balanced speech corpus by retrieving emotional speech from existing podcast recordings","venue":null,"work_id":"437360dd-5ca2-40fc-9bb3-2afce0976867","year":2017},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T04:12:16.442306Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.589132Z"},"links":{"citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:11a166731075b7316b436f3e0bec688aa789c904740237980d78c9f21fd6d5d7","observation_id":"9b0e4c01-87bd-4f7a-b487-cfea8791fdd4","resolution":{"observed_at":"2026-08-06T19:55:03.975384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:03.959815Z","title":"EARS: An anechoic fullband speech dataset benchmarked for speech enhancement and dereverberation","venue":null,"work_id":"6064af2d-1005-46b6-8a57-011a79757234","year":2024},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T04:12:16.442306Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.591411Z"},"links":{"citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:466063920ec73586be13a451ba62e59dae8c0e5ed65971582930426632423487","observation_id":"76e9d925-af9f-4cdc-a122-cb4e78110d5a","resolution":{"observed_at":"2026-08-06T19:55:03.964072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:03.948761Z","title":"Iemocap: Interactive emotional dyadic motion capture database","venue":null,"work_id":"e4a133c1-c709-40ec-a7e9-8d9f8bd780b7","year":2008},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T04:12:16.442306Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.593862Z"},"links":{"citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:66c2133431bed015494266f0f1edd37af42434a5136e67800b47ca2ffa1902b8","observation_id":"04826e61-70a3-40b4-9541-418907ce9bcd","resolution":{"observed_at":"2026-08-06T19:55:03.952788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:03.937521Z","title":"Seen and unseen emotional style transfer for voice conversion with a new emotional speech dataset","venue":null,"work_id":"9f009990-1bf2-4642-8db2-f3ab3004ebd9","year":2021},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T04:12:16.442306Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.596052Z"},"links":{"citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:c9494dc5e3753e7f34a4e036031c561d8d99f092feff1999b5abfffa235dc33e","observation_id":"786b6ee7-f2df-484f-adf6-d87af02a949e","resolution":{"observed_at":"2026-08-06T19:55:03.942258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:03.925492Z","title":"Expresso: A benchmark and analysis of discrete expressive speech resynthesis","venue":null,"work_id":"6d647cca-5df9-4d9c-8755-11c9417ab1a0","year":2023},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T04:12:16.442306Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.598786Z"},"links":{"citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:40847ac38166700a55e28ef22a14f8b8c859dcccd248e34dee46a3fc610d3c4a","observation_id":"50fd03a3-26bf-4b1e-a145-3c47d6137f59","resolution":{"observed_at":"2026-08-06T19:55:03.930958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:03.913961Z","title":"The ryerson audio-visual database of emotional speech and song (RA VDESS): A dynamic, multimodal set of facial and vocal expressions in north american english","venue":null,"work_id":"8edb8684-1c41-48b0-a56a-c65200311747","year":2018},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T04:12:16.442306Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.603813Z"},"links":{"citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:c90a82db2518bce07bf338a8949fbd448f249c55223e2b2304cce203a606ad60","observation_id":"d39eaf97-f758-4234-9303-b0fcedb68c25","resolution":{"observed_at":"2026-08-06T19:55:03.918607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:03.902356Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":"c933c962-b1cc-432b-a22c-d95400d95a49","year":2023},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T04:12:16.442306Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.606423Z"},"links":{"citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:9cd388833eca5147c3aab81891a6ed16e7f58fa9a98141a47dba569234e41787","observation_id":"57707053-24ee-4ccf-b3fa-4bc411d1448c","resolution":{"observed_at":"2026-08-06T19:55:03.908017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-06T19:55:03.608406Z","title":"Seamless: Multilingual expressive and streaming speech translation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T04:12:16.442306Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.608406Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:5554518402c85a3a66449dfa17da7ec13f10e67c469a1c6571612b0ddcd193c6","observation_id":"39cf408f-2267-471a-813e-88f5f227bf17","resolution":{"observed_at":"2026-08-06T19:55:03.608406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:03.611900Z","title":"supple_demo/index.html","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T04:12:16.442306Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.611900Z"},"links":{"citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:4653315b2bd69519bfce5336ec2b47c0fafafaca554d5a52367ff1024c50450f","observation_id":"ce67d789-761f-4502-8d41-2ab1bd58d570","resolution":{"observed_at":"2026-08-06T19:55:03.611900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:55:03.600978Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","snapshot_observed_at":"2026-08-08T04:12:16.442306Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T19:55:03.600978Z"},"links":{"citing_paper":"/paper/2507.04349"},"observation_digest":"sha256:38bfe72318a69def7e879455ad2143a93b7c84e7dc40526ede180df470bcf0f4","observation_id":"94723fb0-b9a0-4101-abd0-d7076b1748b1","resolution":{"observed_at":"2026-08-06T19:55:03.600978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.04349","last_updated":"2025-07-06T11:22:08Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-08T04:12:16.442306Z","submitted_at":"2025-07-06T11:22:08Z","title":"TTS-CtrlNet: Time varying emotion aligned text-to-speech generation with ControlNet"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":4,"verified_fuzzy":17},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 2 inbound Pith citation observations for arXiv:2507.04349."}