{"as_of":"2026-08-08T13:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c01a1c5815f75950d609e707a59ab02c0e4bc27f05ce5710a700f6b530e5ab80","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:49:13.241404Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:49:08.825623Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T13:49:13.486015Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.20868","last_updated":"2025-06-29T12:42:04Z","snapshot_observed_at":"2026-08-07T13:43:23.646436Z","submitted_at":"2025-05-27T08:20:01Z","title":"Spotlight-TTS: Spotlighting the Style via Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2505.20868","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.20868","snapshot_observed_at":"2026-08-07T13:49:13.486015Z","title":"Spotlight-TTS: Spotlighting the Style via Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech","venue":"cs.SD","work_id":"5576ef5e-fbc2-4330-bed0-f5c1d1eafcd2","year":2025},"citing_paper":{"arxiv_id":"2505.20868","last_updated":"2025-06-29T12:42:04Z","snapshot_observed_at":"2026-08-07T13:43:23.646436Z","submitted_at":"2025-05-27T08:20:01Z","title":"Spotlight-TTS: Spotlighting the Style via Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:08.825623Z"},"links":{"cited_paper":"/paper/2505.20868","citing_paper":"/paper/2505.20868"},"observation_digest":"sha256:71023cbf3c586f4ec01a977f1c8a38a23317cb461f922d0643bdc5bd26fd51de","observation_id":"37201e95-7427-4e53-a70f-ca8993b94ef7","resolution":{"observed_at":"2026-08-07T13:49:13.614578Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.20868/citation-record","integrity":"/paper/2505.20868/integrity","json":"/paper/2505.20868/citation-record.json","paper":"/paper/2505.20868"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:20.486827Z","title":"With recent advancements in deep learning technology [2, 3, 4], the naturalness of synthesized speech has improved significantly [5, 6]","venue":null,"work_id":"960340bf-1bc7-4a88-9935-6b5ec8bc05f0","year":null},"citing_paper":{"arxiv_id":"2505.20868","last_updated":"2025-06-29T12:42:04Z","snapshot_observed_at":"2026-08-07T13:43:23.646436Z","submitted_at":"2025-05-27T08:20:01Z","title":"Spotlight-TTS: Spotlighting the Style via Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:08.598000Z"},"links":{"citing_paper":"/paper/2505.20868"},"observation_digest":"sha256:13632866a1b9c2d618bf4ed3ec7b83e772e895e7a8255fe62aac777eb0bbbdd8","observation_id":"2dfd6543-a213-4651-9f4d-04afb3ab856c","resolution":{"observed_at":"2026-08-07T13:49:20.604622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20868","last_updated":"2025-06-29T12:42:04Z","snapshot_observed_at":"2026-08-07T13:43:23.646436Z","submitted_at":"2025-05-27T08:20:01Z","title":"Spotlight-TTS: Spotlighting the Style via Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2505.20868","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.20868","snapshot_observed_at":"2026-08-07T13:49:13.486015Z","title":"Spotlight-TTS: Spotlighting the Style via Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech","venue":"cs.SD","work_id":"5576ef5e-fbc2-4330-bed0-f5c1d1eafcd2","year":2025},"citing_paper":{"arxiv_id":"2505.20868","last_updated":"2025-06-29T12:42:04Z","snapshot_observed_at":"2026-08-07T13:43:23.646436Z","submitted_at":"2025-05-27T08:20:01Z","title":"Spotlight-TTS: Spotlighting the Style via Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:08.825623Z"},"links":{"cited_paper":"/paper/2505.20868","citing_paper":"/paper/2505.20868"},"observation_digest":"sha256:71023cbf3c586f4ec01a977f1c8a38a23317cb461f922d0643bdc5bd26fd51de","observation_id":"37201e95-7427-4e53-a70f-ca8993b94ef7","resolution":{"observed_at":"2026-08-07T13:49:13.614578Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:19.786945Z","title":"Both are about the same distance","venue":null,"work_id":"e225bf28-ead1-48e1-b71b-22cf62ded345","year":null},"citing_paper":{"arxiv_id":"2505.20868","last_updated":"2025-06-29T12:42:04Z","snapshot_observed_at":"2026-08-07T13:43:23.646436Z","submitted_at":"2025-05-27T08:20:01Z","title":"Spotlight-TTS: Spotlighting the Style via Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:08.939599Z"},"links":{"citing_paper":"/paper/2505.20868"},"observation_digest":"sha256:cdbcbbcf29ed52557bd9050dc987057f01b827813bc3ab8f7d34d92ff194010a","observation_id":"4fb189b0-c7a9-45e0-9980-15690766f006","resolution":{"observed_at":"2026-08-07T13:49:19.947674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:19.475598Z","title":"V oiced-aware style extraction considers the acoustic character- istics of different speech regions, enabling more detailed style extraction","venue":null,"work_id":"375e1549-5482-413f-9c81-681b2681ae05","year":null},"citing_paper":{"arxiv_id":"2505.20868","last_updated":"2025-06-29T12:42:04Z","snapshot_observed_at":"2026-08-07T13:43:23.646436Z","submitted_at":"2025-05-27T08:20:01Z","title":"Spotlight-TTS: Spotlighting the Style via Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:09.058543Z"},"links":{"citing_paper":"/paper/2505.20868"},"observation_digest":"sha256:b1109c563094d640e03f697f7bd3b2d5dc5225ce5d6a5f329b30bb3f3d816649","observation_id":"aeec44c5-4f37-4aae-8896-1e08c45796df","resolution":{"observed_at":"2026-08-07T13:49:19.626922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:19.254694Z","title":"RS-2019-II190079), Artificial Intelligence Innova- tion Hub (No","venue":null,"work_id":"d0a8993b-096b-483d-bb8c-6572a5500930","year":2019},"citing_paper":{"arxiv_id":"2505.20868","last_updated":"2025-06-29T12:42:04Z","snapshot_observed_at":"2026-08-07T13:43:23.646436Z","submitted_at":"2025-05-27T08:20:01Z","title":"Spotlight-TTS: Spotlighting the Style via Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:09.173582Z"},"links":{"citing_paper":"/paper/2505.20868"},"observation_digest":"sha256:36b40970d6f141359b3d00391a169323ebe6bbfb6a7424c39d18c364f0b10630","observation_id":"d96f3b0e-2712-4887-bdc8-68f6554cd658","resolution":{"observed_at":"2026-08-07T13:49:19.344369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:18.371974Z","title":"Emosphere-tts: Emotional style and intensity modeling via spherical emotion vector for controllable emotional text-to- speech,","venue":null,"work_id":"a4311aa2-c3d0-4d6c-a91d-4328bccd4c78","year":2024},"citing_paper":{"arxiv_id":"2505.20868","last_updated":"2025-06-29T12:42:04Z","snapshot_observed_at":"2026-08-07T13:43:23.646436Z","submitted_at":"2025-05-27T08:20:01Z","title":"Spotlight-TTS: Spotlighting the Style via Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:09.800248Z"},"links":{"citing_paper":"/paper/2505.20868"},"observation_digest":"sha256:587d2d3d7d9dc8cb288ee90ed9bc99c7c8d0f9be2f2fc66fcd39216ae2e02d18","observation_id":"f5a2dd12-6165-4ae2-916e-8e79ce511c84","resolution":{"observed_at":"2026-08-07T13:49:18.454764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:09.278767Z","title":"Fastspeech 2: Fast and high-quality end-to-end text to speech,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20868","last_updated":"2025-06-29T12:42:04Z","snapshot_observed_at":"2026-08-07T13:43:23.646436Z","submitted_at":"2025-05-27T08:20:01Z","title":"Spotlight-TTS: Spotlighting the Style via Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:09.278767Z"},"links":{"citing_paper":"/paper/2505.20868"},"observation_digest":"sha256:4bdf91d6c5c34b60468e154582da6e1cbfd645adb618377e18c25da51fdb307d","observation_id":"b5132ec1-c45e-40d4-a806-0af870f8d5b8","resolution":{"observed_at":"2026-08-07T13:49:09.278767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:19.060094Z","title":"A new recurrent neural-network ar- chitecture for visual pattern recognition,","venue":null,"work_id":"36840264-112a-4c73-91bf-ef8b25b0d06b","year":1997},"citing_paper":{"arxiv_id":"2505.20868","last_updated":"2025-06-29T12:42:04Z","snapshot_observed_at":"2026-08-07T13:43:23.646436Z","submitted_at":"2025-05-27T08:20:01Z","title":"Spotlight-TTS: Spotlighting the Style via Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:09.364915Z"},"links":{"citing_paper":"/paper/2505.20868"},"observation_digest":"sha256:b929315671f61b33681a197cf1c194477b2763b4a9a5de60d783edacf75006a8","observation_id":"29571275-8d64-43b2-9ff7-6b1c4801f5b2","resolution":{"observed_at":"2026-08-07T13:49:19.160124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:18.877744Z","title":"Multiresolution recognition of hand- written numerals with wavelet transform and multilayer cluster neural network,","venue":null,"work_id":"3de5d7b4-1bcc-4e65-9908-82853aec6a43","year":1995},"citing_paper":{"arxiv_id":"2505.20868","last_updated":"2025-06-29T12:42:04Z","snapshot_observed_at":"2026-08-07T13:43:23.646436Z","submitted_at":"2025-05-27T08:20:01Z","title":"Spotlight-TTS: Spotlighting the Style via Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:09.466239Z"},"links":{"citing_paper":"/paper/2505.20868"},"observation_digest":"sha256:6aa88b043050a554a50c241a822c15de6955fe1b1642da3048cf1b0c2e26c0b7","observation_id":"c62140b5-f2ed-4f10-a2e9-d7a13ac36582","resolution":{"observed_at":"2026-08-07T13:49:18.952551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:18.670837Z","title":"Multilayer cluster neural network for totally un- constrained handwritten numeral recognition,","venue":null,"work_id":"cfaf7f80-86b8-49e6-b43d-02dbb932f6e7","year":1995},"citing_paper":{"arxiv_id":"2505.20868","last_updated":"2025-06-29T12:42:04Z","snapshot_observed_at":"2026-08-07T13:43:23.646436Z","submitted_at":"2025-05-27T08:20:01Z","title":"Spotlight-TTS: Spotlighting the Style via Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:09.583141Z"},"links":{"citing_paper":"/paper/2505.20868"},"observation_digest":"sha256:776251fa4f7aac37ccf71f5492f6a6449b5757a6714796560ddc4ce9ae456ffa","observation_id":"23c905f2-7275-49bc-b83c-26f720a333ff","resolution":{"observed_at":"2026-08-07T13:49:18.753635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:18.527567Z","title":"Hierspeech: Bridging the gap between text and speech by hierarchical variational inference using self-supervised represen- tations for speech synthesis,","venue":null,"work_id":"d755ad35-29b4-4928-b71f-af8d4bece794","year":2022},"citing_paper":{"arxiv_id":"2505.20868","last_updated":"2025-06-29T12:42:04Z","snapshot_observed_at":"2026-08-07T13:43:23.646436Z","submitted_at":"2025-05-27T08:20:01Z","title":"Spotlight-TTS: Spotlighting the Style via Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:09.695138Z"},"links":{"citing_paper":"/paper/2505.20868"},"observation_digest":"sha256:bd83977c3b2b0a48e8986b06592e203843a0b6b7f7a97cf0102c6572155ffddb","observation_id":"492cd53c-4ab1-4a74-86e3-26f2be4dd38f","resolution":{"observed_at":"2026-08-07T13:49:18.593849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:16.975265Z","title":"Neural dis- crete representation learning,","venue":null,"work_id":"7e70ac7b-cec9-4b33-a128-918f183ef0bf","year":2017},"citing_paper":{"arxiv_id":"2505.20868","last_updated":"2025-06-29T12:42:04Z","snapshot_observed_at":"2026-08-07T13:43:23.646436Z","submitted_at":"2025-05-27T08:20:01Z","title":"Spotlight-TTS: Spotlighting the Style via Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:10.568416Z"},"links":{"citing_paper":"/paper/2505.20868"},"observation_digest":"sha256:f8d9502eb3cb1e3a20f4baac2aee268a6d379ab577798e95f2dcc6dcb67f8388","observation_id":"a48a850a-8e74-4922-823f-2a7263d62987","resolution":{"observed_at":"2026-08-07T13:49:17.115825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:18.220057Z","title":"Towards end-to-end prosody transfer for expressive speech synthesis with tacotron,","venue":null,"work_id":"2a193eff-5dec-4b19-8b9c-1879287fa202","year":2018},"citing_paper":{"arxiv_id":"2505.20868","last_updated":"2025-06-29T12:42:04Z","snapshot_observed_at":"2026-08-07T13:43:23.646436Z","submitted_at":"2025-05-27T08:20:01Z","title":"Spotlight-TTS: Spotlighting the Style via Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:09.957838Z"},"links":{"citing_paper":"/paper/2505.20868"},"observation_digest":"sha256:c149aadd0149bdfd1ed44adcb28e0d8875fe47ea68a413bce391d2ee6cbd63e8","observation_id":"c48ee2b7-9b0b-4e3e-b5fd-9096f83f40b2","resolution":{"observed_at":"2026-08-07T13:49:18.294039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:18.105891Z","title":"Style tokens: Unsu- pervised style modeling, control and transfer in end-to-end speech synthesis,","venue":null,"work_id":"700e98cc-33ad-44da-b778-6831032e3f12","year":2018},"citing_paper":{"arxiv_id":"2505.20868","last_updated":"2025-06-29T12:42:04Z","snapshot_observed_at":"2026-08-07T13:43:23.646436Z","submitted_at":"2025-05-27T08:20:01Z","title":"Spotlight-TTS: Spotlighting the Style via Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:10.073323Z"},"links":{"citing_paper":"/paper/2505.20868"},"observation_digest":"sha256:d1f85431a8d8bcfb65e205661dc0dfffdd70447156b6745175a878a95306ae09","observation_id":"8448b2bf-8a24-430f-b812-f41398451042","resolution":{"observed_at":"2026-08-07T13:49:18.156277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:17.844839Z","title":"Meta-stylespeech : Multi-speaker adaptive text-to-speech generation,","venue":null,"work_id":"24daf0e7-4ed8-4f14-aa36-48dfb9911b51","year":2021},"citing_paper":{"arxiv_id":"2505.20868","last_updated":"2025-06-29T12:42:04Z","snapshot_observed_at":"2026-08-07T13:43:23.646436Z","submitted_at":"2025-05-27T08:20:01Z","title":"Spotlight-TTS: Spotlighting the Style via Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:10.197878Z"},"links":{"citing_paper":"/paper/2505.20868"},"observation_digest":"sha256:fa257b67ed35980127ae5ef7b0956a14a1a96c06e7145cca8ceafb076fb61549","observation_id":"2e288fe4-32ca-4ff3-8ce1-20e4398137b7","resolution":{"observed_at":"2026-08-07T13:49:17.966373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:17.557752Z","title":"Qi-tts: Questioning intonation control for emotional speech synthesis,","venue":null,"work_id":"924f082e-3a7f-42fa-883f-73fbd1575888","year":2023},"citing_paper":{"arxiv_id":"2505.20868","last_updated":"2025-06-29T12:42:04Z","snapshot_observed_at":"2026-08-07T13:43:23.646436Z","submitted_at":"2025-05-27T08:20:01Z","title":"Spotlight-TTS: Spotlighting the Style via Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:10.306047Z"},"links":{"citing_paper":"/paper/2505.20868"},"observation_digest":"sha256:2c51f8e3df1517b1ff2b174651f71e7bab2fb5ebda4021eb80fdd7cb6a4971b6","observation_id":"87bad46a-6ff1-4fcc-8ed0-00d8ecd8128b","resolution":{"observed_at":"2026-08-07T13:49:17.696519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:17.273778Z","title":"Generspeech: Towards style transfer for generalizable out-of-domain text-to- speech,","venue":null,"work_id":"5e79ae78-1b78-40ed-8ccb-c2f3433da690","year":2022},"citing_paper":{"arxiv_id":"2505.20868","last_updated":"2025-06-29T12:42:04Z","snapshot_observed_at":"2026-08-07T13:43:23.646436Z","submitted_at":"2025-05-27T08:20:01Z","title":"Spotlight-TTS: Spotlighting the Style via Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:10.461481Z"},"links":{"citing_paper":"/paper/2505.20868"},"observation_digest":"sha256:a539047ae94909f0d303625d1676f5809192d3c49e83a6a8d45058645b515978","observation_id":"9c21da54-39e4-42aa-9ac8-76ae8847ed08","resolution":{"observed_at":"2026-08-07T13:49:17.390099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:16.125953Z","title":"Good helper is around you: Attention- driven masked image modeling,","venue":null,"work_id":"a1932fe0-b6cc-48f0-9c94-125d59c2c36d","year":2023},"citing_paper":{"arxiv_id":"2505.20868","last_updated":"2025-06-29T12:42:04Z","snapshot_observed_at":"2026-08-07T13:43:23.646436Z","submitted_at":"2025-05-27T08:20:01Z","title":"Spotlight-TTS: Spotlighting the Style via Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:11.337465Z"},"links":{"citing_paper":"/paper/2505.20868"},"observation_digest":"sha256:6bcc261f86199a13d5e86e6bde089eb98a59533ef974bee3892ba6483711c8a0","observation_id":"650cbabd-599a-43b2-9269-0a03b82b5f8d","resolution":{"observed_at":"2026-08-07T13:49:16.219360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:20.093130Z","title":"Furthermore, we introduce style direction adjustment, which adjusts the ex- tracted style by modifying its angle using content and prosody vectors in the embedding space","venue":null,"work_id":"d1be71e3-868f-4176-81ea-af5d8c139275","year":null},"citing_paper":{"arxiv_id":"2505.20868","last_updated":"2025-06-29T12:42:04Z","snapshot_observed_at":"2026-08-07T13:43:23.646436Z","submitted_at":"2025-05-27T08:20:01Z","title":"Spotlight-TTS: Spotlighting the Style via Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:08.720482Z"},"links":{"citing_paper":"/paper/2505.20868"},"observation_digest":"sha256:56a8ebd0d8995588bc1a9f9500ccd305d354d75121eaf4457936bced1c6dda4d","observation_id":"f2af16f3-3e05-4ec7-84f7-77d67aa20ab5","resolution":{"observed_at":"2026-08-07T13:49:20.232580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:16.783041Z","title":"Tsp-tts: Text-based style predictor with residual vector quantization for expressive text-to- speech,","venue":null,"work_id":"c499fa52-119f-426c-ae92-665222fece77","year":2024},"citing_paper":{"arxiv_id":"2505.20868","last_updated":"2025-06-29T12:42:04Z","snapshot_observed_at":"2026-08-07T13:43:23.646436Z","submitted_at":"2025-05-27T08:20:01Z","title":"Spotlight-TTS: Spotlighting the Style via Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:10.708545Z"},"links":{"citing_paper":"/paper/2505.20868"},"observation_digest":"sha256:6417cb429c59ba81214620013eeb6b5b5b6479b5e7f9f6c3354a630f7d2d47a0","observation_id":"074771a2-cf4f-4efc-8812-f55a96c6d12b","resolution":{"observed_at":"2026-08-07T13:49:16.868842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:16.602111Z","title":"TCSinger: Zero-shot singing voice synthesis with style transfer and multi-level style control,","venue":null,"work_id":"35e3993f-a8a1-46a9-a6e9-a21c1a4db556","year":2024},"citing_paper":{"arxiv_id":"2505.20868","last_updated":"2025-06-29T12:42:04Z","snapshot_observed_at":"2026-08-07T13:43:23.646436Z","submitted_at":"2025-05-27T08:20:01Z","title":"Spotlight-TTS: Spotlighting the Style via Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:10.821151Z"},"links":{"citing_paper":"/paper/2505.20868"},"observation_digest":"sha256:485e3e8954bf5f84d0d9d945a31dc0d2cfd6768f7a52b9f31df94a786eb3e506","observation_id":"0ea39445-2923-4323-b567-fd8a08025c1b","resolution":{"observed_at":"2026-08-07T13:49:16.669619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1308.3432","last_updated":"2013-08-15T15:19:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-08-15T15:19:34Z","title":"Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1308.3432","snapshot_observed_at":"2026-08-07T13:49:10.936166Z","title":"Estimating or propa- gating gradients through stochastic neurons for conditional com- putation,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.20868","last_updated":"2025-06-29T12:42:04Z","snapshot_observed_at":"2026-08-07T13:43:23.646436Z","submitted_at":"2025-05-27T08:20:01Z","title":"Spotlight-TTS: Spotlighting the Style via Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:10.936166Z"},"links":{"cited_paper":"/paper/1308.3432","citing_paper":"/paper/2505.20868"},"observation_digest":"sha256:4eae4d43fdc93cd6b2c2cdb90a6c79336116aad9a0cae0036fd9e8aa5daca661","observation_id":"dab69dc1-f56f-4ad0-8981-43d15e4c9865","resolution":{"observed_at":"2026-08-07T13:49:10.936166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:16.454947Z","title":"Signal compression based on models of human perception,","venue":null,"work_id":"6f7a7d90-5891-4d29-a33f-25d9526e353d","year":1993},"citing_paper":{"arxiv_id":"2505.20868","last_updated":"2025-06-29T12:42:04Z","snapshot_observed_at":"2026-08-07T13:43:23.646436Z","submitted_at":"2025-05-27T08:20:01Z","title":"Spotlight-TTS: Spotlighting the Style via Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:11.040077Z"},"links":{"citing_paper":"/paper/2505.20868"},"observation_digest":"sha256:9fc6cfbf3a07aad8510481643ffedf11898910b6bed4954550bee1fc79c7dba2","observation_id":"7d9de12d-4f7d-41d8-b735-c0c6fe04e43b","resolution":{"observed_at":"2026-08-07T13:49:16.507721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:16.318729Z","title":"Not all image re- gions matter: Masked vector quantization for autoregressive im- age generation,","venue":null,"work_id":"e5933f93-d789-4390-9235-6b5994020415","year":2023},"citing_paper":{"arxiv_id":"2505.20868","last_updated":"2025-06-29T12:42:04Z","snapshot_observed_at":"2026-08-07T13:43:23.646436Z","submitted_at":"2025-05-27T08:20:01Z","title":"Spotlight-TTS: Spotlighting the Style via Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:11.146945Z"},"links":{"citing_paper":"/paper/2505.20868"},"observation_digest":"sha256:140022429100006629f4509c16ca2180bc99a876c118a80a44c7565193ddd42c","observation_id":"0240fbeb-c308-44f8-b170-4b17c87a7776","resolution":{"observed_at":"2026-08-07T13:49:16.392379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:15.841561Z","title":"Restructuring vector quantization with the rotation trick,","venue":null,"work_id":"b0de63c4-e4cb-4b6f-950f-a05b299e62b2","year":2025},"citing_paper":{"arxiv_id":"2505.20868","last_updated":"2025-06-29T12:42:04Z","snapshot_observed_at":"2026-08-07T13:43:23.646436Z","submitted_at":"2025-05-27T08:20:01Z","title":"Spotlight-TTS: Spotlighting the Style via Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:11.506769Z"},"links":{"citing_paper":"/paper/2505.20868"},"observation_digest":"sha256:821cc0871d47ff6bd1c67ed06326f94edb2dbac7c09bb55a9e518e77d83df0b8","observation_id":"97400640-9587-4f5a-a7f1-440d9a240ea3","resolution":{"observed_at":"2026-08-07T13:49:15.976189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:15.523426Z","title":"Autoregres- sive image generation using residual quantization,","venue":null,"work_id":"144a97fc-3076-4489-bfd1-05416388b9b3","year":2022},"citing_paper":{"arxiv_id":"2505.20868","last_updated":"2025-06-29T12:42:04Z","snapshot_observed_at":"2026-08-07T13:43:23.646436Z","submitted_at":"2025-05-27T08:20:01Z","title":"Spotlight-TTS: Spotlighting the Style via Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:11.631850Z"},"links":{"citing_paper":"/paper/2505.20868"},"observation_digest":"sha256:d5b88fec311fb775b18af6ffbf09d98340d6c6221e17d2bf15eaad13c01c0a71","observation_id":"99691b28-48f4-4916-9eb4-a0ca2170a121","resolution":{"observed_at":"2026-08-07T13:49:15.694669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:15.282520Z","title":"A convnet for the 2020s,","venue":null,"work_id":"bb6ad8b3-4569-4e49-b97f-c7dfb2b0adb5","year":2022},"citing_paper":{"arxiv_id":"2505.20868","last_updated":"2025-06-29T12:42:04Z","snapshot_observed_at":"2026-08-07T13:43:23.646436Z","submitted_at":"2025-05-27T08:20:01Z","title":"Spotlight-TTS: Spotlighting the Style via Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:11.753822Z"},"links":{"citing_paper":"/paper/2505.20868"},"observation_digest":"sha256:60986f0d2377a1c66a9cc81b807ee35787ce6754a45b4326342c13dbcae86698","observation_id":"1fe9ced6-5848-4c35-96ab-7802f53d7094","resolution":{"observed_at":"2026-08-07T13:49:15.396367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:15.012324Z","title":"Cross-speaker emotion disentangling and transfer for end-to-end speech synthe- sis,","venue":null,"work_id":"fb396853-6f3b-4fa4-9fa5-ec4a31cde761","year":2022},"citing_paper":{"arxiv_id":"2505.20868","last_updated":"2025-06-29T12:42:04Z","snapshot_observed_at":"2026-08-07T13:43:23.646436Z","submitted_at":"2025-05-27T08:20:01Z","title":"Spotlight-TTS: Spotlighting the Style via Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:11.920312Z"},"links":{"citing_paper":"/paper/2505.20868"},"observation_digest":"sha256:49292dfbba32a55d65ae45004dc1f0751e3e186dd64e12213980d33ae4d8a5b8","observation_id":"c1aa1b80-3cd3-4629-a678-65b6d0716cff","resolution":{"observed_at":"2026-08-07T13:49:15.126563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:14.687746Z","title":"Bigvgan: A universal neural vocoder with large-scale training,","venue":null,"work_id":"6b7590b5-37f5-472e-9f74-c9e3714abd7c","year":2023},"citing_paper":{"arxiv_id":"2505.20868","last_updated":"2025-06-29T12:42:04Z","snapshot_observed_at":"2026-08-07T13:43:23.646436Z","submitted_at":"2025-05-27T08:20:01Z","title":"Spotlight-TTS: Spotlighting the Style via Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:12.102402Z"},"links":{"citing_paper":"/paper/2505.20868"},"observation_digest":"sha256:482e08d3b112cb7f01e6e65481a048c4317c71f864fedc4a7b62ef48a959f6e2","observation_id":"7a4cec8a-bac5-435d-a068-c5191f12d452","resolution":{"observed_at":"2026-08-07T13:49:14.856896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:14.402107Z","title":"Syntaspeech: Syntax- aware generative adversarial text-to-speech,","venue":null,"work_id":"05208d81-04c0-4426-801a-6e0869eacb19","year":2022},"citing_paper":{"arxiv_id":"2505.20868","last_updated":"2025-06-29T12:42:04Z","snapshot_observed_at":"2026-08-07T13:43:23.646436Z","submitted_at":"2025-05-27T08:20:01Z","title":"Spotlight-TTS: Spotlighting the Style via Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:12.273643Z"},"links":{"citing_paper":"/paper/2505.20868"},"observation_digest":"sha256:c50ecede51ea8ad3ae682c82dc35256fd1e7b69bb4a77df75786792ade796e36","observation_id":"9f0c0508-fd77-48f2-978e-a74fed2f6b3d","resolution":{"observed_at":"2026-08-07T13:49:14.520036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:12.414577Z","title":"Emotional voice con- version: Theory, databases and esd,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20868","last_updated":"2025-06-29T12:42:04Z","snapshot_observed_at":"2026-08-07T13:43:23.646436Z","submitted_at":"2025-05-27T08:20:01Z","title":"Spotlight-TTS: Spotlighting the Style via Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:12.414577Z"},"links":{"citing_paper":"/paper/2505.20868"},"observation_digest":"sha256:3fb1fee4ea5b7c95805751179ede9eb37f452290c9ddfffc09f0198bfff258b0","observation_id":"7c89230c-00db-4818-a6cc-7e7873e10f0b","resolution":{"observed_at":"2026-08-07T13:49:12.414577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:12.573452Z","title":"Decoupled weight decay regulariza- tion,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.20868","last_updated":"2025-06-29T12:42:04Z","snapshot_observed_at":"2026-08-07T13:43:23.646436Z","submitted_at":"2025-05-27T08:20:01Z","title":"Spotlight-TTS: Spotlighting the Style via Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:12.573452Z"},"links":{"citing_paper":"/paper/2505.20868"},"observation_digest":"sha256:772910771314236d66261b467f08047a6557d5313ff8ef8e045527af61303053","observation_id":"bb99b960-9367-4744-a57c-e39fcc39f562","resolution":{"observed_at":"2026-08-07T13:49:12.573452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-07-06T05:01:27.910364Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-07T13:49:12.683286Z","title":"Gaussian error linear units (gelus),","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.20868","last_updated":"2025-06-29T12:42:04Z","snapshot_observed_at":"2026-08-07T13:43:23.646436Z","submitted_at":"2025-05-27T08:20:01Z","title":"Spotlight-TTS: Spotlighting the Style via Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:12.683286Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2505.20868"},"observation_digest":"sha256:4e378d148aa9c73491c5e915cbded71c9337eabaa2f91c2c0bf2da5e1d9608f1","observation_id":"f854d94f-9b33-44f6-bdf1-248c9534ecb0","resolution":{"observed_at":"2026-08-07T13:49:12.683286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:12.837000Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.20868","last_updated":"2025-06-29T12:42:04Z","snapshot_observed_at":"2026-08-07T13:43:23.646436Z","submitted_at":"2025-05-27T08:20:01Z","title":"Spotlight-TTS: Spotlighting the Style via Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:12.837000Z"},"links":{"citing_paper":"/paper/2505.20868"},"observation_digest":"sha256:9256c79b6d5c4709cb5cf917a8ed66deeba166294045c068c14c2c510fb6b4b7","observation_id":"962890a7-b18b-4de6-bc54-d4d2fe32f05f","resolution":{"observed_at":"2026-08-07T13:49:12.837000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:14.035619Z","title":"Utmos: Utokyo-sarulab system for voicemos challenge 2022,","venue":null,"work_id":"0dac4e87-2a0c-481c-aadd-01dd1b5904fa","year":2022},"citing_paper":{"arxiv_id":"2505.20868","last_updated":"2025-06-29T12:42:04Z","snapshot_observed_at":"2026-08-07T13:43:23.646436Z","submitted_at":"2025-05-27T08:20:01Z","title":"Spotlight-TTS: Spotlighting the Style via Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:12.956194Z"},"links":{"citing_paper":"/paper/2505.20868"},"observation_digest":"sha256:f7fedad200507bd6253c64e833b66244eabf05e72b58a015a42868757cbcf8be","observation_id":"40934d75-70b6-4804-92c4-91e82b081f61","resolution":{"observed_at":"2026-08-07T13:49:14.186471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:13.774837Z","title":"Robust speech recognition via large-scale weak su- pervision,","venue":null,"work_id":"2a1d6033-cd2b-4d56-8c6c-030f5e4bb704","year":2023},"citing_paper":{"arxiv_id":"2505.20868","last_updated":"2025-06-29T12:42:04Z","snapshot_observed_at":"2026-08-07T13:43:23.646436Z","submitted_at":"2025-05-27T08:20:01Z","title":"Spotlight-TTS: Spotlighting the Style via Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:13.090584Z"},"links":{"citing_paper":"/paper/2505.20868"},"observation_digest":"sha256:223eb9d548d45287d04137f2cc737dd92ffecd16b514caff3cc636224ed8babd","observation_id":"28783661-d21c-4f50-ba61-08b5993018d3","resolution":{"observed_at":"2026-08-07T13:49:13.892653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:49:13.241404Z","title":"Wavlm: Large-scale self- supervised pre-training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20868","last_updated":"2025-06-29T12:42:04Z","snapshot_observed_at":"2026-08-07T13:43:23.646436Z","submitted_at":"2025-05-27T08:20:01Z","title":"Spotlight-TTS: Spotlighting the Style via Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:49:13.241404Z"},"links":{"citing_paper":"/paper/2505.20868"},"observation_digest":"sha256:0a2ad28f9b717df6e2faf744d166b81dcfb207c810aa9a2a9eb86e770bc22e01","observation_id":"5fa609b9-6ec7-4f85-9a93-9a2989fae3c2","resolution":{"observed_at":"2026-08-07T13:49:13.241404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.20868","last_updated":"2025-06-29T12:42:04Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T13:43:23.646436Z","submitted_at":"2025-05-27T08:20:01Z","title":"Spotlight-TTS: Spotlighting the Style via Voiced-Aware Style Extraction and Style Direction Adjustment for Expressive Text-to-Speech"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":0,"verified_fuzzy":29},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 1 inbound Pith citation observation for arXiv:2505.20868."}