{"as_of":"2026-08-07T23:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9786a09586e285bd5ba49aede218968c8c9d3fe586551f52290d8c73c08a57d2","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:49:29.571097Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.16310/citation-record","integrity":"/paper/2506.16310/integrity","json":"/paper/2506.16310/citation-record.json","paper":"/paper/2506.16310"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1806.04558","last_updated":"2019-01-02T19:00:05Z","snapshot_observed_at":"2026-07-06T06:44:23.151579Z","submitted_at":"2018-06-12T14:29:22Z","title":"Transfer Learning from Speaker Verification to Multispeaker Text-To-Speech Synthesis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.04558","snapshot_observed_at":"2026-08-06T23:49:29.437114Z","title":"Transfer learning from speaker verification to multispeaker text-to-speech synthesis","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-06T23:41:50.460992Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.437114Z"},"links":{"cited_paper":"/paper/1806.04558","citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:f9f34abd70062e63b5147e61cf81369eaa569c4b016feb3e87f9ae47a2e9e610","observation_id":"ebe006ce-447c-44de-9feb-4a5333e79cd3","resolution":{"observed_at":"2026-08-06T23:49:29.437114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15749","last_updated":"2023-05-25T05:57:54Z","snapshot_observed_at":"2026-08-07T04:02:26.840514Z","submitted_at":"2023-05-25T05:57:54Z","title":"Multilingual Text-to-Speech Synthesis for Turkic Languages Using Transliteration","version":1},"cited_work":{"arxiv_id":"2305.15749","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.15749","snapshot_observed_at":"2026-08-06T23:49:29.743499Z","title":"Multilingual Text-to-Speech Synthesis for Turkic Languages Using Transliteration","venue":"eess.AS","work_id":"b4b38f38-e8d6-4f54-9bc1-653bb40a99fe","year":2023},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-06T23:41:50.460992Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.442444Z"},"links":{"cited_paper":"/paper/2305.15749","citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:be8351ec6e8defed6e9ccb6cfe0d77b0a9edbd6488db50b0feb7d5eb340edfeb","observation_id":"971d7b1b-3bd1-4f90-9883-07ee08c0dfbb","resolution":{"observed_at":"2026-08-06T23:49:29.747496Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:29.972402Z","title":"Accented text-to-speech synthesis with limited data","venue":null,"work_id":"24e6b2c0-f720-4226-ac84-4e5b84084b1e","year":2024},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-06T23:41:50.460992Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.447162Z"},"links":{"citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:d170b74342089cab5ef4f37f791df6cf074c9fab591cdcbe9f1c94e1ac487e11","observation_id":"29d3b487-0610-4ad1-a01a-a4193c108122","resolution":{"observed_at":"2026-08-06T23:49:29.975954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10844","last_updated":"2025-01-01T09:33:02Z","snapshot_observed_at":"2026-08-06T15:31:07.451221Z","submitted_at":"2024-06-16T08:34:22Z","title":"Multi-Scale Accent Modeling and Disentangling for Multi-Speaker Multi-Accent Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10844","snapshot_observed_at":"2026-08-06T23:49:29.451391Z","title":"Multi-scale accent modeling with disen- tangling for multi-speaker multi-accent tts synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-06T23:41:50.460992Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.451391Z"},"links":{"cited_paper":"/paper/2406.10844","citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:9823f7ba03a39eb796bcea20c4a4338c0e33ff77d221a856a5fdcc8ad6b7885d","observation_id":"920b7fc6-09cd-427f-a463-9fdf34ff948c","resolution":{"observed_at":"2026-08-06T23:49:29.451391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:29.961487Z","title":"Text to speech synthesis: A systematic review, deep learning based architecture and future research direction","venue":null,"work_id":"b0da4057-8404-4bbe-b806-248ed4c9c666","year":2022},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-06T23:41:50.460992Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.455540Z"},"links":{"citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:d3e755be3caae10883df2174b965cb869e32eadeb4bef129491eb5174f2515ee","observation_id":"47ff6157-599e-444a-819e-6833da8d3962","resolution":{"observed_at":"2026-08-06T23:49:29.965337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.04448","snapshot_observed_at":"2026-08-06T23:49:29.459675Z","title":"Weiss, Heiga Zen, Yonghui Wu, Zhifeng Chen, R","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-06T23:41:50.460992Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.459675Z"},"links":{"cited_paper":"/paper/1907.04448","citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:37cfc8745eafd327dab5878d855ad6d677a2d205d171950d21d4df56811fd331","observation_id":"d54c8481-fba0-4c4e-bfaa-35dfdcb78861","resolution":{"observed_at":"2026-08-06T23:49:29.459675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.15364","last_updated":"2022-10-27T12:23:41Z","snapshot_observed_at":"2026-08-01T23:28:04.973767Z","submitted_at":"2022-10-27T12:23:41Z","title":"Explicit Intensity Control for Accented Text-to-speech","version":1},"cited_work":{"arxiv_id":"2210.15364","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.15364","snapshot_observed_at":"2026-08-06T23:49:29.709157Z","title":"Explicit Intensity Control for Accented Text-to-speech","venue":"cs.SD","work_id":"17b0871b-8995-490e-8a12-069284ac07f7","year":2022},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-06T23:41:50.460992Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.464178Z"},"links":{"cited_paper":"/paper/2210.15364","citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:48e12c22f89a464aa9f776034c31e3888b81755f07f7088cc71d5cb339b7a010","observation_id":"df89730a-db25-4613-b7f7-a47a892e5ab5","resolution":{"observed_at":"2026-08-06T23:49:29.714136Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:29.951380Z","title":"Metts: Multilingual emotional text-to-speech by crossspeaker and cross-lingual emotion transfer","venue":null,"work_id":"a1b0f0ca-2a9a-4ea8-b9b3-7a8fe908d40f","year":2024},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-06T23:41:50.460992Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.468466Z"},"links":{"citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:f20d7ae3662357ffe92603335f5d41cd5fa09273f882a5fe805bd52958413fed","observation_id":"5e8dbce6-88b3-4d36-b716-3b27a1d2c191","resolution":{"observed_at":"2026-08-06T23:49:29.955066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08076","last_updated":"2024-06-12T10:51:29Z","snapshot_observed_at":"2026-08-07T22:13:12.391679Z","submitted_at":"2024-06-12T10:51:29Z","title":"VECL-TTS: Voice identity and Emotional style controllable Cross-Lingual Text-to-Speech","version":1},"cited_work":{"arxiv_id":"2406.08076","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.08076","snapshot_observed_at":"2026-08-06T23:49:29.694362Z","title":"VECL-TTS: Voice identity and Emotional style controllable Cross-Lingual Text-to-Speech","venue":"eess.AS","work_id":"0bdde181-565e-4a51-a9ca-db6a94b28315","year":2024},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-06T23:41:50.460992Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.472578Z"},"links":{"cited_paper":"/paper/2406.08076","citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:2412bb6df37a8d16ab7395251417a631e747494c6d9f37b62f0c5bdd675bd957","observation_id":"20a6c9e4-8d04-4f2d-8150-872813e44731","resolution":{"observed_at":"2026-08-06T23:49:29.698561Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:29.939102Z","title":"Ed-tts: Multi-scale emotion modeling using cross-domain emotion diarization for emotional speech synthesis","venue":null,"work_id":"80f68f84-8544-4658-a7eb-7b9ea118379c","year":2024},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-06T23:41:50.460992Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.477016Z"},"links":{"citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:3da6b00bc84d623e4612ac935806baf308451cfbbc0f97879756c5ee6e2568c0","observation_id":"7880117a-5808-4e96-b545-10976cb35ebc","resolution":{"observed_at":"2026-08-06T23:49:29.943579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:29.927902Z","title":"Advanced emotion and multi-speaker recognition with multilingual voicecloning in cross-cultural communication","venue":null,"work_id":"98a3163f-1d30-47a7-b2d7-85a552253104","year":2024},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-06T23:41:50.460992Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.480523Z"},"links":{"citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:8bd88fe5523c23f5aec69a566761ffdfb93261866e6a9d4cfcdf5b1565c97663","observation_id":"bd2c2e82-c8c7-44a1-8fcf-629fbb2b1d27","resolution":{"observed_at":"2026-08-06T23:49:29.931720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:29.915901Z","title":"Exploring cross-linguistic speech perception in hindi, english, and romance-language through temporal dynamics of neural activity, 2024","venue":null,"work_id":"3a9d29ac-5d37-48f3-80fe-ab8c0394c3fe","year":2024},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-06T23:41:50.460992Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.484546Z"},"links":{"citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:ae197735e56c52f25b60e93c7f8f79ad81ea4ff8e11e8db0d638369084df04ee","observation_id":"dd849131-7d3a-407f-b5ae-50fb7e6f93dc","resolution":{"observed_at":"2026-08-06T23:49:29.920182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:29.903477Z","title":"Diclet-tts: Diffusion model based crosslingual emotion transfer for text-to-speech—a study between english and mandarin","venue":null,"work_id":"9c15473d-4f08-42e2-832f-d25b9eadffce","year":2023},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-06T23:41:50.460992Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.488798Z"},"links":{"citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:b74cefcc7aa0e597fadf3b80d0db51895bf2b1d63505d9e818982fe5e0e9c9e1","observation_id":"19c876c8-5a23-41d5-bb2f-dc9f7763a6a9","resolution":{"observed_at":"2026-08-06T23:49:29.908216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:29.892872Z","title":"Diffsound: Discrete diffusion model for text-to-sound generation","venue":null,"work_id":"b510f4c6-2a03-4d96-a0f4-d9677add9fc9","year":2023},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-06T23:41:50.460992Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.492155Z"},"links":{"citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:4d3da5b85d11e7e82a0f5fce39b8b005436d72689ee858bd25a2901d6eb1cd6c","observation_id":"a8cd64e6-be47-4a18-b61f-a14dfebad091","resolution":{"observed_at":"2026-08-06T23:49:29.896557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-07-06T20:45:50.730195Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-06T23:49:29.495278Z","title":"Spark- tts: An efficient llm-based text-to-speech model with single-stream decoupled speech tokens","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-06T23:41:50.460992Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.495278Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:4d2fc9cd2d00403a8ce7e99a21bb053fd7fe2eb20dd301e828344395f3ca2fda","observation_id":"e5f9d465-6cd7-435c-bc08-08a9f234aa88","resolution":{"observed_at":"2026-08-06T23:49:29.495278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:29.882647Z","title":null,"venue":null,"work_id":"e194ba49-0da9-4c90-a553-4c2074e364b0","year":2020},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-06T23:41:50.460992Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.499193Z"},"links":{"citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:598c0dce7189aa530fd4c278e756cc1f8602153df91ec31cbded2bba40f9f263","observation_id":"f41d8e28-e5b0-41e3-87f7-34b7d5f33d4a","resolution":{"observed_at":"2026-08-06T23:49:29.886317Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01912","last_updated":"2024-02-02T21:29:34Z","snapshot_observed_at":"2026-07-06T17:24:41.012207Z","submitted_at":"2024-02-02T21:29:34Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01912","snapshot_observed_at":"2026-08-06T23:49:29.502416Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-06T23:41:50.460992Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.502416Z"},"links":{"cited_paper":"/paper/2402.01912","citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:765ae994e48cf8f32ddc4b6c94ee71e297eb51f1a6e3bc6104ec6a80a4e57cfb","observation_id":"de9f7812-7aa8-4c1b-ba5a-0257ba1e96db","resolution":{"observed_at":"2026-08-06T23:49:29.502416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-06T23:49:29.506899Z","title":"Gemma 2: Improving open language models at a practical size","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-06T23:41:50.460992Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.506899Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:2a7dbeeff4d716a55a495e5848c1b56d7ccd0fbe28135beecc9e57217bd5b487","observation_id":"9033d180-b44d-471d-861a-7e8e189f475f","resolution":{"observed_at":"2026-08-06T23:49:29.506899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:29.871513Z","title":"Scaling instruction-finetuned language models","venue":null,"work_id":"8b2f1bd4-94a2-4c3e-8cfd-de873233bf9c","year":2024},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-06T23:41:50.460992Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.510659Z"},"links":{"citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:28a8a70bd750b74e330e23c2086ab8bb1a92bf1e972e7f1b71c454ca10e5696a","observation_id":"1008a2d7-3253-410f-b560-762ac16eaa49","resolution":{"observed_at":"2026-08-06T23:49:29.875844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:29.861135Z","title":"Gomez, Łukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":"dbac2b8c-836f-4c20-b6ab-cd85cead84ef","year":2017},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-06T23:41:50.460992Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.514100Z"},"links":{"citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:a829e08245f3a9645617067d60df5fcc77c333be4d004f0bf696687f3ba18c8b","observation_id":"fd193622-ef5f-4b4b-8d33-457b2016e3ad","resolution":{"observed_at":"2026-08-06T23:49:29.864633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:29.518046Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-06T23:41:50.460992Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.518046Z"},"links":{"citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:32ad3963eaa506f35f0cdad83449e2a31fd32d91eec28d5f2251c1a57617e5a1","observation_id":"ef18d909-9835-4e85-99a3-c1b9d7812b1b","resolution":{"observed_at":"2026-08-06T23:49:29.518046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05708","last_updated":"2023-06-12T06:12:41Z","snapshot_observed_at":"2026-07-06T15:40:39.214427Z","submitted_at":"2023-06-09T07:02:43Z","title":"Boosting Fast and High-Quality Speech Synthesis with Linear Diffusion","version":2},"cited_work":{"arxiv_id":"2306.05708","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.05708","snapshot_observed_at":"2026-08-06T23:49:29.651314Z","title":"Boosting Fast and High-Quality Speech Synthesis with Linear Diffusion","venue":"cs.SD","work_id":"06599131-6902-4fcf-996f-c81dde439592","year":2023},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-06T23:41:50.460992Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.521494Z"},"links":{"cited_paper":"/paper/2306.05708","citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:5e0a923fa50f1ed52852d6fafa7a76b3aec7df09984e1992116a64e6789d7556","observation_id":"bc68924d-7453-4089-a094-8cbcf40cb3d0","resolution":{"observed_at":"2026-08-06T23:49:29.655936Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12867","last_updated":"2025-08-13T11:23:57Z","snapshot_observed_at":"2026-08-07T16:01:29.916688Z","submitted_at":"2025-04-17T11:50:04Z","title":"EmoVoice: LLM-based Emotional Text-To-Speech Model with Freestyle Text Prompting","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12867","snapshot_observed_at":"2026-08-06T23:49:29.525601Z","title":"Emovoice: Llm-based emotional textto-speech model with freestyle text prompting","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-06T23:41:50.460992Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.525601Z"},"links":{"cited_paper":"/paper/2504.12867","citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:e428faa04f83af6994aca9a5f5007bb89e9ae9d8fda07e97fe0a8fc1b0eaac83","observation_id":"078c576c-a685-4c0e-aee4-d2d6c75b4979","resolution":{"observed_at":"2026-08-06T23:49:29.525601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14642","last_updated":"2024-11-22T00:21:39Z","snapshot_observed_at":"2026-07-06T19:54:05.139608Z","submitted_at":"2024-11-22T00:21:39Z","title":"VQalAttent: a Transparent Speech Generation Pipeline based on Transformer-learned VQ-VAE Latent Space","version":1},"cited_work":{"arxiv_id":"2411.14642","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.14642","snapshot_observed_at":"2026-08-06T23:49:29.628563Z","title":"VQalAttent: a Transparent Speech Generation Pipeline based on Transformer-learned VQ-VAE Latent Space","venue":"cs.LG","work_id":"2d82e0d3-cff6-416c-b001-c26bace6f9fb","year":2024},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-06T23:41:50.460992Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.529419Z"},"links":{"cited_paper":"/paper/2411.14642","citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:7bd7be9fae487c3febe0e6a858ef13dd3cfc911606970cf06c1f9fcefb2b5abe","observation_id":"efab0454-8e62-4597-848d-b261c2b3ca66","resolution":{"observed_at":"2026-08-06T23:49:29.632522Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:29.842484Z","title":"Indicvoices-r: Unlocking a massive multilingual multi- speaker speech corpus for scaling indian tts.Advances in Neural Information Processing Systems, 37:68161–68182, 2024","venue":null,"work_id":"d3cad2a7-d1a7-4529-8898-8cdb15ae2485","year":2024},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-06T23:41:50.460992Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.533636Z"},"links":{"citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:7418c7fc6b3c8b43c333cbe6e07c549684ad370f0bf7800abd1a6d3736fe2c16","observation_id":"1b137f2d-3da4-4bd3-bdc5-b51002fe3da3","resolution":{"observed_at":"2026-08-06T23:49:29.846905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03706","last_updated":"2022-03-07T21:13:54Z","snapshot_observed_at":"2026-08-05T08:24:50.761606Z","submitted_at":"2022-03-07T21:13:54Z","title":"Detection of AI Synthesized Hindi Speech","version":1},"cited_work":{"arxiv_id":"2203.03706","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.03706","snapshot_observed_at":"2026-08-06T23:49:29.610702Z","title":"Detection of AI Synthesized Hindi Speech","venue":"cs.SD","work_id":"fe9debc5-6fa2-4bef-b11e-d7642b2b3e07","year":2022},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-06T23:41:50.460992Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.537409Z"},"links":{"cited_paper":"/paper/2203.03706","citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:fb8007d0ec8660866ab6cd2d572eb83acbe7f41566d55b93f097ccd25c98a266","observation_id":"d127df31-9e6b-4ac6-b1e9-93cfc094045c","resolution":{"observed_at":"2026-08-06T23:49:29.616820Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-05T01:11:36.813583Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-08-06T23:49:29.542314Z","title":"emotion2vec: Self-supervised pre-training for speech emotion representation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-06T23:41:50.460992Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.542314Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:c2e82b1d31d7f1a84ade0d580b3c5031f0258a62c38197aae172a90c6de7cbca","observation_id":"eb7ebb49-ba2d-4e51-805d-2b1b66e5e02f","resolution":{"observed_at":"2026-08-06T23:49:29.542314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:29.831033Z","title":"Falk, Vijay Parsa, Joao F","venue":null,"work_id":"b6017d99-1981-474b-a67e-123977e83d10","year":2015},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-06T23:41:50.460992Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.546432Z"},"links":{"citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:cfb985fd9b1d8c7310a2f7714d1ea130e6fafcff65aba3f3f136178d6e8e972d","observation_id":"2aabb818-a70c-443e-8bb9-0b0ca4a62248","resolution":{"observed_at":"2026-08-06T23:49:29.835195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:29.818878Z","title":"Timothy Bunnell, Ying Dou, Prasanna Kumar Muthukumar, Daniel Perry, Kishore Prahallad, Callie Vaughn, Alan W","venue":null,"work_id":"5e936405-092b-400f-a308-fc54c1ef0fc3","year":2012},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-06T23:41:50.460992Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.550208Z"},"links":{"citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:d4025bfca0157b0fe3f1d0be2454410cc9799bab787919023f07469941bf3c7b","observation_id":"11e49698-7005-4c6d-adbf-3f493b4ebbd4","resolution":{"observed_at":"2026-08-06T23:49:29.824203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:29.807186Z","title":"Stuck in the mos pit: A critical analysis of mos test methodology in tts evaluation","venue":null,"work_id":"02b91845-4065-4f89-97ec-35f439db4338","year":2023},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-06T23:41:50.460992Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.554359Z"},"links":{"citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:e0680d2b3f754807112f832635f42cc552aa0f47ffe233b18716c5f05e7ef70f","observation_id":"eddc7b06-f3ce-43c3-8754-7511103a3333","resolution":{"observed_at":"2026-08-06T23:49:29.811586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:29.797045Z","title":"The limits of the mean opinion score for speech synthesis evaluation","venue":null,"work_id":"8d2cae85-960d-4262-9409-b01d4c546ae6","year":2024},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-06T23:41:50.460992Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.558358Z"},"links":{"citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:0a9abe4cafda21cbe96f805374d4a6bc55cf22f46470813f243bf9d96943bb3c","observation_id":"68833200-e53d-4d17-83ac-50bb022f34cf","resolution":{"observed_at":"2026-08-06T23:49:29.800445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:29.786592Z","title":"Rix, John G","venue":null,"work_id":"6c6ed892-1e60-4fa4-8fdf-587008a1a9f0","year":2001},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-06T23:41:50.460992Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.562370Z"},"links":{"citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:9b38a187e3e7a806c2b80a33fa772ffad786c111402b8ef7b585b4083fad245e","observation_id":"297a7558-60d5-462b-9fe7-77f624c4ce51","resolution":{"observed_at":"2026-08-06T23:49:29.790105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:29.775744Z","title":"Identification and classification of tts intelligibility errors using asr: A method for automatic evaluation of speech intelligibility, 2023","venue":null,"work_id":"ba501fe7-d471-4433-a98c-7d38c76d3087","year":2023},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-06T23:41:50.460992Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.566649Z"},"links":{"citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:41a87cc7698b23bc258ff93383f93d6dbaa1aa254641609467d4908f34359175","observation_id":"08e37f5d-0fdb-43c8-9658-0220a89a31d2","resolution":{"observed_at":"2026-08-06T23:49:29.779438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:49:29.764855Z","title":"Tracey, D","venue":null,"work_id":"ec18154f-86f0-40cb-bfbb-b7bbd51bb5ae","year":2023},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-06T23:41:50.460992Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.571097Z"},"links":{"citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:8f80cb1ff0045876deedce5d3960ead3d526725921877c378c8d62d159393f00","observation_id":"18ec435c-4c8a-44ca-bc48-8b0c888cb697","resolution":{"observed_at":"2026-08-06T23:49:29.768602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T23:41:50.460992Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":6,"verified_fuzzy":18},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 0 inbound Pith citation observations for arXiv:2506.16310."}