{"as_of":"2026-08-07T10:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a859d3b1e4a6a16cf97b9ab16bfc3337b8c4fcdf2be8517809e5d7661aad717d","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T22:34:43.671787Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T15:21:28.848595Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-12T09:11:27.116919Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-05T22:34:40.328635Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"cited_work":{"arxiv_id":"2508.06890","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.06890","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Maestro-evc: Control- lable emotional voice conversion guided by references and explicit prosody","venue":null,"work_id":"22423099-a7f7-4f79-b5da-58c03cdc5b1b","year":2025},"citing_paper":{"arxiv_id":"2604.26347","last_updated":"2026-07-22T04:43:04Z","snapshot_observed_at":"2026-08-02T15:21:28.271483Z","submitted_at":"2026-04-29T06:59:48Z","title":"The False Resonance: A Critical Examination of Emotion Embedding Similarity for Speech Generation Evaluation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-07T12:34:40.888089Z"},"links":{"cited_paper":"/paper/2508.06890","citing_paper":"/paper/2604.26347"},"observation_digest":"sha256:47e269d3b769e675e87efd9467f1b8bc705540fdf695db7e87158bea4607b0dd","observation_id":"eddc379d-1f05-4fca-a08a-7a160911202c","resolution":{"observed_at":"2026-05-12T09:11:27.119312Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-05T22:34:40.328635Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.06890","snapshot_observed_at":"2026-08-02T15:21:28.848595Z","title":"Maestro-evc: Control- lable emotional voice conversion guided by references and explicit prosody,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.26347","last_updated":"2026-07-22T04:43:04Z","snapshot_observed_at":"2026-08-02T15:21:28.271483Z","submitted_at":"2026-04-29T06:59:48Z","title":"The False Resonance: A Critical Examination of Emotion Embedding Similarity for Speech Generation Evaluation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T15:21:28.848595Z"},"links":{"cited_paper":"/paper/2508.06890","citing_paper":"/paper/2604.26347"},"observation_digest":"sha256:7a65d90a88ec324768d0f543504abb75be25bab60f48800dc5a0e39ccb993a9f","observation_id":"0bae5d3c-20b9-4be2-9f76-b6bed6dfe19f","resolution":{"observed_at":"2026-08-02T15:21:28.848595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.06890/citation-record","integrity":"/paper/2508.06890/integrity","json":"/paper/2508.06890/citation-record.json","paper":"/paper/2508.06890"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:34:47.449314Z","title":"Emotional voice conversion: Theory, databases and esd,","venue":null,"work_id":"fa576abb-e83f-4e94-a623-caa764f7da11","year":2022},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-05T22:34:40.328635Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:41.120573Z"},"links":{"citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:78c6efe87571e2374cd489573cd41f966575d638c3fa8fd28af19afae4e473fb","observation_id":"20926e1c-a02b-4a11-8558-dec56b9999a8","resolution":{"observed_at":"2026-08-05T22:34:47.562774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:34:47.223551Z","title":"Training socially engaging robots: Modeling backchannel behaviors with batch reinforce- ment learning,","venue":null,"work_id":"348d0423-3e83-4476-9fe6-86b3f30ea2bc","year":2022},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-05T22:34:40.328635Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:41.210040Z"},"links":{"citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:7ebe5b257f7c06bb209a976fbf0db45ee5476bd3bff1b540284ea5e124e84954","observation_id":"9875e92b-cf54-4384-84e3-fa3d1fe0ddf1","resolution":{"observed_at":"2026-08-05T22:34:47.302187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:34:47.044124Z","title":"Real-time speech emotion analysis for smart home assistants,","venue":null,"work_id":"f2af7018-0d4a-4037-aa2e-9fe957f8bff6","year":2021},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-05T22:34:40.328635Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:41.279725Z"},"links":{"citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:88e18c4f97be7f2547a023695eaba49a5bbbf07c434f77524c753041f5c01219","observation_id":"569bbde1-c154-4d48-a233-e9dd585397c9","resolution":{"observed_at":"2026-08-05T22:34:47.140382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:34:46.829855Z","title":"Pittermann, A","venue":null,"work_id":"f8001ea9-4af0-42b2-a71b-e7c240f68f88","year":2010},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-05T22:34:40.328635Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:41.356713Z"},"links":{"citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:f4c17b46ee4a306ec1a0e9e70de83a444221c441ab2b058facad4883d2d37eed","observation_id":"799fd7fa-82b8-47cf-bfe5-052bae3554bf","resolution":{"observed_at":"2026-08-05T22:34:46.934170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:34:46.615315Z","title":"Toward artificial emotional intelligence for cooperative social human–machine interaction,","venue":null,"work_id":"3287cc7a-45ac-40e3-81de-184c271c8589","year":2019},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-05T22:34:40.328635Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:41.416266Z"},"links":{"citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:bb3e0ad5f4239bbcf065bdec9db2b41efbed1063e93027608597bc44a1d3d0d4","observation_id":"8056ebe5-a7fe-434a-88d9-2bf869e08d2b","resolution":{"observed_at":"2026-08-05T22:34:46.714801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:34:46.432182Z","title":"Pavits: Exploring prosody-aware vits for end-to-end emotional voice conversion,","venue":null,"work_id":"c6153727-09aa-4e50-ad13-9eac660f1bfc","year":2024},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-05T22:34:40.328635Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:41.491550Z"},"links":{"citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:7bc1aea89cec303038275ecf78a36803b0d9858edb05239e67587cdc0368af43","observation_id":"d084a43a-46cc-4540-9571-8507a4873817","resolution":{"observed_at":"2026-08-05T22:34:46.519963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.07025","last_updated":"2020-10-13T06:07:16Z","snapshot_observed_at":"2026-07-06T09:20:20.582899Z","submitted_at":"2020-05-13T13:36:34Z","title":"Converting Anyone's Emotion: Towards Speaker-Independent Emotional Voice Conversion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.07025","snapshot_observed_at":"2026-08-05T22:34:41.548368Z","title":"Converting anyone’s emotion: Towards speaker-independent emotional voice conversion,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-05T22:34:40.328635Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:41.548368Z"},"links":{"cited_paper":"/paper/2005.07025","citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:eed719172643a2d9f39eb63ac8ceb0a2c6924ebd92ea3ae24a3a756101cea280","observation_id":"96917dc9-93b3-41d0-8a24-bdb7d82010c2","resolution":{"observed_at":"2026-08-05T22:34:41.548368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.16809","last_updated":"2021-06-09T05:17:55Z","snapshot_observed_at":"2026-08-07T00:17:27.334844Z","submitted_at":"2021-03-31T04:56:14Z","title":"Limited Data Emotional Voice Conversion Leveraging Text-to-Speech: Two-stage Sequence-to-Sequence Training","version":2},"cited_work":{"arxiv_id":"2103.16809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2103.16809","snapshot_observed_at":"2026-08-05T22:34:43.980348Z","title":"Limited Data Emotional Voice Conversion Leveraging Text-to-Speech: Two-stage Sequence-to-Sequence Training","venue":"cs.CL","work_id":"72259b49-1df0-443e-976f-3f4b4a551323","year":2021},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-05T22:34:40.328635Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:41.607221Z"},"links":{"cited_paper":"/paper/2103.16809","citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:6b7b1fa63d55a1186db20d3d80435e1fb6e53e95e7a07c803a540910c6950c1c","observation_id":"ad683cd8-97c3-4caa-a811-83c1199a57a7","resolution":{"observed_at":"2026-08-05T22:34:44.023541Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:34:46.265583Z","title":"Emotion inten- sity and its control for emotional voice conversion,","venue":null,"work_id":"4ced290d-3c10-4e97-965f-0c704bdab580","year":2022},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-05T22:34:40.328635Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:41.694838Z"},"links":{"citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:97fc560e8ccf65e90f9e5aca8b23fa2be5e50748526cfc7fde99e40e25589635","observation_id":"aad03414-d5f0-44cd-9fcf-45afb8ed88bf","resolution":{"observed_at":"2026-08-05T22:34:46.358372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:34:46.132504Z","title":"Seen and unseen emotional style transfer for voice conversion with a new emotional speech dataset,","venue":null,"work_id":"5419a400-365c-4acc-af3c-06e1cf60409e","year":2021},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-05T22:34:40.328635Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:41.760599Z"},"links":{"citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:252dc1f5dd7da45c50684649344edb6419e3d70ccd0b4eda823eef646b4692b3","observation_id":"6b2b43b0-48cb-49d9-9acc-10fe9346ae3e","resolution":{"observed_at":"2026-08-05T22:34:46.193432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:34:45.923402Z","title":"Emotional voice conversion with semi-supervised generative modeling,","venue":null,"work_id":"4dde3828-8c48-48af-9a21-4627205036f2","year":2023},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-05T22:34:40.328635Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:41.783931Z"},"links":{"citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:7232dd6634f2237720f0b324213d962066f68b46fb35c77f1506a008fa0d0973","observation_id":"211ee3b7-2bc4-4751-9f7a-1e7d739a6f16","resolution":{"observed_at":"2026-08-05T22:34:46.024775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:34:45.768100Z","title":"Speaker-independent emotional voice conversion via disentangled rep- resentations,","venue":null,"work_id":"b4ba684a-c848-4dac-8eb2-dc68b103dee3","year":2022},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-05T22:34:40.328635Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:41.859084Z"},"links":{"citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:1b24ce00c5dd94c5526fe242af981e4b66dbdb024dfc0063180e32647f8c282d","observation_id":"7bd4e329-4d2b-4c5a-909d-00d088e033f0","resolution":{"observed_at":"2026-08-05T22:34:45.844240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:34:45.573074Z","title":"Nonparallel emotional voice conversion for unseen speaker-emotion pairs using dual domain adversarial network & virtual domain pairing,","venue":null,"work_id":"eb9a8f6a-b7c3-43f5-9bec-cc870e7cf725","year":2023},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-05T22:34:40.328635Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:41.941417Z"},"links":{"citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:f87adb792992660c0ff65225620c8a2c3ef82481d2875a865c5e705605b77490","observation_id":"e9bc8915-48d1-43f4-8959-3a690a7847f4","resolution":{"observed_at":"2026-08-05T22:34:45.664702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:34:45.376774Z","title":"Enhancing zero- shot emotional voice conversion via speaker adaptation and duration prediction,","venue":null,"work_id":"d6274dc7-1144-477c-9300-9ae13b07114b","year":2025},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-05T22:34:40.328635Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:42.000189Z"},"links":{"citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:d447b804c2a12d19b1b7e22772b77519e8ac8b987e2ee4c04cd5c56be157d46f","observation_id":"ba414906-ff95-4c66-8f02-5c0bf5a27a81","resolution":{"observed_at":"2026-08-05T22:34:45.493477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:34:45.123529Z","title":"Zero shot audio to audio emotion trans- fer with speaker disentanglement,","venue":null,"work_id":"27fae8dc-8283-4cca-a1f9-2b272c1c0b14","year":2024},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-05T22:34:40.328635Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:42.115007Z"},"links":{"citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:4b2aa4ef2a6761e9c9714a86ca5b75bec385b6bce016fba1514a8e9184ad2ddb","observation_id":"20bdcbc9-46bd-41a1-b92b-881aaaa60d92","resolution":{"observed_at":"2026-08-05T22:34:45.240270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:34:44.915319Z","title":"Multi-speaker emotional speech synthesis with fine-grained prosody modeling,","venue":null,"work_id":"0200c187-9104-4963-819c-d241929ff831","year":2021},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-05T22:34:40.328635Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:42.182480Z"},"links":{"citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:6dd770315728481e6522f47d56bf8e49cf3d47af844fc24d1961e4e77abc2bee","observation_id":"100315df-b02e-4db2-aff9-654018ffebb6","resolution":{"observed_at":"2026-08-05T22:34:45.027825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:34:42.258853Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-05T22:34:40.328635Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:42.258853Z"},"links":{"citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:29091e3be92622316e844c282e0c859cf38fefd4e48f0c0a6f36f1a3d9d18b82","observation_id":"9f1cda4b-3ec9-4fe2-86f8-a70cf40257b4","resolution":{"observed_at":"2026-08-05T22:34:42.258853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:34:42.325027Z","title":"Unsupervised domain adaptation by back- propagation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-05T22:34:40.328635Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:42.325027Z"},"links":{"citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:f1c7bb3fecca7f2d77cd9c34e224859ca111ea7f536114ec2a5601a17bd27a47","observation_id":"a11c8ce5-6338-410c-bcf9-cee006ee5a8a","resolution":{"observed_at":"2026-08-05T22:34:42.325027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:34:42.391019Z","title":"Hifi-gan: Generative adversarial networks for efficient and high fidelity speech synthesis,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-05T22:34:40.328635Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:42.391019Z"},"links":{"citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:83d6bcb8a69f07c829189905f23f8001cab172e7cfc4a1cfab418142319ac3cf","observation_id":"bf6675bf-e40a-4b2a-8e66-d8c90f8f04e5","resolution":{"observed_at":"2026-08-05T22:34:42.391019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:34:44.732342Z","title":"Sef-vc: Speaker embedding free zero-shot voice conversion with cross attention,","venue":null,"work_id":"07cb163e-57d9-416d-b48a-5097cd17e7e2","year":2024},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-05T22:34:40.328635Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:42.453515Z"},"links":{"citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:2b946fb3e161e3f590f828528c529e3358ef4e38158fb54106a6a5fe22bc8273","observation_id":"801da7cb-fa6c-41af-8f11-f25e6968e1ea","resolution":{"observed_at":"2026-08-05T22:34:44.833308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07402","last_updated":"2022-12-13T14:12:02Z","snapshot_observed_at":"2026-08-05T21:50:11.152608Z","submitted_at":"2021-11-14T18:16:42Z","title":"Textless Speech Emotion Conversion using Discrete and Decomposed Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.07402","snapshot_observed_at":"2026-08-05T22:34:42.520181Z","title":"Textless speech emotion conversion using discrete and decomposed representations,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-05T22:34:40.328635Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:42.520181Z"},"links":{"cited_paper":"/paper/2111.07402","citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:bf445e49becaf3151bd2fd7d72d4de8825c99598cfc15506ee6e093fa1bedfe5","observation_id":"be03c332-48be-41df-aaaf-f72c62f3b4fe","resolution":{"observed_at":"2026-08-05T22:34:42.520181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:34:42.593208Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-05T22:34:40.328635Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:42.593208Z"},"links":{"citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:e5cff942b518461ff65330ce630c05cc083e251d30412075f2390aaaebd76573","observation_id":"fb2b3f2e-cacf-44d5-b267-4036f96cc59d","resolution":{"observed_at":"2026-08-05T22:34:42.593208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:34:44.544544Z","title":"Speech emotion diarization: Which emotion appears when?","venue":null,"work_id":"562b8436-5a96-4f32-95fa-ccac6abc9e51","year":2023},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-05T22:34:40.328635Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:42.701389Z"},"links":{"citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:6d69eb1194c4e8a58408cf60a4be7cdc00067105431c606889d3b3275f7995c3","observation_id":"00cac1e2-1a7e-484f-9e59-5dc1273d5a1d","resolution":{"observed_at":"2026-08-05T22:34:44.612588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:34:44.467693Z","title":"Smoothing and differentiation of data by simplified least squares procedures","venue":null,"work_id":"07167e6d-3648-451a-a3f9-0678be818a51","year":1964},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-05T22:34:40.328635Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:42.785584Z"},"links":{"citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:597f14e8d5a6c12204480aa7e080582eb522e52b3484a0cdd03cadad69df9143","observation_id":"4643191f-1620-45d5-be46-ab5cccd2a862","resolution":{"observed_at":"2026-08-05T22:34:44.501286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.10326","last_updated":"2022-07-21T05:10:48Z","snapshot_observed_at":"2026-08-05T01:15:39.596807Z","submitted_at":"2021-10-20T00:49:02Z","title":"Disentanglement of Emotional Style and Speaker Identity for Expressive Voice Conversion","version":2},"cited_work":{"arxiv_id":"2110.10326","doi":null,"metadata_source":"pith","pith_arxiv_id":"2110.10326","snapshot_observed_at":"2026-08-05T22:34:43.796835Z","title":"Disentanglement of Emotional Style and Speaker Identity for Expressive Voice Conversion","venue":"eess.AS","work_id":"4b925393-4c97-46c0-bd15-1ccc08117e51","year":2021},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-05T22:34:40.328635Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:42.870526Z"},"links":{"cited_paper":"/paper/2110.10326","citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:0048ed05068b5b22c08edc25ae563f067141775a3a953a4e52b3977f91b90863","observation_id":"9b6dc289-b4f0-4549-9aa6-dc52a1638dda","resolution":{"observed_at":"2026-08-05T22:34:43.870586Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.07143","last_updated":"2020-08-10T13:50:24Z","snapshot_observed_at":"2026-08-07T04:59:40.648353Z","submitted_at":"2020-05-14T17:02:15Z","title":"ECAPA-TDNN: Emphasized Channel Attention, Propagation and Aggregation in TDNN Based Speaker Verification","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.07143","snapshot_observed_at":"2026-08-05T22:34:42.929455Z","title":"Ecapa-tdnn: Em- phasized channel attention, propagation and aggregation in tdnn based speaker verification,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-05T22:34:40.328635Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:42.929455Z"},"links":{"cited_paper":"/paper/2005.07143","citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:7b47cbf9b15d243194cee80ba9af282e08eec08f987f970f4104d3ee91b4f634","observation_id":"a65bb56f-2d89-4a1d-acc0-5cc8eac11491","resolution":{"observed_at":"2026-08-05T22:34:42.929455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:34:42.988717Z","title":"Librispeech: an asr corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-05T22:34:40.328635Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:42.988717Z"},"links":{"citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:2d93a7143f505aec3ffc315119a28281a5fb29d422916a62e4de9a6e7d2d0bb5","observation_id":"0a3eed7f-de8c-4bad-a880-dc9c14addb56","resolution":{"observed_at":"2026-08-05T22:34:42.988717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.08612","last_updated":"2018-05-30T06:52:06Z","snapshot_observed_at":"2026-08-02T05:48:34.226234Z","submitted_at":"2017-06-26T21:42:27Z","title":"VoxCeleb: a large-scale speaker identification dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.08612","snapshot_observed_at":"2026-08-05T22:34:43.077499Z","title":"V oxceleb: a large-scale speaker identification dataset,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-05T22:34:40.328635Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:43.077499Z"},"links":{"cited_paper":"/paper/1706.08612","citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:8bb3b2db49d2f980ebbebd98d9e994215d7f7d35b966ca0dbf7bd9823752fd97","observation_id":"8194931f-49f6-4562-b8c8-9f7815849fbf","resolution":{"observed_at":"2026-08-05T22:34:43.077499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:34:43.132364Z","title":"World: a vocoder-based high-quality speech synthesis system for real-time applications,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-05T22:34:40.328635Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:43.132364Z"},"links":{"citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:29a0ad8caa317245027df55e72aa21dfded439c68aaa6701e9a7aa3f5748e6ec","observation_id":"e316a941-445a-4437-aca8-b5ff72e5b0ce","resolution":{"observed_at":"2026-08-05T22:34:43.132364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:34:44.312862Z","title":"CSTR VCTK Corpus: English multi-speaker corpus for CSTR voice cloning toolkit,","venue":null,"work_id":"2dd08430-b755-4328-be93-2f2b5848be81","year":2017},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-05T22:34:40.328635Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:43.226294Z"},"links":{"citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:300fb5efe53d3a84a94f809e7c6d0c3c00c9365f66d5e5a1a487f89089c43f62","observation_id":"8545e167-d0ec-48e0-8495-0f55808c1266","resolution":{"observed_at":"2026-08-05T22:34:44.378234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:34:43.313933Z","title":"Crema-d: Crowd-sourced emotional multimodal actors dataset,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-05T22:34:40.328635Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:43.313933Z"},"links":{"citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:899f0bb6febbda76b3416e87cbdc9fbbcab6c369d41ba936d10293fc1feaa73b","observation_id":"6e0497cd-f0cf-4150-acd0-997ad90397e5","resolution":{"observed_at":"2026-08-05T22:34:43.313933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:34:43.377951Z","title":"Iemocap: Interactive emotional dyadic motion capture database,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-05T22:34:40.328635Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:43.377951Z"},"links":{"citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:5bf5b8cb5fe05be639a2d29e963a7f01380ad36099aa6f060de1cb7256543250","observation_id":"f8e74ea5-68c6-46db-b60d-59dcc73f5f55","resolution":{"observed_at":"2026-08-05T22:34:43.377951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:34:43.467839Z","title":"Robust speech recognition via large-scale weak supervi- sion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-05T22:34:40.328635Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:43.467839Z"},"links":{"citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:6983c0e26b4782a88973d39282421552991eb386e67008fc07f5ac9c1c70493c","observation_id":"76398b06-ef06-4cd6-8449-401c4d65e55c","resolution":{"observed_at":"2026-08-05T22:34:43.467839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-05T01:11:36.813583Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-08-05T22:34:43.524538Z","title":"emotion2vec: Self-supervised pre-training for speech emotion repre- sentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-05T22:34:40.328635Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:43.524538Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:d74d339fe3b08bc6c1e2208a1f6c454eedd757af34e72605cbf38d30ecd31405","observation_id":"f5dcc674-87c2-4a7e-a7b8-417df35ec02d","resolution":{"observed_at":"2026-08-05T22:34:43.524538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:34:43.593809Z","title":"Pearson correlation coefficient,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-05T22:34:40.328635Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:43.593809Z"},"links":{"citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:4aed11685267aa7ac2d2bb982b0ebdcb9027768efd7a0cb54dc28692b89c04bf","observation_id":"806a96a9-e1d7-4f86-9e2e-4f1b10d5b70f","resolution":{"observed_at":"2026-08-05T22:34:43.593809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:34:44.144966Z","title":"Dynamic time warping,","venue":null,"work_id":"756bd6ab-d09b-4c52-bba9-6288afe63606","year":2007},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-05T22:34:40.328635Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:43.671787Z"},"links":{"citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:cc8ec8dbd81f516f140be480ceb2fcb214afe31b4f2e64e8f80272077512683e","observation_id":"b15cd2ad-0f72-4282-99ab-f5e65f92e585","resolution":{"observed_at":"2026-08-05T22:34:44.198017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-05T22:34:40.328635Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":2,"verified_fuzzy":19},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 2 inbound Pith citation observations for arXiv:2508.06890."}