{"as_of":"2026-08-09T04:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:47fc4edd1e34431df870b0490b56fe9b45a32e78b3fc129aaf1ec75df0a10610","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T00:50:15.291565Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.03666/citation-record","integrity":"/paper/2607.03666/integrity","json":"/paper/2607.03666/citation-record.json","paper":"/paper/2607.03666"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"Emotional voice conversion: Theory, databases and esd,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:bf963192d66b35ac8b0ff5978673498ef6b002e87edb4ea38489d876168d9361","observation_id":"49ab19d4-8356-4832-983a-c42e4f2d6a25","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"An Overview & Analysis of Sequence-to-Sequence Emotional V oice Conversion,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:98b5e36d6c45036faaaaf9bd3018a746b84318a1e2312496d73b0523e9015232","observation_id":"4d743f06-af9e-46db-b7f4-3c5d6c45d923","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"Emotion inten- sity and its control for emotional voice conversion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:36d9b5042d2b7d350b113bd1e09fea030ee15daee8c789024aa1877dfc4d76aa","observation_id":"78a7dee7-b4f7-47ba-bc37-27fca5fe471a","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"Mixed-EVC: Mixed Emotion Synthesis and Control in V oice Conversion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:ec680e53ca83641f3fadd85ff0699bd3093a34e73254f2eddf5b1c15209017e5","observation_id":"e038e055-e033-42f6-87ec-03f4432d01eb","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"Vaw-gan for disentanglement and recomposition of emotional elements in speech,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:7825eef43f8592559d9dbae769184b5b2cc7b10ff65ca48feae88bcaf52d7414","observation_id":"7dfa1d9f-d459-4afc-a605-5679c207c7fc","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"An Improved StarGAN for Emotional V oice Conversion: Enhancing V oice Quality and Data Augmentation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:baa8d1d7817fb606063886de06e58fb4cfaa372497aa252a9ab99ddf85ace195","observation_id":"a3aa4d3b-2834-48d5-83c6-58b49b52b239","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"Limited Data Emotional V oice Con- version Leveraging Text-to-Speech: Two-Stage Sequence-to-Sequence Training,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:f2cc443e080684bd94968c87343fe00d1057671b8b2d496d47e05962963d550e","observation_id":"7cb1b0f6-7cf2-4139-bdf4-c494464fd3bb","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"Durflex-evc: Duration- flexible emotional voice conversion leveraging discrete representations without text alignment,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:42ccd7f65cc4cc0961df3003370ed98ca7900937b7b683cf7d0fbd56858da45d","observation_id":"7d4c8529-0eac-4e62-8bed-65c19126615e","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"Emotional V oice Conversion with Semi-Supervised Generative Modeling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:378e0d42cab8e24a0213f347ee7510b4330709a159a74c009f3c82aa88b0ae81","observation_id":"4e097fab-cbab-4ce3-a536-1ba877a69dd4","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"Zero shot audio to audio emotion trans- fer with speaker disentanglement,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:4c77f3c4f779ce80a4ac3f29f316681b3580062fa0274b8899f14e4735d3911f","observation_id":"bb0a8b69-a8a8-4c8b-aefd-52f441e15fe9","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"Textless speech emotion conversion using discrete & decomposed representations,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:375543ba055404c27fe01cd5d2fb6e1a13c9f2e83660ed78ae5e30b47eb43a93","observation_id":"7cc90615-1d59-4842-9764-3ecbccf84a4d","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"Speaking style conversion in the waveform domain using discrete self-supervised units,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:e9d6f7fea7527aa8688bc9a49199eca8517f5e4234e940c4647233405fd009b6","observation_id":"7ce0d28c-cde4-4493-b5e5-fea8692b29d9","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"Vevo: Control- lable zero-shot voice imitation with self-supervised disentanglement,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:911022a3dbf7750515203229c753046c28f865160fe5f33268f32bf1db2df609","observation_id":"aa899b3d-a8c0-4ed6-a767-2bfab8dab981","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"HybridVC: Efficient V oice Style Conversion with Text and Audio Prompts,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:cb6678ccb61d0ae0688462b9829aa33b30e299ce77965464635702ab048fe38e","observation_id":"8a080ca5-b1c6-4eff-a161-f63668552324","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"PromptEVC: Controllable Emotional V oice Conversion with Natural Language Prompts,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:6ea02b16b310264af9d11f2ec3baa79647540582b1b0b5ba49ee004dfe3d6baf","observation_id":"87724074-494c-45ef-8fec-f03759d578b3","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"ClapFM-EVC: High-Fidelity and Flexible Emotional V oice Conversion with Dual Control from Natural Language and Speech,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:d58e6947d71e525ce551aaf26958aecfec0433225d9b560abc58470afb68cdb5","observation_id":"f90bcc1e-1303-4fbd-b8c0-46d68c1b9fe6","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"Promptvc: Flexible stylistic voice conversion in latent space driven by natural language prompts,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:7deb740d0d5c31fa44ae8dc05ff26675f4edcc8ec61611ee9ec4e384a1c3f062","observation_id":"16d133a6-caaa-48c6-88e2-b50bc209d0b5","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"Textrolspeech: A text style control speech corpus with codec language text-to-speech models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:fcfb60ad0fe7244473049f449ac77e625ae66477d9702e2fe541ad090a667915","observation_id":"955b7154-fa80-4fbb-9eb0-e8415f21981a","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"Speechcraft: A fine-grained expressive speech dataset with natural language description,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:ef2b5b76ca6e8e34aa5ad58047bc2348e06037922e0b9133defdd444b5f8d3cb","observation_id":"c432e85d-c8b0-45f3-8320-873462a6c0e7","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"Stylecap: Automatic speaking- style captioning from speech based on speech and language self- supervised learning models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:7df2726638c0000d68126d7f776c8632268062a04b0e50228016e2940d40bb38","observation_id":"b094d958-9af7-483f-9a2d-638837b34be2","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive V oice Conversion,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:24e519888f00736ff355328e9af84672c601b78c22bb43225baf049ee29ac7e1","observation_id":"3a9fd845-3ef9-46e2-9b21-d26715785190","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"Discl-VC: Disentangled Discrete Tokens and In-Context Learning for Controllable Zero-Shot V oice Conversion,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:8762b26a31bc3b03aa7efe56222ab514520ba1d0fb0616c9b3c7bb6c22a8ca70","observation_id":"869f54b9-61fa-4ef0-95c9-71dbf095d462","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"Speaker Normalization and Content Restoration for Zero-Shot V oice Conversion with Attention- Enhanced Discriminator,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:bb50f61852a820aa945d627481d9925cf256a0e9cadafb65eac99b5f7c0753f5","observation_id":"feda30d3-0eec-4717-a0f5-0c291596ec8a","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"Emotional V oice Conversion Using Neural Networks with Different Temporal Scales of F0 based on Wavelet Transform,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:b7097711e7104bc815b58522ffcabe444734af628f9db530dad7abd9ff6aec96","observation_id":"db544fd5-1ccc-44ea-b814-30f6951550f7","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"Deep Bidirectional LSTM Modeling of Timbre and Prosody for Emotional V oice Conversion,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:b3fdcb20fc00851127cd155314bb45e5e018dfef1527d7ecd9a724603fe2d300","observation_id":"eccf22b1-ba2f-477c-a4a3-64aaf9961c05","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"Transforming Spectrum and Prosody for Emotional V oice Conversion with Non-Parallel Training Data,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:605f5d5489e4ce01cbea644d0f96088dd4c984904b67a67e0526cda1e694555b","observation_id":"c87195c6-412d-4658-90eb-a57e7288ad74","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"Nonparallel Emotional Speech Conversion Using V AE-GAN,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:053b8e50937c2a23c57cf5f09e6ad18d3081d6751edee8cacff6f60e893e1133","observation_id":"029dfc75-90c1-43c4-8192-f1cc221ebb52","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"Disentanglement of Emotional Style and Speaker Identity for Expressive V oice Conversion,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:46713149c29ce17175929f91790443fcc9b6dba958f4bcfe23fac963161b1ef1","observation_id":"45843dd0-6dad-42b3-a3d3-3e1bdf77a620","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"Converting Anyone’s Emotion: Towards Speaker-Independent Emotional V oice Conversion,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:950a0a7402c7480d96f268b4445c17ff949676a4a5a2ee30845d21117e804939","observation_id":"13a79cb7-b947-4514-9ac9-aece197c6e15","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"DiffEmotionVC: A Dual-Granularity Disentangled Diffusion Framework for Any-to-Any Emotional V oice Conversion,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:c65835348f2530273cde1b7eaa0492214c61675b1bd623328965b21deee747cf","observation_id":"f09f5af5-4298-4bb6-a5fd-bfe65e0dcbab","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"ZSDEVC: Zero-Shot Diffusion-based Emotional V oice Conversion with Disentan- gled Mechanism,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:2f53ff322311855c48751a03563423b6b5cf5251d7353fb69255ed14a39ec2bb","observation_id":"61bf9c75-b2f1-48f5-be71-efef2038b3c7","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"Prompttts: Controllable text-to-speech with text descriptions,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:1cf66d5fd1a68b2a5845311b1291c10b1940bab983aaaf0ba06556404e034f6a","observation_id":"51f84f22-166e-4502-a880-bf59de092a54","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"Instructtts: Modelling expressive tts in discrete latent space with natural language style prompt,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:61eeae758bd2c07b4a66ecd425b772134068b3169d7baf7e3f055dea9e1dbb91","observation_id":"d9887d5d-ce28-45ba-bdaa-f963fc56146c","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"PromptStyle: Controllable Style Transfer for Text-to-Speech with Nat- ural Language Descriptions,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:c5a9517a151058038d774076e38348edfbb4d77686a430eae939f1d3283bf645","observation_id":"95ffc631-0f7b-4b83-8aa9-90af56433896","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"Controlling Emotion in Text-to-Speech with Natural Language Prompts,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:e7faff058bc8afed23f476e7abf7265cf728ab90ee4b255989f31adf83103bd3","observation_id":"4962152a-78ef-4499-b597-89c26226f519","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"PL-TTS: A Generalizable Prompt-based Diffusion TTS Augmented by Large Language Model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:57af3079197ca791585ca67f4391add450aced2e62467c23d9093385046cc111","observation_id":"3c2d7964-4b85-4c1a-b23a-61340d707bf4","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"Exploring speech style spaces with language models: Emotional TTS without emotion labels,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:3a5e01c6e28d654484a0b640986fa0b8c148e465cfafcb06a855ef3c0fd41d04","observation_id":"c097a499-0a07-4ddf-8fde-bf4ba3be1efa","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:3313291e4fca37ebf8d5450bcffcba83b415e990e683a6c0276a1be34b90de9f","observation_id":"4d50aaed-a4ae-48d6-ae6e-9c682ad9505a","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"Cross-Cultural Comparison of Gradient Emotion Perception: Human vs. Alexa TTS V oices,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:2044817439c238772ec0c4b28f46d4e504a2e6388a901affdfa1cbeb7e91f073","observation_id":"6355fa00-a634-4b4b-a0fd-cd298b923f8e","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"Cross- linguistic Emotion Perception in Human and TTS V oices,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:337ab1b0cdbca8b1a77cf498195b811ba2f0a32549aac523a12b98f55d8ea659","observation_id":"872b1bea-27a7-4b07-bc20-015ea687ca40","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"Emotional dimension control in language model-based text-to-speech: Spanning a broad spectrum of human emotions,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:717d1a8e4f464d1cdb0281274d2e1183f7414a148af902e33d9eaf2ce886f7df","observation_id":"54d1a384-a026-4ba3-ad05-c0378c9f4c9f","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"Emotion Arithmetic: Emotional Speech Synthesis via Weight Space Interpolation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:6de01778fd959107480c0b5203a79188017fadfb76fd5ea7065164c75d8eb601","observation_id":"a31c50fe-7f0f-4651-ae5e-fb1ab95a877f","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"VECL- TTS: V oice identity and Emotional style controllable Cross-Lingual Text-to-Speech,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:3caccbbea26d2d2cd482d16118f75151b9a697a1a6636eb793f6d1f42de91d6b","observation_id":"11ff5179-4b87-4d85-9c15-f6f7a46a10fb","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"EME-TTS: Unlocking the Emphasis and Emotion Link in Speech Synthesis,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:fc8557ae2f5e0e877a519eae875331f87411c04a0c4f6cdffe53821167712ccd","observation_id":"fe069f44-f577-47d2-9ef5-53723ecce46a","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"DiEmo-TTS: Disentan- gled Emotion Representations via Self-Supervised Distillation for Cross- Speaker Emotion Transfer in Text-to-Speech,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:c09e7c29bd3cc8bcfecb1e24b8ef3f776573c49eb519e9d447323116d1bd3d47","observation_id":"d84b0c31-6c7e-4902-9d99-2e38be142516","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"EATS-Speech: Emotion- Adaptive Transformation and Priority Synthesis for Zero-Shot Text-to- Speech,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:6819b2783d6597b1e730e8a847ef04d4432372d390bda8e0cbc9bf7856b88729","observation_id":"b686b75f-30fe-4979-952e-b149d4a91a82","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"RepeaTTS: Towards Feature Discovery through Repeated Fine-Tuning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:a84743b52db14f9b24bc1b4594c42c50ccef972031aba9f911078e1ffe6bd04a","observation_id":"57bd7e1d-3032-49b3-9359-f66d8415f04f","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"Affective story teller: a TTS system for emotional expressivity,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:3f40e876ef7cf0b25afc699a33b36ab07a1c9d4caab8782e4350378946fa289d","observation_id":"03387741-4cf8-4f81-afd9-9f40c75d3e09","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"EmoSphere- TTS: Emotional Style and Intensity Modeling via Spherical Emotion Vector for Controllable Emotional Text-to-Speech,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:a0838e85079bf0239151f7d87b39114f2794f018f725553774574f8f896ebdcc","observation_id":"a407c7bf-3311-492a-aa5a-dc75d906a448","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"Emosphere++: Emotion-controllable zero-shot text-to-speech via emotion-adaptive spherical vector,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:bf5d0b60ba06f1ce2a66f7eee65df4f28cbea8e59881c33d9a31953032f45d58","observation_id":"10100b2e-438d-4fcb-a7fd-acde779090c4","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"Mead: A large-scale audio-visual dataset for emotional talking-face generation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:48453dd613a3bc643087b6e68ad9be16bf60ef89f5ac8f98a59fd13d90380e68","observation_id":"2e9698a1-c067-4eff-89f9-abd88d6acea9","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"Odyssey 2024 - Speech Emotion Recognition Challenge: Dataset, Baseline Framework, and Results,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:d56bf6d6ef22db1c5a9933706a14ba9bd677f21e2d3e16b98095e249a6bb0068","observation_id":"1680b4b0-b85d-4a8b-9e92-ea240cb46a50","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"Qwen3 technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:c554f2348c15a7647eda0adccb506c104cbcccfd0c5ccc073bd437f19eee87a4","observation_id":"434f3217-6904-4b86-95f1-1bac54f1dbfc","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03533","last_updated":"2024-02-22T06:21:51Z","snapshot_observed_at":"2026-07-06T14:27:46.217000Z","submitted_at":"2022-12-07T09:25:54Z","title":"Text Embeddings by Weakly-Supervised Contrastive Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03533","snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"Text embeddings by weakly-supervised contrastive pre- training,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"cited_paper":"/paper/2212.03533","citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:e030787635f6e4ba28684f6629d3790940e3f0bf751552a9cb53ec6ae0b3022b","observation_id":"35a1dac2-a77b-4a98-ac1e-8c0c84b36204","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"emotion2vec: Self-supervised pre-training for speech emotion representation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:960bb5610b7a45e4d2e964464e67f9dcc3995a4d82e0dfe260e41bbdfbed56f5","observation_id":"45a58833-c0e8-4621-8758-fc0238dd727e","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:f5d5e057e952211d1093888b541f19e63f9942dfa1a6f4f43ea839e7df16687c","observation_id":"620fe6a4-0eb9-4698-bac3-40057c480f0d","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"Hifi-gan: Generative adversarial networks for efficient and high fidelity speech synthesis,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:2b3e7a2d8b0772691da92b7edba08259b499fe5d8bf080d50e08c39d99281844","observation_id":"26376330-2791-43e4-89e2-48b97e465bbb","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"Amphion: An open-source audio, music and speech generation toolkit,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:3ddcbba0a9d68e15f428d4f75d8c6b0a7234de599dcae4143deeef2040703efb","observation_id":"400ef672-8dc7-4a0e-96d3-7bbbcc9bab20","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15442","last_updated":"2025-02-11T13:05:36Z","snapshot_observed_at":"2026-07-06T20:26:17.112340Z","submitted_at":"2025-01-26T08:10:13Z","title":"Overview of the Amphion Toolkit (v0.2)","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15442","snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"Overview of the amphion toolkit (v0.2),","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"cited_paper":"/paper/2501.15442","citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:5911bcf3379186d352156c0d5e9033ee32d3892730defde6e65c4193188ef44f","observation_id":"81f71f1e-67c0-4bba-a587-c6a478490971","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:89955e0e7b76ba022a5c1edb475ff06cf7fc156d71a72e570ea55ae1ba3a9793","observation_id":"7c7c253e-097e-41f3-b933-efee78d54c05","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"Generalized end-to-end loss for speaker verification,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:a38e3e46e9646a624eeb3e04e460d5ff051216654679fa694a0a0cc5a23b599d","observation_id":"3a59489e-e29d-4c9d-a3cd-26a812b0122a","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"UTMOS: UTokyo-SaruLab System for V oiceMOS Chal- lenge 2022,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:f3382394f9c4ec8868519669740e43d19d3a1f2d82736c71d175dfd821bfa69a","observation_id":"b6b7ed2b-a28b-46cd-913f-77fd814490cb","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"NISQA: A Deep CNN-Self-Attention Model for Multidimensional Speech Quality Pre- diction with Crowdsourced Datasets,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:676d31e86139c4fd8521145d76a3b5a2ee4acbcc7e5a3d4006d0ea39dd6f6074","observation_id":"ea8002c3-dc1b-4440-b4e1-5aa3f7c22b08","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"Un- supervised Cross-Lingual Representation Learning for Speech Recogni- tion,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:d691196790be52eff7fa76997ec8f4621b032f51f873da11712479dc68a935af","observation_id":"e58cadf4-5e74-42ea-8939-e17fed0ecfac","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"LibriTTS: A Corpus Derived from LibriSpeech for Text- to-Speech,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:7197c9013c0d6a7b1b72de41a23c2fd31dcf544c8149d7be71e264c7ee9a0c3b","observation_id":"be39e8e7-b365-46f6-b274-f3d60e0fd9e8","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"Mtld, vocd-d, and hd-d: A validation study of sophisticated approaches to lexical diversity assessment,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:bd50a8541c22ab92a090eb050a15f211ca084d14e041bf272575c504768b96fa","observation_id":"6000afb6-1de1-4842-9fe1-4f6b2849e9bd","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T00:50:15.291565Z","title":"Texygen: A benchmarking platform for text generation models,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-12T00:50:15.291565Z"},"links":{"citing_paper":"/paper/2607.03666"},"observation_digest":"sha256:0e230095c2f64cb665f52113e194f7c409a37e6b6fc9e170d8b6a4193ee78f8b","observation_id":"7d0c8570-935b-4512-b7d5-861380d0d6e0","resolution":{"observed_at":"2026-07-12T00:50:15.291565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.03666","last_updated":"2026-07-04T02:38:35Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-03T00:03:53.124256Z","submitted_at":"2026-07-04T02:38:35Z","title":"TRACE-EVC: Text-Guided Relative Affective Control for Zero-Shot Emotional Voice Conversion"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":67,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 0 inbound Pith citation observations for arXiv:2607.03666."}