{"as_of":"2026-08-08T11:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2dc9b2f53567e0a3a4e647c09ee2f23ef06076b4bf5315280d4d0b2ca01be094","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:50:27.922828Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:50:27.774312Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T05:50:28.138136Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.07036","last_updated":"2025-06-13T15:54:51Z","snapshot_observed_at":"2026-08-07T05:41:08.298197Z","submitted_at":"2025-06-08T08:00:56Z","title":"In This Environment, As That Speaker: A Text-Driven Framework for Multi-Attribute Speech Conversion","version":2},"cited_work":{"arxiv_id":"2506.07036","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.07036","snapshot_observed_at":"2026-08-07T05:50:28.138136Z","title":"In This Environment, As That Speaker: A Text-Driven Framework for Multi-Attribute Speech Conversion","venue":"cs.SD","work_id":"271c4d2c-282b-4bf5-852e-c5c758cc540c","year":2025},"citing_paper":{"arxiv_id":"2506.07036","last_updated":"2025-06-13T15:54:51Z","snapshot_observed_at":"2026-08-07T05:41:08.298197Z","submitted_at":"2025-06-08T08:00:56Z","title":"In This Environment, As That Speaker: A Text-Driven Framework for Multi-Attribute Speech Conversion","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:27.774312Z"},"links":{"cited_paper":"/paper/2506.07036","citing_paper":"/paper/2506.07036"},"observation_digest":"sha256:cb3ab2878e7a6af2c497b32b11123a405d0c3924ca41bf729e44c575281d4cfd","observation_id":"ed6d504b-ac82-4492-ba4d-8b8377e6d331","resolution":{"observed_at":"2026-08-07T05:50:28.142487Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.07036/citation-record","integrity":"/paper/2506.07036/integrity","json":"/paper/2506.07036/citation-record.json","paper":"/paper/2506.07036"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.07036","last_updated":"2025-06-13T15:54:51Z","snapshot_observed_at":"2026-08-07T05:41:08.298197Z","submitted_at":"2025-06-08T08:00:56Z","title":"In This Environment, As That Speaker: A Text-Driven Framework for Multi-Attribute Speech Conversion","version":2},"cited_work":{"arxiv_id":"2506.07036","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.07036","snapshot_observed_at":"2026-08-07T05:50:28.138136Z","title":"In This Environment, As That Speaker: A Text-Driven Framework for Multi-Attribute Speech Conversion","venue":"cs.SD","work_id":"271c4d2c-282b-4bf5-852e-c5c758cc540c","year":2025},"citing_paper":{"arxiv_id":"2506.07036","last_updated":"2025-06-13T15:54:51Z","snapshot_observed_at":"2026-08-07T05:41:08.298197Z","submitted_at":"2025-06-08T08:00:56Z","title":"In This Environment, As That Speaker: A Text-Driven Framework for Multi-Attribute Speech Conversion","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:27.774312Z"},"links":{"cited_paper":"/paper/2506.07036","citing_paper":"/paper/2506.07036"},"observation_digest":"sha256:cb3ab2878e7a6af2c497b32b11123a405d0c3924ca41bf729e44c575281d4cfd","observation_id":"ed6d504b-ac82-4492-ba4d-8b8377e6d331","resolution":{"observed_at":"2026-08-07T05:50:28.142487Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:28.437159Z","title":"System Overview The proposed TES-VC model is trained on purely acoustic data (Figure 1(a)), and leverages text-guided control during infer- ence (Figure 1(b))","venue":null,"work_id":"5a700381-78d0-46da-a159-3f02ed0911d6","year":null},"citing_paper":{"arxiv_id":"2506.07036","last_updated":"2025-06-13T15:54:51Z","snapshot_observed_at":"2026-08-07T05:41:08.298197Z","submitted_at":"2025-06-08T08:00:56Z","title":"In This Environment, As That Speaker: A Text-Driven Framework for Multi-Attribute Speech Conversion","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:27.779390Z"},"links":{"citing_paper":"/paper/2506.07036"},"observation_digest":"sha256:44ab1deaa287534314f981302cf01c9762b04f71a23393e1d39cd0b549765e72","observation_id":"618533bc-c194-4a81-b5e9-327ed0ba2f61","resolution":{"observed_at":"2026-08-07T05:50:28.441777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:28.410327Z","title":"w/o CLAP-timbre adapter","venue":null,"work_id":"8d7d0401-5d54-47ec-b626-abc81374afa7","year":null},"citing_paper":{"arxiv_id":"2506.07036","last_updated":"2025-06-13T15:54:51Z","snapshot_observed_at":"2026-08-07T05:41:08.298197Z","submitted_at":"2025-06-08T08:00:56Z","title":"In This Environment, As That Speaker: A Text-Driven Framework for Multi-Attribute Speech Conversion","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:27.788147Z"},"links":{"citing_paper":"/paper/2506.07036"},"observation_digest":"sha256:c423e3a265db7bd8fc18f4a6d5a408e66c9957cda94aab4a03965f59429af65e","observation_id":"48cbb941-8c1f-4de7-8308-edf7658baac7","resolution":{"observed_at":"2026-08-07T05:50:28.415135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:28.397212Z","title":"Our systematic data con- struction methodology facilitates disentangled learning of con- tent preservation, environmental acoustics, and speaker char- acteristics","venue":null,"work_id":"e2cf7849-8a20-45a4-8d4a-f5805c9f6b56","year":null},"citing_paper":{"arxiv_id":"2506.07036","last_updated":"2025-06-13T15:54:51Z","snapshot_observed_at":"2026-08-07T05:41:08.298197Z","submitted_at":"2025-06-08T08:00:56Z","title":"In This Environment, As That Speaker: A Text-Driven Framework for Multi-Attribute Speech Conversion","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:27.792988Z"},"links":{"citing_paper":"/paper/2506.07036"},"observation_digest":"sha256:5d42e8a2c1b3bb0fff9a77c8efcaf63f7dfd149f684fe1d7034167879f60107f","observation_id":"3084a535-3219-4eec-b023-9e8548298b77","resolution":{"observed_at":"2026-08-07T05:50:28.401841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:28.384460Z","title":null,"venue":null,"work_id":"e192e7c1-8acd-4907-ab0e-bd717760a699","year":null},"citing_paper":{"arxiv_id":"2506.07036","last_updated":"2025-06-13T15:54:51Z","snapshot_observed_at":"2026-08-07T05:41:08.298197Z","submitted_at":"2025-06-08T08:00:56Z","title":"In This Environment, As That Speaker: A Text-Driven Framework for Multi-Attribute Speech Conversion","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:27.797270Z"},"links":{"citing_paper":"/paper/2506.07036"},"observation_digest":"sha256:cd3b81fb14f603910063de120791fd44f779b5d81c3a9e2254f3122092b462c4","observation_id":"a0052ca4-0a48-4862-befa-be64016bb46b","resolution":{"observed_at":"2026-08-07T05:50:28.389063Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04154","last_updated":"2020-06-07T14:01:16Z","snapshot_observed_at":"2026-07-06T09:26:43.943376Z","submitted_at":"2020-06-07T14:01:16Z","title":"VQVC+: One-Shot Voice Conversion by Vector Quantization and U-Net architecture","version":1},"cited_work":{"arxiv_id":"2006.04154","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.04154","snapshot_observed_at":"2026-08-07T05:50:28.119062Z","title":"VQVC+: One-Shot Voice Conversion by Vector Quantization and U-Net architecture","venue":"eess.AS","work_id":"dfae1e0b-57db-43b7-b705-f5bf94326a85","year":2020},"citing_paper":{"arxiv_id":"2506.07036","last_updated":"2025-06-13T15:54:51Z","snapshot_observed_at":"2026-08-07T05:41:08.298197Z","submitted_at":"2025-06-08T08:00:56Z","title":"In This Environment, As That Speaker: A Text-Driven Framework for Multi-Attribute Speech Conversion","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:27.822845Z"},"links":{"cited_paper":"/paper/2006.04154","citing_paper":"/paper/2506.07036"},"observation_digest":"sha256:40b3801cc93dd920fdc6511d4b0fe1eb77a4eed62b5b5af0e2f423afd15a087f","observation_id":"fd4b639f-80ea-4197-8b1b-4f8999bca226","resolution":{"observed_at":"2026-08-07T05:50:28.123806Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:28.371668Z","title":"From speaker to dubber: movie dubbing with prosody and duration consistency learning,","venue":null,"work_id":"3f111926-d8fa-4f24-bb20-0ad6e683ec3e","year":2024},"citing_paper":{"arxiv_id":"2506.07036","last_updated":"2025-06-13T15:54:51Z","snapshot_observed_at":"2026-08-07T05:41:08.298197Z","submitted_at":"2025-06-08T08:00:56Z","title":"In This Environment, As That Speaker: A Text-Driven Framework for Multi-Attribute Speech Conversion","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:27.801473Z"},"links":{"citing_paper":"/paper/2506.07036"},"observation_digest":"sha256:6b3b7358ec4037305f707cf556594c479dc1584222ad536e93c50e6c3f67ed71","observation_id":"03f441c5-9272-4768-8e7c-f5276eea761a","resolution":{"observed_at":"2026-08-07T05:50:28.376082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:28.359043Z","title":"Diffdub: Person- generic visual dubbing using inpainting renderer with diffusion auto-encoder,","venue":null,"work_id":"c7328a48-5eb9-4364-9d01-325148b5fa53","year":2024},"citing_paper":{"arxiv_id":"2506.07036","last_updated":"2025-06-13T15:54:51Z","snapshot_observed_at":"2026-08-07T05:41:08.298197Z","submitted_at":"2025-06-08T08:00:56Z","title":"In This Environment, As That Speaker: A Text-Driven Framework for Multi-Attribute Speech Conversion","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:27.805474Z"},"links":{"citing_paper":"/paper/2506.07036"},"observation_digest":"sha256:3ca50d5dd4dea4a66ef7a13fa8cb23850785f5d62fe940e48c2216cb8311371f","observation_id":"da12b11f-3751-4cda-8e18-53c8fbf4ce2c","resolution":{"observed_at":"2026-08-07T05:50:28.363254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:28.345716Z","title":"(voick): Enhancing accessibility in audiobooks through voice cloning technology,","venue":null,"work_id":"9b5cdab7-fd80-41bb-84b7-9d7afba7a2a0","year":2024},"citing_paper":{"arxiv_id":"2506.07036","last_updated":"2025-06-13T15:54:51Z","snapshot_observed_at":"2026-08-07T05:41:08.298197Z","submitted_at":"2025-06-08T08:00:56Z","title":"In This Environment, As That Speaker: A Text-Driven Framework for Multi-Attribute Speech Conversion","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:27.809683Z"},"links":{"citing_paper":"/paper/2506.07036"},"observation_digest":"sha256:3bca436afb496e0b5acd32e777693c8d9184a57406061576c3d9d136c9ca77bb","observation_id":"c91b86d5-674d-4609-b686-79f060a208b5","resolution":{"observed_at":"2026-08-07T05:50:28.350161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:28.331708Z","title":"Person- alized voice command systems in multi modal user interface,","venue":null,"work_id":"61663a29-173b-461f-8e41-d603eaeac741","year":2012},"citing_paper":{"arxiv_id":"2506.07036","last_updated":"2025-06-13T15:54:51Z","snapshot_observed_at":"2026-08-07T05:41:08.298197Z","submitted_at":"2025-06-08T08:00:56Z","title":"In This Environment, As That Speaker: A Text-Driven Framework for Multi-Attribute Speech Conversion","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:27.813881Z"},"links":{"citing_paper":"/paper/2506.07036"},"observation_digest":"sha256:7956d18041d3479919c40d417f037995605947cbcf8dfe5ea57d93fb273e11dc","observation_id":"c4650323-b8e8-40f8-a62d-b59ddb9d6241","resolution":{"observed_at":"2026-08-07T05:50:28.336623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:28.316562Z","title":"Triaan- vc: Triple adaptive attention normalization for any-to-any voice conversion,","venue":null,"work_id":"74e2d1f8-3e9c-468b-b0ca-d975edea0847","year":2023},"citing_paper":{"arxiv_id":"2506.07036","last_updated":"2025-06-13T15:54:51Z","snapshot_observed_at":"2026-08-07T05:41:08.298197Z","submitted_at":"2025-06-08T08:00:56Z","title":"In This Environment, As That Speaker: A Text-Driven Framework for Multi-Attribute Speech Conversion","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:27.818032Z"},"links":{"citing_paper":"/paper/2506.07036"},"observation_digest":"sha256:eca1700d9fd15fa525c003e79245a75fc8ea5fd1b25c718bd326dec41fec0c35","observation_id":"a316880e-5cf8-4628-a8d2-59f35f16ea68","resolution":{"observed_at":"2026-08-07T05:50:28.321177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.07025","last_updated":"2020-10-13T06:07:16Z","snapshot_observed_at":"2026-07-06T09:20:20.582899Z","submitted_at":"2020-05-13T13:36:34Z","title":"Converting Anyone's Emotion: Towards Speaker-Independent Emotional Voice Conversion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.07025","snapshot_observed_at":"2026-08-07T05:50:27.849139Z","title":"Converting anyone’s emotion: Towards speaker-independent emotional voice conver- sion,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.07036","last_updated":"2025-06-13T15:54:51Z","snapshot_observed_at":"2026-08-07T05:41:08.298197Z","submitted_at":"2025-06-08T08:00:56Z","title":"In This Environment, As That Speaker: A Text-Driven Framework for Multi-Attribute Speech Conversion","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:27.849139Z"},"links":{"cited_paper":"/paper/2005.07025","citing_paper":"/paper/2506.07036"},"observation_digest":"sha256:0cee49093fd946a40a6a3da027b477cc7021550abe9816fe2b497eab1f312e69","observation_id":"452c982a-5f58-4b0e-9ee1-2f6db5dbaf41","resolution":{"observed_at":"2026-08-07T05:50:27.849139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:28.300817Z","title":"One-shot voice conversion by vector quantization,","venue":null,"work_id":"c4a0b0be-886a-4a4f-bf0e-fb37543b4e21","year":2020},"citing_paper":{"arxiv_id":"2506.07036","last_updated":"2025-06-13T15:54:51Z","snapshot_observed_at":"2026-08-07T05:41:08.298197Z","submitted_at":"2025-06-08T08:00:56Z","title":"In This Environment, As That Speaker: A Text-Driven Framework for Multi-Attribute Speech Conversion","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:27.827596Z"},"links":{"citing_paper":"/paper/2506.07036"},"observation_digest":"sha256:01e7cb5944930018d3770fd4701e73305471dd58558825672b0b0d0cf329eff1","observation_id":"83d8044b-d3a9-48d1-a304-99d98d629c03","resolution":{"observed_at":"2026-08-07T05:50:28.306552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.10132","last_updated":"2021-06-18T13:50:38Z","snapshot_observed_at":"2026-07-06T11:20:43.002537Z","submitted_at":"2021-06-18T13:50:38Z","title":"VQMIVC: Vector Quantization and Mutual Information-Based Unsupervised Speech Representation Disentanglement for One-shot Voice Conversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.10132","snapshot_observed_at":"2026-08-07T05:50:27.831804Z","title":"Vqmivc: Vector quantization and mutual information-based un- supervised speech representation disentanglement for one-shot voice conversion,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07036","last_updated":"2025-06-13T15:54:51Z","snapshot_observed_at":"2026-08-07T05:41:08.298197Z","submitted_at":"2025-06-08T08:00:56Z","title":"In This Environment, As That Speaker: A Text-Driven Framework for Multi-Attribute Speech Conversion","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:27.831804Z"},"links":{"cited_paper":"/paper/2106.10132","citing_paper":"/paper/2506.07036"},"observation_digest":"sha256:ee9dbd09dffddd8ec97f06cee73e7ac1477ce90fe9a236a9488c94f95cc18847","observation_id":"c16a1228-2172-4aa0-9ce4-e3657be4de11","resolution":{"observed_at":"2026-08-07T05:50:27.831804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11160","last_updated":"2024-09-16T12:07:48Z","snapshot_observed_at":"2026-07-06T16:34:27.319192Z","submitted_at":"2023-10-17T11:26:28Z","title":"Leveraging Diverse Semantic-based Audio Pretrained Models for Singing Voice Conversion","version":3},"cited_work":{"arxiv_id":"2310.11160","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.11160","snapshot_observed_at":"2026-08-07T05:50:28.087047Z","title":"Leveraging Diverse Semantic-based Audio Pretrained Models for Singing Voice Conversion","venue":"cs.SD","work_id":"ee4b34d0-4c15-43bc-9e5b-d0dd67d6d3df","year":2023},"citing_paper":{"arxiv_id":"2506.07036","last_updated":"2025-06-13T15:54:51Z","snapshot_observed_at":"2026-08-07T05:41:08.298197Z","submitted_at":"2025-06-08T08:00:56Z","title":"In This Environment, As That Speaker: A Text-Driven Framework for Multi-Attribute Speech Conversion","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:27.836225Z"},"links":{"cited_paper":"/paper/2310.11160","citing_paper":"/paper/2506.07036"},"observation_digest":"sha256:c2a74ea8921a4b7e8fef3866ed52b9aed79b733fdcb16a5f847a76d36dd79a82","observation_id":"9e26d0bd-b304-4970-84f4-65a42fbd6529","resolution":{"observed_at":"2026-08-07T05:50:28.091474Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:28.286247Z","title":"Styletts-vc: One-shot voice conversion by knowledge transfer from style-based tts models,","venue":null,"work_id":"a1312c61-5ec0-4672-ab62-403ac561d934","year":2023},"citing_paper":{"arxiv_id":"2506.07036","last_updated":"2025-06-13T15:54:51Z","snapshot_observed_at":"2026-08-07T05:41:08.298197Z","submitted_at":"2025-06-08T08:00:56Z","title":"In This Environment, As That Speaker: A Text-Driven Framework for Multi-Attribute Speech Conversion","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:27.840805Z"},"links":{"citing_paper":"/paper/2506.07036"},"observation_digest":"sha256:c3eec7b4a31d699069bd95bc3a5c026068f6f8b95ced0a1a7cf0dd85ddaac7b8","observation_id":"79c730fa-d3d4-48e3-8383-72d2ee36d6cc","resolution":{"observed_at":"2026-08-07T05:50:28.290811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:28.273054Z","title":"Ace- vc: Adaptive and controllable voice conversion using explicitly disentangled self-supervised speech representations,","venue":null,"work_id":"d9dadcbd-1b7a-4175-9c70-7a00de6f817b","year":2023},"citing_paper":{"arxiv_id":"2506.07036","last_updated":"2025-06-13T15:54:51Z","snapshot_observed_at":"2026-08-07T05:41:08.298197Z","submitted_at":"2025-06-08T08:00:56Z","title":"In This Environment, As That Speaker: A Text-Driven Framework for Multi-Attribute Speech Conversion","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:27.845013Z"},"links":{"citing_paper":"/paper/2506.07036"},"observation_digest":"sha256:137df97e8da9fcbbae8fc3e64b9da5060455e02ea3d50035107e5d843948db45","observation_id":"b4f63a61-1881-40ca-885c-39b0ced08d03","resolution":{"observed_at":"2026-08-07T05:50:28.277378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16977","last_updated":"2024-12-22T11:26:58Z","snapshot_observed_at":"2026-07-06T20:11:42.361400Z","submitted_at":"2024-12-22T11:26:58Z","title":"Incremental Disentanglement for Environment-Aware Zero-Shot Text-to-Speech Synthesis","version":1},"cited_work":{"arxiv_id":"2412.16977","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.16977","snapshot_observed_at":"2026-08-07T05:50:28.000843Z","title":"Incremental Disentanglement for Environment-Aware Zero-Shot Text-to-Speech Synthesis","venue":"eess.AS","work_id":"c82e871a-eba6-4ca7-b04b-b66834dfeb66","year":2024},"citing_paper":{"arxiv_id":"2506.07036","last_updated":"2025-06-13T15:54:51Z","snapshot_observed_at":"2026-08-07T05:41:08.298197Z","submitted_at":"2025-06-08T08:00:56Z","title":"In This Environment, As That Speaker: A Text-Driven Framework for Multi-Attribute Speech Conversion","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:27.874421Z"},"links":{"cited_paper":"/paper/2412.16977","citing_paper":"/paper/2506.07036"},"observation_digest":"sha256:bf50c91be0a33e45d71700e7976be426cc7fdba1b1fdb8f512785d47f36de328","observation_id":"3836c19a-1375-4dcd-960d-f1e59a7a2acf","resolution":{"observed_at":"2026-08-07T05:50:28.007478Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.11563","last_updated":"2019-06-20T16:05:26Z","snapshot_observed_at":"2026-07-06T07:55:57.584952Z","submitted_at":"2019-05-28T01:36:31Z","title":"Unsupervised End-to-End Learning of Discrete Linguistic Units for Voice Conversion","version":3},"cited_work":{"arxiv_id":"1905.11563","doi":null,"metadata_source":"pith","pith_arxiv_id":"1905.11563","snapshot_observed_at":"2026-08-07T05:50:28.055136Z","title":"Unsupervised End-to-End Learning of Discrete Linguistic Units for Voice Conversion","venue":"cs.CL","work_id":"a3815656-fa09-4ae9-8d81-0e7a5227e2c4","year":2019},"citing_paper":{"arxiv_id":"2506.07036","last_updated":"2025-06-13T15:54:51Z","snapshot_observed_at":"2026-08-07T05:41:08.298197Z","submitted_at":"2025-06-08T08:00:56Z","title":"In This Environment, As That Speaker: A Text-Driven Framework for Multi-Attribute Speech Conversion","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:27.853583Z"},"links":{"cited_paper":"/paper/1905.11563","citing_paper":"/paper/2506.07036"},"observation_digest":"sha256:36da5795ec1572398959fd7f483aa839e96dc952f79eadf5442525e10da8b7ac","observation_id":"b6444f9b-2cb6-4349-9002-a8499bf57673","resolution":{"observed_at":"2026-08-07T05:50:28.059900Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15637","last_updated":"2024-09-25T01:17:48Z","snapshot_observed_at":"2026-07-06T18:04:46.468725Z","submitted_at":"2024-04-24T04:18:31Z","title":"HybridVC: Efficient Voice Style Conversion with Text and Audio Prompts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.15637","snapshot_observed_at":"2026-08-07T05:50:27.857907Z","title":"Hybridvc: Efficient voice style conversion with text and audio prompts,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07036","last_updated":"2025-06-13T15:54:51Z","snapshot_observed_at":"2026-08-07T05:41:08.298197Z","submitted_at":"2025-06-08T08:00:56Z","title":"In This Environment, As That Speaker: A Text-Driven Framework for Multi-Attribute Speech Conversion","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:27.857907Z"},"links":{"cited_paper":"/paper/2404.15637","citing_paper":"/paper/2506.07036"},"observation_digest":"sha256:2a7266ce8871a5e7f9b4c7f3828824a47cbeb7ae925acdddaa950e69f8c1c4b2","observation_id":"fe6e7b29-8590-4365-9355-29198724fa7e","resolution":{"observed_at":"2026-08-07T05:50:27.857907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:28.259580Z","title":"Towards general-purpose text-instruction-guided voice conversion,","venue":null,"work_id":"4249fe7c-16fc-4155-a0dd-da2d62e0c03c","year":2023},"citing_paper":{"arxiv_id":"2506.07036","last_updated":"2025-06-13T15:54:51Z","snapshot_observed_at":"2026-08-07T05:41:08.298197Z","submitted_at":"2025-06-08T08:00:56Z","title":"In This Environment, As That Speaker: A Text-Driven Framework for Multi-Attribute Speech Conversion","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:27.862282Z"},"links":{"citing_paper":"/paper/2506.07036"},"observation_digest":"sha256:41a53f102f272e99d5478e9dea3657e3471fd5ea5871ce0f12b979680fe05d39","observation_id":"c2952113-d869-4710-a3a2-a83e3d0c5956","resolution":{"observed_at":"2026-08-07T05:50:28.263928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:28.246231Z","title":"Promptvc: Flexible stylistic voice conversion in latent space driven by natural language prompts,","venue":null,"work_id":"ba9d15b7-fd42-4553-a3aa-6c4ca36d9195","year":2024},"citing_paper":{"arxiv_id":"2506.07036","last_updated":"2025-06-13T15:54:51Z","snapshot_observed_at":"2026-08-07T05:41:08.298197Z","submitted_at":"2025-06-08T08:00:56Z","title":"In This Environment, As That Speaker: A Text-Driven Framework for Multi-Attribute Speech Conversion","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:27.866233Z"},"links":{"citing_paper":"/paper/2506.07036"},"observation_digest":"sha256:696d26fb1fc5ebf5d507d043e598ba0f4c5482cc7957963fcdb2b2dea51adf9e","observation_id":"a5280fb0-3e23-4c36-a394-0e05b4e1901e","resolution":{"observed_at":"2026-08-07T05:50:28.250679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.03887","last_updated":"2022-08-06T18:55:53Z","snapshot_observed_at":"2026-08-03T23:43:50.948084Z","submitted_at":"2021-10-08T04:19:19Z","title":"Environment Aware Text-to-Speech Synthesis","version":4},"cited_work":{"arxiv_id":"2110.03887","doi":null,"metadata_source":"pith","pith_arxiv_id":"2110.03887","snapshot_observed_at":"2026-08-07T05:50:28.022374Z","title":"Environment Aware Text-to-Speech Synthesis","venue":"eess.AS","work_id":"30812967-1e9c-4ed9-892c-94296a65b9c4","year":2021},"citing_paper":{"arxiv_id":"2506.07036","last_updated":"2025-06-13T15:54:51Z","snapshot_observed_at":"2026-08-07T05:41:08.298197Z","submitted_at":"2025-06-08T08:00:56Z","title":"In This Environment, As That Speaker: A Text-Driven Framework for Multi-Attribute Speech Conversion","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:27.870314Z"},"links":{"cited_paper":"/paper/2110.03887","citing_paper":"/paper/2506.07036"},"observation_digest":"sha256:3beb5982eed19a26238328a23e66f03b3a91707c425ed8c5dc89b77f32d4561b","observation_id":"96fd65e0-3d24-474c-9732-ff7c45cc54c2","resolution":{"observed_at":"2026-08-07T05:50:28.027366Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:28.185811Z","title":"Recent advancements in speech en- hancement,","venue":null,"work_id":"cb610e92-7da8-4baf-b5c4-d9f03344aca7","year":2006},"citing_paper":{"arxiv_id":"2506.07036","last_updated":"2025-06-13T15:54:51Z","snapshot_observed_at":"2026-08-07T05:41:08.298197Z","submitted_at":"2025-06-08T08:00:56Z","title":"In This Environment, As That Speaker: A Text-Driven Framework for Multi-Attribute Speech Conversion","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:27.898488Z"},"links":{"citing_paper":"/paper/2506.07036"},"observation_digest":"sha256:1bddf2b78cf2b3153110141ce572ec2deaf6c60ebb4576147f3c50762e0120e1","observation_id":"c8827523-b73b-449d-aaf4-c2bc8566e13f","resolution":{"observed_at":"2026-08-07T05:50:28.190075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:28.423742Z","title":null,"venue":null,"work_id":"be74529e-fc1f-4e87-a036-caa9bee46e32","year":null},"citing_paper":{"arxiv_id":"2506.07036","last_updated":"2025-06-13T15:54:51Z","snapshot_observed_at":"2026-08-07T05:41:08.298197Z","submitted_at":"2025-06-08T08:00:56Z","title":"In This Environment, As That Speaker: A Text-Driven Framework for Multi-Attribute Speech Conversion","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:27.783843Z"},"links":{"citing_paper":"/paper/2506.07036"},"observation_digest":"sha256:620be61a61c99490c439047b80a8363ac5df8564330bc6961180208feb0fed4a","observation_id":"f9669ce7-e361-4c04-b8ad-9df20ab4f70c","resolution":{"observed_at":"2026-08-07T05:50:28.428193Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:28.231777Z","title":"V oiceldm: Text-to- speech with environmental context,","venue":null,"work_id":"9d4578fd-06d5-4b24-b58f-20fa7b8389af","year":2024},"citing_paper":{"arxiv_id":"2506.07036","last_updated":"2025-06-13T15:54:51Z","snapshot_observed_at":"2026-08-07T05:41:08.298197Z","submitted_at":"2025-06-08T08:00:56Z","title":"In This Environment, As That Speaker: A Text-Driven Framework for Multi-Attribute Speech Conversion","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:27.878461Z"},"links":{"citing_paper":"/paper/2506.07036"},"observation_digest":"sha256:4a910b505eb2ee06fec3df714569eedb70cfeec24c27b95619acfa7c04e57452","observation_id":"5164b042-7d47-4b7e-a8d2-93118912647f","resolution":{"observed_at":"2026-08-07T05:50:28.236798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:27.882328Z","title":"Clap learning audio concepts from natural language supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07036","last_updated":"2025-06-13T15:54:51Z","snapshot_observed_at":"2026-08-07T05:41:08.298197Z","submitted_at":"2025-06-08T08:00:56Z","title":"In This Environment, As That Speaker: A Text-Driven Framework for Multi-Attribute Speech Conversion","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:27.882328Z"},"links":{"citing_paper":"/paper/2506.07036"},"observation_digest":"sha256:dfa7f9181633a92fdad36363866195621ec1315388321aedb04a454a84901467","observation_id":"bb6e24f0-a5e0-44b5-9c2f-8a6ba4f54f11","resolution":{"observed_at":"2026-08-07T05:50:27.882328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:28.208151Z","title":"Learning the unlearned: Mitigating feature suppression in con- trastive learning,","venue":null,"work_id":"5d9d20fe-4438-4962-b989-7bcdc2d3f5aa","year":2024},"citing_paper":{"arxiv_id":"2506.07036","last_updated":"2025-06-13T15:54:51Z","snapshot_observed_at":"2026-08-07T05:41:08.298197Z","submitted_at":"2025-06-08T08:00:56Z","title":"In This Environment, As That Speaker: A Text-Driven Framework for Multi-Attribute Speech Conversion","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:27.886197Z"},"links":{"citing_paper":"/paper/2506.07036"},"observation_digest":"sha256:bdf6929a88b3bc494e602e5067d65aa06aac32c51e397346ae0b46847a3a878d","observation_id":"50490b61-a75d-45cc-a193-f9ac58bdf65c","resolution":{"observed_at":"2026-08-07T05:50:28.213330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:27.890082Z","title":"Prompttts: Control- lable text-to-speech with text descriptions,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07036","last_updated":"2025-06-13T15:54:51Z","snapshot_observed_at":"2026-08-07T05:41:08.298197Z","submitted_at":"2025-06-08T08:00:56Z","title":"In This Environment, As That Speaker: A Text-Driven Framework for Multi-Attribute Speech Conversion","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:27.890082Z"},"links":{"citing_paper":"/paper/2506.07036"},"observation_digest":"sha256:476673ad0411278c3fda01ce291656b56bdb40b9244acbbe12b5e58f3781c096","observation_id":"cdee7974-125e-46dd-a51f-1729d9df69c3","resolution":{"observed_at":"2026-08-07T05:50:27.890082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07969","last_updated":"2024-06-12T07:49:21Z","snapshot_observed_at":"2026-07-06T18:29:25.765578Z","submitted_at":"2024-06-12T07:49:21Z","title":"LibriTTS-P: A Corpus with Speaking Style and Speaker Identity Prompts for Text-to-Speech and Style Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07969","snapshot_observed_at":"2026-08-07T05:50:27.894511Z","title":"Libritts-p: A corpus with speaking style and speaker identity prompts for text-to-speech and style captioning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07036","last_updated":"2025-06-13T15:54:51Z","snapshot_observed_at":"2026-08-07T05:41:08.298197Z","submitted_at":"2025-06-08T08:00:56Z","title":"In This Environment, As That Speaker: A Text-Driven Framework for Multi-Attribute Speech Conversion","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:27.894511Z"},"links":{"cited_paper":"/paper/2406.07969","citing_paper":"/paper/2506.07036"},"observation_digest":"sha256:48ac7edb96feb6c61ce94c1ef98c1beb7726fc5af76140b52fdb785a00f6bf78","observation_id":"95accd3d-dbe4-4b30-abe1-c446db699210","resolution":{"observed_at":"2026-08-07T05:50:27.894511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02612","last_updated":"2024-12-03T17:41:24Z","snapshot_observed_at":"2026-08-02T21:27:26.884251Z","submitted_at":"2024-12-03T17:41:24Z","title":"GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02612","snapshot_observed_at":"2026-08-07T05:50:27.902521Z","title":"Glm-4-voice: Towards intelligent and human-like end- to-end spoken chatbot,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07036","last_updated":"2025-06-13T15:54:51Z","snapshot_observed_at":"2026-08-07T05:41:08.298197Z","submitted_at":"2025-06-08T08:00:56Z","title":"In This Environment, As That Speaker: A Text-Driven Framework for Multi-Attribute Speech Conversion","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:27.902521Z"},"links":{"cited_paper":"/paper/2412.02612","citing_paper":"/paper/2506.07036"},"observation_digest":"sha256:802ee9f3fa8d123e5c02be1a56bd0cd94c9c96f4c93fa86a37e34099ab2d2acf","observation_id":"74adbc61-b926-4cf6-9355-eb9286bd6796","resolution":{"observed_at":"2026-08-07T05:50:27.902521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:27.906656Z","title":"X-vectors: Robust dnn embeddings for speaker recognition,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.07036","last_updated":"2025-06-13T15:54:51Z","snapshot_observed_at":"2026-08-07T05:41:08.298197Z","submitted_at":"2025-06-08T08:00:56Z","title":"In This Environment, As That Speaker: A Text-Driven Framework for Multi-Attribute Speech Conversion","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:27.906656Z"},"links":{"citing_paper":"/paper/2506.07036"},"observation_digest":"sha256:f8a389f863d4d9444367b5e9ef8428c86ca6670302ede1f88ec5628a80c61eae","observation_id":"1019bbbb-a944-403e-a427-703a03b06966","resolution":{"observed_at":"2026-08-07T05:50:27.906656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18802","last_updated":"2023-05-30T07:30:21Z","snapshot_observed_at":"2026-07-06T15:35:15.564727Z","submitted_at":"2023-05-30T07:30:21Z","title":"LibriTTS-R: A Restored Multi-Speaker Text-to-Speech Corpus","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18802","snapshot_observed_at":"2026-08-07T05:50:27.910684Z","title":"Libritts-r: A restored multi-speaker text-to-speech corpus,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07036","last_updated":"2025-06-13T15:54:51Z","snapshot_observed_at":"2026-08-07T05:41:08.298197Z","submitted_at":"2025-06-08T08:00:56Z","title":"In This Environment, As That Speaker: A Text-Driven Framework for Multi-Attribute Speech Conversion","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:27.910684Z"},"links":{"cited_paper":"/paper/2305.18802","citing_paper":"/paper/2506.07036"},"observation_digest":"sha256:b81f0fb140b03b375419004f278cd877c78649a0a732883f33cb78989ce6bc36","observation_id":"3764641e-6569-495a-a220-56d32fa87e82","resolution":{"observed_at":"2026-08-07T05:50:27.910684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:27.914984Z","title":"gpurir: A python library for room impulse response simulation with gpu acceler- ation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07036","last_updated":"2025-06-13T15:54:51Z","snapshot_observed_at":"2026-08-07T05:41:08.298197Z","submitted_at":"2025-06-08T08:00:56Z","title":"In This Environment, As That Speaker: A Text-Driven Framework for Multi-Attribute Speech Conversion","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:27.914984Z"},"links":{"citing_paper":"/paper/2506.07036"},"observation_digest":"sha256:ef93b9f75a69f7c0b0971b2e947212a0594f8a7e1ea056d07d00f4a465872fb4","observation_id":"ff833e3e-4076-4bd8-a8d2-3758b2d4a262","resolution":{"observed_at":"2026-08-07T05:50:27.914984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:27.918844Z","title":"Freevc: Towards high-quality text-free one-shot voice conversion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07036","last_updated":"2025-06-13T15:54:51Z","snapshot_observed_at":"2026-08-07T05:41:08.298197Z","submitted_at":"2025-06-08T08:00:56Z","title":"In This Environment, As That Speaker: A Text-Driven Framework for Multi-Attribute Speech Conversion","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:27.918844Z"},"links":{"citing_paper":"/paper/2506.07036"},"observation_digest":"sha256:938095a88d646fcb5082a335b7bac4973aeb7a08a63e519f86ce6343870e493a","observation_id":"c369a375-9f8b-41e4-95a8-0cee80373675","resolution":{"observed_at":"2026-08-07T05:50:27.918844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:50:27.922828Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07036","last_updated":"2025-06-13T15:54:51Z","snapshot_observed_at":"2026-08-07T05:41:08.298197Z","submitted_at":"2025-06-08T08:00:56Z","title":"In This Environment, As That Speaker: A Text-Driven Framework for Multi-Attribute Speech Conversion","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:27.922828Z"},"links":{"citing_paper":"/paper/2506.07036"},"observation_digest":"sha256:d1958fafa090e8b41a76f9a3052f6a312ffea325b0e43f20464be6cda8ec2e4e","observation_id":"3daa2ac8-e0a9-41e8-8508-b30a51a6870b","resolution":{"observed_at":"2026-08-07T05:50:27.922828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.07036","last_updated":"2025-06-13T15:54:51Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T05:41:08.298197Z","submitted_at":"2025-06-08T08:00:56Z","title":"In This Environment, As That Speaker: A Text-Driven Framework for Multi-Attribute Speech Conversion"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":6,"verified_fuzzy":16},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 1 inbound Pith citation observation for arXiv:2506.07036."}