{"as_of":"2026-08-08T08:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ba12267b59e9776c3964a62a64e5abb56079ad5e328b60bdb2d2a4901c5265a2","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:00:12.519114Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:00:09.374265Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T12:00:13.204804Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-07T11:54:50.494600Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"cited_work":{"arxiv_id":"2506.00832","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.00832","snapshot_observed_at":"2026-08-07T12:00:13.204804Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","venue":"cs.SD","work_id":"e258a77b-e2a7-426e-be61-706a56afe366","year":2025},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-07T11:54:50.494600Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:09.374265Z"},"links":{"cited_paper":"/paper/2506.00832","citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:1e9f98042fed6b9b59435d65df35de0768f18cf5ba46e20ec2f04c74b08cbc51","observation_id":"5638f2c9-2732-4a60-a3ac-02461578072a","resolution":{"observed_at":"2026-08-07T12:00:13.248560Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.00832/citation-record","integrity":"/paper/2506.00832/integrity","json":"/paper/2506.00832/citation-record.json","paper":"/paper/2506.00832"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:00:18.200691Z","title":"What would the internal representation look like if the model aimed for a higher pitch rather than the current, lower one?","venue":null,"work_id":"0dade551-acb3-4043-939f-b9229163d288","year":null},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-07T11:54:50.494600Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:09.318584Z"},"links":{"citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:7b979be6af1fcacb28a77be354f23b4c6b53cb4bdea89af49ecae842bce6836b","observation_id":"02f6f1f8-c1ca-42de-870b-2c079d7d87b2","resolution":{"observed_at":"2026-08-07T12:00:18.318653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-07T11:54:50.494600Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"cited_work":{"arxiv_id":"2506.00832","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.00832","snapshot_observed_at":"2026-08-07T12:00:13.204804Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","venue":"cs.SD","work_id":"e258a77b-e2a7-426e-be61-706a56afe366","year":2025},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-07T11:54:50.494600Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:09.374265Z"},"links":{"cited_paper":"/paper/2506.00832","citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:1e9f98042fed6b9b59435d65df35de0768f18cf5ba46e20ec2f04c74b08cbc51","observation_id":"5638f2c9-2732-4a60-a3ac-02461578072a","resolution":{"observed_at":"2026-08-07T12:00:13.248560Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:00:17.997083Z","title":"What would the internal representation look like if the synthesized speech had a higher pitch rather than a lower pitch?","venue":null,"work_id":"cdac0d01-ed0f-4539-9d28-b4f15d36b351","year":null},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-07T11:54:50.494600Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:09.480496Z"},"links":{"citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:f4f33b7756ba11d2a4f4164c2073c0b7b1ff48916cae44bb14bf77a9b85a8d46","observation_id":"7241112a-e882-4420-8835-0c7fb9c7aefb","resolution":{"observed_at":"2026-08-07T12:00:18.062228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:00:17.822193Z","title":null,"venue":null,"work_id":"946d2c1d-ea44-46ee-ab45-11dd1b09eda5","year":null},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-07T11:54:50.494600Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:09.563895Z"},"links":{"citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:d14339d991a8934a76cce83523f0605af0fdbfa805fea88d4d80fbecf1371422","observation_id":"3590fff4-d059-4644-a4e7-015aed35fa08","resolution":{"observed_at":"2026-08-07T12:00:17.902086Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:00:17.666576Z","title":"In planning its data processing techniques","venue":null,"work_id":"a8fd4919-665e-471b-a98a-f1a64ef2ec0a","year":null},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-07T11:54:50.494600Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:09.654733Z"},"links":{"citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:66d2afd33239f995aad7a730fe0344075e80cf2c19f1f44ce4174221d8b6ceff","observation_id":"37349320-eb49-4298-81b1-7a3994aa0f7b","resolution":{"observed_at":"2026-08-07T12:00:17.722710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:00:17.578773Z","title":null,"venue":null,"work_id":"ccf373f9-3aa9-4f6d-8408-5852da422cf8","year":null},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-07T11:54:50.494600Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:09.732784Z"},"links":{"citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:307a77ffe1093202a2d62111b9f144821cd2d2e4fc1ae04f0260916290f2d806","observation_id":"44d11211-003e-41f0-8d42-4ce76193197d","resolution":{"observed_at":"2026-08-07T12:00:17.633955Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:00:17.359758Z","title":"2022-0-00984, Devel- opment of Artificial Intelligence Technology for Personalized Plug-and-Play Explanation and Verification of Explanation; No","venue":null,"work_id":"60103c2d-5eef-4262-890e-5454aba2a584","year":2019},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-07T11:54:50.494600Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:09.840699Z"},"links":{"citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:76c4917e7fa1ffd845b786e3e2c1fcdbe4ab2f826722a0f93b80d436a9c8f2f1","observation_id":"1003b833-5259-4b16-bc68-dfe11d55928d","resolution":{"observed_at":"2026-08-07T12:00:17.417830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1703.10135","last_updated":"2017-04-06T21:20:34Z","snapshot_observed_at":"2026-08-05T15:51:16.043022Z","submitted_at":"2017-03-29T16:55:13Z","title":"Tacotron: Towards End-to-End Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.10135","snapshot_observed_at":"2026-08-07T12:00:09.959311Z","title":"Tacotron: Towards end-to-end speech synthesis,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-07T11:54:50.494600Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:09.959311Z"},"links":{"cited_paper":"/paper/1703.10135","citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:889559b54eb5a657cc6fc810c4f33c274977defa93a1c72f0e83bff401cc96ba","observation_id":"2b339be2-3a3e-42ca-a3fb-9dd0a901e141","resolution":{"observed_at":"2026-08-07T12:00:09.959311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:00:17.169870Z","title":"Natural tts synthesis by conditioning wavenet on mel spectrogram predic- tions,","venue":null,"work_id":"2515e8df-3189-4c9f-ae49-a658b45e04b5","year":2018},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-07T11:54:50.494600Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:10.014611Z"},"links":{"citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:20487d5b375c8b301b1b7eaa5462a48176cb380ccf28d4cd052905ab8c9fc446","observation_id":"d7419863-81a5-4109-a059-61c5e407d01b","resolution":{"observed_at":"2026-08-07T12:00:17.294685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:00:17.019667Z","title":"Neural speech synthe- sis with transformer network,","venue":null,"work_id":"02a7032a-c545-4e86-9d4a-9a1e88dd422e","year":2019},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-07T11:54:50.494600Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:10.124986Z"},"links":{"citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:56e9fac35d67a22970ad3e53d3c1c51192e11ff2dfdceaded03b05a6b1e0ef7c","observation_id":"24f6eeb6-59af-4911-b21b-dd9f13ab3f56","resolution":{"observed_at":"2026-08-07T12:00:17.049983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:00:10.220550Z","title":"Fastspeech: Fast, robust and controllable text to speech,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-07T11:54:50.494600Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:10.220550Z"},"links":{"citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:177e58daaf143184bd5327ff6ed2ba7442e59856b26761603f823cbe3b093209","observation_id":"508dffc0-9d53-459f-ba21-77ad334033e4","resolution":{"observed_at":"2026-08-07T12:00:10.220550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04558","last_updated":"2022-08-08T01:53:05Z","snapshot_observed_at":"2026-08-06T18:05:37.673476Z","submitted_at":"2020-06-08T13:05:40Z","title":"FastSpeech 2: Fast and High-Quality End-to-End Text to Speech","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04558","snapshot_observed_at":"2026-08-07T12:00:10.317617Z","title":"Fastspeech 2: Fast and high-quality end-to-end text to speech,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-07T11:54:50.494600Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:10.317617Z"},"links":{"cited_paper":"/paper/2006.04558","citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:b111c438fb588d7c9845c1bc1f5f58cfd5bbf4ec88a02c992adb7b5a9214b2a6","observation_id":"fc3de9b6-9a65-4842-a3ef-4433dcddfc69","resolution":{"observed_at":"2026-08-07T12:00:10.317617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-07T12:00:10.368822Z","title":"Wavenet: A generative model for raw audio,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-07T11:54:50.494600Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:10.368822Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:300c1609cad633e8e80ae7ca39173dcf46625ee04dd5c0b4f35e2b1ac9268387","observation_id":"c8bfe558-57ec-4f69-82b4-b383d3bf917b","resolution":{"observed_at":"2026-08-07T12:00:10.368822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:00:16.814788Z","title":"Waveglow: A flow-based generative network for speech synthesis,","venue":null,"work_id":"b530d237-cfb2-4a44-aa28-b1a27e1e006a","year":2019},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-07T11:54:50.494600Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:10.424096Z"},"links":{"citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:c371c993c2f649c38575328868a204a58ecc98c9073a45cccddcbefd879e1a11","observation_id":"a44eca22-eeaf-46c1-9a54-1f7da6dacf01","resolution":{"observed_at":"2026-08-07T12:00:16.909764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:00:16.558180Z","title":"Mel- gan: Generative adversarial networks for conditional waveform synthesis,","venue":null,"work_id":"822eb98c-4a64-4828-a365-ffac5df6f291","year":2019},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-07T11:54:50.494600Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:10.536694Z"},"links":{"citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:20e2b1cd2017682b13caed7788aa17534998fe5bff5fcbd09a6bc70ba7cb8e34","observation_id":"3bff5da7-4ba2-473e-86e7-8a80941dfa07","resolution":{"observed_at":"2026-08-07T12:00:16.716059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:00:16.316740Z","title":"Hifi-gan: Generative adversarial net- works for efficient and high fidelity speech synthesis,","venue":null,"work_id":"21e59b44-7e9e-4678-af6e-8660261111c4","year":2020},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-07T11:54:50.494600Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:10.614594Z"},"links":{"citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:2623e6a49d261aa750df4c1cc9eaa0c0d0f7443b8fa011788f7514593587e4b2","observation_id":"4337127c-beb1-442c-8cd1-27d4b13c3992","resolution":{"observed_at":"2026-08-07T12:00:16.447390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:00:10.682549Z","title":"Style tokens: Un- supervised style modeling, control and transfer in end-to-end speech synthesis,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-07T11:54:50.494600Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:10.682549Z"},"links":{"citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:6dd212b3ec3297be6509a4c64bf97f6b2eedfa4ffb7f01e2ff100693dc3a0ff1","observation_id":"cb462432-b81c-4d94-a303-910b17317d71","resolution":{"observed_at":"2026-08-07T12:00:10.682549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:00:10.754568Z","title":"To- wards end-to-end prosody transfer for expressive speech synthesis with tacotron,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-07T11:54:50.494600Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:10.754568Z"},"links":{"citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:8fdcc9f1a07e0704ee01f7a38ad40a8c7d4d3f421ad169c872f33c46de3a8274","observation_id":"3b54d476-2d76-49c6-aa5d-b571d2f94059","resolution":{"observed_at":"2026-08-07T12:00:10.754568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.07217","last_updated":"2018-12-27T06:50:41Z","snapshot_observed_at":"2026-07-06T07:08:41.080825Z","submitted_at":"2018-10-16T18:20:02Z","title":"Hierarchical Generative Modeling for Controllable Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.07217","snapshot_observed_at":"2026-08-07T12:00:10.808080Z","title":"Hierarchical genera- tive modeling for controllable speech synthesis,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-07T11:54:50.494600Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:10.808080Z"},"links":{"cited_paper":"/paper/1810.07217","citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:445bd945d1cda79e2b978f38617afc0966b8aaff7218cb3caa8a7a6347d31635","observation_id":"0fd643ee-44fa-46ab-a53d-8e9ccab5cb3a","resolution":{"observed_at":"2026-08-07T12:00:10.808080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:00:15.259681Z","title":"Prosody under con- trol: Controlling prosody in text-to-speech synthesis by adjust- ments in latent reference space,","venue":null,"work_id":"817df643-97aa-48ce-863f-0dfb99eb4d14","year":2023},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-07T11:54:50.494600Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:10.916035Z"},"links":{"citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:d2559ef028d8bf3f5cfc2f7d1893ab7a38e4fc8ef1eec1f496b083f68f4ea17e","observation_id":"004539f0-2355-42fe-9072-d05e53e7391b","resolution":{"observed_at":"2026-08-07T12:00:15.506225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.08352","last_updated":"2021-06-15T18:03:48Z","snapshot_observed_at":"2026-07-06T11:19:38.321360Z","submitted_at":"2021-06-15T18:03:48Z","title":"Ctrl-P: Temporal Control of Prosodic Variation for Speech Synthesis","version":1},"cited_work":{"arxiv_id":"2106.08352","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.08352","snapshot_observed_at":"2026-08-07T12:00:12.957717Z","title":"Ctrl-P: Temporal Control of Prosodic Variation for Speech Synthesis","venue":"eess.AS","work_id":"31ddd0f1-0127-4cbb-a76c-9485e81a6b0b","year":2021},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-07T11:54:50.494600Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:11.005095Z"},"links":{"cited_paper":"/paper/2106.08352","citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:60fdec7d2764d4a08711702202141118c98a6a243c9764d4dc3181c25ce4d92f","observation_id":"86511840-7bf2-40cd-b188-343e069a30e6","resolution":{"observed_at":"2026-08-07T12:00:13.054479Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:00:14.948693Z","title":"Hierarchical prosody modeling and control in non-autoregressive parallel neural tts,","venue":null,"work_id":"28485cb2-3049-4c00-ae8f-45aa79f175de","year":2022},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-07T11:54:50.494600Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:11.095853Z"},"links":{"citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:a9d766f9a3b4bf7167e861062b4e53363a02e77bf5726cbcfc82def3a8c2cb4b","observation_id":"f3586622-df59-4260-90dd-f93722557864","resolution":{"observed_at":"2026-08-07T12:00:15.025126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:00:14.780724Z","title":"Analysis of pronunciation learning in end-to-end speech synthesis","venue":null,"work_id":"d0eca43a-9316-4ceb-88e2-c4092935c90f","year":2019},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-07T11:54:50.494600Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:11.170821Z"},"links":{"citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:0af65b871a8afa7fdbf2a8ebf0dfef5e5b9a669c7466bcc36323981a5e8f0bb8","observation_id":"1d4052e0-cd1c-4850-990a-bdb2b00d5acb","resolution":{"observed_at":"2026-08-07T12:00:14.866577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:00:14.563530Z","title":"Expressive prosody for unit- selection speech synthesis","venue":null,"work_id":"21b671c6-6292-46c4-9485-3f7300bc51f1","year":2006},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-07T11:54:50.494600Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:11.217114Z"},"links":{"citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:52285dad4441917ae8e4031ca81635196b170829c16a563e814fd5fcc4149b1f","observation_id":"a4613d82-41a0-40cc-ab7b-439523ce1418","resolution":{"observed_at":"2026-08-07T12:00:14.657076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08846","last_updated":"2023-10-13T04:13:26Z","snapshot_observed_at":"2026-07-06T16:32:19.417168Z","submitted_at":"2023-10-13T04:13:26Z","title":"Speaking rate attention-based duration prediction for speed control TTS","version":1},"cited_work":{"arxiv_id":"2310.08846","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.08846","snapshot_observed_at":"2026-08-07T12:00:12.782356Z","title":"Speaking rate attention-based duration prediction for speed control TTS","venue":"eess.AS","work_id":"711d7c11-9e30-4fed-ba44-8c6d8e300f07","year":2023},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-07T11:54:50.494600Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:11.312003Z"},"links":{"cited_paper":"/paper/2310.08846","citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:a8b10ad4d8ce186b118e6ec212ceaccd0c2a670572ce47176bdf91cbfd214e26","observation_id":"68cf2e50-5554-4ae8-9655-447e62ecce8d","resolution":{"observed_at":"2026-08-07T12:00:12.835344Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:00:14.365616Z","title":"Speaking rate control of end-to-end tts models by direct manipulation of the encoder’s out- put embeddings,","venue":null,"work_id":"6a46985c-569c-4514-a682-c11edfeef099","year":2022},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-07T11:54:50.494600Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:11.374501Z"},"links":{"citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:288d786f4f2921cb6947e4803c385cd312187e62e0cedefc42e2eb7673a49104","observation_id":"445b59ed-41b1-4406-9923-d6d1812161ea","resolution":{"observed_at":"2026-08-07T12:00:14.461220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.15404","last_updated":"2020-12-31T02:34:57Z","snapshot_observed_at":"2026-08-08T04:55:45.060984Z","submitted_at":"2020-12-31T02:34:57Z","title":"Unified Mandarin TTS Front-end Based on Distilled BERT Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.15404","snapshot_observed_at":"2026-08-07T12:00:11.440776Z","title":"Unified mandarin tts front-end based on distilled bert model,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-07T11:54:50.494600Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:11.440776Z"},"links":{"cited_paper":"/paper/2012.15404","citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:bbc17f3923f6796d814eb027fce9ae0c90d2cb38fb52145f152604470aeb6797","observation_id":"0b83458a-f700-4ac0-ad80-36057ab40fb3","resolution":{"observed_at":"2026-08-07T12:00:11.440776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:00:14.188844Z","title":"Speech audio corrector: using speech from non-target speakers for one- off correction of mispronunciations in grapheme-input text-to- speech,","venue":null,"work_id":"385fa46b-c0f1-4794-a729-2970e68e8f53","year":2022},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-07T11:54:50.494600Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:11.517200Z"},"links":{"citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:63cc98b08970df19cb1a58941d45cc65aff0f21f3754a7bd138c0f484ced6e6a","observation_id":"d1e7c6ee-5379-450d-b595-528859d2db11","resolution":{"observed_at":"2026-08-07T12:00:14.256621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:00:14.076295Z","title":"Exact prosody cloning in zero- shot multispeaker text-to-speech,","venue":null,"work_id":"3481b3f6-3ea6-49b1-ac08-7fe2f1d7f601","year":2023},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-07T11:54:50.494600Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:11.587352Z"},"links":{"citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:5ea8200e029a7a62c931766d0845dd0d5255b2ffd01e37bdea52a378da9fd880","observation_id":"e376def8-8962-4098-8b46-8ebfe1c77cba","resolution":{"observed_at":"2026-08-07T12:00:14.115182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:00:11.667468Z","title":"Hubert: Self-supervised speech rep- resentation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-07T11:54:50.494600Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:11.667468Z"},"links":{"citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:9997d50cea0d52cd8c751f03bae23be1ce85f9ce69377ae0f10d9fb120944eb9","observation_id":"f68dbea8-097f-45fe-9527-0df732a749dd","resolution":{"observed_at":"2026-08-07T12:00:11.667468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.12489","last_updated":"2022-06-24T20:55:46Z","snapshot_observed_at":"2026-08-06T13:53:56.625125Z","submitted_at":"2022-06-24T20:55:46Z","title":"Predicting within and across language phoneme recognition performance of self-supervised learning speech pre-trained models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.12489","snapshot_observed_at":"2026-08-07T12:00:11.722250Z","title":"Predicting within and across language phoneme recognition performance of self- supervised learning speech pre-trained models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-07T11:54:50.494600Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:11.722250Z"},"links":{"cited_paper":"/paper/2206.12489","citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:df79b0b6dc3c650e2b96421a7f412924ab32ccba4176cea875961930e21c83e1","observation_id":"5d2ce58f-ac88-44b7-bbdd-7403a9ea9228","resolution":{"observed_at":"2026-08-07T12:00:11.722250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.03471","last_updated":"2018-10-22T14:27:40Z","snapshot_observed_at":"2026-07-06T05:37:27.385512Z","submitted_at":"2017-04-11T18:01:07Z","title":"What do Neural Machine Translation Models Learn about Morphology?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.03471","snapshot_observed_at":"2026-08-07T12:00:11.782293Z","title":"What do neural machine translation models learn about morphology?","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-07T11:54:50.494600Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:11.782293Z"},"links":{"cited_paper":"/paper/1704.03471","citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:73429c5cdcc8d85c520566a655267a254309aeb5a83852347f7ccdcba95eb4b8","observation_id":"b1e1493a-f485-411c-97f1-fc0529edeae0","resolution":{"observed_at":"2026-08-07T12:00:11.782293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:00:13.945231Z","title":"What is one grain of sand in the desert? analyzing individual neu- rons in deep nlp models,","venue":null,"work_id":"a2298314-4b92-4b80-9a6a-fc7a3632d098","year":2019},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-07T11:54:50.494600Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:11.876789Z"},"links":{"citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:633bd32319594af22c9bc29102c13c1fb4fc78846305b6da1d61b51a3b1ff2db","observation_id":"4b48f0f9-6544-478c-b1d1-0d2c492e11bc","resolution":{"observed_at":"2026-08-07T12:00:14.001445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.09615","last_updated":"2019-07-22T22:35:51Z","snapshot_observed_at":"2026-08-02T12:52:51.834393Z","submitted_at":"2019-07-22T22:35:51Z","title":"Towards Realistic Individual Recourse and Actionable Explanations in Black-Box Decision Making Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.09615","snapshot_observed_at":"2026-08-07T12:00:11.931116Z","title":"Towards realistic individual recourse and actionable explana- tions in black-box decision making systems,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-07T11:54:50.494600Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:11.931116Z"},"links":{"cited_paper":"/paper/1907.09615","citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:addff051b9129449f24234f69855e054eab1a71059d08f3e4604623a25f1bdc7","observation_id":"7e3f52dc-1e90-4081-86ad-cb68208c4814","resolution":{"observed_at":"2026-08-07T12:00:11.931116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:00:13.795718Z","title":"Diffeomorphic counterfactuals with generative models,","venue":null,"work_id":"70f70584-7f3a-497e-b049-9eef477e8bca","year":2023},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-07T11:54:50.494600Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:12.023797Z"},"links":{"citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:c60795f96f2269d342106883d9cf14b1d34bea8543f39747d93ecaa7185fde5e","observation_id":"1952a89f-b8e6-4015-b9a0-e0f5dc6cdf65","resolution":{"observed_at":"2026-08-07T12:00:13.854760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:00:13.664023Z","title":"beta-vae: Learning basic visual concepts with a constrained variational framework,","venue":null,"work_id":"0f60df19-e0c9-44f4-bf4b-a159c16c9731","year":2016},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-07T11:54:50.494600Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:12.065057Z"},"links":{"citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:4e0376429122f4e32de3d3bed8a016153e84e8e3c2e5b5e2d2762aa930fb5e46","observation_id":"1db4c802-4710-465f-bea5-b579d3e189c3","resolution":{"observed_at":"2026-08-07T12:00:13.742857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:00:13.528383Z","title":"Neural discrete represen- tation learning,","venue":null,"work_id":"37a3f5d0-bf96-4397-b0f9-22ca492701c3","year":2017},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-07T11:54:50.494600Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:12.131190Z"},"links":{"citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:70f6c6b26b6fd445f2d35ad25600aa67c077c4e3e72e996b552207a01d145979","observation_id":"fd3bb7e5-c28d-4611-ad1d-542c4bbf2e2f","resolution":{"observed_at":"2026-08-07T12:00:13.586825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:00:12.209634Z","title":"The lj speech dataset,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-07T11:54:50.494600Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:12.209634Z"},"links":{"citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:4d8b2e1e5cd027e6275f17828b5d34d54e0c0240cdc947ac1bb7f228e4818364","observation_id":"861b9cab-a2b4-4017-8617-33324a2c61ab","resolution":{"observed_at":"2026-08-07T12:00:12.209634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.11096","last_updated":"2019-02-25T21:32:06Z","snapshot_observed_at":"2026-07-06T07:04:57.275371Z","submitted_at":"2018-09-28T15:38:49Z","title":"Large Scale GAN Training for High Fidelity Natural Image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.11096","snapshot_observed_at":"2026-08-07T12:00:12.264666Z","title":"Large scale gan train- ing for high fidelity natural image synthesis,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-07T11:54:50.494600Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:12.264666Z"},"links":{"cited_paper":"/paper/1809.11096","citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:4a6b11b626f55d0f9996d63f4b178d058d663359ccf043a7861cd92b8d94405f","observation_id":"f8e062e2-2d29-4f38-bb32-edd9b8a6d929","resolution":{"observed_at":"2026-08-07T12:00:12.264666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:00:12.370607Z","title":"Robust speech recognition via large-scale weak su- pervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-07T11:54:50.494600Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:12.370607Z"},"links":{"citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:470dbc728df5705406637b78a49fe34a31ccf84a725f15eb1c98bc288494cd9a","observation_id":"c22909a4-cdd4-41c5-a5c2-13d369506f8e","resolution":{"observed_at":"2026-08-07T12:00:12.370607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:00:12.455556Z","title":"Language models are unsupervised multitask learners,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-07T11:54:50.494600Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:12.455556Z"},"links":{"citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:1e0970c7f710ff22ada440c8db8443ba4b35951a495255c1958390a6958366c3","observation_id":"a972daaa-7f52-4136-8cb9-cfa7279a8627","resolution":{"observed_at":"2026-08-07T12:00:12.455556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:00:13.323891Z","title":"Speech quality assessment,","venue":null,"work_id":"16603543-a432-401c-ae7e-a50d96478208","year":2011},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-07T11:54:50.494600Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:12.519114Z"},"links":{"citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:78cd6ec464d1ddefb9a617f198bd55fecc349e046cedc2cdefe199b27ddb350b","observation_id":"3363bde7-799e-4e73-8c61-0ef606ae6fa3","resolution":{"observed_at":"2026-08-07T12:00:13.409116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T11:54:50.494600Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":18,"verified_exact":2,"verified_fuzzy":21},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 1 inbound Pith citation observation for arXiv:2506.00832."}