{"as_of":"2026-08-07T20:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2efff9446d6fa369fbaaa50e591351065e85aa3b879ef3ab43387aecc7b01cab","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:11:40.541402Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:11:26.568638Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T21:11:40.627696Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"cited_work":{"arxiv_id":"2507.00808","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.00808","snapshot_observed_at":"2026-08-06T21:11:40.627696Z","title":"Multi-interaction TTS toward professional recording reproduction","venue":"cs.SD","work_id":"862b98b9-88e9-44a0-9971-145b947b7f0b","year":2025},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:26.568638Z"},"links":{"cited_paper":"/paper/2507.00808","citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:a38e0161e98f63ca717e0b4b19f29b873af661bf81daa713cdc2d3d3cdf89ca9","observation_id":"f5356663-a23d-46d0-be41-e81f4b445693","resolution":{"observed_at":"2026-08-06T21:11:40.632803Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.00808/citation-record","integrity":"/paper/2507.00808/integrity","json":"/paper/2507.00808/citation-record.json","paper":"/paper/2507.00808"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"cited_work":{"arxiv_id":"2507.00808","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.00808","snapshot_observed_at":"2026-08-06T21:11:40.627696Z","title":"Multi-interaction TTS toward professional recording reproduction","venue":"cs.SD","work_id":"862b98b9-88e9-44a0-9971-145b947b7f0b","year":2025},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:26.568638Z"},"links":{"cited_paper":"/paper/2507.00808","citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:a38e0161e98f63ca717e0b4b19f29b873af661bf81daa713cdc2d3d3cdf89ca9","observation_id":"f5356663-a23d-46d0-be41-e81f4b445693","resolution":{"observed_at":"2026-08-06T21:11:40.632803Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.239930Z","title":"During the recording of this dataset, a di- rector iteratively gave acting directions, and the voice actor then reflected the given directions","venue":null,"work_id":"b42fb6d9-c10f-4a52-ba8b-f3046cf0f7a3","year":null},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:26.576860Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:9e305f6f4f5da7a226bf42ed63082c0191dfee42355aff155013ea47850c20a2","observation_id":"c49bf936-37ec-4847-a415-fd790f86d472","resolution":{"observed_at":"2026-08-06T21:11:41.243995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.227809Z","title":"Speak more brightly,","venue":null,"work_id":"27c0494d-73d1-4021-9919-0cd48c521d71","year":null},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:26.591023Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:a54732c197f697c427aa610da401f0ad1e22ab1f66aea69ba797f597f651bc4d","observation_id":"e1c22324-83e5-42e7-bef6-bbd725d26ea2","resolution":{"observed_at":"2026-08-06T21:11:41.232486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.217413Z","title":"In- sert a silent-pause after this word,","venue":null,"work_id":"35977ba9-fe6e-475b-b9d8-d006f62881df","year":null},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:26.605668Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:ad1085609f54d21a721c3afdecd7b51100828b22ba820bd199a1a8d289617565","observation_id":"7d97edb3-756a-490f-b9ba-e537f8a8edae","resolution":{"observed_at":"2026-08-06T21:11:41.220883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.205290Z","title":"Follow my example","venue":null,"work_id":"e0309806-41a9-4478-9601-8224bab79296","year":null},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:26.623467Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:cd91f8b440a8d44f865ce612cc190d7460a4b79d8d0e7b07abef7ba5f3efe93a","observation_id":"e59eaec2-69c1-42b3-8cb5-86b257961fb5","resolution":{"observed_at":"2026-08-06T21:11:41.209689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.190861Z","title":"The Guideline for TTS Speaking Style Classification","venue":null,"work_id":"45ca8209-54b1-4f99-a1cf-4af0a3fac4ea","year":null},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:26.642547Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:677a8fcc35f32b698087af593133751358636a141b9e120c9d13ea6414c57413","observation_id":"0bc539be-d5a5-48d3-9873-1a8d7fd58242","resolution":{"observed_at":"2026-08-06T21:11:41.195100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.178410Z","title":"Dataset We used three Japanese 22 kHz datasets: interactive, non- interactive, and large in-house datasets","venue":null,"work_id":"9f82e59f-a1b5-4388-8941-8d2d08986193","year":null},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:26.663023Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:8e8fecca99d227644db51d69a4e95d1df9222f32db62732a28c78c322fe0dad3","observation_id":"589bc8ec-64dd-45fb-b977-05653a3c6f3c","resolution":{"observed_at":"2026-08-06T21:11:41.182706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.167040Z","title":null,"venue":null,"work_id":"1dddc731-e5ac-463b-bf08-88de2b34ff48","year":null},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:26.683475Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:01d7a5c959d6b70d9c4d477a19bc140feaa4eb0452615a23cfa14b35f339de89","observation_id":"2255d797-b963-460e-befe-03f7b0d40e36","resolution":{"observed_at":"2026-08-06T21:11:41.170322Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.154783Z","title":null,"venue":null,"work_id":"59f7be4a-1247-4556-a490-898b525d2bac","year":null},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:26.694379Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:321fce630cfc35e180779ce598867f8f0ef8b78ae7ef5012c68e9dff8e3a8d37","observation_id":"53851e5c-e299-44a8-bb96-0a63fe1a2e24","resolution":{"observed_at":"2026-08-06T21:11:41.159357Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.144447Z","title":"The loss function and learning rate were the same as in the previous step","venue":null,"work_id":"1099232e-90e0-4d1d-af1e-26f77a5ddcfe","year":null},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:26.703922Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:45ca5ed80eebbcc1afb10995a5c933121218c4ee5bbcd8e9aa89e7193dfe88af","observation_id":"98649d8d-f586-442b-a582-b690c2f38fc5","resolution":{"observed_at":"2026-08-06T21:11:41.148255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.133637Z","title":"The training step was 10K steps with AdamW optimizer [41] with 4K warm-up steps","venue":null,"work_id":"c5047e62-5a8c-48e7-a71c-c4af6eacaf80","year":null},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:26.715018Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:12a6037c0404afb192c4155194a8a7fb8f2da5ac6fce1f6ca390cc8790a51e3d","observation_id":"84dc560a-abc9-4044-bb90-bc8db27c61d3","resolution":{"observed_at":"2026-08-06T21:11:41.137813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.122190Z","title":"Overall alignment only","venue":null,"work_id":"67317ba5-0d15-4aba-9c5e-86e120a092cf","year":null},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:26.725122Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:0230498a44a52a41bd8d01aafbd8af67e49bb57b5cd4f89d667d38eaaa2bead7","observation_id":"62883a09-b4af-4998-81d9-34b4d500cd6f","resolution":{"observed_at":"2026-08-06T21:11:41.125676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.111658Z","title":"at the beginning","venue":null,"work_id":"795f2f73-8139-43b7-bf59-e9bb48f434c3","year":null},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:26.736074Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:fe37b275834308ca828282438d4f3c460b9810239bd5a0f3afa54502ad10ee65","observation_id":"30701ae4-0d7b-4e3d-bc99-85fcfd78448c","resolution":{"observed_at":"2026-08-06T21:11:41.115057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.100822Z","title":"Subjective evaluations demonstrated that our proposed method achieved iterative style refinement that matched the user’s di- rections to some extent","venue":null,"work_id":"a036ce55-d590-48ed-8748-09ef9b9ebea8","year":null},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:26.749700Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:5bedb174b0841ff10af4a61cb3fab587b8355e1e1cd69f1c745eccf9dcc121ed","observation_id":"11d0c593-3556-437e-8097-2fccaec969bf","resolution":{"observed_at":"2026-08-06T21:11:41.104855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.087896Z","title":"The relevance of trial-and-error: Can trial-and- error be a sufficient learning method in technical problem-solving- contexts?","venue":null,"work_id":"fe137a7c-a878-461e-882c-ebbb528d62bf","year":2021},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:26.754699Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:947fb61b95b5edfcb26eda939beaf058d09b0cfc7174571011f308f1fed992b8","observation_id":"163bc918-16bc-40fe-a3db-a4eac5a8a983","resolution":{"observed_at":"2026-08-06T21:11:41.092369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.075725Z","title":"From da Vinci’s flying machines to a theory of the creative process,","venue":null,"work_id":"fe79dc77-9882-4ec5-b3a7-b7aa6fb0fedb","year":2021},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:26.762988Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:91e7edf9fa5abe206d13d12ba0698f7792c8a4f15664b066a00fdc1b55123f95","observation_id":"d8bf1404-3233-4bf1-9700-f8452d280a5c","resolution":{"observed_at":"2026-08-06T21:11:41.079650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.063465Z","title":"What are the stages of the creative process? What visual art students are saying","venue":null,"work_id":"575eb29d-7d15-4dab-b20f-8e6715b7f3ca","year":2018},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:26.806058Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:e598d5c01c30b6af7e38f34fcefe79c41c4f63c179aacc6516a47cb40cdefe66","observation_id":"1f4e05c7-a4fa-4026-a76d-176b02ac7acf","resolution":{"observed_at":"2026-08-06T21:11:41.067214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.051582Z","title":"From page to stage: The director’s interpretation and picturization of a script,","venue":null,"work_id":"2ef9e609-8023-4f62-b4a3-e142452343cf","year":2023},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:26.863549Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:3385871f97d3514f33ff59cefa6d8ddfd859151b0411828ca71365f561571c89","observation_id":"af7aab1a-6d09-4f31-87d0-ce2ac2493414","resolution":{"observed_at":"2026-08-06T21:11:41.056318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.039057Z","title":"Showing and telling—How directors combine embodied demonstrations and verbal descrip- tions to instruct in theater rehearsals,","venue":null,"work_id":"1ac06ca7-4a21-4ea9-894e-e56967e3469a","year":2023},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:26.952999Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:a8263fa082e9e7064bf2704a22ba797bf2a08603eabb9686f20537a0af1b6295","observation_id":"e678791d-f81a-4aac-9e6b-68544a57c169","resolution":{"observed_at":"2026-08-06T21:11:41.043331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-06T21:11:27.044864Z","title":"Hi- erarchical text-conditional image generation with CLIP latents,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:27.044864Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:1e8b7e0d46527ada1537afd6cce49dfe1ace2e00fbb7ba86687a60b651324a05","observation_id":"6cf3832f-cff7-4458-a084-a642fbc34abb","resolution":{"observed_at":"2026-08-06T21:11:27.044864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.027161Z","title":"High-resolution image synthesis with latent diffusion models,","venue":null,"work_id":"96cc5b7b-4473-4934-9a9d-afcf221f479e","year":2022},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:27.144346Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:4c3c35819e0b17ea43485a984fe78ba592c87b268eab2785e2f68700bef6c3fa","observation_id":"e58288b0-a4b1-4f92-a2ef-a146ededeeb0","resolution":{"observed_at":"2026-08-06T21:11:41.030672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.015294Z","title":"Photorealistic text-to- image diffusion models with deep language understanding,","venue":null,"work_id":"a452c608-1d36-43d1-8256-b5eaad270c13","year":2022},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:27.271811Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:63edad50bf7508219c45699e17c5fd1b4bc38fced8e9819b5ed4638294f6b3be","observation_id":"aae4d33f-0de3-41cc-b023-a8f231788bf9","resolution":{"observed_at":"2026-08-06T21:11:41.019811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-06T21:11:27.358467Z","title":"Program synthesis with large language models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:27.358467Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:558e5c0ee4f6b1a329b68edd7a1980385e72993201347353067773612ba3c5b0","observation_id":"0a6f5387-cb32-4563-8ea8-44b89c4a90a1","resolution":{"observed_at":"2026-08-06T21:11:27.358467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:41.001958Z","title":"CodeGen: An open large language model for code with multi-turn program synthesis,","venue":null,"work_id":"b03b743c-6c9c-47c7-97bd-958f5c2c6c9c","year":2023},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:27.459503Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:f1194997dad621581e68d5f77d3bd368603fb3be0858af0f09a39e7be293f484","observation_id":"5ddfe0d6-1d71-498e-b9b0-ef9c9ae37a37","resolution":{"observed_at":"2026-08-06T21:11:41.006962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.987966Z","title":"Training language models to follow instruc- tions with human feedback,","venue":null,"work_id":"f73d885a-7df1-48b2-9f5f-7a84d001a695","year":2022},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.323645Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:b2e0a1a965d7883bb1b54def434910e0a59b7f0b9e6438706de22fca10497bb3","observation_id":"d212c621-fc9d-4f65-a863-63aa3f829877","resolution":{"observed_at":"2026-08-06T21:11:40.993049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.976118Z","title":"PaLM: Scaling language modeling with path- ways,","venue":null,"work_id":"9d1a6163-9e7d-4320-90c7-b7b4b62ed975","year":2023},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.341138Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:ba7d3a2b650168f83291b2a1cce3f8c218208d462551576d6d94b581f7d60e2b","observation_id":"75703a4b-a7e8-464c-a830-477c1c0ca0e4","resolution":{"observed_at":"2026-08-06T21:11:40.980148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.15561","last_updated":"2021-07-23T12:32:52Z","snapshot_observed_at":"2026-07-06T11:24:19.530747Z","submitted_at":"2021-06-29T16:50:51Z","title":"A Survey on Neural Speech Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.15561","snapshot_observed_at":"2026-08-06T21:11:40.364754Z","title":"A survey on neural speech synthesis,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.364754Z"},"links":{"cited_paper":"/paper/2106.15561","citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:41e7a277d2970a23a9305da3a535fb2e7429ebd0799f0588e93bebc07195cedd","observation_id":"8b928b82-e0bb-41eb-b8de-269c3720e067","resolution":{"observed_at":"2026-08-06T21:11:40.364754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.391082Z","title":"A review of deep learning techniques for speech processing,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.391082Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:660bd041a81703c1e7510af86f6d79ad2c166fdf975bcee59e0fbcdd4ce13af9","observation_id":"229a5f78-d42d-43a9-9874-757d67685f5d","resolution":{"observed_at":"2026-08-06T21:11:40.391082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.956891Z","title":"Model archi- tectures to extrapolate emotional expressions in DNN-based text- to-speech,","venue":null,"work_id":"63a44829-6434-4ab4-ac02-02d1059e1c4d","year":2021},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.408756Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:6846040a653350bf5e64ed05ff16fde805f8fd31f43005873827f8ca70d78636","observation_id":"4b376339-a22d-4f5a-b305-0dcea196f62a","resolution":{"observed_at":"2026-08-06T21:11:40.961913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.944842Z","title":"V oice puppetry: Exploring dramatic performance to develop speech synthesis,","venue":null,"work_id":"285692e3-4a7d-474d-b7a0-d533ff9c3707","year":2019},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.417111Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:30c4a640c142870f4dc6be554447c45c7c3e649febcdaa43429a5f98578e0e08","observation_id":"4da98607-1c1e-42f2-a736-10a0cfe4ae89","resolution":{"observed_at":"2026-08-06T21:11:40.948640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.932780Z","title":"V oice puppetry with FastPitch,","venue":null,"work_id":"afec0ef1-df3c-489b-a4a1-ea2229c2e4b0","year":2022},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.420350Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:3462b672058baec755981abda234c89e2ff4ab79c02b0a64f24ef399d056325a","observation_id":"d7d8a15b-bdbf-4a10-ad7b-6e9bb3c7339a","resolution":{"observed_at":"2026-08-06T21:11:40.936595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.921259Z","title":"Style Tokens: Unsu- pervised style modeling, control and transfer in end-to-end speech synthesis,","venue":null,"work_id":"d25c697f-58b1-4996-84fe-5150cf884c40","year":2018},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.423738Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:e715b076dba4be97a46b168317790842b3b79fc58917fa2cfb7705451c3a0096","observation_id":"6a885f33-c101-4bd3-8e7c-a2a3de59c71d","resolution":{"observed_at":"2026-08-06T21:11:40.925522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.910750Z","title":"Robust and fine-grained prosody control of end-to-end speech synthesis,","venue":null,"work_id":"bec02749-8281-4b11-bb48-1e12d25823b1","year":2019},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.437462Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:0c408594f2d3ed9cfd340102c38a79ae55b92d91098ea751f2e99da1af8f1e9e","observation_id":"0858633e-7ff2-4f3a-909d-9a0cb74122cd","resolution":{"observed_at":"2026-08-06T21:11:40.914140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.899309Z","title":"Fine- grained robust prosody transfer for single-speaker neural text-to- speech,","venue":null,"work_id":"e81084d2-8a79-4086-a148-3f00780d235b","year":2019},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.442586Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:02a4eb91429c4712b8b090d53629b0b873b48e9938096ee077d89633f1c70b45","observation_id":"82dd43d4-0a36-4e58-8ede-1133e2d234d4","resolution":{"observed_at":"2026-08-06T21:11:40.903959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.888845Z","title":"Daft- Exprt: Cross-speaker prosody transfer on any text for expressive speech synthesis,","venue":null,"work_id":"be74fe22-ac5d-4664-be86-e0aa79f2a2c2","year":2022},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.448323Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:dbcf7739de2d5624056f89c3daa265ceadb5ed6ca444f8fc83464c5325af8336","observation_id":"92a808f0-8fd2-4add-a03d-b91a9555accb","resolution":{"observed_at":"2026-08-06T21:11:40.892893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.877898Z","title":"PromptTTS: Controllable text-to-speech with text descriptions,","venue":null,"work_id":"2e345c65-1eb0-4e7f-89c9-c405fcb69970","year":2023},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.452192Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:a163196252324e19d94fccc720c95faa312c0d8456e34f2c4bcc739a8048391c","observation_id":"3e7cf286-77db-4070-8541-5dba1a3fde25","resolution":{"observed_at":"2026-08-06T21:11:40.882082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01912","last_updated":"2024-02-02T21:29:34Z","snapshot_observed_at":"2026-07-06T17:24:41.012207Z","submitted_at":"2024-02-02T21:29:34Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01912","snapshot_observed_at":"2026-08-06T21:11:40.456914Z","title":"Natural language guidance of high- fidelity text-to-speech with synthetic annotations,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.456914Z"},"links":{"cited_paper":"/paper/2402.01912","citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:73afbf5bda5214577dae3a5e3ddf5c4ac63e65d3e54bd315fb31e11639b85190","observation_id":"5c2cf6a8-f131-4464-984c-ec5e78ae53f9","resolution":{"observed_at":"2026-08-06T21:11:40.456914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.867477Z","title":"VoiceCraft: Zero-shot speech editing and text-to-speech in the wild,","venue":null,"work_id":"d3af184e-68ad-4c22-bff8-c9abcebcf5f4","year":2024},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.460077Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:74b908a57f03ef34fb68089d8fbe572c43c72c87f3fa48fbf151735faa7ef839","observation_id":"8e89fee7-5269-4fea-9a9c-9fcabc87d058","resolution":{"observed_at":"2026-08-06T21:11:40.870810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.854823Z","title":"V oice at- tribute editing with text prompt,","venue":null,"work_id":"191ee721-ab7e-484a-be38-d756704a3eec","year":2025},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.463626Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:73b956b69211bcfa9d51d557d04517c10230773713499d38c158929be342bc7c","observation_id":"ee147f85-f3dc-4ce7-ab12-bd22785346eb","resolution":{"observed_at":"2026-08-06T21:11:40.859744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.844147Z","title":"The guidelines for TTS speaking style classifi- cation (IT-4012),","venue":null,"work_id":"39408c7d-4b33-4121-86a3-4231d58c60ca","year":2021},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.466780Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:34fe606ffccee9f3b2a7abbd7acd6f0131674f2e431904819045c8364f6ea8bb","observation_id":"c3f6fd9f-63d3-4cb1-8b9f-21642b264989","resolution":{"observed_at":"2026-08-06T21:11:40.848015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.831979Z","title":"Zero-shot text-to-speech synthesis conditioned using self- supervised speech representation model,","venue":null,"work_id":"d68c0ab6-2706-4cc6-88f6-19d83de24194","year":2023},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.470345Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:06a0aaa44debc6aec81c8d2bc9ed0d1f5cd5f552427c60552239fee453335a56","observation_id":"1c9e30ab-a281-45c9-baed-3c15a4a6478a","resolution":{"observed_at":"2026-08-06T21:11:40.836114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.820214Z","title":"Why does self-supervised learning for speech recognition benefit speaker recognition?","venue":null,"work_id":"2f2da908-424a-4f74-8a1a-a407ee223806","year":2022},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.474432Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:b7aa8c1c567fd8f397ef0ceee9e40276e4f76856d93521945186510fc64ddad8","observation_id":"edd0a729-303e-49e2-817c-e4fd0189a9cc","resolution":{"observed_at":"2026-08-06T21:11:40.824285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.808240Z","title":"Feed-forward networks with atten- tion can solve some long-term memory problems,","venue":null,"work_id":"7472c2e9-c51c-4472-ae62-8ed6a697c19d","year":2016},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.478099Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:7f9d11292dffad8243065407ab88b5bb0c0caf64eed73f10ed36dbec931d42b3","observation_id":"90c31184-97b6-4947-8cf3-5ad8aea0dadf","resolution":{"observed_at":"2026-08-06T21:11:40.812387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.795331Z","title":"FiLM: Visual reasoning with a general conditioning layer,","venue":null,"work_id":"39dcb26e-7e41-46bc-811f-cf5715e1d454","year":2018},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.481854Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:a07adefcdb5a8595a36d5cbb2fda6a79fa348c0da0e5ff4d02dcb6fb7737f4e3","observation_id":"3f58c8c9-6a46-4d3d-8bef-7e44cc592c25","resolution":{"observed_at":"2026-08-06T21:11:40.799080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.782621Z","title":"Learning alignment for multimodal emotion recognition from speech,","venue":null,"work_id":"b727fa2c-e20f-4b98-b9d5-6e096190db16","year":2019},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.485594Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:6cd03b42791b37991c318fca87bb11ed7d08c9d1a0af2c87b77f425c14b2134d","observation_id":"a142c6f3-6c21-4885-9782-5769efddf13f","resolution":{"observed_at":"2026-08-06T21:11:40.786499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.769292Z","title":"Multimodal cross- and self-attention network for speech emotion recognition,","venue":null,"work_id":"02368237-d04a-4e72-8379-6a3e342e1713","year":2021},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.489331Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:f62f405143ed0a168811e1421f065d1a8764b7a4a725fc425dbf7a5991b12122","observation_id":"6f8acf10-56df-4593-9a55-93ff0820cb56","resolution":{"observed_at":"2026-08-06T21:11:40.774085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.757424Z","title":"Hello GPT-4o,","venue":null,"work_id":"1c51ae04-a296-418b-a635-28f298a9f198","year":2024},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.492151Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:7e1567edc7b0439e23d614f9ac651ebdb6f82b9e8605b0cc310b837c50a39a45","observation_id":"30949dc0-96c0-4ef4-b9ea-9bc9b9e9bf48","resolution":{"observed_at":"2026-08-06T21:11:40.761622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.746902Z","title":"Rephrasing the web: A recipe for compute and data-efficient lan- guage modeling,","venue":null,"work_id":"c858fd71-d2d7-49b3-a8ba-835aeef95bc4","year":2024},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.498128Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:1cc828fcdec82a4dd6549c8731474869a03be8f85b4ce2c34d4cf62abeade720","observation_id":"2356dee1-9d92-443f-97df-de095f883371","resolution":{"observed_at":"2026-08-06T21:11:40.750736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.736781Z","title":"FastSpeech 2: Fast and high-quality end-to-end text to speech,","venue":null,"work_id":"d0253091-937a-41f7-aa06-ae67f4299b0b","year":2020},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.502456Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:dd3efa1df26e2da34412c25fdccb0e52e8389f516f687daeacd558a559204ad7","observation_id":"04d3e439-1ad4-410d-a1c7-fdd0af902c2f","resolution":{"observed_at":"2026-08-06T21:11:40.740424Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.726559Z","title":"In- vestigating on incorporating pretrained and learnable speaker rep- resentations for multi-speaker multi-style text-to-speech,","venue":null,"work_id":"d5d87f8c-0ada-4822-9bc1-feb651a9b44d","year":2021},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.505360Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:0fb2da2aea9b03b68a15acbb14cc389f99ee7cd767a071f16404616c3a509012","observation_id":"24aeb924-e40f-458f-ac95-331827345ec7","resolution":{"observed_at":"2026-08-06T21:11:40.729800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.508676Z","title":"HiFi-GAN: Generative adversarial networks for efficient and high fidelity speech synthesis,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.508676Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:e06b4b5f64ae9098387cdc98574db64ede314db2550945c175cc553d6d3747b3","observation_id":"0bc8d84b-6de6-49fa-9a4b-4c6bfcf054b6","resolution":{"observed_at":"2026-08-06T21:11:40.508676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17493","last_updated":"2024-04-14T05:20:10Z","snapshot_observed_at":"2026-08-05T16:03:40.517679Z","submitted_at":"2023-05-27T15:10:41Z","title":"The Curse of Recursion: Training on Generated Data Makes Models Forget","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17493","snapshot_observed_at":"2026-08-06T21:11:40.512618Z","title":"The curse of recursion: Training on generated data makes models forget,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.512618Z"},"links":{"cited_paper":"/paper/2305.17493","citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:71202d8274b25c7f49d11db0a7145a1f634fc18635cad13257f11da3866ba097","observation_id":"3dc66171-3503-43ed-a7c8-4a85e6d20c9b","resolution":{"observed_at":"2026-08-06T21:11:40.512618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.709603Z","title":"Multi-speaker modeling for DNN- based speech synthesis incorporating generative adversarial net- works,","venue":null,"work_id":"b437d13f-cb74-401f-a54a-a3a185918bec","year":2019},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.515996Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:dd5cc4000b7c61f63729f550c8235b4e602aa0452eb2ea85c7c5843d99305347","observation_id":"2e60fafe-82e7-4392-80da-a62b9d224e36","resolution":{"observed_at":"2026-08-06T21:11:40.713292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.700032Z","title":"Variational discriminator bottleneck: Improving imitation learn- ing, inverse RL, and GANs by constraining information flow,","venue":null,"work_id":"5d0a516e-6584-4ebd-93c6-9e286d9ad630","year":2019},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.519705Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:fa94547e02bf86bb68bd328cb150df6c19808766fd692831cdff3e7ddc335c8f","observation_id":"ac610f13-f5c7-4140-b63a-55e47da9bec4","resolution":{"observed_at":"2026-08-06T21:11:40.703451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.523505Z","title":"Decoupled weight decay regulariza- tion,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.523505Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:6d3687ab26e809396300a6293ca0fdbb9717b21a22848d4c33375a646844c463","observation_id":"ddfa18e2-47f7-4b0b-8e0b-9cbe15bdf6c9","resolution":{"observed_at":"2026-08-06T21:11:40.523505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.681163Z","title":"Expressive text-to-speech synthesis using text chat dataset with speaking style information,","venue":null,"work_id":"3bee1736-7847-412e-9134-ef182987ed2d","year":2023},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.526777Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:1b89909e0edb74dbdafd2e6cdcdb4052b3bf3134c64901a3c91654841dd729d6","observation_id":"03f70cff-87dd-4cf0-8dfb-4b54da726799","resolution":{"observed_at":"2026-08-06T21:11:40.685250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.670202Z","title":"NaturalSpeech 3: Zero-shot speech synthesis with factorized codec and diffusion models,","venue":null,"work_id":"25f99a9d-6599-4a10-957c-8958c71939fd","year":2024},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.530589Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:b19179e6ef2e0eff2c9a5336294475a6d6708309ce38d48be38b383a125ce960","observation_id":"79df0849-aaf6-4be3-923c-1d70f86d183f","resolution":{"observed_at":"2026-08-06T21:11:40.673622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.660111Z","title":"Neural codec language models are zero-shot text to speech synthesizers,","venue":null,"work_id":"b3b6c1c8-ca6b-4044-9803-9f59d75a1e28","year":2025},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.534096Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:9bc6e713bfe0d7b7493ba998674861e4b86d9f80738f884021d7bcc0e7d1ab55","observation_id":"55c5343b-e23d-4e33-94bd-556f25af4981","resolution":{"observed_at":"2026-08-06T21:11:40.663664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.649364Z","title":"FETV: A benchmark for fine-grained evaluation of open-domain text-to-video generation,","venue":null,"work_id":"a878becd-4842-4c98-ba47-1cb6a80e8987","year":2023},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.537401Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:1e0e4ef66abf8b0c81c1d587d553d662032b0bf3db139894758d2b18751a6c90","observation_id":"448d23c8-497b-4cee-9f0c-fb3ba3d0a156","resolution":{"observed_at":"2026-08-06T21:11:40.652925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:11:40.639771Z","title":"Toward verifiable and repro- ducible human evaluation for text-to-image generation,","venue":null,"work_id":"c703e984-606b-45c5-a6f8-525925a1a7f3","year":2023},"citing_paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T21:11:40.541402Z"},"links":{"citing_paper":"/paper/2507.00808"},"observation_digest":"sha256:55d30485c002d26784a80927c68c85134560b958ff20f7c0137ac088f62ad9cd","observation_id":"27e012b0-5b8d-47a2-a991-ebdd4448ff7e","resolution":{"observed_at":"2026-08-06T21:11:40.643029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.00808","last_updated":"2025-07-02T05:42:47Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-06T21:04:23.906292Z","submitted_at":"2025-07-01T14:40:51Z","title":"Multi-interaction TTS toward professional recording reproduction"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":49},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 1 inbound Pith citation observation for arXiv:2507.00808."}