{"as_of":"2026-08-04T22:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6225484645d33ad449cc4c01fab1dc03e0068b7fea5ac2962571ee473629ce13","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-25T08:27:16.910352Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-25T08:27:16.910352Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-05-25T08:30:32.052997Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1907.02479","last_updated":"2019-07-04T16:20:42Z","snapshot_observed_at":"2026-08-02T21:43:57.499724Z","submitted_at":"2019-07-04T16:20:42Z","title":"Fine-grained robust prosody transfer for single-speaker neural text-to-speech","version":1},"cited_work":{"arxiv_id":"1907.02479","doi":null,"metadata_source":"pith","pith_arxiv_id":"1907.02479","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fine-grained robust prosody transfer for single-speaker neural text-to-speech","venue":"eess.AS","work_id":"cef23869-6956-4b85-9f62-d4bbbc9d1f36","year":2019},"citing_paper":{"arxiv_id":"1907.02479","last_updated":"2019-07-04T16:20:42Z","snapshot_observed_at":"2026-08-02T21:43:57.499724Z","submitted_at":"2019-07-04T16:20:42Z","title":"Fine-grained robust prosody transfer for single-speaker neural text-to-speech","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-25T08:27:16.910352Z"},"links":{"cited_paper":"/paper/1907.02479","citing_paper":"/paper/1907.02479"},"observation_digest":"sha256:a5d1a003435e926c0288dc2fd2a90bd83d143b2f495d027b70a1cacd58e6c6d9","observation_id":"db14eace-953b-4c5e-8a29-857535ab6815","resolution":{"observed_at":"2026-05-25T08:30:32.055801Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/1907.02479/citation-record","integrity":"/paper/1907.02479/integrity","json":"/paper/1907.02479/citation-record.json","paper":"/paper/1907.02479"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1907.02479","last_updated":"2019-07-04T16:20:42Z","snapshot_observed_at":"2026-08-02T21:43:57.499724Z","submitted_at":"2019-07-04T16:20:42Z","title":"Fine-grained robust prosody transfer for single-speaker neural text-to-speech","version":1},"cited_work":{"arxiv_id":"1907.02479","doi":null,"metadata_source":"pith","pith_arxiv_id":"1907.02479","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fine-grained robust prosody transfer for single-speaker neural text-to-speech","venue":"eess.AS","work_id":"cef23869-6956-4b85-9f62-d4bbbc9d1f36","year":2019},"citing_paper":{"arxiv_id":"1907.02479","last_updated":"2019-07-04T16:20:42Z","snapshot_observed_at":"2026-08-02T21:43:57.499724Z","submitted_at":"2019-07-04T16:20:42Z","title":"Fine-grained robust prosody transfer for single-speaker neural text-to-speech","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-25T08:27:16.910352Z"},"links":{"cited_paper":"/paper/1907.02479","citing_paper":"/paper/1907.02479"},"observation_digest":"sha256:a5d1a003435e926c0288dc2fd2a90bd83d143b2f495d027b70a1cacd58e6c6d9","observation_id":"db14eace-953b-4c5e-8a29-857535ab6815","resolution":{"observed_at":"2026-05-25T08:30:32.055801Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"First, a seq2seq acoustic model predicts mel-spectrograms from a sequence of phoneme-level linguistic inputs","venue":null,"work_id":"f8a40ba5-a4b9-4452-9459-b37a6d520d6c","year":null},"citing_paper":{"arxiv_id":"1907.02479","last_updated":"2019-07-04T16:20:42Z","snapshot_observed_at":"2026-08-02T21:43:57.499724Z","submitted_at":"2019-07-04T16:20:42Z","title":"Fine-grained robust prosody transfer for single-speaker neural text-to-speech","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-25T08:27:16.910352Z"},"links":{"citing_paper":"/paper/1907.02479"},"observation_digest":"sha256:e7f94653cff982a32de2bd768abff0e4508861fff16ea2afb93aca11ddbaae63","observation_id":"e8cb53c8-2f6b-4e98-910f-da6ad4326ee6","resolution":{"observed_at":"2026-05-25T09:06:52.825003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Then we show the application of V AE for better gener- alization towards unseen speakers","venue":null,"work_id":"0cee3f7a-7313-43b2-828e-964d56b9e144","year":null},"citing_paper":{"arxiv_id":"1907.02479","last_updated":"2019-07-04T16:20:42Z","snapshot_observed_at":"2026-08-02T21:43:57.499724Z","submitted_at":"2019-07-04T16:20:42Z","title":"Fine-grained robust prosody transfer for single-speaker neural text-to-speech","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-25T08:27:16.910352Z"},"links":{"citing_paper":"/paper/1907.02479"},"observation_digest":"sha256:fbefb96cf66d0289290e1ba8c435c32fd55e29c75aecc3b0cb755051fd69d098","observation_id":"10c8ac42-1939-4764-a3ba-a86fe50656b9","resolution":{"observed_at":"2026-05-25T09:06:52.821104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Data We conducted experiments on an internal US English dataset of audiobook recordings","venue":null,"work_id":"cbb7db82-f397-4fbe-8c73-710bafd3edff","year":null},"citing_paper":{"arxiv_id":"1907.02479","last_updated":"2019-07-04T16:20:42Z","snapshot_observed_at":"2026-08-02T21:43:57.499724Z","submitted_at":"2019-07-04T16:20:42Z","title":"Fine-grained robust prosody transfer for single-speaker neural text-to-speech","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-25T08:27:16.910352Z"},"links":{"citing_paper":"/paper/1907.02479"},"observation_digest":"sha256:5fad5da76ddd767be848aa5d7fd5fbfd49d0e71070cc1bb7ae58f99ec13a0468","observation_id":"5f7247ca-381d-49f3-aa99-9692af4f9f54","resolution":{"observed_at":"2026-05-25T09:06:52.828768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c54491a8-f9e8-4da4-b5f0-f870c225a655","year":null},"citing_paper":{"arxiv_id":"1907.02479","last_updated":"2019-07-04T16:20:42Z","snapshot_observed_at":"2026-08-02T21:43:57.499724Z","submitted_at":"2019-07-04T16:20:42Z","title":"Fine-grained robust prosody transfer for single-speaker neural text-to-speech","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-25T08:27:16.910352Z"},"links":{"citing_paper":"/paper/1907.02479"},"observation_digest":"sha256:fadbd8a9d4bbce1433bef3256fc45c5c61cc14300477243e75b0356a5d8a6cda","observation_id":"fd364e43-9682-40eb-acb5-dc9e530d83e5","resolution":{"observed_at":"2026-05-25T09:06:52.801181Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Char2wav: End-to-end speech syn- thesis","venue":null,"work_id":"67f82ce7-e86d-4a68-90f1-eee528558092","year":2017},"citing_paper":{"arxiv_id":"1907.02479","last_updated":"2019-07-04T16:20:42Z","snapshot_observed_at":"2026-08-02T21:43:57.499724Z","submitted_at":"2019-07-04T16:20:42Z","title":"Fine-grained robust prosody transfer for single-speaker neural text-to-speech","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-25T08:27:16.910352Z"},"links":{"citing_paper":"/paper/1907.02479"},"observation_digest":"sha256:717a3241119aa932ea540dc17278197a9954491ab6216cef22915ad64621aa87","observation_id":"7e5c9f51-beac-4432-b48d-cd60e92fda42","resolution":{"observed_at":"2026-05-25T09:06:52.751087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Natural tts synthesis by conditioning wavenet on mel spectrogram predic- tions","venue":null,"work_id":"8558889d-7402-4fbf-b565-f53af9dde940","year":2018},"citing_paper":{"arxiv_id":"1907.02479","last_updated":"2019-07-04T16:20:42Z","snapshot_observed_at":"2026-08-02T21:43:57.499724Z","submitted_at":"2019-07-04T16:20:42Z","title":"Fine-grained robust prosody transfer for single-speaker neural text-to-speech","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-25T08:27:16.910352Z"},"links":{"citing_paper":"/paper/1907.02479"},"observation_digest":"sha256:640bbdbfd438d6b57012ce3f347e00b145ef1544fd1a1db02c6dfa6cfb3411b3","observation_id":"ba2f932b-15d0-4687-a950-2f75ab143e2d","resolution":{"observed_at":"2026-05-25T09:06:52.804848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.08895","last_updated":"2019-01-30T12:40:57Z","snapshot_observed_at":"2026-08-03T19:33:08.140992Z","submitted_at":"2018-09-19T07:41:17Z","title":"Neural Speech Synthesis with Transformer Network","version":3},"cited_work":{"arxiv_id":"1809.08895","doi":null,"metadata_source":"pith","pith_arxiv_id":"1809.08895","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Neural Speech Synthesis with Transformer Network","venue":"cs.CL","work_id":"38520c67-5997-4eec-98e3-598c791b2353","year":2018},"citing_paper":{"arxiv_id":"1907.02479","last_updated":"2019-07-04T16:20:42Z","snapshot_observed_at":"2026-08-02T21:43:57.499724Z","submitted_at":"2019-07-04T16:20:42Z","title":"Fine-grained robust prosody transfer for single-speaker neural text-to-speech","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-25T08:27:16.910352Z"},"links":{"cited_paper":"/paper/1809.08895","citing_paper":"/paper/1907.02479"},"observation_digest":"sha256:5d7365d80692fdf2546413c5c4c0fdf89c0f07df4c647824d4abd71ec13a7e38","observation_id":"e0241bba-fc47-41ad-9741-0525428e9a66","resolution":{"observed_at":"2026-05-25T08:30:32.074602Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In other news: A bi-style text-to-speech model for synthesizing newscaster voice with limited data","venue":null,"work_id":"6bb6ae66-0077-40da-9f61-403b19c8b267","year":2019},"citing_paper":{"arxiv_id":"1907.02479","last_updated":"2019-07-04T16:20:42Z","snapshot_observed_at":"2026-08-02T21:43:57.499724Z","submitted_at":"2019-07-04T16:20:42Z","title":"Fine-grained robust prosody transfer for single-speaker neural text-to-speech","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-25T08:27:16.910352Z"},"links":{"citing_paper":"/paper/1907.02479"},"observation_digest":"sha256:ed7c12271b0d5a6816ccd4ccd4b03f50ddd893da1ae1334efb419712b090736f","observation_id":"a5731762-99ae-4f8b-bb8b-572c2084a752","resolution":{"observed_at":"2026-05-25T09:06:52.809071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards end-to-end prosody transfer for expressive speech synthesis with tacotron","venue":null,"work_id":"b404d7b7-8bd8-493c-b804-62be4053232a","year":2018},"citing_paper":{"arxiv_id":"1907.02479","last_updated":"2019-07-04T16:20:42Z","snapshot_observed_at":"2026-08-02T21:43:57.499724Z","submitted_at":"2019-07-04T16:20:42Z","title":"Fine-grained robust prosody transfer for single-speaker neural text-to-speech","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-25T08:27:16.910352Z"},"links":{"citing_paper":"/paper/1907.02479"},"observation_digest":"sha256:e4f6ea17b14eac108ecf792f6d3a3e188c2e42d7bb153645468276ad4c7c7f08","observation_id":"45af1267-9b7b-430b-aaa7-c4887636866b","resolution":{"observed_at":"2026-05-25T09:06:52.812969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep voice 2: Multi-speaker neural text- to-speech","venue":null,"work_id":"1e40a787-e1a5-4f76-b242-bb27abee46db","year":2017},"citing_paper":{"arxiv_id":"1907.02479","last_updated":"2019-07-04T16:20:42Z","snapshot_observed_at":"2026-08-02T21:43:57.499724Z","submitted_at":"2019-07-04T16:20:42Z","title":"Fine-grained robust prosody transfer for single-speaker neural text-to-speech","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-25T08:27:16.910352Z"},"links":{"citing_paper":"/paper/1907.02479"},"observation_digest":"sha256:d42f4c7ae985cbd7e5ea7e9e0959c2a5afb853421617d5bfddae648cf61be91f","observation_id":"5a2e7b7c-38bc-4504-a639-494fddefaa95","resolution":{"observed_at":"2026-05-25T09:06:52.789830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.09017","last_updated":"2018-03-23T23:56:49Z","snapshot_observed_at":"2026-07-06T06:29:57.506159Z","submitted_at":"2018-03-23T23:56:49Z","title":"Style Tokens: Unsupervised Style Modeling, Control and Transfer in End-to-End Speech Synthesis","version":1},"cited_work":{"arxiv_id":"1803.09017","doi":null,"metadata_source":"pith","pith_arxiv_id":"1803.09017","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Style Tokens: Unsupervised Style Modeling, Control and Transfer in End-to-End Speech Synthesis","venue":"cs.CL","work_id":"b15a3841-4dd9-4bf5-b593-50ee31767c59","year":2018},"citing_paper":{"arxiv_id":"1907.02479","last_updated":"2019-07-04T16:20:42Z","snapshot_observed_at":"2026-08-02T21:43:57.499724Z","submitted_at":"2019-07-04T16:20:42Z","title":"Fine-grained robust prosody transfer for single-speaker neural text-to-speech","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-25T08:27:16.910352Z"},"links":{"cited_paper":"/paper/1803.09017","citing_paper":"/paper/1907.02479"},"observation_digest":"sha256:f62d5d21f584a25950762b3213c2ffabe8d0c0d4a32332f4f1ae13fa6a84b937","observation_id":"25029453-e096-4e0b-aa56-a45ce9a79918","resolution":{"observed_at":"2026-05-25T08:30:32.079703Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.04342","last_updated":"2019-02-14T08:20:10Z","snapshot_observed_at":"2026-07-06T07:20:29.365936Z","submitted_at":"2018-12-11T12:00:06Z","title":"Learning latent representations for style control and transfer in end-to-end speech synthesis","version":2},"cited_work":{"arxiv_id":"1812.04342","doi":null,"metadata_source":"pith","pith_arxiv_id":"1812.04342","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning latent representations for style control and transfer in end-to-end speech synthesis","venue":"cs.CL","work_id":"3e03f837-e2e4-4894-89a3-bf838a187eb9","year":2018},"citing_paper":{"arxiv_id":"1907.02479","last_updated":"2019-07-04T16:20:42Z","snapshot_observed_at":"2026-08-02T21:43:57.499724Z","submitted_at":"2019-07-04T16:20:42Z","title":"Fine-grained robust prosody transfer for single-speaker neural text-to-speech","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-25T08:27:16.910352Z"},"links":{"cited_paper":"/paper/1812.04342","citing_paper":"/paper/1907.02479"},"observation_digest":"sha256:d7b97024ef6e4e1beb12a4c3d690e2550a7df10801cf2143f2e3fd0ae80a90af","observation_id":"b51900ce-7714-46a4-911c-88ba23dbb501","resolution":{"observed_at":"2026-05-25T08:30:32.062090Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tacotron: Towards end-to-end speech synthesis","venue":null,"work_id":"ae44d678-c1cf-48ef-9935-4b59cd42747a","year":2017},"citing_paper":{"arxiv_id":"1907.02479","last_updated":"2019-07-04T16:20:42Z","snapshot_observed_at":"2026-08-02T21:43:57.499724Z","submitted_at":"2019-07-04T16:20:42Z","title":"Fine-grained robust prosody transfer for single-speaker neural text-to-speech","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-25T08:27:16.910352Z"},"links":{"citing_paper":"/paper/1907.02479"},"observation_digest":"sha256:fe3781cea161114d6c2c5954c7512dfd56ccc0e13df92728d7e3befdcff9b7b8","observation_id":"705c5aa8-eb6a-4bcb-bea9-85d744b68617","resolution":{"observed_at":"2026-05-25T09:06:52.797960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.02122","last_updated":"2019-02-18T06:33:37Z","snapshot_observed_at":"2026-07-06T07:12:51.741506Z","submitted_at":"2018-11-06T01:54:22Z","title":"Robust and fine-grained prosody control of end-to-end speech synthesis","version":2},"cited_work":{"arxiv_id":"1811.02122","doi":null,"metadata_source":"pith","pith_arxiv_id":"1811.02122","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robust and fine-grained prosody control of end-to-end speech synthesis","venue":"cs.CL","work_id":"91e2a387-176a-49d3-9457-b9bb1b94c935","year":2018},"citing_paper":{"arxiv_id":"1907.02479","last_updated":"2019-07-04T16:20:42Z","snapshot_observed_at":"2026-08-02T21:43:57.499724Z","submitted_at":"2019-07-04T16:20:42Z","title":"Fine-grained robust prosody transfer for single-speaker neural text-to-speech","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-25T08:27:16.910352Z"},"links":{"cited_paper":"/paper/1811.02122","citing_paper":"/paper/1907.02479"},"observation_digest":"sha256:6780258b8253b82602d4bfe63beb2e41eb87c517f8e4b1cf32c9d76528c73c6c","observation_id":"6970d838-1b04-4122-9908-22f5bde734e2","resolution":{"observed_at":"2026-05-25T08:30:32.050302Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Automatic segmentation and labeling of speech","venue":null,"work_id":"06c444f6-ddc9-469e-a4cd-59ecd125416e","year":1991},"citing_paper":{"arxiv_id":"1907.02479","last_updated":"2019-07-04T16:20:42Z","snapshot_observed_at":"2026-08-02T21:43:57.499724Z","submitted_at":"2019-07-04T16:20:42Z","title":"Fine-grained robust prosody transfer for single-speaker neural text-to-speech","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-25T08:27:16.910352Z"},"links":{"citing_paper":"/paper/1907.02479"},"observation_digest":"sha256:8fb02a54a897f08125e5db12c8fc058be1623ac9b2daa306edd72139af54c6dd","observation_id":"23725094-7cac-4b78-9675-6bb762d0ae28","resolution":{"observed_at":"2026-05-25T09:06:52.747394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.06292","last_updated":"2019-07-04T15:50:14Z","snapshot_observed_at":"2026-07-06T07:14:54.462047Z","submitted_at":"2018-11-15T10:54:13Z","title":"Towards achieving robust universal neural vocoding","version":2},"cited_work":{"arxiv_id":"1811.06292","doi":null,"metadata_source":"pith","pith_arxiv_id":"1811.06292","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards achieving robust universal neural vocoding","venue":"eess.AS","work_id":"8c77a054-4a83-45a9-b471-5dccf8ccd39a","year":2018},"citing_paper":{"arxiv_id":"1907.02479","last_updated":"2019-07-04T16:20:42Z","snapshot_observed_at":"2026-08-02T21:43:57.499724Z","submitted_at":"2019-07-04T16:20:42Z","title":"Fine-grained robust prosody transfer for single-speaker neural text-to-speech","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-25T08:27:16.910352Z"},"links":{"cited_paper":"/paper/1811.06292","citing_paper":"/paper/1907.02479"},"observation_digest":"sha256:5336659df0b80f1e32548d745d59d7aa26c4d89652d803b904dcb1cf27ca5f4a","observation_id":"da69ff2a-1cb1-4359-b740-d7e796c4a056","resolution":{"observed_at":"2026-05-25T08:30:32.067762Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Effect of data reduction on sequence-to-sequence neural tts","venue":null,"work_id":"29865b07-7663-409a-a8b6-a84f97ba999e","year":2019},"citing_paper":{"arxiv_id":"1907.02479","last_updated":"2019-07-04T16:20:42Z","snapshot_observed_at":"2026-08-02T21:43:57.499724Z","submitted_at":"2019-07-04T16:20:42Z","title":"Fine-grained robust prosody transfer for single-speaker neural text-to-speech","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-25T08:27:16.910352Z"},"links":{"citing_paper":"/paper/1907.02479"},"observation_digest":"sha256:5d7a8ed5584b033c2dd0da9407bf4a76c2244016245d74bd29d42ec211200fde","observation_id":"3c811f8e-74bb-483d-884c-4c6a9045634a","resolution":{"observed_at":"2026-05-25T09:06:52.817237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":"1312.6114","doi":"10.2139/ssrn.4269703","metadata_source":"pith","pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Auto-Encoding Variational Bayes","venue":"stat.ML","work_id":"97d95295-30e1-42b4-bbf6-85f0fa4edb44","year":2013},"citing_paper":{"arxiv_id":"1907.02479","last_updated":"2019-07-04T16:20:42Z","snapshot_observed_at":"2026-08-02T21:43:57.499724Z","submitted_at":"2019-07-04T16:20:42Z","title":"Fine-grained robust prosody transfer for single-speaker neural text-to-speech","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-25T08:27:16.910352Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/1907.02479"},"observation_digest":"sha256:fcf04aaac0356ce64efe9bdfd8bd6abfd20fb83d0e101f1f573a5a0aee58b7ce","observation_id":"90ff4946-860a-485c-94b2-d6c5a987be36","resolution":{"observed_at":"2026-05-25T08:30:32.045044Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.02135","last_updated":"2019-02-11T09:41:22Z","snapshot_observed_at":"2026-07-06T06:32:02.796768Z","submitted_at":"2018-04-06T05:27:14Z","title":"Expressive Speech Synthesis via Modeling Expressions with Variational Autoencoder","version":3},"cited_work":{"arxiv_id":"1804.02135","doi":null,"metadata_source":"pith","pith_arxiv_id":"1804.02135","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Expressive Speech Synthesis via Modeling Expressions with Variational Autoencoder","venue":"cs.CL","work_id":"5821aee8-0304-4157-940a-dc4191516958","year":2018},"citing_paper":{"arxiv_id":"1907.02479","last_updated":"2019-07-04T16:20:42Z","snapshot_observed_at":"2026-08-02T21:43:57.499724Z","submitted_at":"2019-07-04T16:20:42Z","title":"Fine-grained robust prosody transfer for single-speaker neural text-to-speech","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-25T08:27:16.910352Z"},"links":{"cited_paper":"/paper/1804.02135","citing_paper":"/paper/1907.02479"},"observation_digest":"sha256:83d9780ebe0d88e4a1a77edcf5197396542adb75c33a7243238fe8e45f127515","observation_id":"448aca12-f537-4413-b74c-917890d842e7","resolution":{"observed_at":"2026-05-25T08:30:32.088042Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On adaptive control processes","venue":null,"work_id":"4df872bf-bd86-4d84-88d4-f7bce54e6c71","year":1959},"citing_paper":{"arxiv_id":"1907.02479","last_updated":"2019-07-04T16:20:42Z","snapshot_observed_at":"2026-08-02T21:43:57.499724Z","submitted_at":"2019-07-04T16:20:42Z","title":"Fine-grained robust prosody transfer for single-speaker neural text-to-speech","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-25T08:27:16.910352Z"},"links":{"citing_paper":"/paper/1907.02479"},"observation_digest":"sha256:40cccebc26430dda6542e0faf4e3c440923b929802801ebb4912ca6ae869d95a","observation_id":"d914be73-ccf9-49ea-b3a1-1dc88698e5dd","resolution":{"observed_at":"2026-05-25T09:06:52.777639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reducing f0 frame error of f0 tracking algorithms under noisy conditions with an unvoiced/voiced clas- siﬁcation frontend","venue":null,"work_id":"81013f38-4733-48bf-b9e3-16ccee4857d7","year":2009},"citing_paper":{"arxiv_id":"1907.02479","last_updated":"2019-07-04T16:20:42Z","snapshot_observed_at":"2026-08-02T21:43:57.499724Z","submitted_at":"2019-07-04T16:20:42Z","title":"Fine-grained robust prosody transfer for single-speaker neural text-to-speech","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-25T08:27:16.910352Z"},"links":{"citing_paper":"/paper/1907.02479"},"observation_digest":"sha256:af1f28b9a15ebbb7542d1aeb9fb2f2c00069ceff5df5299d0e0831e14dc29c71","observation_id":"287c9344-cc8c-4d79-8b27-d7c144ad5ce2","resolution":{"observed_at":"2026-05-25T09:06:52.769824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Joint robust voicing detection and pitch estimation based on residual harmonics","venue":null,"work_id":"0025eea1-f5ab-4c74-8e87-f05549c1063e","year":2011},"citing_paper":{"arxiv_id":"1907.02479","last_updated":"2019-07-04T16:20:42Z","snapshot_observed_at":"2026-08-02T21:43:57.499724Z","submitted_at":"2019-07-04T16:20:42Z","title":"Fine-grained robust prosody transfer for single-speaker neural text-to-speech","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-25T08:27:16.910352Z"},"links":{"citing_paper":"/paper/1907.02479"},"observation_digest":"sha256:824858da83474aea20343b6ddcdad4f0add6627cc665260cf42678127f0f1e1d","observation_id":"58bd9de0-0024-4712-ba7b-0cb22f407564","resolution":{"observed_at":"2026-05-25T09:06:52.773957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"1534-1,method for the subjective assessment of in- termediate quality levels of coding systems (mushra)","venue":null,"work_id":"ab620e41-2f43-4e2e-8232-949d9eeaa6ba","year":2003},"citing_paper":{"arxiv_id":"1907.02479","last_updated":"2019-07-04T16:20:42Z","snapshot_observed_at":"2026-08-02T21:43:57.499724Z","submitted_at":"2019-07-04T16:20:42Z","title":"Fine-grained robust prosody transfer for single-speaker neural text-to-speech","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-25T08:27:16.910352Z"},"links":{"citing_paper":"/paper/1907.02479"},"observation_digest":"sha256:1760dc75be742b4e63602a8b592848ae609e20650c47526f24f99181674b7b62","observation_id":"25749930-db4d-42df-8142-177264016ef2","resolution":{"observed_at":"2026-05-25T09:06:52.781845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Statistical analysis of the blizzard challenge 2007 listening test results","venue":null,"work_id":"54bce831-c9cd-4605-904d-a7e5129406ea","year":2007},"citing_paper":{"arxiv_id":"1907.02479","last_updated":"2019-07-04T16:20:42Z","snapshot_observed_at":"2026-08-02T21:43:57.499724Z","submitted_at":"2019-07-04T16:20:42Z","title":"Fine-grained robust prosody transfer for single-speaker neural text-to-speech","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-25T08:27:16.910352Z"},"links":{"citing_paper":"/paper/1907.02479"},"observation_digest":"sha256:3dfbbf7643374a334270fde7b898dd009faaddc4724598d0c94cc4c0dd11f0e4","observation_id":"bd83952d-8057-4310-bfc8-a2c4a2734bb0","resolution":{"observed_at":"2026-05-25T09:06:52.785929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Phonetic poste- riorgrams for many-to-one voice conversion without parallel data training","venue":null,"work_id":"bca883f7-018a-489b-9f93-297170a19ded","year":2016},"citing_paper":{"arxiv_id":"1907.02479","last_updated":"2019-07-04T16:20:42Z","snapshot_observed_at":"2026-08-02T21:43:57.499724Z","submitted_at":"2019-07-04T16:20:42Z","title":"Fine-grained robust prosody transfer for single-speaker neural text-to-speech","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-25T08:27:16.910352Z"},"links":{"citing_paper":"/paper/1907.02479"},"observation_digest":"sha256:64eb28f1ed6fef24262a883bb63b287bf54a6d5723508032808056ec8ba404a3","observation_id":"e15b316d-087b-4538-9b01-133821962b55","resolution":{"observed_at":"2026-05-25T09:06:52.794416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"V oice con- version across arbitrary speakers based on a single target-speaker utterance","venue":null,"work_id":"4c171c25-80a2-44f7-9052-76cb0629ec84","year":2018},"citing_paper":{"arxiv_id":"1907.02479","last_updated":"2019-07-04T16:20:42Z","snapshot_observed_at":"2026-08-02T21:43:57.499724Z","submitted_at":"2019-07-04T16:20:42Z","title":"Fine-grained robust prosody transfer for single-speaker neural text-to-speech","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-25T08:27:16.910352Z"},"links":{"citing_paper":"/paper/1907.02479"},"observation_digest":"sha256:2be3cd6ef9a0c06adaca8f613c141c7dfc9fe7524b376f21eb8c24e8b1a8d9c5","observation_id":"f3beba7d-a8a7-44c9-9bde-3ff744f2b647","resolution":{"observed_at":"2026-05-25T09:06:52.765523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.5567","last_updated":"2014-12-19T21:36:13Z","snapshot_observed_at":"2026-07-06T04:03:56.251710Z","submitted_at":"2014-12-17T20:39:45Z","title":"Deep Speech: Scaling up end-to-end speech recognition","version":2},"cited_work":{"arxiv_id":"1412.5567","doi":"10.48550/arxiv.1412.5567","metadata_source":"pith","pith_arxiv_id":"1412.5567","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Deep Speech: Scaling up end-to-end speech recognition","venue":"cs.CL","work_id":"eb57b6c8-18a7-4e51-b90a-2add68d4ee9e","year":2014},"citing_paper":{"arxiv_id":"1907.02479","last_updated":"2019-07-04T16:20:42Z","snapshot_observed_at":"2026-08-02T21:43:57.499724Z","submitted_at":"2019-07-04T16:20:42Z","title":"Fine-grained robust prosody transfer for single-speaker neural text-to-speech","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-25T08:27:16.910352Z"},"links":{"cited_paper":"/paper/1412.5567","citing_paper":"/paper/1907.02479"},"observation_digest":"sha256:2576642b13bd2e17b6d535ca07a11ec1dea0666e4a3a10dd39e7f32c0dfe0fb3","observation_id":"51ff81b0-f8f9-42b3-8f3c-dd60da89375a","resolution":{"observed_at":"2026-05-25T08:30:32.083727Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lib- rispeech: an asr corpus based on public domain audio books","venue":null,"work_id":"a8e808f1-13c2-42e1-b590-140b1a8b6495","year":2015},"citing_paper":{"arxiv_id":"1907.02479","last_updated":"2019-07-04T16:20:42Z","snapshot_observed_at":"2026-08-02T21:43:57.499724Z","submitted_at":"2019-07-04T16:20:42Z","title":"Fine-grained robust prosody transfer for single-speaker neural text-to-speech","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-25T08:27:16.910352Z"},"links":{"citing_paper":"/paper/1907.02479"},"observation_digest":"sha256:fe9d8a8fbec090085d56d2f89f328555dce9df0754fb79b98c82480d59a69c83","observation_id":"57f7692d-7d9c-41fc-8d17-efb6cea94f21","resolution":{"observed_at":"2026-05-25T09:06:52.758651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Common voice","venue":null,"work_id":"734612ee-5acd-41da-bc22-d4359d3ac3be","year":2013},"citing_paper":{"arxiv_id":"1907.02479","last_updated":"2019-07-04T16:20:42Z","snapshot_observed_at":"2026-08-02T21:43:57.499724Z","submitted_at":"2019-07-04T16:20:42Z","title":"Fine-grained robust prosody transfer for single-speaker neural text-to-speech","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-25T08:27:16.910352Z"},"links":{"citing_paper":"/paper/1907.02479"},"observation_digest":"sha256:379e7e5852d7b3b1f5b5beda91ce035cbad8641e68e21b87b1fc6556e8a8f999","observation_id":"820d2561-c44d-467e-b4fe-4bca19f0679f","resolution":{"observed_at":"2026-05-25T09:06:52.754685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"1907.02479","last_updated":"2019-07-04T16:20:42Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-02T21:43:57.499724Z","submitted_at":"2019-07-04T16:20:42Z","title":"Fine-grained robust prosody transfer for single-speaker neural text-to-speech"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":1,"verified_exact":8,"verified_fuzzy":20},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 1 inbound Pith citation observation for arXiv:1907.02479."}