{"as_of":"2026-08-12T16:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0c1fd8150269cce99d0f9fdf6a9fc3ffc676f780672e82b35a411b0135e6a8b9","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T20:27:40.037176Z","state":"measured"},{"denominator":160,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":160,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":206,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T15:11:21.068085Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":3618,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":"1609.03499","doi":"10.48550/arxiv.1609.03499","metadata_source":"pith","pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WaveNet: A Generative Model for Raw Audio","venue":"cs.SD","work_id":"05682736-8137-4a5f-a5b6-1127e99b0041","year":2016},"citing_paper":{"arxiv_id":"1710.10196","last_updated":"2018-02-26T15:33:34Z","snapshot_observed_at":"2026-07-06T06:06:26.276752Z","submitted_at":"2017-10-27T15:28:35Z","title":"Progressive Growing of GANs for Improved Quality, Stability, and Variation","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-12T12:24:03.252331Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/1710.10196"},"observation_digest":"sha256:cb7573a843eea3daabf7d34a1d0f98f30991943f0e25c92313677887d31418d1","observation_id":"25396cc0-5d9b-40b7-93f6-0fc15a6a6744","resolution":{"observed_at":"2026-05-12T20:27:40.593869Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":"1609.03499","doi":"10.48550/arxiv.1609.03499","metadata_source":"pith","pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WaveNet: A Generative Model for Raw Audio","venue":"cs.SD","work_id":"05682736-8137-4a5f-a5b6-1127e99b0041","year":2016},"citing_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-09T19:46:04.857927Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T19:50:53.385943Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/1904.10509"},"observation_digest":"sha256:924bf4104a344ad6bcec2302faaf3c05d04fd9caaada76d0b125e4fb3c4e32f7","observation_id":"a5d6c55c-9686-4f81-b3a4-84b1cb2e4f05","resolution":{"observed_at":"2026-05-12T20:27:40.593869Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":"1609.03499","doi":"10.48550/arxiv.1609.03499","metadata_source":"pith","pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WaveNet: A Generative Model for Raw Audio","venue":"cs.SD","work_id":"05682736-8137-4a5f-a5b6-1127e99b0041","year":2016},"citing_paper":{"arxiv_id":"1906.08977","last_updated":"2019-06-21T06:40:06Z","snapshot_observed_at":"2026-07-06T08:01:53.211305Z","submitted_at":"2019-06-21T06:40:06Z","title":"Singing Voice Synthesis Using Deep Autoregressive Neural Networks for Acoustic Modeling","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-25T18:37:53.990536Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/1906.08977"},"observation_digest":"sha256:502719f216136054b9e822b364bf38d03d7a157092e33d6cd11452a5b371d974","observation_id":"765ff3db-c420-4625-9767-a57b77ac1f35","resolution":{"observed_at":"2026-05-25T18:41:08.301926Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":"1609.03499","doi":"10.48550/arxiv.1609.03499","metadata_source":"pith","pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WaveNet: A Generative Model for Raw Audio","venue":"cs.SD","work_id":"05682736-8137-4a5f-a5b6-1127e99b0041","year":2016},"citing_paper":{"arxiv_id":"1906.10859","last_updated":"2019-06-26T06:12:59Z","snapshot_observed_at":"2026-08-07T21:45:57.585250Z","submitted_at":"2019-06-26T06:12:59Z","title":"End-to-End Emotional Speech Synthesis Using Style Tokens and Semi-Supervised Training","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-25T15:33:09.748398Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/1906.10859"},"observation_digest":"sha256:88d2f2f208387bb2cf3bdb3279aa5e09733a979de7846b0fa156341839ea601b","observation_id":"2ac6a384-dc47-4dac-a84d-53581d0442d0","resolution":{"observed_at":"2026-05-25T15:35:58.945560Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":"1609.03499","doi":"10.48550/arxiv.1609.03499","metadata_source":"pith","pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WaveNet: A Generative Model for Raw Audio","venue":"cs.SD","work_id":"05682736-8137-4a5f-a5b6-1127e99b0041","year":2016},"citing_paper":{"arxiv_id":"1906.11645","last_updated":"2019-06-26T11:06:05Z","snapshot_observed_at":"2026-08-03T10:43:20.980826Z","submitted_at":"2019-06-26T11:06:05Z","title":"RUSLAN: Russian Spoken Language Corpus for Speech Synthesis","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-25T15:15:38.672352Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/1906.11645"},"observation_digest":"sha256:280d5bf75e0bafe5130ef92eaa11be698bef5ed82808f430e34ab3fdb0183713","observation_id":"ab9e09ca-474c-4142-8ad3-92023ba43f4c","resolution":{"observed_at":"2026-05-25T15:15:58.489413Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":"1609.03499","doi":"10.48550/arxiv.1609.03499","metadata_source":"pith","pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WaveNet: A Generative Model for Raw Audio","venue":"cs.SD","work_id":"05682736-8137-4a5f-a5b6-1127e99b0041","year":2016},"citing_paper":{"arxiv_id":"1907.00772","last_updated":"2019-07-01T13:46:54Z","snapshot_observed_at":"2026-08-02T00:51:07.348779Z","submitted_at":"2019-07-01T13:46:54Z","title":"Analysis by Adversarial Synthesis -- A Novel Approach for Speech Vocoding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-25T11:31:31.494334Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/1907.00772"},"observation_digest":"sha256:632980c8ea3c364d976d7b6627b6f1aefdd6a775c3fda092587ed1e88f4afef7","observation_id":"7e0f6a8d-4a40-4ffa-9194-43d57ccbfbc8","resolution":{"observed_at":"2026-05-25T11:35:43.705807Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":"1609.03499","doi":"10.48550/arxiv.1609.03499","metadata_source":"pith","pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WaveNet: A Generative Model for Raw Audio","venue":"cs.SD","work_id":"05682736-8137-4a5f-a5b6-1127e99b0041","year":2016},"citing_paper":{"arxiv_id":"1907.01925","last_updated":"2019-07-26T08:31:39Z","snapshot_observed_at":"2026-07-06T08:04:53.804209Z","submitted_at":"2019-07-03T13:13:35Z","title":"Multitasking with Alexa Multitasking with Alexa: How Using Intelligent Personal Assistants Impacts Language-based Primary Task Performance","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-25T09:56:13.087146Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/1907.01925"},"observation_digest":"sha256:0ff09bcd92742be537acda4a47836b6471626d20043863069083359e6629af82","observation_id":"0506599a-285c-44cd-8699-4f7dd3c54f97","resolution":{"observed_at":"2026-05-25T09:56:51.305971Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":"1609.03499","doi":"10.48550/arxiv.1609.03499","metadata_source":"pith","pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WaveNet: A Generative Model for Raw Audio","venue":"cs.SD","work_id":"05682736-8137-4a5f-a5b6-1127e99b0041","year":2016},"citing_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-25T00:09:35.661121Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/1907.04448"},"observation_digest":"sha256:77fc8f6b66f17aaad793c192fe5ebf57616528b563031e9ddcd12512b7e85e16","observation_id":"dad61d25-0bb5-4b23-9366-265181562df0","resolution":{"observed_at":"2026-05-25T00:10:07.041425Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":"1609.03499","doi":"10.48550/arxiv.1609.03499","metadata_source":"pith","pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WaveNet: A Generative Model for Raw Audio","venue":"cs.SD","work_id":"05682736-8137-4a5f-a5b6-1127e99b0041","year":2016},"citing_paper":{"arxiv_id":"1907.06286","last_updated":"2019-07-14T21:58:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-07-14T21:58:10Z","title":"Autoencoding sensory substitution","version":1},"reference_index":127,"source":"pdf_text","source_observed_at":"2026-05-24T21:24:11.898508Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/1907.06286"},"observation_digest":"sha256:7354a34834fdd592374abc7a171ccd471a614cc5e06baaac03e0250cd6f2f2f1","observation_id":"78ff8076-a283-434b-948e-315857d6ccb0","resolution":{"observed_at":"2026-05-24T21:24:57.830206Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":"1609.03499","doi":"10.48550/arxiv.1609.03499","metadata_source":"pith","pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WaveNet: A Generative Model for Raw Audio","venue":"cs.SD","work_id":"05682736-8137-4a5f-a5b6-1127e99b0041","year":2016},"citing_paper":{"arxiv_id":"1907.07769","last_updated":"2019-07-15T07:54:46Z","snapshot_observed_at":"2026-08-02T01:49:57.493719Z","submitted_at":"2019-07-15T07:54:46Z","title":"Hierarchical Sequence to Sequence Voice Conversion with Limited Data","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-24T21:30:16.923017Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/1907.07769"},"observation_digest":"sha256:8ad270a8072accde01f671107bfbe7aa4cd0338b050a2973517e7360bf947df6","observation_id":"b6513f91-188c-4fea-91fe-4fe3e210dd58","resolution":{"observed_at":"2026-05-24T21:34:58.851967Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":"1609.03499","doi":"10.48550/arxiv.1609.03499","metadata_source":"pith","pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WaveNet: A Generative Model for Raw Audio","venue":"cs.SD","work_id":"05682736-8137-4a5f-a5b6-1127e99b0041","year":2016},"citing_paper":{"arxiv_id":"1907.08294","last_updated":"2019-07-19T09:11:35Z","snapshot_observed_at":"2026-08-03T05:33:55.070515Z","submitted_at":"2019-07-19T09:11:35Z","title":"DNN-based Speaker Embedding Using Subjective Inter-speaker Similarity for Multi-speaker Modeling in Speech Synthesis","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-24T19:05:32.567355Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/1907.08294"},"observation_digest":"sha256:a7c69d37ca9f34a59ec8591f8a419e7349c54100a448ec1fe669672ed290f4c8","observation_id":"7cbfa735-d2ad-494c-a29c-69b7ec9d4ec4","resolution":{"observed_at":"2026-05-24T19:06:18.897869Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":"1609.03499","doi":"10.48550/arxiv.1609.03499","metadata_source":"pith","pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WaveNet: A Generative Model for Raw Audio","venue":"cs.SD","work_id":"05682736-8137-4a5f-a5b6-1127e99b0041","year":2016},"citing_paper":{"arxiv_id":"1907.09006","last_updated":"2019-07-18T12:24:30Z","snapshot_observed_at":"2026-08-01T12:47:18.470797Z","submitted_at":"2019-07-18T12:24:30Z","title":"Forward-Backward Decoding for Regularizing End-to-End TTS","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-24T19:27:54.013474Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/1907.09006"},"observation_digest":"sha256:49bb1a9cd06a7d3b5531b3eb2b26e492753d0e0a9c7e1973e63882cc523fdc64","observation_id":"47f3f8a2-142b-4b20-a7d9-40c1996d44d2","resolution":{"observed_at":"2026-05-24T19:29:50.889655Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":"1609.03499","doi":"10.48550/arxiv.1609.03499","metadata_source":"pith","pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WaveNet: A Generative Model for Raw Audio","venue":"cs.SD","work_id":"05682736-8137-4a5f-a5b6-1127e99b0041","year":2016},"citing_paper":{"arxiv_id":"1907.10185","last_updated":"2019-07-24T00:37:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-07-24T00:37:20Z","title":"Non-Parallel Voice Conversion with Cyclic Variational Autoencoder","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-24T17:05:25.448346Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/1907.10185"},"observation_digest":"sha256:fa9cda358b3b322b6c0b1b89ef1081a0876aa8667a9c9bd62920fddea9a6d315","observation_id":"bd8dd9f0-b5fc-4035-98ab-d92bf4eef222","resolution":{"observed_at":"2026-05-24T17:06:16.923305Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":"1609.03499","doi":"10.48550/arxiv.1609.03499","metadata_source":"pith","pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WaveNet: A Generative Model for Raw Audio","venue":"cs.SD","work_id":"05682736-8137-4a5f-a5b6-1127e99b0041","year":2016},"citing_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-08-10T02:15:37.272323Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"reference_index":139,"source":"arxiv_source","source_observed_at":"2026-05-18T10:46:16.373197Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/1911.05507"},"observation_digest":"sha256:bb235e7681d3b581ba5b9e161d4b2fe3138c57a4a9c96e8a4372d0ad458e23be","observation_id":"870e7831-3113-4507-a274-02196d43553c","resolution":{"observed_at":"2026-05-18T10:46:16.671855Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":"1609.03499","doi":"10.48550/arxiv.1609.03499","metadata_source":"pith","pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WaveNet: A Generative Model for Raw Audio","venue":"cs.SD","work_id":"05682736-8137-4a5f-a5b6-1127e99b0041","year":2016},"citing_paper":{"arxiv_id":"2005.00341","last_updated":"2020-04-30T09:02:45Z","snapshot_observed_at":"2026-08-06T03:57:57.420510Z","submitted_at":"2020-04-30T09:02:45Z","title":"Jukebox: A Generative Model for Music","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-24T15:19:06.065102Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2005.00341"},"observation_digest":"sha256:31d7b4051bbbab66abeb7aefd3cadc4e81a517c5f551a838a6cc327532e4b47d","observation_id":"d6f94607-a95a-4f29-8a02-543ce382d26d","resolution":{"observed_at":"2026-05-24T15:19:37.741156Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":"1609.03499","doi":"10.48550/arxiv.1609.03499","metadata_source":"pith","pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WaveNet: A Generative Model for Raw Audio","venue":"cs.SD","work_id":"05682736-8137-4a5f-a5b6-1127e99b0041","year":2016},"citing_paper":{"arxiv_id":"2006.11239","last_updated":"2020-12-16T21:15:05Z","snapshot_observed_at":"2026-08-10T05:21:27.485481Z","submitted_at":"2020-06-19T17:24:44Z","title":"Denoising Diffusion Probabilistic Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-11T03:24:24.752572Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2006.11239"},"observation_digest":"sha256:1de36224609ff4347b3d3ee629c9dfe8a4662edc6944e1b84c01af12266d9fee","observation_id":"550dc318-e255-422c-a6fa-42b435e7481f","resolution":{"observed_at":"2026-05-12T20:27:40.593869Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":"1609.03499","doi":"10.48550/arxiv.1609.03499","metadata_source":"pith","pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WaveNet: A Generative Model for Raw Audio","venue":"cs.SD","work_id":"05682736-8137-4a5f-a5b6-1127e99b0041","year":2016},"citing_paper":{"arxiv_id":"2006.16668","last_updated":"2020-06-30T10:42:02Z","snapshot_observed_at":"2026-08-07T09:27:36.420559Z","submitted_at":"2020-06-30T10:42:02Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-11T02:26:44.624137Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2006.16668"},"observation_digest":"sha256:93500fcdfbf94975898574f33afed0a52a008c63095c0d6861d0176a2c0375a9","observation_id":"f1b3c8e9-3841-4fb8-a2be-458d386304f5","resolution":{"observed_at":"2026-05-12T20:27:40.593869Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":"1609.03499","doi":"10.48550/arxiv.1609.03499","metadata_source":"pith","pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WaveNet: A Generative Model for Raw Audio","venue":"cs.SD","work_id":"05682736-8137-4a5f-a5b6-1127e99b0041","year":2016},"citing_paper":{"arxiv_id":"2009.09761","last_updated":"2021-03-30T19:48:38Z","snapshot_observed_at":"2026-07-06T09:57:19.117228Z","submitted_at":"2020-09-21T11:20:38Z","title":"DiffWave: A Versatile Diffusion Model for Audio Synthesis","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-15T13:13:37.085932Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2009.09761"},"observation_digest":"sha256:379066ce70d4f94072a992e6f0f5f2a0a16d564d9c07f6295b7db9e3180c4f08","observation_id":"c7def291-5593-49de-b441-c9751af99b70","resolution":{"observed_at":"2026-05-15T13:13:37.129089Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":"1609.03499","doi":"10.48550/arxiv.1609.03499","metadata_source":"pith","pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WaveNet: A Generative Model for Raw Audio","venue":"cs.SD","work_id":"05682736-8137-4a5f-a5b6-1127e99b0041","year":2016},"citing_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-24T14:41:23.935708Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2010.02502"},"observation_digest":"sha256:813a386c8665ff431e24dfc3f8fa398c21f8e1caaa0131deffd29a86d0247242","observation_id":"5dd56de1-6972-4ec6-8a42-0e1ab7cb09a2","resolution":{"observed_at":"2026-05-24T14:44:36.954327Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":"1609.03499","doi":"10.48550/arxiv.1609.03499","metadata_source":"pith","pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WaveNet: A Generative Model for Raw Audio","venue":"cs.SD","work_id":"05682736-8137-4a5f-a5b6-1127e99b0041","year":2016},"citing_paper":{"arxiv_id":"2104.10157","last_updated":"2021-09-14T21:20:06Z","snapshot_observed_at":"2026-07-06T11:02:11.424356Z","submitted_at":"2021-04-20T17:58:03Z","title":"VideoGPT: Video Generation using VQ-VAE and Transformers","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-13T17:24:33.725187Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2104.10157"},"observation_digest":"sha256:b023fffd317498de952c73ba46c4f28999242d03e8daf023f8745eb611ecf5f1","observation_id":"14096d3c-3752-4525-96e0-66efeb690dc3","resolution":{"observed_at":"2026-05-13T17:24:33.845712Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":"1609.03499","doi":"10.48550/arxiv.1609.03499","metadata_source":"pith","pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WaveNet: A Generative Model for Raw Audio","venue":"cs.SD","work_id":"05682736-8137-4a5f-a5b6-1127e99b0041","year":2016},"citing_paper":{"arxiv_id":"2104.13478","last_updated":"2021-05-02T16:16:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-04-27T21:09:51Z","title":"Geometric Deep Learning: Grids, Groups, Graphs, Geodesics, and Gauges","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-13T02:39:29.411021Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2104.13478"},"observation_digest":"sha256:23db10310c1dc2b99e71d617c44207ccada5745ccb06fd72460c187bae003d02","observation_id":"c555b75f-c5a6-4e17-b92f-9198820fa97b","resolution":{"observed_at":"2026-05-13T02:39:30.003876Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":"1609.03499","doi":"10.48550/arxiv.1609.03499","metadata_source":"pith","pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WaveNet: A Generative Model for Raw Audio","venue":"cs.SD","work_id":"05682736-8137-4a5f-a5b6-1127e99b0041","year":2016},"citing_paper":{"arxiv_id":"2105.05233","last_updated":"2021-06-01T17:49:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-05-11T17:50:24Z","title":"Diffusion Models Beat GANs on Image Synthesis","version":4},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-13T11:16:28.445702Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2105.05233"},"observation_digest":"sha256:372c05142ed35a73bf13dc5bcb1fe0c111c3f74c0872bff07e22f713c3dfa58f","observation_id":"d2b9af6c-f04e-499c-9620-f1bbc75e6ac4","resolution":{"observed_at":"2026-05-13T11:16:28.487571Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":"1609.03499","doi":"10.48550/arxiv.1609.03499","metadata_source":"pith","pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WaveNet: A Generative Model for Raw Audio","venue":"cs.SD","work_id":"05682736-8137-4a5f-a5b6-1127e99b0041","year":2016},"citing_paper":{"arxiv_id":"2111.00396","last_updated":"2022-08-05T17:54:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-10-31T03:32:18Z","title":"Efficiently Modeling Long Sequences with Structured State Spaces","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-11T10:41:55.618357Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2111.00396"},"observation_digest":"sha256:d8726e61b4cccb0bb6eb6382f4cefcfa678fda52e3f74704b3c9309377c10495","observation_id":"5a14c320-3519-4396-a963-80c10ca18787","resolution":{"observed_at":"2026-05-12T20:27:40.593869Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":"1609.03499","doi":"10.48550/arxiv.1609.03499","metadata_source":"pith","pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WaveNet: A Generative Model for Raw Audio","venue":"cs.SD","work_id":"05682736-8137-4a5f-a5b6-1127e99b0041","year":2016},"citing_paper":{"arxiv_id":"2201.10005","last_updated":"2022-01-24T23:36:20Z","snapshot_observed_at":"2026-07-06T12:30:51.934079Z","submitted_at":"2022-01-24T23:36:20Z","title":"Text and Code Embeddings by Contrastive Pre-Training","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-15T19:24:11.907204Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2201.10005"},"observation_digest":"sha256:4844e2895d72fed91979d86bb2540bd448b09c5a95d8d9d5326b64c1a41679ae","observation_id":"26a18e11-b72b-4575-b765-b819bc20598a","resolution":{"observed_at":"2026-05-15T19:24:12.083924Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":"1609.03499","doi":"10.48550/arxiv.1609.03499","metadata_source":"pith","pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WaveNet: A Generative Model for Raw Audio","venue":"cs.SD","work_id":"05682736-8137-4a5f-a5b6-1127e99b0041","year":2016},"citing_paper":{"arxiv_id":"2205.06175","last_updated":"2022-11-11T10:04:29Z","snapshot_observed_at":"2026-08-08T03:18:33.595658Z","submitted_at":"2022-05-12T16:03:26Z","title":"A Generalist Agent","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-13T06:24:49.833638Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2205.06175"},"observation_digest":"sha256:891e84a76b0a4e41aa098d55b0e92d37a671d2bf7b35417624309807e3355c85","observation_id":"2fdfeb2e-804c-4c68-a0b5-45caef47e4b8","resolution":{"observed_at":"2026-05-13T06:24:49.935627Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":"1609.03499","doi":"10.48550/arxiv.1609.03499","metadata_source":"pith","pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WaveNet: A Generative Model for Raw Audio","venue":"cs.SD","work_id":"05682736-8137-4a5f-a5b6-1127e99b0041","year":2016},"citing_paper":{"arxiv_id":"2208.04933","last_updated":"2023-03-03T18:35:28Z","snapshot_observed_at":"2026-07-06T13:40:19.948018Z","submitted_at":"2022-08-09T17:57:43Z","title":"Simplified State Space Layers for Sequence Modeling","version":3},"reference_index":133,"source":"arxiv_source","source_observed_at":"2026-05-16T08:16:11.406774Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2208.04933"},"observation_digest":"sha256:797d3b79a1cd73e0d782d0ea1cc9bde9d257b620404e0619dcd48539b4069fe6","observation_id":"27868269-23e0-4e14-a36a-82fe74e2d2b9","resolution":{"observed_at":"2026-05-16T08:16:11.516486Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":"1609.03499","doi":"10.48550/arxiv.1609.03499","metadata_source":"pith","pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WaveNet: A Generative Model for Raw Audio","venue":"cs.SD","work_id":"05682736-8137-4a5f-a5b6-1127e99b0041","year":2016},"citing_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-09T07:12:13.721596Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-13T21:49:52.184932Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2210.13438"},"observation_digest":"sha256:a256a87ef6441c4e3aead6511d1aeb7afac3ba40cf34bc03fd6f7ac4fcb15d96","observation_id":"6433f12a-e595-4a38-a021-ab6f1bb82b4d","resolution":{"observed_at":"2026-05-13T21:49:52.247674Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":"1609.03499","doi":"10.48550/arxiv.1609.03499","metadata_source":"pith","pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WaveNet: A Generative Model for Raw Audio","venue":"cs.SD","work_id":"05682736-8137-4a5f-a5b6-1127e99b0041","year":2016},"citing_paper":{"arxiv_id":"2211.15657","last_updated":"2023-07-10T07:25:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-28T18:59:02Z","title":"Is Conditional Generative Modeling all you need for Decision-Making?","version":4},"reference_index":194,"source":"arxiv_source","source_observed_at":"2026-05-15T15:35:10.593969Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2211.15657"},"observation_digest":"sha256:cd4bd59474f1d1c7da63bff44a70cf4e282e71544211f3e4fe3defac14b1970f","observation_id":"3b6fac2a-65bf-4c59-a0bd-0e5e75d09b4f","resolution":{"observed_at":"2026-05-15T15:35:10.985464Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":"1609.03499","doi":"10.48550/arxiv.1609.03499","metadata_source":"pith","pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WaveNet: A Generative Model for Raw Audio","venue":"cs.SD","work_id":"05682736-8137-4a5f-a5b6-1127e99b0041","year":2016},"citing_paper":{"arxiv_id":"2310.10688","last_updated":"2024-04-17T18:24:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-14T17:01:37Z","title":"A decoder-only foundation model for time-series forecasting","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-16T18:07:21.246053Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2310.10688"},"observation_digest":"sha256:43a6d81903335875fba2def2071dd3ae7936536bf9bb062e964b1113c0264f7b","observation_id":"f9673700-c241-4c4b-9615-23b9d4d2fde7","resolution":{"observed_at":"2026-05-16T18:07:21.278674Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":"1609.03499","doi":"10.48550/arxiv.1609.03499","metadata_source":"pith","pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WaveNet: A Generative Model for Raw Audio","venue":"cs.SD","work_id":"05682736-8137-4a5f-a5b6-1127e99b0041","year":2016},"citing_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-10T11:53:06.570968Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2312.00752"},"observation_digest":"sha256:28027dec5eac6ea87f9e3841da7b66e45bd2b1ab809c8d9cff8f8dab8a3c23ba","observation_id":"81570b34-cd30-4dd0-bbd5-82a9f85e4768","resolution":{"observed_at":"2026-05-12T20:27:40.593869Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":"1609.03499","doi":"10.48550/arxiv.1609.03499","metadata_source":"pith","pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WaveNet: A Generative Model for Raw Audio","venue":"cs.SD","work_id":"05682736-8137-4a5f-a5b6-1127e99b0041","year":2016},"citing_paper":{"arxiv_id":"2402.17762","last_updated":"2024-08-14T16:00:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-27T18:55:17Z","title":"Massive Activations in Large Language Models","version":2},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-05-16T07:02:53.740597Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2402.17762"},"observation_digest":"sha256:c88178f0c099d5da70d456f70fc9c32015d1d543708731fb47190a8b13472b48","observation_id":"90c7731a-54c6-40fe-b20d-fcd8dadc4053","resolution":{"observed_at":"2026-05-16T07:02:53.919878Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":"1609.03499","doi":"10.48550/arxiv.1609.03499","metadata_source":"pith","pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WaveNet: A Generative Model for Raw Audio","venue":"cs.SD","work_id":"05682736-8137-4a5f-a5b6-1127e99b0041","year":2016},"citing_paper":{"arxiv_id":"2403.07815","last_updated":"2024-11-04T17:42:45Z","snapshot_observed_at":"2026-07-06T17:43:27.034067Z","submitted_at":"2024-03-12T16:53:54Z","title":"Chronos: Learning the Language of Time Series","version":3},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-13T08:27:23.298009Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2403.07815"},"observation_digest":"sha256:bfb0b0e9b8f0334bbf42dcf33343857cd2e73918c2bc63b19429ba94aeb16ef2","observation_id":"b00f98e0-9052-4415-8ce6-a6b428035075","resolution":{"observed_at":"2026-05-13T08:27:23.386102Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":"1609.03499","doi":"10.48550/arxiv.1609.03499","metadata_source":"pith","pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WaveNet: A Generative Model for Raw Audio","venue":"cs.SD","work_id":"05682736-8137-4a5f-a5b6-1127e99b0041","year":2016},"citing_paper":{"arxiv_id":"2407.13278","last_updated":"2026-05-04T08:07:42Z","snapshot_observed_at":"2026-07-06T18:48:20.902620Z","submitted_at":"2024-07-18T08:31:55Z","title":"Deep Time Series Models: A Comprehensive Survey and Benchmark","version":3},"reference_index":130,"source":"pdf_text","source_observed_at":"2026-05-23T23:03:45.096751Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2407.13278"},"observation_digest":"sha256:3879f62105613747b95121094bb4623d18c8e05acc19119664bc1dd870938e55","observation_id":"1ac39f3f-ebad-4f45-b7e0-d7f259c72f03","resolution":{"observed_at":"2026-05-23T23:05:51.461510Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":"1609.03499","doi":"10.48550/arxiv.1609.03499","metadata_source":"pith","pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WaveNet: A Generative Model for Raw Audio","venue":"cs.SD","work_id":"05682736-8137-4a5f-a5b6-1127e99b0041","year":2016},"citing_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-05-12T08:13:21.962488Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2410.00037"},"observation_digest":"sha256:57aab9dad6ced7633a0a6eedb2aa51c49908c3e7832adb114945b2f7ca5f532e","observation_id":"d8f9c0b7-475c-47ed-b53e-a23d8e08f1bd","resolution":{"observed_at":"2026-05-12T20:27:40.593869Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-12T15:11:21.068085Z","title":"Wavenet: A generative model for raw audio","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.14586","last_updated":"2024-11-21T20:52:02Z","snapshot_observed_at":"2026-08-12T15:05:31.971345Z","submitted_at":"2024-11-21T20:52:02Z","title":"Listening for Expert Identified Linguistic Features: Assessment of Audio Deepfake Discernment among Undergraduate Students","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T15:11:21.068085Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2411.14586"},"observation_digest":"sha256:c5e63361dbff76402db7a728ec2cd3ac5cb3e42bd998bec516e169a273da3345","observation_id":"23cf175a-bce8-4654-9620-e39ae0ca35d3","resolution":{"observed_at":"2026-08-12T15:11:21.068085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-12T15:07:25.275090Z","title":"Wavenet: A gener- ative model for raw audio,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.14642","last_updated":"2024-11-22T00:21:39Z","snapshot_observed_at":"2026-08-12T15:01:26.533932Z","submitted_at":"2024-11-22T00:21:39Z","title":"VQalAttent: a Transparent Speech Generation Pipeline based on Transformer-learned VQ-VAE Latent Space","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T15:07:25.275090Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2411.14642"},"observation_digest":"sha256:ae7b3828030fd85517883141969a3c2f0f95d731bd71528bdad5ab9d7e3a2059","observation_id":"0b87d536-ad02-4d34-8103-156ec6d0bcc2","resolution":{"observed_at":"2026-08-12T15:07:25.275090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-12T14:25:18.886889Z","title":"Wavenet: A generative model for raw audio,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.15380","last_updated":"2024-11-22T23:45:15Z","snapshot_observed_at":"2026-08-12T14:19:53.417514Z","submitted_at":"2024-11-22T23:45:15Z","title":"Nd-BiMamba2: A Unified Bidirectional Architecture for Multi-Dimensional Data Processing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T14:25:18.886889Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2411.15380"},"observation_digest":"sha256:cebca20fde79606365818b464de84dd46a527e080602ce7c62bc91028f5525d6","observation_id":"44302862-b9cc-440a-890c-44b4f516a23f","resolution":{"observed_at":"2026-08-12T14:25:18.886889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-12T05:56:42.839450Z","title":"Wavenet: A generative model for raw audio","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.19842","last_updated":"2024-11-29T16:58:02Z","snapshot_observed_at":"2026-08-12T05:43:52.157811Z","submitted_at":"2024-11-29T16:58:02Z","title":"Scaling Transformers for Low-Bitrate High-Quality Speech Coding","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-12T05:56:42.839450Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2411.19842"},"observation_digest":"sha256:05b49cd943ed3e534f9af5d3fed479270f8b8d8dcb4cb3df36086a8ad5cb5639","observation_id":"bb796e25-1903-400b-a62b-40a5ddf7ad50","resolution":{"observed_at":"2026-08-12T05:56:42.839450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-12T05:44:47.673947Z","title":"van den Oord, S","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.19897","last_updated":"2025-08-07T17:05:15Z","snapshot_observed_at":"2026-08-12T05:39:59.091565Z","submitted_at":"2024-11-29T18:02:16Z","title":"Input-Output Optics as a Causal Time Series Mapping: A Generative Machine Learning Solution","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T05:44:47.673947Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2411.19897"},"observation_digest":"sha256:904b7875bdca393c35ba2d5bf8fa27fb70b8a0cbe37ce1d836966ffa0097bc0b","observation_id":"c4197214-845f-47ba-98db-b03e5b82f365","resolution":{"observed_at":"2026-08-12T05:44:47.673947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-12T04:47:48.563368Z","title":"Wavenet: A gener- ative model for raw audio,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.01092","last_updated":"2024-12-02T04:00:10Z","snapshot_observed_at":"2026-08-12T04:39:54.454209Z","submitted_at":"2024-12-02T04:00:10Z","title":"Deep Learning-Based Approach for Identification and Compensation of Nonlinear Distortions in Parametric Array Loudspeakers","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T04:47:48.563368Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2412.01092"},"observation_digest":"sha256:9ed2abaada167563e28828dc355547a8cdf136847811d10db2eb32dde21d8260","observation_id":"de80e184-caaf-4486-adbd-cf29eb9c4743","resolution":{"observed_at":"2026-08-12T04:47:48.563368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-12T04:37:35.007035Z","title":"Wavenet: A gener- ative model for raw audio.arXiv preprint arXiv:1609.03499,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01243","last_updated":"2025-03-05T11:17:18Z","snapshot_observed_at":"2026-08-12T04:30:18.037592Z","submitted_at":"2024-12-02T08:05:26Z","title":"Schedule On the Fly: Diffusion Time Prediction for Faster and Better Image Generation","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T04:37:35.007035Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2412.01243"},"observation_digest":"sha256:08f18368d2b7c64b5e368dc608e1e5e71f93aeb0edff55518f056ac0964b615a","observation_id":"80e11592-8b73-4872-b0aa-bd56c304a878","resolution":{"observed_at":"2026-08-12T04:37:35.007035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-12T04:27:34.797915Z","title":"van den Oord, S","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.01393","last_updated":"2025-03-30T04:37:48Z","snapshot_observed_at":"2026-08-12T04:22:20.134744Z","submitted_at":"2024-12-02T11:27:26Z","title":"Machine Learning Analysis of Anomalous Diffusion","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-12T04:27:34.797915Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2412.01393"},"observation_digest":"sha256:10621b13cc633fa0fa8bc2ba1f25c8d96ea7860475126e4ee7b5a2472f3e9e0a","observation_id":"592b121f-6d10-48d0-8d18-df0a35c2b369","resolution":{"observed_at":"2026-08-12T04:27:34.797915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-11T21:59:28.646021Z","title":"Wavenet: A generative model for raw audio","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.03936","last_updated":"2024-12-05T07:34:04Z","snapshot_observed_at":"2026-08-11T21:53:26.793771Z","submitted_at":"2024-12-05T07:34:04Z","title":"Deep Learning Modeling Method for RF Devices Based on Uniform Noise Training Set","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T21:59:28.646021Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2412.03936"},"observation_digest":"sha256:7678f7be7ed167418ba2f4d06f9698adc693093ea4aa24a7a3111fb4b79084c2","observation_id":"4628b374-f65f-4d5c-989b-28b7163e358f","resolution":{"observed_at":"2026-08-11T21:59:28.646021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-11T21:41:49.762079Z","title":"Wave N et: A generative model for raw audio","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.04242","last_updated":"2024-12-05T15:25:18Z","snapshot_observed_at":"2026-08-12T08:40:50.123143Z","submitted_at":"2024-12-05T15:25:18Z","title":"LMDM:Latent Molecular Diffusion Model For 3D Molecule Generation","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T21:41:49.762079Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2412.04242"},"observation_digest":"sha256:7e71167122c5cb1493fee67947a82fa1ab26a7cb3fd87ce3a73c67a671d12f8a","observation_id":"af09983c-47e3-4522-b4f9-ced1eb201898","resolution":{"observed_at":"2026-08-11T21:41:49.762079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-11T19:09:55.136086Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.07177","last_updated":"2024-12-10T04:22:11Z","snapshot_observed_at":"2026-08-11T21:47:47.069506Z","submitted_at":"2024-12-10T04:22:11Z","title":"Effective Reward Specification in Deep Reinforcement Learning","version":1},"reference_index":234,"source":"arxiv_source","source_observed_at":"2026-08-11T19:09:55.136086Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2412.07177"},"observation_digest":"sha256:0be86fc4131e557679fbfed4df994c31affba5a2644c6c8abccca86d512d9026","observation_id":"b3901e03-157b-463b-bc79-44ce9350a8b0","resolution":{"observed_at":"2026-08-11T19:09:55.136086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-11T19:00:03.760512Z","title":"Wavenet: A generative model for raw audio,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.07264","last_updated":"2024-12-10T07:44:35Z","snapshot_observed_at":"2026-08-11T19:58:02.349919Z","submitted_at":"2024-12-10T07:44:35Z","title":"QuantFormer: Learning to Quantize for Neural Activity Forecasting in Mouse Visual Cortex","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T19:00:03.760512Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2412.07264"},"observation_digest":"sha256:aa6e74e3168cdb66b170f9d6a51e3ccda90e60a817287255c3a6c7154d27a65c","observation_id":"fa1813f9-3053-4de2-8ed4-920a997a2721","resolution":{"observed_at":"2026-08-11T19:00:03.760512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-11T18:31:59.939362Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.07935","last_updated":"2024-12-10T21:31:12Z","snapshot_observed_at":"2026-08-11T18:21:42.893876Z","submitted_at":"2024-12-10T21:31:12Z","title":"Non-Normal Diffusion Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T18:31:59.939362Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2412.07935"},"observation_digest":"sha256:3bfbc5afd45b57dfcb815cabd8bdf1e24ac3def7dd97e762f85a6fcf9af1b5f2","observation_id":"45b8afa9-96e9-4123-a765-1c4e54567888","resolution":{"observed_at":"2026-08-11T18:31:59.939362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-11T18:01:14.165761Z","title":"Available: https://arxiv.org/abs/1609.03499","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08312","last_updated":"2024-12-11T11:47:39Z","snapshot_observed_at":"2026-08-11T17:55:24.067349Z","submitted_at":"2024-12-11T11:47:39Z","title":"A Unified Model For Voice and Accent Conversion In Speech and Singing using Self-Supervised Learning and Feature Extraction","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-11T18:01:14.165761Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2412.08312"},"observation_digest":"sha256:e0d27771e78d7eef8d373b9c00811e18f8f6b34c4a03e8b9c6f3576c45de1306","observation_id":"53f5181f-6cc7-4fd9-b5e0-d53044501f8d","resolution":{"observed_at":"2026-08-11T18:01:14.165761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-11T17:31:06.866412Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.08918","last_updated":"2024-12-13T13:43:11Z","snapshot_observed_at":"2026-08-11T17:23:45.018950Z","submitted_at":"2024-12-12T04:01:28Z","title":"CSSinger: End-to-End Chunkwise Streaming Singing Voice Synthesis System Based on Conditional Variational Autoencoder","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T17:31:06.866412Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2412.08918"},"observation_digest":"sha256:68776568a598fe2a87a529f6a16b2a84e0b2316767aaae38dc4b4638ee0e11f6","observation_id":"db5a8688-9ea4-4e82-b032-7fd09029d8c0","resolution":{"observed_at":"2026-08-11T17:31:06.866412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-11T17:24:22.390076Z","title":"Wavenet: A generative model for raw audio","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.09032","last_updated":"2025-07-17T03:29:13Z","snapshot_observed_at":"2026-08-12T05:28:06.409447Z","submitted_at":"2024-12-12T07:48:17Z","title":"Speech-Forensics: Towards Comprehensive Synthetic Speech Dataset Establishment and Analysis","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T17:24:22.390076Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2412.09032"},"observation_digest":"sha256:3614eb21fb307296c096e5ffb940b9bf682fb443609b3e7397136d3b5eeab24d","observation_id":"5aa73031-419c-4f51-a949-4ed69ad28f61","resolution":{"observed_at":"2026-08-11T17:24:22.390076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-11T15:17:18.781697Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.11171","last_updated":"2024-12-15T12:41:53Z","snapshot_observed_at":"2026-08-11T15:11:49.462599Z","submitted_at":"2024-12-15T12:41:53Z","title":"Learning Latent Spaces for Domain Generalization in Time Series Forecasting","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T15:17:18.781697Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2412.11171"},"observation_digest":"sha256:7ab7db598fb0985f38075b6bc71f1463116b8f4732ab86930fb8f45b0aac21f2","observation_id":"03cd3e37-ab42-4411-97ff-9c31f280a311","resolution":{"observed_at":"2026-08-11T15:17:18.781697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-11T15:00:02.704954Z","title":"Wavenet: A generative model for raw audio,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.11449","last_updated":"2026-06-09T04:55:57Z","snapshot_observed_at":"2026-08-11T14:53:24.338197Z","submitted_at":"2024-12-16T05:03:48Z","title":"Whisper-GPT -- Continuous Discrete Hybrid Representation Language Models For Speech And Music","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T15:00:02.704954Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2412.11449"},"observation_digest":"sha256:476b5886709d2588f1fe8687ea526b9957d24ed1d4785a5bac4150c96bd89d34","observation_id":"d2bfc67e-447f-46ff-a2fb-684b61a9c752","resolution":{"observed_at":"2026-08-11T15:00:02.704954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-11T13:57:20.917865Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.12619","last_updated":"2024-12-17T07:31:19Z","snapshot_observed_at":"2026-08-11T13:51:59.186708Z","submitted_at":"2024-12-17T07:31:19Z","title":"Phoneme-Level Feature Discrepancies: A Key to Detecting Sophisticated Speech Deepfakes","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T13:57:20.917865Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2412.12619"},"observation_digest":"sha256:d8953fbc82941f92c179f386ad11128f8eb31d684ca339c9c19f118756b60bb9","observation_id":"47bddea1-c0f3-4e49-a7c1-e1042d9b1111","resolution":{"observed_at":"2026-08-11T13:57:20.917865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-11T13:56:39.734235Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.12639","last_updated":"2025-04-22T07:32:21Z","snapshot_observed_at":"2026-08-12T11:57:04.940808Z","submitted_at":"2024-12-17T08:02:08Z","title":"Falcon: Faster and Parallel Inference of Large Language Models through Enhanced Semi-Autoregressive Drafting and Custom-Designed Decoding Tree","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T13:56:39.734235Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2412.12639"},"observation_digest":"sha256:89a0c0ee5a9685a89a328db78eeb446c3ed670ab01b6b8461215c81a2beee81f","observation_id":"15dee101-6225-40c4-b916-5ceafb872b5e","resolution":{"observed_at":"2026-08-11T13:56:39.734235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-11T12:18:39.623125Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.14435","last_updated":"2024-12-19T01:34:17Z","snapshot_observed_at":"2026-08-12T06:32:10.467902Z","submitted_at":"2024-12-19T01:34:17Z","title":"Cherry-Picking in Time Series Forecasting: How to Select Datasets to Make Your Model Shine","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T12:18:39.623125Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2412.14435"},"observation_digest":"sha256:adfc4f00701f419d4c0dd0ae162819c2512e80f2301a1c60eb9e67d9ebc33d4a","observation_id":"1ecd6d59-2419-45e9-b905-792981723578","resolution":{"observed_at":"2026-08-11T12:18:39.623125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-11T13:26:31.598140Z","title":"Wavenet: A generative model for raw audio,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.16207","last_updated":"2024-12-17T18:07:40Z","snapshot_observed_at":"2026-08-11T13:20:46.880634Z","submitted_at":"2024-12-17T18:07:40Z","title":"Synthetic Time Series Data Generation for Healthcare Applications: A PCG Case Study","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T13:26:31.598140Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2412.16207"},"observation_digest":"sha256:29a6d7dc046b24740e6823486f44481cff56668e4d667872653833003b882ddd","observation_id":"c3571804-71ec-4ce4-ac19-35a70a84b943","resolution":{"observed_at":"2026-08-11T13:26:31.598140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-11T04:47:13.612051Z","title":"Wavenet: A generative model for raw audio,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.18442","last_updated":"2025-01-24T11:39:32Z","snapshot_observed_at":"2026-08-11T04:40:14.332217Z","submitted_at":"2024-12-24T14:02:44Z","title":"SoK: On the Offensive Potential of AI","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T04:47:13.612051Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2412.18442"},"observation_digest":"sha256:3ddee70f6a7de00a0edb75d1b65374894c6dc47e17d184aa5d64d8e78f303c39","observation_id":"ef7937de-2a79-48ee-9cf0-43cba92739f0","resolution":{"observed_at":"2026-08-11T04:47:13.612051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-11T01:04:03.326861Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.19099","last_updated":"2024-12-26T07:42:07Z","snapshot_observed_at":"2026-08-12T03:04:54.842601Z","submitted_at":"2024-12-26T07:42:07Z","title":"BSDB-Net: Band-Split Dual-Branch Network with Selective State Spaces Mechanism for Monaural Speech Enhancement","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T01:04:03.326861Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2412.19099"},"observation_digest":"sha256:ba1cff5aff057a94faa781b1d4eb28634a9ae5b0234e4b3b0640d0ede71493e3","observation_id":"19a5df6a-434a-4307-a63c-01b564b267c0","resolution":{"observed_at":"2026-08-11T01:04:03.326861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-11T00:49:27.847846Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.19279","last_updated":"2024-12-30T16:08:39Z","snapshot_observed_at":"2026-08-12T04:38:57.570876Z","submitted_at":"2024-12-26T16:45:20Z","title":"Improving Generalization for AI-Synthesized Voice Detection","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T00:49:27.847846Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2412.19279"},"observation_digest":"sha256:32390cda0db2d80640bd42af06b6d84a046a46ff4c2454e98b3e43c6b5383265","observation_id":"8756600b-a2ad-42ba-9761-68db09328321","resolution":{"observed_at":"2026-08-11T00:49:27.847846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-10T23:41:01.095472Z","title":"Wavenet: A gener- ative model for raw audio,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.20048","last_updated":"2024-12-28T06:32:49Z","snapshot_observed_at":"2026-08-11T20:29:42.592115Z","submitted_at":"2024-12-28T06:32:49Z","title":"CrossSpeech++: Cross-lingual Speech Synthesis with Decoupled Language and Speaker Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T23:41:01.095472Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2412.20048"},"observation_digest":"sha256:08845f0675e1f0613be2aed6c210a722198fa199991555b485097f9961ca6c2d","observation_id":"614d5c98-5ce2-4392-8be2-08ff8d25809c","resolution":{"observed_at":"2026-08-10T23:41:01.095472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-10T23:14:07.002483Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.20848","last_updated":"2024-12-30T10:35:03Z","snapshot_observed_at":"2026-08-10T23:06:25.081578Z","submitted_at":"2024-12-30T10:35:03Z","title":"Analog Alchemy: Neural Computation with In-Memory Inference, Learning and Routing","version":1},"reference_index":130,"source":"pdf_text","source_observed_at":"2026-08-10T23:14:07.002483Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2412.20848"},"observation_digest":"sha256:196aeedaa523cfa621c51f432e8d26e21ca669e12456470dfc2227231e9bcf15","observation_id":"e1b33c7b-fa58-44ca-abbb-8ef64363fde4","resolution":{"observed_at":"2026-08-10T23:14:07.002483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-10T21:55:50.454144Z","title":"WaveNet: A Generative Model for Raw Audio,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.03461","last_updated":"2025-07-15T12:08:06Z","snapshot_observed_at":"2026-08-11T09:24:47.338661Z","submitted_at":"2025-01-07T01:35:56Z","title":"Few-Shot Radar Signal Recognition through Self-Supervised Learning and Radio Frequency Domain Adaptation","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T21:55:50.454144Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2501.03461"},"observation_digest":"sha256:4299bb89708c8eaa42142e431de7c70ddb398b2463803314daeefd7d2e8d9537","observation_id":"7061aed6-cde3-4b39-951a-889f4b70f02f","resolution":{"observed_at":"2026-08-10T21:55:50.454144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-10T21:26:24.653080Z","title":"Wavenet: A genera- tive model for raw audio,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.05068","last_updated":"2025-01-13T12:06:15Z","snapshot_observed_at":"2026-08-10T22:41:44.144754Z","submitted_at":"2025-01-09T08:44:06Z","title":"D3RM: A Discrete Denoising Diffusion Refinement Model for Piano Transcription","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T21:26:24.653080Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2501.05068"},"observation_digest":"sha256:9f5dc3a14440da0e35095e87108f9639efeda9ed761178dea76349300e6bf130","observation_id":"8b6a760d-85ad-4ff9-82f1-5b7fb3d8b4b9","resolution":{"observed_at":"2026-08-10T21:26:24.653080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-10T20:56:10.284004Z","title":"Wavenet: A generative model for raw audio","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.06999","last_updated":"2025-01-13T01:20:23Z","snapshot_observed_at":"2026-08-10T20:47:17.474689Z","submitted_at":"2025-01-13T01:20:23Z","title":"Likelihood Training of Cascaded Diffusion Models via Hierarchical Volume-preserving Maps","version":1},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-10T20:56:10.284004Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2501.06999"},"observation_digest":"sha256:31306a4d57641cef57a4ed21af7b1d6a32ae1084ecda6304008c5438f7c40c5f","observation_id":"21ae3f99-7ab1-486f-b819-b0095109a3c1","resolution":{"observed_at":"2026-08-10T20:56:10.284004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-10T20:53:16.449766Z","title":"van den, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.07034","last_updated":"2025-01-13T03:13:32Z","snapshot_observed_at":"2026-08-12T11:19:19.644483Z","submitted_at":"2025-01-13T03:13:32Z","title":"Explore the Use of Time Series Foundation Model for Car-Following Behavior Analysis","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T20:53:16.449766Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2501.07034"},"observation_digest":"sha256:409b668479918996c70973ffc7c9132541e831b270635b36114c75b0992bb126","observation_id":"74340849-317d-46ea-8d02-3d5e4f01def4","resolution":{"observed_at":"2026-08-10T20:53:16.449766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-10T20:38:48.150043Z","title":"Wavenet: A gener- ative model for raw audio,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.07814","last_updated":"2025-01-14T03:26:05Z","snapshot_observed_at":"2026-08-11T20:15:37.911708Z","submitted_at":"2025-01-14T03:26:05Z","title":"STTS-EAD: Improving Spatio-Temporal Learning Based Time Series Prediction via","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T20:38:48.150043Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2501.07814"},"observation_digest":"sha256:60cbcbc72cd166fc7a86a5945bfe94f8ddf12d7f359e7f769c5bd1b188dd66ea","observation_id":"85cab1f6-3833-4292-beb0-99196bf8e6f2","resolution":{"observed_at":"2026-08-10T20:38:48.150043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-10T20:36:57.404572Z","title":"Wavenet: A generative model for raw audio,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.07897","last_updated":"2025-01-14T07:26:05Z","snapshot_observed_at":"2026-08-11T16:12:18.936413Z","submitted_at":"2025-01-14T07:26:05Z","title":"Bridge-SR: Schr\\\"odinger Bridge for Efficient SR","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T20:36:57.404572Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2501.07897"},"observation_digest":"sha256:cfb39a0747de518d1a68ce94c8b984e7dc96f83422211220b2ef37a95ffde832","observation_id":"dc334105-3d5b-4439-8189-969ae6c280df","resolution":{"observed_at":"2026-08-10T20:36:57.404572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-10T19:08:48.862373Z","title":"Wavenet: A generative model for raw audio","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.10617","last_updated":"2025-01-18T00:43:11Z","snapshot_observed_at":"2026-08-12T02:00:36.288517Z","submitted_at":"2025-01-18T00:43:11Z","title":"Mutual Regression Distance","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-10T19:08:48.862373Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2501.10617"},"observation_digest":"sha256:88c1bb61c6d1ddb8443b64efef932dcb6cf6a8746d49e41f5db66189d96b7aac","observation_id":"3124be9c-6d0e-4872-9108-6d9827f33b4d","resolution":{"observed_at":"2026-08-10T19:08:48.862373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-10T17:45:45.995849Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.11959","last_updated":"2025-01-21T08:10:02Z","snapshot_observed_at":"2026-08-12T08:01:40.317881Z","submitted_at":"2025-01-21T08:10:02Z","title":"Noise-Resilient Point-wise Anomaly Detection in Time Series Using Weak Segment Labels","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-10T17:45:45.995849Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2501.11959"},"observation_digest":"sha256:051ef11cb7e87ff128529b73a61cf94a0e5b6a94d263bc687e8761cfbb74ddc1","observation_id":"0f1707ea-3eac-4b01-ba0b-5e0d943caac2","resolution":{"observed_at":"2026-08-10T17:45:45.995849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-10T16:21:57.443951Z","title":"Wavenet: A generative model for raw audio","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.13274","last_updated":"2025-03-26T07:43:36Z","snapshot_observed_at":"2026-08-10T23:50:24.863995Z","submitted_at":"2025-01-22T23:32:29Z","title":"T-Graphormer: Using Transformers for Spatiotemporal Forecasting","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-10T16:21:57.443951Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2501.13274"},"observation_digest":"sha256:a38ee6a6f8c337f288ed4d83027567d84a2a61b26c7177cdd206b7931512b8bc","observation_id":"640b5ffb-de29-44d9-9f9c-44e07a269046","resolution":{"observed_at":"2026-08-10T16:21:57.443951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-10T15:59:21.046334Z","title":"Wavenet: A gener- ative model for raw audio,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.13465","last_updated":"2025-01-23T08:27:01Z","snapshot_observed_at":"2026-08-11T02:34:18.430606Z","submitted_at":"2025-01-23T08:27:01Z","title":"Neural Vocoders as Speech Enhancers","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T15:59:21.046334Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2501.13465"},"observation_digest":"sha256:459c7c5f12106f5f256560d6b59dc91e516626cb4df64097c61b5f4366acf4b7","observation_id":"18582bdb-2f48-44fc-9078-8e3f6501fe95","resolution":{"observed_at":"2026-08-10T15:59:21.046334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-09T23:38:10.292452Z","title":"Wavenet: A Generative Model for Raw Audio","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.18665","last_updated":"2025-07-18T23:49:21Z","snapshot_observed_at":"2026-08-12T08:02:10.414571Z","submitted_at":"2025-01-30T15:44:04Z","title":"BARNN: A Bayesian Autoregressive and Recurrent Neural Network","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-09T23:38:10.292452Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2501.18665"},"observation_digest":"sha256:3e42be35cd4b7fabd6f1b169eb837e8373788fcc8a14c217988e2de0b173551a","observation_id":"276af8c5-afba-497c-bd78-dd83e2c9f782","resolution":{"observed_at":"2026-08-09T23:38:10.292452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-09T17:43:14.294425Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.00820","last_updated":"2025-02-02T15:14:17Z","snapshot_observed_at":"2026-08-10T23:21:10.067917Z","submitted_at":"2025-02-02T15:14:17Z","title":"OOD Detection with immature Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-09T17:43:14.294425Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2502.00820"},"observation_digest":"sha256:99987cee9e67eca8d116eefeba23217a8129b3cbd3192caa3b5d1089eae147e7","observation_id":"d0f759fd-81aa-46d8-b6c0-b866c42e6977","resolution":{"observed_at":"2026-08-09T17:43:14.294425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-09T11:00:16.848844Z","title":"WaveNet: A generative model for raw audio,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02830","last_updated":"2025-02-05T02:14:08Z","snapshot_observed_at":"2026-08-10T18:09:46.588420Z","submitted_at":"2025-02-05T02:14:08Z","title":"Multimodal Brain-Computer Interfaces: AI-powered Decoding Methodologies","version":1},"reference_index":143,"source":"pdf_text","source_observed_at":"2026-08-09T11:00:16.848844Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2502.02830"},"observation_digest":"sha256:002d1bf816edef4781deeb7bad7f18de9c95dbf2f4dccb056a7aab1708333994","observation_id":"cba65a0d-e72e-47f2-a4dc-53c734ef45bb","resolution":{"observed_at":"2026-08-09T11:00:16.848844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-09T10:44:27.936799Z","title":"Wavenet: A generative model for raw audio","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.02912","last_updated":"2025-02-05T06:18:43Z","snapshot_observed_at":"2026-08-12T07:51:46.314722Z","submitted_at":"2025-02-05T06:18:43Z","title":"MobiCLR: Mobility Time Series Contrastive Learning for Urban Region Representations","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-09T10:44:27.936799Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2502.02912"},"observation_digest":"sha256:1ad350bb14067d9253cc298fb6e2497f8ad3c9f2904fe6a169551ba390b4ed26","observation_id":"7fa8aef8-8086-4156-8024-43485f67940b","resolution":{"observed_at":"2026-08-09T10:44:27.936799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-08T23:48:28.957134Z","title":"Van Den Oord, S","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.04049","last_updated":"2025-06-01T07:23:30Z","snapshot_observed_at":"2026-08-10T10:08:38.064529Z","submitted_at":"2025-02-06T13:06:33Z","title":"Towards Explainable Spoofed Speech Attribution and Detection:a Probabilistic Approach for Characterizing Speech Synthesizer Components","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-08T23:48:28.957134Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2502.04049"},"observation_digest":"sha256:08dac03f72ecb8dc5a80a258cdbd83cc97e0edb0229eda161b3455365eee01a4","observation_id":"b8be1c4b-cadf-4a29-b8fd-1ca592a2eb54","resolution":{"observed_at":"2026-08-08T23:48:28.957134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-09T11:32:47.954111Z","title":"Wavenet: A generative model for raw audio","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04357","last_updated":"2025-02-04T19:37:35Z","snapshot_observed_at":"2026-08-09T21:31:34.898991Z","submitted_at":"2025-02-04T19:37:35Z","title":"Reusing Embeddings: Reproducible Reward Model Research in Large Language Model Alignment without GPUs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-09T11:32:47.954111Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2502.04357"},"observation_digest":"sha256:51bc7754511b541ee3cd82eb554f717116b2b9119c73c68d4c32039289ab4bf1","observation_id":"ff9dfb75-04a8-4166-a8ae-d6d1ef3c2093","resolution":{"observed_at":"2026-08-09T11:32:47.954111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-08T14:33:16.029766Z","title":"Wavenet: A generative model for raw audio","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.06751","last_updated":"2025-05-30T23:27:14Z","snapshot_observed_at":"2026-08-09T17:04:04.288558Z","submitted_at":"2025-02-10T18:26:40Z","title":"What makes a good feedforward computational graph?","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-08T14:33:16.029766Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2502.06751"},"observation_digest":"sha256:af336ffaa980fe4f4db6531dc21380b9603d86574a17b33aa6d831e87d3b1592","observation_id":"49d0fd8b-9410-4c57-86bb-6b09667ed3eb","resolution":{"observed_at":"2026-08-08T14:33:16.029766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-08T22:35:47.762112Z","title":"Wavenet: A generative model for raw audio","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.06845","last_updated":"2025-02-06T21:00:35Z","snapshot_observed_at":"2026-08-08T23:26:11.464348Z","submitted_at":"2025-02-06T21:00:35Z","title":"DiffNMR3: Advancing NMR Resolution Beyond Instrumental Limits","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T22:35:47.762112Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2502.06845"},"observation_digest":"sha256:ee7ac6cb46c83e07463f740a014957e8a63ecc2157b6249d69b7ff011f2efada","observation_id":"0b0fad9c-15ba-44af-8c65-7959d2edbdad","resolution":{"observed_at":"2026-08-08T22:35:47.762112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-08T10:25:17.122248Z","title":"WaveNet: A generative model for raw audio,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.08122","last_updated":"2025-02-12T05:03:49Z","snapshot_observed_at":"2026-08-10T05:48:52.673747Z","submitted_at":"2025-02-12T05:03:49Z","title":"Hookpad Aria: A Copilot for Songwriters","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T10:25:17.122248Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2502.08122"},"observation_digest":"sha256:ca1b3e5dcc47b60c5a236aa68c4b8bbdd8fb760767ef7e0399ae6ad6821d26c7","observation_id":"212fbf2d-35e4-4d71-b131-fae7ed2b1053","resolution":{"observed_at":"2026-08-08T10:25:17.122248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-07T23:32:41.933335Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.08857","last_updated":"2025-04-24T22:48:39Z","snapshot_observed_at":"2026-08-10T22:40:47.530359Z","submitted_at":"2025-02-13T00:15:54Z","title":"ASVspoof 5: Design, Collection and Validation of Resources for Spoofing, Deepfake, and Adversarial Attack Detection Using Crowdsourced Speech","version":4},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T23:32:41.933335Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2502.08857"},"observation_digest":"sha256:62147df57824193dac882020d6f90ba8ffda0cbd8b543801d3bd312eb2cfd98c","observation_id":"daf066ab-d4ab-4c72-af8b-b320338f2213","resolution":{"observed_at":"2026-08-07T23:32:41.933335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-07T23:27:13.303771Z","title":"Wavenet: A generative model for raw audio","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.08869","last_updated":"2025-08-30T06:05:18Z","snapshot_observed_at":"2026-08-10T13:48:29.412103Z","submitted_at":"2025-02-13T00:42:11Z","title":"Harnessing Vision Models for Time Series Analysis: A Survey","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T23:27:13.303771Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2502.08869"},"observation_digest":"sha256:ac529c5bf007b0f36fbee082583fb185f9b55aead9ee536e23730e57b8268ef8","observation_id":"d8eba047-a0fc-4978-adf7-ceb656644f82","resolution":{"observed_at":"2026-08-07T23:27:13.303771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-08T12:04:37.441316Z","title":"Senior, and Koray Kavukcuoglu","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.15756","last_updated":"2025-02-11T15:51:59Z","snapshot_observed_at":"2026-08-09T11:28:09.614250Z","submitted_at":"2025-02-11T15:51:59Z","title":"Causal Covariate Shift Correction using Fisher information penalty","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T12:04:37.441316Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2502.15756"},"observation_digest":"sha256:3879bc723dca57433d021af54f7148b5dafbb58cf9bc7f0137eed0ce7e4c9ad0","observation_id":"e56fda20-2609-4af0-96e1-81938a4439bf","resolution":{"observed_at":"2026-08-08T12:04:37.441316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-07T15:35:36.141592Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.14505","last_updated":"2025-05-20T15:34:36Z","snapshot_observed_at":"2026-08-10T18:25:34.594517Z","submitted_at":"2025-05-20T15:34:36Z","title":"ModRWKV: Transformer Multimodality in Linear Time","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T15:35:36.141592Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2505.14505"},"observation_digest":"sha256:8114a74f817a5fd0910395bf5e68ed9b6f609ddf157dc362121aa7ac044c9a81","observation_id":"b631993f-1a1e-4a52-b85e-ca91850650a3","resolution":{"observed_at":"2026-08-07T15:35:36.141592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-07T15:30:59.227529Z","title":"”Wavenet: A generative model for raw audio.” arXiv preprint arXiv:1609.03499 (2016)","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.15044","last_updated":"2025-05-21T02:53:49Z","snapshot_observed_at":"2026-08-07T15:22:54.391204Z","submitted_at":"2025-05-21T02:53:49Z","title":"Learning-based Airflow Inertial Odometry for MAVs using Thermal Anemometers in a GPS and vision denied environment","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:30:59.227529Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2505.15044"},"observation_digest":"sha256:0cab72c27a079029fd5f409138b212729776eff50c8f8381cf1bb7312fd65af7","observation_id":"9bdfb6a8-ab96-431b-8cdc-596432ac9ea4","resolution":{"observed_at":"2026-08-07T15:30:59.227529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-07T15:24:06.895949Z","title":"WaveNet: A Generative Model for Raw Audio,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.15863","last_updated":"2025-05-21T07:59:18Z","snapshot_observed_at":"2026-08-07T23:22:27.322342Z","submitted_at":"2025-05-21T07:59:18Z","title":"Generative AI for Autonomous Driving: A Review","version":1},"reference_index":171,"source":"pdf_text","source_observed_at":"2026-08-07T15:24:06.895949Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2505.15863"},"observation_digest":"sha256:01073c0d3ac1e0eda50caa3099b943c7a1e7a98d69ba8ab3b066cbd4d4d9d2d7","observation_id":"413e8f29-202c-4454-b323-98c4e88440ab","resolution":{"observed_at":"2026-08-07T15:24:06.895949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-07T15:12:02.369628Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.15973","last_updated":"2025-05-21T19:44:58Z","snapshot_observed_at":"2026-08-09T22:34:17.522518Z","submitted_at":"2025-05-21T19:44:58Z","title":"An Exploratory Study on Multi-modal Generative AI in AR Storytelling","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:02.369628Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2505.15973"},"observation_digest":"sha256:16b1fe407e8635f1a8bf1dd9d45ba09d8d7eb66fce07149e6b61efd56cf913a3","observation_id":"7e5e0f0e-b334-43cc-82f0-28d95c3b394e","resolution":{"observed_at":"2026-08-07T15:12:02.369628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-07T14:54:44.630851Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.17307","last_updated":"2025-05-22T21:57:50Z","snapshot_observed_at":"2026-08-11T23:06:00.818453Z","submitted_at":"2025-05-22T21:57:50Z","title":"Wavelet Probabilistic Recurrent Convolutional Network for Multivariate Time Series Classification","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:54:44.630851Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2505.17307"},"observation_digest":"sha256:2962e03acfd0406a14ae1a031f458da3daaf42009211782e97eaeca842843d3a","observation_id":"5fc16efa-f3b9-456d-89f8-3a0d26f281b4","resolution":{"observed_at":"2026-08-07T14:54:44.630851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-07T14:31:34.143637Z","title":"Wavenet: A generative model for raw audio","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.18621","last_updated":"2025-05-24T10:06:22Z","snapshot_observed_at":"2026-08-09T01:23:31.841929Z","submitted_at":"2025-05-24T10:06:22Z","title":"Beyond Equilibrium: Non-Equilibrium Foundations Should Underpin Generative Processes in Complex Dynamical Systems","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T14:31:34.143637Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2505.18621"},"observation_digest":"sha256:0df77f3cf2974e4f88d4adb111d7695c7424fc79a765bfc8861399a78f3dd4b1","observation_id":"0c8522db-a3e9-4706-9c1e-77d85e6baec3","resolution":{"observed_at":"2026-08-07T14:31:34.143637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-07T13:51:42.248579Z","title":"Wavenet: A generative model for raw audio.arXiv preprint arXiv:1609.03499, 12, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.20739","last_updated":"2025-05-27T05:29:02Z","snapshot_observed_at":"2026-08-09T13:37:55.344812Z","submitted_at":"2025-05-27T05:29:02Z","title":"Detecting Informative Channels: ActionFormer","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:42.248579Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2505.20739"},"observation_digest":"sha256:04d71386138f6bb627d7162d1afce536b7503b43a4c3f5cb2b549b198dc51854","observation_id":"976e46b6-ae17-4def-af59-9111a2c06811","resolution":{"observed_at":"2026-08-07T13:51:42.248579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-07T13:16:59.636755Z","title":"arXiv preprint arXiv:1609.03499 12 (2016)","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.22306","last_updated":"2025-08-21T03:53:43Z","snapshot_observed_at":"2026-08-10T19:53:31.011033Z","submitted_at":"2025-05-28T12:45:39Z","title":"Versatile Cardiovascular Signal Generation with a Unified Diffusion Transformer","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T13:16:59.636755Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2505.22306"},"observation_digest":"sha256:e98d726fc95f88d9697e0534c1aace8ebe168d66c3900668eb70a1d1308fda3d","observation_id":"d5b1d85e-49f2-4d2d-b2f3-f8b40b86493e","resolution":{"observed_at":"2026-08-07T13:16:59.636755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-07T13:09:18.344173Z","title":"Wavenet: A generative model for raw audio, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.22748","last_updated":"2025-05-28T18:05:49Z","snapshot_observed_at":"2026-08-07T12:59:10.821532Z","submitted_at":"2025-05-28T18:05:49Z","title":"Nonparametric Estimation of Conditional Survival Function with Time-Varying Covariates Using DeepONet","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T13:09:18.344173Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2505.22748"},"observation_digest":"sha256:7007cd6140f347fd7f7753d1cd493bbe1675500f854d685cba406c6c3d898720","observation_id":"cee255ca-f30a-4f02-a882-eb659088f941","resolution":{"observed_at":"2026-08-07T13:09:18.344173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-07T13:04:13.162866Z","title":"Wavenet: A generative model for raw audio.arXiv preprint arXiv:1609.03499, 12,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22865","last_updated":"2025-05-28T20:59:15Z","snapshot_observed_at":"2026-08-09T00:06:43.902414Z","submitted_at":"2025-05-28T20:59:15Z","title":"BinauralFlow: A Causal and Streamable Approach for High-Quality Binaural Speech Synthesis with Flow Matching Models","version":1},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-07T13:04:13.162866Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2505.22865"},"observation_digest":"sha256:f259a3d757de003f3e8406ea937a14097fd2e5eff812c3f45e688fe5f5aef3bc","observation_id":"53412ab4-300f-4825-9a76-46584e8aaf77","resolution":{"observed_at":"2026-08-07T13:04:13.162866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-07T13:30:21.394211Z","title":"Wavenet: A generative model for raw audio.arXiv preprint arXiv:1609.03499, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.23821","last_updated":"2025-06-02T03:22:08Z","snapshot_observed_at":"2026-08-07T13:17:42.548082Z","submitted_at":"2025-05-28T02:20:33Z","title":"SpeechVerifier: Robust Acoustic Fingerprint against Tampering Attacks via Watermarking","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:30:21.394211Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2505.23821"},"observation_digest":"sha256:746d0cb3b9709b3fb89d69dac521daddb5a009b5fe8d7cda32b2a28c3918bd8f","observation_id":"29eaab13-5848-44f4-94db-c5597f4da6a3","resolution":{"observed_at":"2026-08-07T13:30:21.394211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":"1609.03499","doi":"10.48550/arxiv.1609.03499","metadata_source":"pith","pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WaveNet: A Generative Model for Raw Audio","venue":"cs.SD","work_id":"05682736-8137-4a5f-a5b6-1127e99b0041","year":2016},"citing_paper":{"arxiv_id":"2505.24437","last_updated":"2026-05-07T16:01:45Z","snapshot_observed_at":"2026-08-11T08:48:59.548957Z","submitted_at":"2025-05-30T10:20:04Z","title":"SwitchCodec: A High-Fidelity Nerual Audio Codec With Sparse Quantization","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-19T13:10:14.839742Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2505.24437"},"observation_digest":"sha256:cbd3f1252558d96141a7c9b50dc8ca2d166d41238e502dcc0a817319d98bd52c","observation_id":"cd989631-8db0-4189-84c2-20dd9ef2871f","resolution":{"observed_at":"2026-05-19T13:12:18.200370Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-07T12:12:57.357887Z","title":"Wavenet: A generative model for raw audio,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.00350","last_updated":"2025-05-31T02:23:38Z","snapshot_observed_at":"2026-08-07T23:23:36.425454Z","submitted_at":"2025-05-31T02:23:38Z","title":"DiffDSR: Dysarthric Speech Reconstruction Using Latent Diffusion Model","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:57.357887Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2506.00350"},"observation_digest":"sha256:05b7e1b58caba68eebcda340f4b8d02dd572d6546a964d762f915059a4a268a0","observation_id":"28c6cab5-1945-48c2-9fc3-f4162815c91f","resolution":{"observed_at":"2026-08-07T12:12:57.357887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-07T12:00:10.368822Z","title":"Wavenet: A generative model for raw audio,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.00832","last_updated":"2025-06-01T04:33:37Z","snapshot_observed_at":"2026-08-12T16:31:47.782831Z","submitted_at":"2025-06-01T04:33:37Z","title":"Counterfactual Activation Editing for Post-hoc Prosody and Mispronunciation Correction in TTS Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:00:10.368822Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2506.00832"},"observation_digest":"sha256:ba181435b9c053e293473dad31e8af2f3d63c7158940bf77d607485ab8542cf8","observation_id":"c8bfe558-57ec-4f69-82b4-b383d3bf917b","resolution":{"observed_at":"2026-08-07T12:00:10.368822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-07T11:41:18.397823Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.01737","last_updated":"2025-06-02T14:47:48Z","snapshot_observed_at":"2026-08-11T02:03:20.489871Z","submitted_at":"2025-06-02T14:47:48Z","title":"The Promise of Spiking Neural Networks for Ubiquitous Computing: A Survey and New Perspectives","version":1},"reference_index":201,"source":"pdf_text","source_observed_at":"2026-08-07T11:41:18.397823Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2506.01737"},"observation_digest":"sha256:a8e9aa5abf2a7a2d54fc21a920b77c2bbb12f82596d3bd07e7c7e4b2e1221e38","observation_id":"3ed84848-c431-4617-8919-5075d1f70ebe","resolution":{"observed_at":"2026-08-07T11:41:18.397823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-07T10:40:49.016291Z","title":", author Dieleman, S","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.04677","last_updated":"2025-07-09T12:32:09Z","snapshot_observed_at":"2026-08-11T13:42:38.295232Z","submitted_at":"2025-06-05T06:54:19Z","title":"The cost of ensembling: is it always worth combining?","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T10:40:49.016291Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2506.04677"},"observation_digest":"sha256:1250beddef0d2b608df7bfa34edb701ceb08df28df5bee6ae13748477f64119d","observation_id":"9d35f1bf-339e-4b51-b565-7b01b396321e","resolution":{"observed_at":"2026-08-07T10:40:49.016291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-07T10:26:15.614683Z","title":"Wavenet: A generative model for raw audio.arXiv preprint arXiv:1609.03499,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05515","last_updated":"2025-08-11T12:57:52Z","snapshot_observed_at":"2026-08-11T01:13:54.305988Z","submitted_at":"2025-06-05T18:56:14Z","title":"Winner-takes-all for Multivariate Probabilistic Time Series Forecasting","version":2},"reference_index":2005,"source":"pdf_text","source_observed_at":"2026-08-07T10:26:15.614683Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2506.05515"},"observation_digest":"sha256:b067c019277d135be87cff3599740939e12a538c17a43db0cf18a1d4dfcf136a","observation_id":"859c22ac-99a8-47f0-a808-49434e87a16f","resolution":{"observed_at":"2026-08-07T10:26:15.614683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/1609.03499/citation-record","integrity":"/paper/1609.03499/integrity","json":"/paper/1609.03499/citation-record.json","paper":"/paper/1609.03499"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vocaine the vocoder and applications is speech synthesis","venue":null,"work_id":"13476cf6-ab84-4f09-8aa9-f713544d7c30","year":2015},"citing_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-12T20:27:40.037176Z"},"links":{"citing_paper":"/paper/1609.03499"},"observation_digest":"sha256:2074a6e3244d60c17a7a69be5db8927549ac7f1115ae46264a6d2ffd9d75c993","observation_id":"ccefc5c3-fb0c-43fb-8496-8450d7ea5fa0","resolution":{"observed_at":"2026-05-12T20:27:40.529223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mixture density networks","venue":null,"work_id":"c96b52e8-1df3-465c-9ee1-c4f716c37066","year":1994},"citing_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-12T20:27:40.037176Z"},"links":{"citing_paper":"/paper/1609.03499"},"observation_digest":"sha256:2fab23d3060e54abf883a0cae9bb3953aa638e1ae1d35e0302eae3e036aba5c3","observation_id":"3c56338c-cffe-408f-a826-5f404fa066a3","resolution":{"observed_at":"2026-05-12T20:27:40.568577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.7062","last_updated":"2016-06-07T04:00:08Z","snapshot_observed_at":"2026-08-12T14:38:04.324875Z","submitted_at":"2014-12-22T17:18:33Z","title":"Semantic Image Segmentation with Deep Convolutional Nets and Fully Connected CRFs","version":4},"cited_work":{"arxiv_id":"1412.7062","doi":null,"metadata_source":"pith","pith_arxiv_id":"1412.7062","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Semantic Image Segmentation with Deep Convolutional Nets and Fully Connected CRFs","venue":"cs.CV","work_id":"d2a48269-aa6d-452f-895c-aafd2ec1f435","year":2014},"citing_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-12T20:27:40.037176Z"},"links":{"cited_paper":"/paper/1412.7062","citing_paper":"/paper/1609.03499"},"observation_digest":"sha256:325d698546c10d1813ee887345b5f2e921405fe18e6ae4a2ddafcb487e85122e","observation_id":"dc8daafa-1b98-4800-9216-6d78cbb8b576","resolution":{"observed_at":"2026-05-12T20:27:40.277427Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The Vowel: I ts Nature and Structure","venue":null,"work_id":"711ccdf7-1189-439b-b389-16643b375e61","year":1942},"citing_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-12T20:27:40.037176Z"},"links":{"citing_paper":"/paper/1609.03499"},"observation_digest":"sha256:a4eb370cb4b187594aa3eee59a1c008475bc45fb0d9032453b2905da7610d6a0","observation_id":"02b36a99-1641-4fd4-b3b6-d62f93e44044","resolution":{"observed_at":"2026-05-12T20:27:40.572368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Remaking speech","venue":null,"work_id":"320464ee-11c6-44a3-9c4e-2960841e1a5e","year":1939},"citing_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-12T20:27:40.037176Z"},"links":{"citing_paper":"/paper/1609.03499"},"observation_digest":"sha256:ccbbb919904ea8e2bca39d0ca7cbfda97bf047851da596b05b4a8614f2b8420b","observation_id":"498c99fe-ced4-4d83-84d2-6fe9c2c96b6e","resolution":{"observed_at":"2026-05-12T20:27:40.577411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An implementation of the ``algorithme \\`a trous'' to compute the wavelet transform","venue":null,"work_id":"0825c571-a66c-4d2f-801f-4b62a009245d","year":1989},"citing_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-12T20:27:40.037176Z"},"links":{"citing_paper":"/paper/1609.03499"},"observation_digest":"sha256:d802e99371bb2a24ae5466c9c953e6063fbedcdfb8653c8ac2ca9ea9c82a1869","observation_id":"2fc67396-4d7e-4b9d-9524-db62705edf79","resolution":{"observed_at":"2026-05-12T20:27:40.581691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"TTS synthesis with bidirectional LSTM based recurrent neural networks","venue":null,"work_id":"26052ebc-5786-4a47-87e9-d9556bb7db3b","year":1964},"citing_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-12T20:27:40.037176Z"},"links":{"citing_paper":"/paper/1609.03499"},"observation_digest":"sha256:794f408ec03782812735e9e068497f8b65d4f6d7d4d46500bf903f4fb7495ddb","observation_id":"643d1882-4a33-4a49-b411-6422ba7d6ae1","resolution":{"observed_at":"2026-05-12T20:27:40.585500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Acoustic Theory of Speech Production","venue":null,"work_id":"98000e22-3c3d-46b3-851d-b1d2b7fbf1d6","year":1970},"citing_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-12T20:27:40.037176Z"},"links":{"citing_paper":"/paper/1609.03499"},"observation_digest":"sha256:ac4a74c67a801ad183b94b2577527c126bc28cad57142398014e94cc16ae2694","observation_id":"9c68de14-19cf-4561-8c33-cd67cf6060f6","resolution":{"observed_at":"2026-05-12T20:27:40.588978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DARPA TIMIT acoustic-phonetic continuous speech corpus CD-ROM","venue":null,"work_id":"3f14b03e-d2aa-4f71-9515-d88d127064e5","year":1993},"citing_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-12T20:27:40.037176Z"},"links":{"citing_paper":"/paper/1609.03499"},"observation_digest":"sha256:b0d22bd685dd5ad16b78f295ffd47c9d189ebb2e1022f9f476c38dd83cd7064c","observation_id":"c4b46274-f20e-40f1-80c0-c7f089479b83","resolution":{"observed_at":"2026-05-12T20:27:40.592620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Recent advances in G oogle real-time HMM -driven unit selection synthesizer","venue":null,"work_id":"d977d6ae-cbbb-4f36-ae5e-1789fbb6f250","year":2016},"citing_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-12T20:27:40.037176Z"},"links":{"citing_paper":"/paper/1609.03499"},"observation_digest":"sha256:9af53840442bcbde4d62df488170c203fd6c4fcd5631e6910a2d18b581bf19b7","observation_id":"d622104a-1b9c-4530-9f7c-864007b61faf","resolution":{"observed_at":"2026-05-12T20:27:40.328737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1512.03385","last_updated":"2015-12-10T19:51:55Z","snapshot_observed_at":"2026-07-06T04:39:28.429064Z","submitted_at":"2015-12-10T19:51:55Z","title":"Deep Residual Learning for Image Recognition","version":1},"cited_work":{"arxiv_id":"1512.03385","doi":"10.48550/arxiv.1512.03385","metadata_source":"pith","pith_arxiv_id":"1512.03385","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deep Residual Learning for Image Recognition","venue":"cs.CV","work_id":"ae9e5671-23e8-4853-82a4-699b5b8dd639","year":2015},"citing_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-12T20:27:40.037176Z"},"links":{"cited_paper":"/paper/1512.03385","citing_paper":"/paper/1609.03499"},"observation_digest":"sha256:7d623eb0731368f8c8d8d679d0870c181cc861ffd579fecde4264b715b2075be","observation_id":"226da7d5-06e6-430c-88a3-21c71b16a057","resolution":{"observed_at":"2026-05-12T20:27:40.287030Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-02T01:38:25.811068+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-02T01:38:25.811068+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"and Schmidhuber, J","venue":null,"work_id":"d0617033-0ff3-4467-a201-e29f2901855b","year":1997},"citing_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-12T20:27:40.037176Z"},"links":{"citing_paper":"/paper/1609.03499"},"observation_digest":"sha256:a682baa0132bdc6fea9d0ef0bf157296a0b57df37274e4650facce6a4e47e3e4","observation_id":"5171066e-9614-4189-88c7-5fbebac38d83","resolution":{"observed_at":"2026-05-12T20:27:40.332469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A real-time algorithm for signal analysis with the help of the wavelet transform","venue":null,"work_id":"4f707aec-58d0-4799-9a0e-17da68d027fe","year":1989},"citing_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-12T20:27:40.037176Z"},"links":{"citing_paper":"/paper/1609.03499"},"observation_digest":"sha256:d946128dbc1307da3c302c689ecad7928994e44ab9020e5e991c9085b765ac8b","observation_id":"201d3590-a625-4122-bf29-61d421c0c3c1","resolution":{"observed_at":"2026-05-12T20:27:40.336603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Speech acoustic modeling from raw multichannel waveforms","venue":null,"work_id":"2d959a78-c2c2-42f6-981c-22d0012eb4a9","year":2015},"citing_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-12T20:27:40.037176Z"},"links":{"citing_paper":"/paper/1609.03499"},"observation_digest":"sha256:23d2291456d2a2efeb43f29fcc8b34972645f923529ca2456a7d983abbeaa9d5","observation_id":"3ccc7158-8ce0-43ac-b79b-2679eb8c3339","resolution":{"observed_at":"2026-05-12T20:27:40.340844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"and Black, Alan W","venue":null,"work_id":"2b423af8-52d5-4513-b5ee-e86f91a8a0ab","year":1996},"citing_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-12T20:27:40.037176Z"},"links":{"citing_paper":"/paper/1609.03499"},"observation_digest":"sha256:40662f48b6c4bc41860027883ed4547f258f842d239a52d67936f0883de3c37d","observation_id":"c352245f-e9d2-4cb9-a3bb-4d686c0b9920","resolution":{"observed_at":"2026-05-12T20:27:40.344793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unbiased estimation of log spectrum","venue":null,"work_id":"45e517e4-3f15-42e2-82bb-4fc8a2624ee4","year":1988},"citing_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-12T20:27:40.037176Z"},"links":{"citing_paper":"/paper/1609.03499"},"observation_digest":"sha256:a9ec1bb1254d97d7040aff67bd82635ee3e02601b86752d062126b9d50812ec0","observation_id":"aaf80b9f-78aa-4e82-a437-55653452b15e","resolution":{"observed_at":"2026-05-12T20:27:40.348377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Line spectrum representation of linear predictor coefficients of speech signals","venue":null,"work_id":"0326bd3a-1bb3-4836-8a60-84b63dcd5fc9","year":1975},"citing_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-12T20:27:40.037176Z"},"links":{"citing_paper":"/paper/1609.03499"},"observation_digest":"sha256:4801766fbecc945ec85b348c6f236f884c19eebc1c9ab5e43327effcf6552f59","observation_id":"50cd9dbe-3209-4c4e-84fa-7a364ff9a93e","resolution":{"observed_at":"2026-05-12T20:27:40.352332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A statistical method for estimation of speech spectral density and formant frequencies","venue":null,"work_id":"9cf80fe4-8714-4af9-be2c-bc8798f4ec42","year":1970},"citing_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-12T20:27:40.037176Z"},"links":{"citing_paper":"/paper/1609.03499"},"observation_digest":"sha256:06ff6a28b08009f5b1351e7e9033c0b831d297539c704f9908d21dbb4a8653e6","observation_id":"8da411f8-8e2e-458b-8174-3f81df1bde1f","resolution":{"observed_at":"2026-05-12T20:27:40.356071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Recommendation G","venue":null,"work_id":"f74aa18a-e603-4c93-8036-54713d74618b","year":1988},"citing_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-12T20:27:40.037176Z"},"links":{"citing_paper":"/paper/1609.03499"},"observation_digest":"sha256:a28b6ce9e994d3fe4c41b26b9c7df3068c6fdd549bd82ff14005fd24eb2eddb8","observation_id":"ea312d8b-ae77-4880-8dd4-af2651bad9f0","resolution":{"observed_at":"2026-05-12T20:27:40.359637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1602.02410","last_updated":"2016-02-11T23:01:48Z","snapshot_observed_at":"2026-08-10T06:35:58.834171Z","submitted_at":"2016-02-07T19:11:17Z","title":"Exploring the Limits of Language Modeling","version":2},"cited_work":{"arxiv_id":"1602.02410","doi":"10.48550/arxiv.1602.02410","metadata_source":"pith","pith_arxiv_id":"1602.02410","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Exploring the Limits of Language Modeling","venue":"cs.CL","work_id":"a9dbcb7a-e48d-42a4-8d60-a8f723751a97","year":2016},"citing_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-12T20:27:40.037176Z"},"links":{"cited_paper":"/paper/1602.02410","citing_paper":"/paper/1609.03499"},"observation_digest":"sha256:1c790319a3bc5f7518a04cc225684f015006a69f88a50a64da8171de1e7656dd","observation_id":"9bc77de7-7299-4d59-bb6c-3dac25075cb0","resolution":{"observed_at":"2026-05-12T20:27:40.300459Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mixture autoregressive hidden M arkov models for speech signals","venue":null,"work_id":"ef7ca635-53fd-46ae-b24b-e0bd3e16688f","year":1985},"citing_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-12T20:27:40.037176Z"},"links":{"citing_paper":"/paper/1609.03499"},"observation_digest":"sha256:f1a3a967446248c45a82593d84eaff684d41efd0c12e057c0eefb82e00c19e59","observation_id":"62c70682-612b-4e25-bbfd-5c735eb3a0e3","resolution":{"observed_at":"2026-05-12T20:27:40.363274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Speech analysis with multi-kernel linear prediction","venue":null,"work_id":"95267f7a-e6ca-4aaa-b070-6d4029b6fed5","year":2010},"citing_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-12T20:27:40.037176Z"},"links":{"citing_paper":"/paper/1609.03499"},"observation_digest":"sha256:bf667206de6256db16facd1eb1b69122c6d1d338e9952c559fcad20a898074b4","observation_id":"4c923379-4a2e-4f7a-ba3e-9e63c9038eff","resolution":{"observed_at":"2026-05-12T20:27:40.367662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Text-to-speech conversion with neural networks: A recurrent TDNN approach","venue":null,"work_id":"7a6f18c1-1c9f-4bd6-9155-abbf453bb953","year":1997},"citing_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-12T20:27:40.037176Z"},"links":{"citing_paper":"/paper/1609.03499"},"observation_digest":"sha256:7607a7b255f128f1e42bc9e0562546ca50043f7aa3db6635e7230a4565b5cd93","observation_id":"d85ff923-4e06-48e9-9c83-6eddd4ac7510","resolution":{"observed_at":"2026-05-12T20:27:40.371821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0910c8b5-9335-49b7-9d83-b3589c0eb987","year":1999},"citing_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-12T20:27:40.037176Z"},"links":{"citing_paper":"/paper/1609.03499"},"observation_digest":"sha256:9f6dca0980c0bff0f4a146fd374b14bce65d2bd32f0e6215930da226c982d61e","observation_id":"21596be3-1044-49eb-a5fb-4c005305be91","resolution":{"observed_at":"2026-05-12T20:27:40.388742Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Aperiodicity extraction and control using mixed mode excitation and group delay manipulation for a high quality speech analysis, modification and synthesis system STRAIGHT","venue":null,"work_id":"63b9e272-4392-461b-bfb5-51e3f0cae1ce","year":2001},"citing_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-12T20:27:40.037176Z"},"links":{"citing_paper":"/paper/1609.03499"},"observation_digest":"sha256:220704cc575eca8b2c65187579afb6e0ad5c5b25d816163cffdcd7f58372436a","observation_id":"d001d266-47cb-40d1-9255-6145475d4f9a","resolution":{"observed_at":"2026-05-12T20:27:40.395522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Input-agreement: a new mechanism for collecting data using human computation games","venue":null,"work_id":"1e3ce630-ef52-469b-a99d-30f943135180","year":2009},"citing_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-12T20:27:40.037176Z"},"links":{"citing_paper":"/paper/1609.03499"},"observation_digest":"sha256:163964228adfe7785027f8e7dec0a2e83dc005bdfb68952a07a2a630bbf6b8cb","observation_id":"0b58d73e-ac8a-4e94-b8ca-3d56b6d8f6d5","resolution":{"observed_at":"2026-05-12T20:27:40.400631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"46670de9-9103-4247-afc9-a56a55cf5d64","year":2010},"citing_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-12T20:27:40.037176Z"},"links":{"citing_paper":"/paper/1609.03499"},"observation_digest":"sha256:b5849ad5386970141d394baf91332f588fe8ca3a5eb451f8b138aff2628cdfe4","observation_id":"ee4b5b70-cc5c-41a8-80b9-b31e69d981b9","resolution":{"observed_at":"2026-05-12T20:27:40.405003Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"WORLD : A vocoder-based high-quality speech synthesis system for real-time applications","venue":null,"work_id":"c6f0fa73-5f42-4cec-b5b4-9e8c28140204","year":2016},"citing_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-12T20:27:40.037176Z"},"links":{"citing_paper":"/paper/1609.03499"},"observation_digest":"sha256:0bc69ac39cda3b490465ed6c856d88e1b7a5a09296cf78522b2b1a9ff4087919","observation_id":"96c927c7-7f1f-40c7-9829-f8016bafe341","resolution":{"observed_at":"2026-05-12T20:27:40.412000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pitch synchronous waveform processing techniques for text-to-speech synthesis using diphones","venue":null,"work_id":"75609292-e46d-4e0a-89de-b37b80537bd3","year":1990},"citing_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-12T20:27:40.037176Z"},"links":{"citing_paper":"/paper/1609.03499"},"observation_digest":"sha256:1bb4b77097587e73e49d54bcf1bd79c2b38c1e0eea6964b955bd38c90cf48ca5","observation_id":"7d8b97b0-d481-45c2-84dc-75948cd482c4","resolution":{"observed_at":"2026-05-12T20:27:40.417385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1409.8558","last_updated":"2014-09-30T14:20:29Z","snapshot_observed_at":"2026-08-02T16:33:38.559826Z","submitted_at":"2014-09-30T14:20:29Z","title":"A Deep Learning Approach to Data-driven Parameterizations for Statistical Parametric Speech Synthesis","version":1},"cited_work":{"arxiv_id":"1409.8558","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1409.8558","snapshot_observed_at":"2026-07-04T19:05:24.719892Z","title":"and Black, Alan W","venue":null,"work_id":"584da580-e91b-4c18-8f8d-63734ece8962","year":2014},"citing_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-12T20:27:40.037176Z"},"links":{"cited_paper":"/paper/1409.8558","citing_paper":"/paper/1609.03499"},"observation_digest":"sha256:33f82e38ca087e4cdbc60b417311da917f7194e4c94686f1449ec6ff4b02e424","observation_id":"91e7108d-2fad-4adc-bfa1-baa792248f1e","resolution":{"observed_at":"2026-07-04T19:05:24.719892Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rectified linear units improve restricted B oltzmann machines","venue":null,"work_id":"e6b2e2db-923d-4c9e-a16b-3a3a853641b6","year":2010},"citing_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-12T20:27:40.037176Z"},"links":{"citing_paper":"/paper/1609.03499"},"observation_digest":"sha256:9609fe09a11263d8d14ba1838249359a71c025bd1a91f617447ec9ffded49237","observation_id":"83aa7022-3b3e-4c89-b04f-e7a1bdb4c19b","resolution":{"observed_at":"2026-05-12T20:27:40.423725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Integration of spectral feature extraction and modeling for HMM -based speech synthesis","venue":null,"work_id":"b343003d-e01f-41e6-8adf-bd4bc165edc0","year":2014},"citing_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-12T20:27:40.037176Z"},"links":{"citing_paper":"/paper/1609.03499"},"observation_digest":"sha256:9b4175f53660e745031f1a4b108b057f8289e8ec85bfe52093f49702bc3c27d3","observation_id":"bca85b06-c248-4720-9ef9-4d141186dbc6","resolution":{"observed_at":"2026-05-12T20:27:40.427963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Estimating phoneme class conditional probabilities from raw speech signal using convolutional neural networks","venue":null,"work_id":"473d9019-6be9-4beb-8b59-51ab93792c8e","year":2013},"citing_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-12T20:27:40.037176Z"},"links":{"citing_paper":"/paper/1609.03499"},"observation_digest":"sha256:ec7beedb7264f64fb8b0080a1b4c1cfd444d1c9ec5693a1d31d5fb654118e065","observation_id":"87ed2107-5a57-4980-9a1e-712c2e35e4f2","resolution":{"observed_at":"2026-05-12T20:27:40.432935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nonlinear filter design: methodologies and challenges","venue":null,"work_id":"53bbe75e-a234-49a7-b766-376eeed93aad","year":2001},"citing_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-12T20:27:40.037176Z"},"links":{"citing_paper":"/paper/1609.03499"},"observation_digest":"sha256:2756ffc154e6d74df400056fc694a2976e107a1f6d535757550e7fb23d94ecbb","observation_id":"e3fcc7c3-4ecf-42cf-9c30-e8e4b92475e6","resolution":{"observed_at":"2026-05-12T20:27:40.438918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Linear predictive hidden M arkov models and the speech signal","venue":null,"work_id":"33827695-921d-4ed3-bebb-be4eabb155d5","year":1982},"citing_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-12T20:27:40.037176Z"},"links":{"citing_paper":"/paper/1609.03499"},"observation_digest":"sha256:0752d95d54a462723f3ff21e9b87d2d531621d67a84e4aecf51ed4fdad30ef4e","observation_id":"5efe7188-309d-4996-9edc-2d8f852c13b8","resolution":{"observed_at":"2026-05-12T20:27:40.443179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fundamentals of Speech Recognition","venue":null,"work_id":"ff3de869-622b-4696-84fb-5a12b5def2c0","year":1993},"citing_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-12T20:27:40.037176Z"},"links":{"citing_paper":"/paper/1609.03499"},"observation_digest":"sha256:a856b7229011dc71cc2b1445ec135d51fb9b511b308a8295a0949a9e794b3667","observation_id":"e3873c6b-47ba-4fc1-9ee2-9e82b8697182","resolution":{"observed_at":"2026-05-12T20:27:40.447656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ATR -talk speech synthesis system","venue":null,"work_id":"c23b168d-244a-438a-8636-19af970b49ad","year":1992},"citing_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-12T20:27:40.037176Z"},"links":{"citing_paper":"/paper/1609.03499"},"observation_digest":"sha256:fc7d99ea2675d5a96557ab5f09695adbe721726ebda03a866b19d3e7f4093515","observation_id":"8c7697ef-9ac9-4d3c-8d1f-152a64c1a7b2","resolution":{"observed_at":"2026-05-12T20:27:40.451995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning the speech front-end with raw waveform CLDNN s","venue":null,"work_id":"639d779b-1ef8-40cd-913b-751b898d2cfc","year":2015},"citing_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-12T20:27:40.037176Z"},"links":{"citing_paper":"/paper/1609.03499"},"observation_digest":"sha256:476d77b829c93a2956d9afe7e6d052a57e7d4afb3568e052dffd95f67c8cb752","observation_id":"95f61bbd-5778-42f8-83e0-2ec8e5ec666e","resolution":{"observed_at":"2026-05-12T20:27:40.458834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A deep auto-encoder based low-dimensional feature extraction from FFT spectral envelopes for statistical parametric speech synthesis","venue":null,"work_id":"6ae5e815-326f-4f20-a2b0-c2da4e1f8d8f","year":2016},"citing_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-12T20:27:40.037176Z"},"links":{"citing_paper":"/paper/1609.03499"},"observation_digest":"sha256:0ded5e88fdcee686bdf92a856f54215f9e33bee0058818baad06e9c0df6d08f4","observation_id":"a9b5c17e-e536-4839-bf6c-04c3c29fdeed","resolution":{"observed_at":"2026-05-12T20:27:40.463864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Postfilters to modify the modulation spectrum for statistical parametric speech synthesis","venue":null,"work_id":"33eec259-f2f1-4789-bade-a8dd1021b5c4","year":2016},"citing_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-12T20:27:40.037176Z"},"links":{"citing_paper":"/paper/1609.03499"},"observation_digest":"sha256:37f597a2c5ae8946cdcdf4ba865adc6acd7de38d69e39cb27374b4e3130ede48","observation_id":"486b95c6-502f-42f8-aa93-2a8625e9b21e","resolution":{"observed_at":"2026-05-12T20:27:40.469229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generative image modeling using spatial LSTM s","venue":null,"work_id":"ac84220d-ca93-42cd-b880-6e282a9ce5b2","year":1927},"citing_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-12T20:27:40.037176Z"},"links":{"citing_paper":"/paper/1609.03499"},"observation_digest":"sha256:3186c692cfacc12bef30c12cfa67663d5d6c877adf72afe2c62256b691040d42","observation_id":"fa7c4ea9-594c-4f17-bc98-3723de51df3a","resolution":{"observed_at":"2026-05-12T20:27:40.475340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A speech parameter generation algorithm considering global variance for HMM -based speech synthesis","venue":null,"work_id":"4fae0c08-e226-41cc-8a9a-73bf2fa7bcbc","year":2007},"citing_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-12T20:27:40.037176Z"},"links":{"citing_paper":"/paper/1609.03499"},"observation_digest":"sha256:5e2ce0fba0fdef26d91ea04e1b1ec8b88fcf56bc11edb989d07b6b950266ccef","observation_id":"add153d4-5afd-4794-aa86-9458040d9d89","resolution":{"observed_at":"2026-05-12T20:27:40.480660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Statistical approach to vocal tract transfer function estimation based on factor analyzed trajectory hmm","venue":null,"work_id":"2da179f8-fd61-4b61-835a-00227cf0a6bf","year":2008},"citing_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-12T20:27:40.037176Z"},"links":{"citing_paper":"/paper/1609.03499"},"observation_digest":"sha256:710645d346abd71aaffb5922bc5554312ee54f27cf1e8be306cc40583dd3356a","observation_id":"b4005e76-e90a-42ea-8582-a70ea1a12990","resolution":{"observed_at":"2026-05-12T20:27:40.485186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Speech synthesis as a statistical machine learning problem","venue":null,"work_id":"af241afe-4115-4590-9f06-0e87d84c0fc2","year":2011},"citing_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-12T20:27:40.037176Z"},"links":{"citing_paper":"/paper/1609.03499"},"observation_digest":"sha256:d408116202c037d301db2b889512afa980f07bdda60332cb1a51acf33d192fd4","observation_id":"60332101-a50c-44f0-b7c5-06452af4cba8","resolution":{"observed_at":"2026-05-12T20:27:40.489858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Directly modeling speech waveforms by neural networks for statistical parametric speech synthesis","venue":null,"work_id":"6105b5c3-9824-484e-b311-54a3637a326d","year":2015},"citing_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-12T20:27:40.037176Z"},"links":{"citing_paper":"/paper/1609.03499"},"observation_digest":"sha256:122c65b71275cccebaec7a2833cd79df3b0d090fa4e8da14d2e5e92cbba7e4ca","observation_id":"63efedd9-f713-4b2e-8041-bfe5601b674b","resolution":{"observed_at":"2026-05-12T20:27:40.498494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Directly modeling voiced and unvoiced components in speech waveforms by neural networks","venue":null,"work_id":"25886bb3-68e7-4557-8b0a-84a146e0c913","year":2016},"citing_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-12T20:27:40.037176Z"},"links":{"citing_paper":"/paper/1609.03499"},"observation_digest":"sha256:fd057c86e2ff41fe682b376dc7c7d8d06e2c6a5d48794e95b0de7760a2f31578","observation_id":"da9bd224-14f4-4c02-8f1d-75a675aab7d8","resolution":{"observed_at":"2026-05-12T20:27:40.504745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Speech synthesis using artificial neural networks trained on cepstral coefficients","venue":null,"work_id":"0713285b-d1c0-422a-bdbf-57f98c4efe18","year":1993},"citing_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-12T20:27:40.037176Z"},"links":{"citing_paper":"/paper/1609.03499"},"observation_digest":"sha256:1d6822dd6cf88f5408e1a19764624b1634598008a2335f6ab0627ede982cadc5","observation_id":"db26ac27-4204-4632-a6e5-4cd825954355","resolution":{"observed_at":"2026-05-12T20:27:40.509602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"u ske, Zolt \\'a n, Golik, Pavel, Schl \\","venue":null,"work_id":"e1179bd5-8a9c-4f60-b81f-8f7cce06c8fa","year":2014},"citing_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-12T20:27:40.037176Z"},"links":{"citing_paper":"/paper/1609.03499"},"observation_digest":"sha256:9ccba4c38d0b68b7f9d19152429802db16bc4a11ff1833ac9e072a2b04b1adf5","observation_id":"93b1e614-7c5c-416a-bad3-f92f2f494149","resolution":{"observed_at":"2026-05-12T20:27:40.514165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Modelling acoustic feature dependencies with artificial neural networks: T rajectory- RNADE","venue":null,"work_id":"b9b1342d-e2b0-4978-9512-d70798d6d258","year":2015},"citing_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-12T20:27:40.037176Z"},"links":{"citing_paper":"/paper/1609.03499"},"observation_digest":"sha256:a16eb493aa0684aa4c72efc17d6d5b5ea0f71ce8254c9b5b5e9f42ed47105f91","observation_id":"f8a8b8af-23c0-4b67-b5e5-d5b01a053c4f","resolution":{"observed_at":"2026-05-12T20:27:40.518783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1601.06759","last_updated":"2016-08-19T14:10:16Z","snapshot_observed_at":"2026-08-01T14:54:58.495346Z","submitted_at":"2016-01-25T20:34:24Z","title":"Pixel Recurrent Neural Networks","version":3},"cited_work":{"arxiv_id":"1601.06759","doi":"10.48550/arxiv.1601.06759","metadata_source":"pith","pith_arxiv_id":"1601.06759","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixel Recurrent Neural Networks","venue":"cs.CV","work_id":"69d61439-cf3d-4fbe-a48c-fbfddf5ca9ed","year":2016},"citing_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-12T20:27:40.037176Z"},"links":{"cited_paper":"/paper/1601.06759","citing_paper":"/paper/1609.03499"},"observation_digest":"sha256:da29202e6a68eb882085988876a82b4b274350f8a5096ceba8b4facabbcf8615","observation_id":"0cd7fa5f-9733-41b2-a61b-b96e0d9953ce","resolution":{"observed_at":"2026-05-12T20:27:40.306428Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.05328","last_updated":"2016-06-18T15:44:24Z","snapshot_observed_at":"2026-07-06T05:00:17.202185Z","submitted_at":"2016-06-16T19:40:56Z","title":"Conditional Image Generation with PixelCNN Decoders","version":2},"cited_work":{"arxiv_id":"1606.05328","doi":null,"metadata_source":"pith","pith_arxiv_id":"1606.05328","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Conditional Image Generation with PixelCNN Decoders","venue":"cs.CV","work_id":"49af5d38-b813-4a32-a1b4-25d6a185270e","year":2016},"citing_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-12T20:27:40.037176Z"},"links":{"cited_paper":"/paper/1606.05328","citing_paper":"/paper/1609.03499"},"observation_digest":"sha256:00cc26a88ce51343fbb49d175aeded8b58a6e098f178a27efa41f1808e4beca7","observation_id":"3f83e73b-f2fd-4783-a030-2fb4d12f8f8b","resolution":{"observed_at":"2026-05-12T20:27:40.313149Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Minimum generation error training with direct log spectral distortion on LSP s for HMM -based speech synthesis","venue":null,"work_id":"12256b8c-8b0a-4b9a-888c-cf0d6198b615","year":2008},"citing_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-12T20:27:40.037176Z"},"links":{"citing_paper":"/paper/1609.03499"},"observation_digest":"sha256:84011157eba5d1c72425fd2076eb45a9ed0d52832a50793e4762dc5e75967823","observation_id":"1d714af5-cea9-4927-ae49-26bea11f1cbb","resolution":{"observed_at":"2026-05-12T20:27:40.523722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"English multi-speaker corpus for CSTR voice cloning toolkit","venue":null,"work_id":"63589106-6504-4d3e-a51e-83e869077f1b","year":2012},"citing_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-12T20:27:40.037176Z"},"links":{"citing_paper":"/paper/1609.03499"},"observation_digest":"sha256:06b36d5363dbacbe9670b8e019b6aecd8e5d549451c8f897ef018f3e844a35c6","observation_id":"8147b9a6-db1a-4ae6-bc88-8ddcaad6d7c5","resolution":{"observed_at":"2026-05-12T20:27:40.558962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Simultaneous modeling of phonetic and prosodic parameters, and characteristic conversion for HMM -based text-to-speech systems","venue":null,"work_id":"0242b462-d1ad-4365-a7b4-a08280c24e6e","year":2002},"citing_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-12T20:27:40.037176Z"},"links":{"citing_paper":"/paper/1609.03499"},"observation_digest":"sha256:ccedd99e7e92e643bf5ac7e64fe9ad04cc9731b8116c00efc7bde3b36968ae1e","observation_id":"22565bf5-63d0-4868-a3b4-65aaeca6a1c9","resolution":{"observed_at":"2026-05-12T20:27:40.533877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.07122","last_updated":"2016-04-30T18:19:37Z","snapshot_observed_at":"2026-07-06T04:37:24.552839Z","submitted_at":"2015-11-23T07:32:14Z","title":"Multi-Scale Context Aggregation by Dilated Convolutions","version":3},"cited_work":{"arxiv_id":"1511.07122","doi":null,"metadata_source":"pith","pith_arxiv_id":"1511.07122","snapshot_observed_at":"2026-07-10T20:37:34.453940Z","title":"Multi-Scale Context Aggregation by Dilated Convolutions","venue":"cs.CV","work_id":"4784b5b3-7851-455f-ba76-9446e31e6b96","year":2015},"citing_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-12T20:27:40.037176Z"},"links":{"cited_paper":"/paper/1511.07122","citing_paper":"/paper/1609.03499"},"observation_digest":"sha256:97503debbc1901d98a9c2a7f1d54a4ca948291572e9fba7244759e101b63bb3e","observation_id":"3507755f-6d5e-4013-8277-6cd722f7b82a","resolution":{"observed_at":"2026-05-12T20:27:40.293972Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An example of context-dependent label format for HMM -based speech synthesis in E nglish","venue":null,"work_id":"04e643c2-e085-4eb8-8ac7-51d33dd19e32","year":2006},"citing_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-12T20:27:40.037176Z"},"links":{"citing_paper":"/paper/1609.03499"},"observation_digest":"sha256:e58edaeb2f38cb24bde42ca3fabc431ab77d52942c34ec01fa573534ff4027f7","observation_id":"cb5651c2-f9cd-45b5-b062-092173ec0747","resolution":{"observed_at":"2026-05-12T20:27:40.540543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reformulating the HMM as a trajectory model by imposing explicit relationships between static and dynamic features","venue":null,"work_id":"796410db-31ed-4110-9d81-1d3ee4f2d8f9","year":2007},"citing_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-12T20:27:40.037176Z"},"links":{"citing_paper":"/paper/1609.03499"},"observation_digest":"sha256:e110fd2a2e26e720b97387c43b81812d5523ca6e2b9a96177d36a8433e1a677a","observation_id":"0aa55e31-6921-45c8-b5ec-96a39fe057e1","resolution":{"observed_at":"2026-05-12T20:27:40.546294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Statistical parametric speech synthesis","venue":null,"work_id":"913e7974-2bcd-4ed2-9348-0ab31e8e43a5","year":2009},"citing_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-12T20:27:40.037176Z"},"links":{"citing_paper":"/paper/1609.03499"},"observation_digest":"sha256:2962dc16a19c91c2d92185e020a7706f7d50b7d9da9a5ac4240474a045116d37","observation_id":"caf8afbf-f03e-4021-8c25-d59b29a647df","resolution":{"observed_at":"2026-05-12T20:27:40.551394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Statistical parametric speech synthesis using deep neural networks","venue":null,"work_id":"7c4e9f73-832e-4974-89c6-b0ce0a71e295","year":2013},"citing_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-12T20:27:40.037176Z"},"links":{"citing_paper":"/paper/1609.03499"},"observation_digest":"sha256:ee54603b50388907892d66014039e16b6e2de0e9d1830c80547444610a483ed9","observation_id":"67f747b9-d820-43c8-8a27-bc9d887b755a","resolution":{"observed_at":"2026-05-12T20:27:40.555537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06061","last_updated":"2016-06-22T15:11:30Z","snapshot_observed_at":"2026-08-10T17:46:35.627247Z","submitted_at":"2016-06-20T10:54:51Z","title":"Fast, Compact, and High Quality LSTM-RNN Based Statistical Parametric Speech Synthesizers for Mobile Devices","version":2},"cited_work":{"arxiv_id":"1606.06061","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1606.06061","snapshot_observed_at":"2026-07-04T21:05:47.149369Z","title":"Fast, compact, and high quality LSTM - RNN based statistical parametric speech synthesizers for mobile devices","venue":null,"work_id":"740cbfcb-ab5b-4025-bcd8-f645f8e84e60","year":2016},"citing_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-12T20:27:40.037176Z"},"links":{"cited_paper":"/paper/1606.06061","citing_paper":"/paper/1609.03499"},"observation_digest":"sha256:63669c8240351899fc743eec910eb5ab359f31dde9c2b96522a79b7810f97199","observation_id":"bb484fef-6e4a-44c2-b171-017b7642ac7a","resolution":{"observed_at":"2026-07-04T21:05:47.149369Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":2,"verified_exact":8,"verified_fuzzy":50},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 100 inbound Pith citation observations for arXiv:1609.03499."}