{"as_of":"2026-08-17T09:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9cee890fb1c0d90aedd96cc07d78e43da842ed2654fb9c78318e5f1879f6871f","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T21:37:53.355467Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T14:33:15.000548Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-16T20:38:24.803202Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"cited_work":{"arxiv_id":"2505.09325","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.09325","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-The-Wild Singing V oice Dataset","venue":null,"work_id":"dc6c7675-b671-4330-8691-290c2aa3002b","year":2025},"citing_paper":{"arxiv_id":"2512.20211","last_updated":"2026-06-29T06:29:50Z","snapshot_observed_at":"2026-08-11T16:21:41.773574Z","submitted_at":"2025-12-23T10:04:48Z","title":"Aliasing-Free Neural Audio Synthesis","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-16T20:34:50.539351Z"},"links":{"cited_paper":"/paper/2505.09325","citing_paper":"/paper/2512.20211"},"observation_digest":"sha256:3142466b279f6a3d12f195f6621c2aabe954066b4ddf92059d98613daa909fc1","observation_id":"5f4f4543-f945-44f5-b050-0cc2af105bc4","resolution":{"observed_at":"2026-05-16T20:38:24.804768Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09325","snapshot_observed_at":"2026-08-03T14:33:15.000548Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-The-Wild Singing V oice Dataset,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.20211","last_updated":"2026-06-29T06:29:50Z","snapshot_observed_at":"2026-08-11T16:21:41.773574Z","submitted_at":"2025-12-23T10:04:48Z","title":"Aliasing-Free Neural Audio Synthesis","version":3},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-03T14:33:15.000548Z"},"links":{"cited_paper":"/paper/2505.09325","citing_paper":"/paper/2512.20211"},"observation_digest":"sha256:ab07034e680746a842124f8234bcf89b219e724f1178f7b1704bfd6b6e81772b","observation_id":"68f2c4be-45ea-4fe0-a024-2d89263c7db6","resolution":{"observed_at":"2026-08-03T14:33:15.000548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.09325/citation-record","integrity":"/paper/2505.09325/integrity","json":"/paper/2505.09325/citation-record.json","paper":"/paper/2505.09325"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T21:37:53.135212Z","title":"Gpt-4 technical repor t","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.135212Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:5f17fdd90371c8a0b1e501d3374260d018c6b9e037f359b9cd09ab41fab7455a","observation_id":"147436ae-b14f-4f11-84b9-5a50170741c0","resolution":{"observed_at":"2026-08-15T21:37:53.135212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:37:54.002195Z","title":"wav2vec 2.0: A Framework for Self-Supervised Learning of Speech Representations","venue":null,"work_id":"2d4d9e2a-23e9-4988-b74f-cd07b87b8792","year":2020},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.138967Z"},"links":{"citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:d3ccf7b7a4e52e1791b707b1955aa6c0814c6fb029eaaef53f6b76dea86b3e1e","observation_id":"a256d01e-5ab1-4897-aa7b-7cc3c02716c0","resolution":{"observed_at":"2026-08-15T21:37:54.005682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:37:53.992679Z","title":"Automatic identification of emotional cues in Chinese opera singing","venue":null,"work_id":"63d724b9-e6df-45b7-9fa0-533c5d692421","year":2014},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.142283Z"},"links":{"citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:41809f8c65cb17a747c8a9d64652472a9be6547b24e4b0f843eeb923bb60c326","observation_id":"f19e5a2a-3d18-49d2-80dc-7e2473946053","resolution":{"observed_at":"2026-08-15T21:37:53.996091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:37:53.983645Z","title":"WavLM: Large-Scale Self-Supervised Pre-Training for Full Stack Speech Processing","venue":null,"work_id":"3739c152-f1be-4361-97ec-526162114577","year":2022},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.145694Z"},"links":{"citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:0e58b692374a47f7234e58adf2d5e048a6c28d5ba6cc0613b4b132c169d31f32","observation_id":"02a3d9cc-fb99-4b33-9ac5-1b02749d40b9","resolution":{"observed_at":"2026-08-15T21:37:53.986816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05325","last_updated":"2024-06-08T02:42:52Z","snapshot_observed_at":"2026-08-16T13:44:59.151834Z","submitted_at":"2024-06-08T02:42:52Z","title":"LDM-SVC: Latent Diffusion Model Based Zero-Shot Any-to-Any Singing Voice Conversion with Singer Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05325","snapshot_observed_at":"2026-08-15T21:37:53.149056Z","title":"LDM-SVC: Latent Diffusion Model Based Zero-Shot Any-to-Any Singing Voice Conversion with Singer Guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.149056Z"},"links":{"cited_paper":"/paper/2406.05325","citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:b98b8e390d64f4642860f6b275343169c3625cdb69b521615dae3b0a85720867","observation_id":"8516c171-31ed-45da-bf7a-b2bf29967c36","resolution":{"observed_at":"2026-08-15T21:37:53.149056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:37:53.974150Z","title":"Children’s song dataset for singing voice research","venue":null,"work_id":"93db3984-8304-4c10-9103-aecf768ed8e4","year":2020},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.152357Z"},"links":{"citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:487f2caa6f07b12fe0328d7369910686058b15062cef69b5145fb35149c3b7e4","observation_id":"0afacdf0-de0f-48c5-a2e8-8a14ce1c0f2f","resolution":{"observed_at":"2026-08-15T21:37:53.977775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:37:53.965507Z","title":"w2v-BERT: Combining Contrastive Learning and Masked Language Modeling for Self-Supervised Speech Pre-Training","venue":null,"work_id":"ded76dc4-730a-4c69-ac28-1c7a1d81c6b5","year":2021},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.155675Z"},"links":{"citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:55c95cb626bcdc47a909f880ea44f6621be3dcede0127239e45542f2ac60cb5f","observation_id":"130ed8ef-aecd-4580-800a-bcdda3047aeb","resolution":{"observed_at":"2026-08-15T21:37:53.968575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:37:53.955411Z","title":"Generalization Ability of MOS Prediction Networks","venue":null,"work_id":"9740f044-9d13-4fa6-8c38-b8119f91ca55","year":2022},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.158646Z"},"links":{"citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:217507d63717edf52215035975cccb9ca03c180c2ac1e4c816cb2ea57d413274","observation_id":"4bf766b0-664b-422a-839c-eef7f712d2d8","resolution":{"observed_at":"2026-08-15T21:37:53.958896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:37:53.946358Z","title":"Multiple F0 Estimation in Vocal Ensembles using Convolutional Neura l networks","venue":null,"work_id":"0b0db82a-40a9-40ba-8ab8-1fe57f39d96b","year":2020},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.161668Z"},"links":{"citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:174dcb414a89270645d2190075cf69785386263f0cddba901c13cfd9ad637b0d","observation_id":"b4e9e751-862c-4143-9ae8-bedd33567f2c","resolution":{"observed_at":"2026-08-15T21:37:53.949613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:37:53.937166Z","title":"Dannenberg","venue":null,"work_id":"023df10e-6bdf-4d1b-96f8-bd9e262494c7","year":2023},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.164739Z"},"links":{"citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:1112dacb4d0ff8573caf45107ebd1c3a80c1de9c6ae6ec8e1d611f3f129055a3","observation_id":"ca0f3162-212b-45c9-8f89-802a9c80efc7","resolution":{"observed_at":"2026-08-15T21:37:53.940314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:37:53.927798Z","title":"The NUS sung and spoken lyrics corpus: A quantitative comparison of singing and speech","venue":null,"work_id":"07f5d8c6-2e0c-4499-a2fa-00b43373e328","year":2013},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.167602Z"},"links":{"citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:b37f13e494f332459435b1ec7fb79b44346b27816d009d3b71d854a8b48d5c16","observation_id":"d6e6a6b5-ed75-4d82-8564-3ce295a02fa7","resolution":{"observed_at":"2026-08-15T21:37:53.931111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:37:53.918830Z","title":"Fabbro, S","venue":null,"work_id":"f99b3e4b-a634-4c7b-95af-71ef83bb0c7d","year":2023},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.170720Z"},"links":{"citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:aa556f343a9ee390a4584cfa0167cfd8f66b85e17c29a24e3319ba569ce58240","observation_id":"4030c130-eed3-4c10-8529-993256db753a","resolution":{"observed_at":"2026-08-15T21:37:53.921948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.17161","last_updated":"2024-04-26T05:11:03Z","snapshot_observed_at":"2026-08-16T13:57:40.410596Z","submitted_at":"2024-04-26T05:11:03Z","title":"An Investigation of Time-Frequency Representation Discriminators for High-Fidelity Vocoder","version":1},"cited_work":{"arxiv_id":"2404.17161","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.17161","snapshot_observed_at":"2026-08-15T21:37:53.442117Z","title":"An Investigation of Time-Frequency Representation Discriminators for High-Fidelity Vocoder","venue":"cs.SD","work_id":"24b90a9f-4ef4-4d31-a661-a47f0139fd83","year":2024},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.173595Z"},"links":{"cited_paper":"/paper/2404.17161","citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:c66e6e9fa6661687dd060e31b85e2c9e383c4ee0a2e5809fb37e347571e561a0","observation_id":"470c47f2-32a6-425a-8bee-f31a893a0c5f","resolution":{"observed_at":"2026-08-15T21:37:53.445899Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:37:53.909437Z","title":"Multi-scale sub-band constant-q transform discriminator for high-fidelity vocoder","venue":null,"work_id":"84473d58-6185-436f-9d27-352411dfa6d3","year":2024},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.176610Z"},"links":{"citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:03388605571a4159a41a43f30c11f5a58147d98301db3ecad08a58745a939dea","observation_id":"3d0c3df2-c49e-4aaa-b3f9-6840ff0123ec","resolution":{"observed_at":"2026-08-15T21:37:53.912708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:37:53.900422Z","title":"SingAug: Data Augmentation for Singing Voice Synthesis with Cycle-consistent Training Strategy","venue":null,"work_id":"b4121e77-98c1-4930-9ffa-9933ea9a348a","year":2022},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.179573Z"},"links":{"citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:3718000873fb1913b5e6d1b70934867a6cb740fee315f265eb5f4863f3f3469f","observation_id":"f3d99cad-51cd-4346-a33c-c3540be7890d","resolution":{"observed_at":"2026-08-15T21:37:53.903385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:37:53.890576Z","title":"Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation","venue":null,"work_id":"3708cecf-d2f0-4a07-b7cb-0166d4fd6749","year":2024},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.182546Z"},"links":{"citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:36b65c0dd4f9a0dc527816f9a38db1c21a5e11edfacf51d071ed9a320f8d705e","observation_id":"95f77202-efab-4545-b57f-1230fbc9fe7e","resolution":{"observed_at":"2026-08-15T21:37:53.894335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:37:53.880982Z","title":"On the Improvement of Singing Voice Separation for Monaural Recordings Using the MIR-1K Dataset","venue":null,"work_id":"644a9d36-713b-4d55-ba6f-63a9c5f41128","year":2010},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.185605Z"},"links":{"citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:335f05e7d69e13a670f8686211e962244a51e778085502fc134c65080ba16868","observation_id":"b4c0058c-7c2c-4c1b-bd69-e6f2bb48ca2c","resolution":{"observed_at":"2026-08-15T21:37:53.884313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:37:53.871695Z","title":"HuBERT: Self-Supervised Speech Representation Learning by Masked Prediction of Hidden Units","venue":null,"work_id":"c82732eb-b0a7-46d6-9541-35e40bc16736","year":2021},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.188785Z"},"links":{"citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:0d68a085db3ecee65ba77e5c5bce70d5158db1983b8a250dc358b71b74aaa8e6","observation_id":"3e48a5bf-71b2-4aef-94e4-05d2ea382e75","resolution":{"observed_at":"2026-08-15T21:37:53.874840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:37:53.862745Z","title":"Multi-Singer: Fast Multi-Singer Singing Voice Vocoder With A Large-Scale Corpus","venue":null,"work_id":"78b3711c-79b5-4200-af48-56f7bf1cbbce","year":2021},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.191757Z"},"links":{"citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:af85e4c9da181f754048eb988fe9767d079db464bafd554038471cdd73b8186c","observation_id":"c90ea4e0-b970-4136-9438-511e6890ad7e","resolution":{"observed_at":"2026-08-15T21:37:53.865949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14422","last_updated":"2023-07-06T08:17:31Z","snapshot_observed_at":"2026-08-16T15:21:14.343808Z","submitted_at":"2023-06-26T05:04:58Z","title":"The Singing Voice Conversion Challenge 2023","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14422","snapshot_observed_at":"2026-08-15T21:37:53.194822Z","title":"The Singing Voice Conversion Challenge 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.194822Z"},"links":{"cited_paper":"/paper/2306.14422","citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:900fa1ff388548dd4bdecbe9187729f16407eb65e68c686fc2ab4b12bb9bbf22","observation_id":"56bde2dc-31e2-4fa5-ad7a-209b316d652a","resolution":{"observed_at":"2026-08-15T21:37:53.194822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:37:53.853594Z","title":"Jadoul, Bill Thompson, and Bart de Boer","venue":null,"work_id":"8e59cbc2-c52e-48d7-87e2-8e4f6d8bb84d","year":2018},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.197905Z"},"links":{"citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:7be0af698008360343975532a3b5828b5762b5684f52ddd642a63ebc65b0ccab","observation_id":"5e17b61b-6a84-489c-88c7-0bed132c6d32","resolution":{"observed_at":"2026-08-15T21:37:53.856744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:37:53.844375Z","title":"Mega-TTS 2: Boosting Prompting Mechanisms for Zero-Shot Speech Synthesis","venue":null,"work_id":"159aeebb-8e08-42da-9d33-759837a48f3c","year":2024},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.200877Z"},"links":{"citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:a3e9ae7343a9c65d4181e91eb3c83d9636187904c0b9e8250fcd75e73fed75b2","observation_id":"56c0661c-62ae-4c33-9891-fed0629c3fd6","resolution":{"observed_at":"2026-08-15T21:37:53.847672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:37:53.835105Z","title":"NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models","venue":null,"work_id":"392a00b7-f79f-4725-a086-2f5dee8552f3","year":2024},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.204092Z"},"links":{"citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:c8aee6233655d5e368894c48288611af431671ad9c97df906967183c7bb0dab5","observation_id":"7cec4dac-8866-4541-9e2c-e98ab31581e3","resolution":{"observed_at":"2026-08-15T21:37:53.838507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:37:53.825863Z","title":"Efficient Neural Audio Synthesis","venue":null,"work_id":"380be191-3067-44b4-bd78-2c869c3788f9","year":2018},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.206990Z"},"links":{"citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:190d166ef699567f3194a5eaacd35f6704ca546e7ceec10df370f7a0ee07a28c","observation_id":"0309f106-6b32-46bb-8fbc-76757c432ee5","resolution":{"observed_at":"2026-08-15T21:37:53.829088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:37:53.816662Z","title":"STRAIGHT, exploitation of the other aspect of VOCODER: Perceptually isomorphic decomposition of speech sounds","venue":null,"work_id":"f2f9fbb3-dca5-43d1-a0c9-9e11c398cc3b","year":2006},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.209923Z"},"links":{"citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:2cb04b240baabfa78077ff350d5996272285d36c011f68b704dfc88180aa092f","observation_id":"640f81ad-6c5c-4526-ae32-7c87571110b3","resolution":{"observed_at":"2026-08-15T21:37:53.819950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:37:53.807146Z","title":"Librivox: Free public domain audiobooks","venue":null,"work_id":"b2d4edde-465a-4216-87bf-fea85e5ab90e","year":2014},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.212883Z"},"links":{"citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:ca0425ad2396e30c035fdcd0e94f4022e0b5de927e53267fcde611b06b569d49","observation_id":"4f559d15-69ea-4237-9d6e-64e97e3db499","resolution":{"observed_at":"2026-08-15T21:37:53.810738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:37:53.798147Z","title":"PJS: phoneme-balanced Japanese singing-voice corpus","venue":null,"work_id":"fa595088-4272-42a0-b9c6-701d9b3ce00e","year":2020},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.215959Z"},"links":{"citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:c4ea5fd26ed215a0ec838e1b05582a62f8932a59d446af652f7d009cd8d12ea3","observation_id":"41d9609d-e1c6-437a-a187-15e9ed0b25aa","resolution":{"observed_at":"2026-08-15T21:37:53.801378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:37:53.789155Z","title":"DiffWave: A Versatile Diffusion Model for Audio Synthesis","venue":null,"work_id":"558f0cf6-ccb0-4dec-a567-8df6437a0a85","year":2021},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.221682Z"},"links":{"citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:02e79e614eb1f8cdc5e3d0542948f7b5b398e90e52da3d463d3800ff19c8a7cc","observation_id":"315df28f-07fc-4327-b953-dde2fe045d66","resolution":{"observed_at":"2026-08-15T21:37:53.792398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:37:53.779717Z","title":"Mel-cepstral distance measure for objective speech quality assessment","venue":null,"work_id":"fa2ac04f-553b-4589-9a11-d035a58e7fd6","year":1993},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.225511Z"},"links":{"citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:cc3b19751971f9e7832c11a68b17d879eadd97dfaa5411d8774b3cbe364c0912","observation_id":"ccdb52b1-bdd8-44ef-a774-88a5c8d962c4","resolution":{"observed_at":"2026-08-15T21:37:53.782960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:37:53.770593Z","title":"BigVGAN: A Universal Neural Vocoder with Large-Scale Training","venue":null,"work_id":"9548ce2c-1978-4780-8507-cb62386aeac0","year":2023},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.228503Z"},"links":{"citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:a0b90d8b500796eb22b39d9aca095a2daa19a78689951e1000181900252b700f","observation_id":"21548722-7b93-4ce3-95d1-77c22d78eaec","resolution":{"observed_at":"2026-08-15T21:37:53.773871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:37:53.760910Z","title":"Dannenberg, Ruibo Liu, Wenhu Chen, Gus Xia, Yemin Shi, Wenhao Huang, Zili Wang, Yike Guo, and Jie Fu","venue":null,"work_id":"349c73df-0aa2-419a-821f-a3a1839cbe5e","year":2024},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.231520Z"},"links":{"citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:94d0151145fb3c2c0d21f7b2665107a32b3f02aeee5b0cdb799733542665cfbb","observation_id":"dfc3bb70-0f1d-43ed-90a8-83ba77740ac1","resolution":{"observed_at":"2026-08-15T21:37:53.764306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:37:53.751213Z","title":"DiffSinger: Singing Voice Synthesis via Shallow Diffusion Mechanism","venue":null,"work_id":"0fcbcf35-a408-4564-8851-e323509463d3","year":2022},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.234656Z"},"links":{"citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:18a6ea506c14500f427d7f10ddc2e5045460598335ff468fe0075295c6eb8bf6","observation_id":"48aa5239-2529-4c54-8053-d3031d166439","resolution":{"observed_at":"2026-08-15T21:37:53.755003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:37:53.742157Z","title":"Learning the Beauty in Songs: Neural Singing Voice Beautifier","venue":null,"work_id":"2b2ab3ce-4bf1-41bc-8602-3d85c70a5d84","year":2022},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.237768Z"},"links":{"citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:34cb9dd51e7abff86a016624793cf087d50a23b2f863786d41fb48b15cb1a613","observation_id":"2eebc7b3-8894-47f7-a438-660a0935778a","resolution":{"observed_at":"2026-08-15T21:37:53.745460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:37:53.733156Z","title":"DiffSVC: A Diffusion Probabilistic Model for Singing Voice Conversion","venue":null,"work_id":"747cc650-23b9-4829-a267-f77d8d8aa12e","year":2021},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.240777Z"},"links":{"citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:317aed80842bd63dbdc96806eef46ddd344587eb759e1871d2e9cfa53708f663","observation_id":"afd78071-35e6-4656-a4fc-db75c1a3bbfa","resolution":{"observed_at":"2026-08-15T21:37:53.736527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:37:53.723964Z","title":"Decoupled Weight Decay Regularization","venue":null,"work_id":"da452caf-c60b-4572-8291-89fdd2c9ab8f","year":2019},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.243890Z"},"links":{"citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:1dee0bcfd536449307ef367534caa6bfab921ff3df4972029456398c8178f566","observation_id":"6ad2df6b-43da-463a-9ab2-07bb300fdd9e","resolution":{"observed_at":"2026-08-15T21:37:53.727430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:37:53.714999Z","title":null,"venue":null,"work_id":"6f676170-840c-4842-a568-c531c864ed35","year":2015},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.247159Z"},"links":{"citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:6ac13b7205d53e267b4764d7658ca294144bf6c9673b45494cd0ff3f8478ac0b","observation_id":"cc4e3cd4-128c-4b0a-8913-5c7d9942d25a","resolution":{"observed_at":"2026-08-15T21:37:53.718160Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:37:53.706056Z","title":"WORLD: a vocoder-based high-quality speech synthesis system for real-time applications","venue":null,"work_id":"84e411fa-5028-42be-b150-225b765e2c01","year":2016},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.250371Z"},"links":{"citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:3ff257f86e290f50673560d219d68d050d14957e0dc8abb93b9f68067331eb26","observation_id":"aa5f1653-9c2a-4871-bcf0-fb0dcfd1761e","resolution":{"observed_at":"2026-08-15T21:37:53.709271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:37:53.697082Z","title":"Tohoku kiritan singing database: A singing database for statistical parametric singing synthesis using japanese pop songs","venue":null,"work_id":"f2ae2bb0-3887-4c0d-9b60-e76b5a6aea9a","year":2021},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.253093Z"},"links":{"citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:cb40ec80202ffd3e87afb0d77f531fe370cddb6391bda0229acec5b82809bcce","observation_id":"5ee2eb35-b99f-4109-acef-c90f254851b6","resolution":{"observed_at":"2026-08-15T21:37:53.700187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:37:53.688248Z","title":"Audio Slicer , 2022","venue":null,"work_id":"fee5d497-ecc5-4dfa-b175-a770dfe5136b","year":2022},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.255966Z"},"links":{"citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:b62bb53549d76035cbee8fdaf70c1381b82e6c49ed7b151a0e89a50300064b3a","observation_id":"2bdf3267-abb7-49bd-afb4-0e1159dc8add","resolution":{"observed_at":"2026-08-15T21:37:53.691344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:37:53.679072Z","title":"DiffSinger Community Vocoders , 2024","venue":null,"work_id":"d72c6ce2-e918-438f-b616-f78fc5402ed4","year":2024},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.258814Z"},"links":{"citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:b1483db86369a88ae9c2e0de1888b673ddb57528a1443a0c533efaff4f6e3740","observation_id":"5a475500-4d08-49f2-b704-74198ee6d5d0","resolution":{"observed_at":"2026-08-15T21:37:53.682163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:37:53.670415Z","title":"Transfer Learning of wav2vec 2.0 for Automatic Lyric Transcription","venue":null,"work_id":"945df108-da36-4165-92b1-ae7644d7d2fc","year":2022},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.262943Z"},"links":{"citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:c7c60bd62b13fcc7e4569f2dcdbc585e6bd579b8dd09f98472caf4b5db5b0bc2","observation_id":"00992a65-986e-4391-9a24-2479fe67c0f0","resolution":{"observed_at":"2026-08-15T21:37:53.673602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:37:53.660964Z","title":"Librispeech: An ASR corpus based on public domain audio books","venue":null,"work_id":"444d200c-c0ac-4fa4-89d8-fb8076d3e6af","year":2015},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.265854Z"},"links":{"citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:bf9b78d768af24b23a8ebfa55537e4c24fe670b9e0e78fe78c74bd625d0fcc74","observation_id":"335f8152-2943-4b25-82c6-f668bd2a131e","resolution":{"observed_at":"2026-08-15T21:37:53.664572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:37:53.651867Z","title":"Waveglow: A Flow-based Generative Network for Speech Synthesis","venue":null,"work_id":"89027598-4743-4c04-9dd6-af2264d97f16","year":2019},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.268681Z"},"links":{"citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:a119d439cff62ae75b1666f1fad62f2a427503e852ea30580fc35e680b235302","observation_id":"3e8d450f-1133-4495-bad8-f1d669cfac5b","resolution":{"observed_at":"2026-08-15T21:37:53.655143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:37:53.642916Z","title":"Cox, Mark Hasegawa - Johnson, and Shiyu Chang","venue":null,"work_id":"ade72f9b-eeed-4131-a05d-869d9ef40ce1","year":2022},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.272199Z"},"links":{"citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:338fbeb460d50cf732357ce0bc02fcd266f2a463612910e2dcf3ead007df2052","observation_id":"939277fb-60ea-4c6b-b44b-c1b0669e24a4","resolution":{"observed_at":"2026-08-15T21:37:53.646167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:37:53.633747Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","venue":null,"work_id":"4c7e2a8f-0be6-462c-9b39-4c0d42ddf058","year":2023},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.275526Z"},"links":{"citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:aa9ce85d0833079626d4b6cad5b21f612683443b99e83eee789d6b005e713b63","observation_id":"8fae14b8-fc14-41d3-b0bd-63213353a40c","resolution":{"observed_at":"2026-08-15T21:37:53.636960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:37:53.624415Z","title":"Deepsinger: Singing voice synthesis with data mined from the web","venue":null,"work_id":"cc24b1bb-6f21-40e9-8c5e-45ce6e9e199f","year":2020},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.278268Z"},"links":{"citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:f429408a62e1c28e27e7eb36aec48b8d4347401435a8168a0055af1693f4636d","observation_id":"f646381e-e49a-4901-8f51-ca2e8f96740c","resolution":{"observed_at":"2026-08-15T21:37:53.627714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:37:53.615372Z","title":"NHSS: A speech and singing parallel database","venue":null,"work_id":"48a1cc48-5817-4722-ba07-1acabcb685db","year":2021},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.281553Z"},"links":{"citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:fe251089fa2d070e5287efb26c7c551968e52d7e9db4f4d842f13dc02d9f2f10","observation_id":"cf8b444d-d59a-42d9-bf1f-40cff4956adb","resolution":{"observed_at":"2026-08-15T21:37:53.618584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:37:53.605938Z","title":"NaturalSpeech 2: Latent Diffusion Models are Natural and Zero-Shot Speech and Singing Synthesizers","venue":null,"work_id":"6c487b04-4c96-4837-88ff-ad9da00486be","year":2024},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.284738Z"},"links":{"citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:fbad7d2b0b9f0d05fc8a0d97122a91bfc1c24a9e632c611e9f3c5275749121c8","observation_id":"9177fbc1-c636-4e4f-8f9c-351da7ef7ae0","resolution":{"observed_at":"2026-08-15T21:37:53.609515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:37:53.597084Z","title":"Muskits: an End-to-end Music Processing Toolkit for Singing Voice Synthesis","venue":null,"work_id":"27f0e69a-ecd4-4650-b1b8-07bebf953ba4","year":2022},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.287963Z"},"links":{"citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:69ba76b19b6b35d9ca250fef2feed1cc9eace2fe9fe8abd6285488484c23c748","observation_id":"aa9e02fd-5d53-4180-8483-ec593714aec3","resolution":{"observed_at":"2026-08-15T21:37:53.600377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17619","last_updated":"2024-06-12T20:55:59Z","snapshot_observed_at":"2026-08-16T14:22:58.750879Z","submitted_at":"2024-01-31T06:17:51Z","title":"Singing Voice Data Scaling-up: An Introduction to ACE-Opencpop and ACE-KiSing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.17619","snapshot_observed_at":"2026-08-15T21:37:53.291050Z","title":"Singing Voice Data Scaling-up: An Introduction to ACE-Opencpop and KiSing-v2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.291050Z"},"links":{"cited_paper":"/paper/2401.17619","citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:8967420a1c20ad0b6bb19734dae007c9ca80598c7f8cbcf1e8fee45eff939a53","observation_id":"c687e2dd-ed10-4f54-aae7-2b7625c9b2af","resolution":{"observed_at":"2026-08-15T21:37:53.291050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:37:53.588169Z","title":"Benchmarks and leaderboards for sound demixing tasks, 2023","venue":null,"work_id":"88075415-4aae-46c8-aeb8-6342ba460ce4","year":2023},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.294764Z"},"links":{"citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:73b1ff523dd29377d5e5c0cb9c927239e46ec2347505d69f4c20209173cd4518","observation_id":"a1175bad-da79-46df-aa50-e92603bb7cde","resolution":{"observed_at":"2026-08-15T21:37:53.591560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:37:53.578924Z","title":"HiFi-GAN: High-Fidelity Denoising and Dereverberation Based on Speech Deep Features in Adversarial Networks","venue":null,"work_id":"ee1f63ea-1ecb-4e5e-b357-9a04bc2d40d5","year":2020},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.298059Z"},"links":{"citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:83a23d607ade5e7133b7f979408deb752172cefcf54cd97c00f16a55d3c4c86c","observation_id":"55b8dda5-32a9-41a5-8157-4e317eea7112","resolution":{"observed_at":"2026-08-15T21:37:53.582202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10911","last_updated":"2024-06-20T11:26:08Z","snapshot_observed_at":"2026-08-16T13:42:34.320541Z","submitted_at":"2024-06-16T12:15:28Z","title":"SingMOS: An extensive Open-Source Singing Voice Dataset for MOS Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10911","snapshot_observed_at":"2026-08-15T21:37:53.301162Z","title":"SingMOS: An extensive Open-Source Singing Voice Dataset for MOS Prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.301162Z"},"links":{"cited_paper":"/paper/2406.10911","citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:8c2dbef43d04c65c0b7081f3448dbe3f916f6db02855d55c4ffe821cdff9a345","observation_id":"368bb720-eac5-43a0-a194-f743c4da8df4","resolution":{"observed_at":"2026-08-15T21:37:53.301162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:37:53.569954Z","title":"Senior, and Koray Kavukcuoglu","venue":null,"work_id":"21c44038-940d-4b21-bcbe-a7c4fc3ee184","year":2016},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.304657Z"},"links":{"citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:b8a85471ceea174737e9ac26bab6a608b49cc58974c4dcb2ec8cdd0f5399e42c","observation_id":"28674728-aa3f-497d-ba7a-ca324881928b","resolution":{"observed_at":"2026-08-15T21:37:53.573096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:37:53.560317Z","title":"Opencpop: A High-Quality Open Source Chinese Popular Song Corpus for Singing Voice Synthesis","venue":null,"work_id":"8516467a-eb90-47ca-80f9-aa5ae8873474","year":2022},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.307977Z"},"links":{"citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:b5c5f0d820c285802130dcdb365195b94089e134378518a03bd95935c59b501c","observation_id":"9997a78f-77b3-4494-a05a-230f7f0ff10b","resolution":{"observed_at":"2026-08-15T21:37:53.563753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07728","last_updated":"2024-11-15T07:51:08Z","snapshot_observed_at":"2026-07-06T18:44:16.139499Z","submitted_at":"2024-07-10T15:00:08Z","title":"SaMoye: Zero-shot Singing Voice Conversion Model Based on Feature Disentanglement and Enhancement","version":5},"cited_work":{"arxiv_id":"2407.07728","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.07728","snapshot_observed_at":"2026-08-15T21:37:53.401016Z","title":"SaMoye: Zero-shot Singing Voice Conversion Model Based on Feature Disentanglement and Enhancement","venue":"cs.SD","work_id":"7e1b272e-9db4-427e-8fb6-098ffd201121","year":2024},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.311066Z"},"links":{"cited_paper":"/paper/2407.07728","citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:57a9d0348c60fa103c50b4c97c5de3fea639deb5efdb04e9bfd1a16f8e160082","observation_id":"307ab26f-daf8-4230-8274-df39a1c4f7f0","resolution":{"observed_at":"2026-08-15T21:37:53.406323Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:37:53.551014Z","title":"VocalSet: A Singing Voice Dataset","venue":null,"work_id":"7faddcf8-7cf3-4c34-a3ca-544b999634a0","year":2018},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.314660Z"},"links":{"citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:a3ad8318e250dc1e74ca1d6ae3c9ec21e7d36b0fd050175ad3200d83c6bd7739","observation_id":"d9cda270-d000-4b86-ae6e-ec17757ec968","resolution":{"observed_at":"2026-08-15T21:37:53.554288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.03771","last_updated":"2020-07-14T03:42:34Z","snapshot_observed_at":"2026-07-06T08:27:58.343233Z","submitted_at":"2019-10-09T03:23:22Z","title":"HuggingFace's Transformers: State-of-the-art Natural Language Processing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.03771","snapshot_observed_at":"2026-08-15T21:37:53.317811Z","title":"HuggingFace's Transformers: State-of-the-art Natural Language Processing","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.317811Z"},"links":{"cited_paper":"/paper/1910.03771","citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:b865e361cbc18e91922689c505bfb8e3f04d2d8d5af8728a86379d20232ee336","observation_id":"6d71c7d6-b4ae-4939-864b-541dfa798097","resolution":{"observed_at":"2026-08-15T21:37:53.317811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:37:53.540952Z","title":"DDSP-based Singing Vocoders: A New Subtractive-based Synthesizer and A Comprehensive Evaluation","venue":null,"work_id":"060bafac-e584-40db-a647-09bc2e480a0f","year":2022},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.321458Z"},"links":{"citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:f991a23e6bcbf648668617238b36d323c15d216f7a397920aa13d2ce4631cdfc","observation_id":"1c431b5d-aea4-4fa0-b79f-0dcf44722e6b","resolution":{"observed_at":"2026-08-15T21:37:53.544589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:37:53.530598Z","title":"M4Singer: A Multi-Style, Multi-Singer and Musical Score Provided Mandarin Singing Corpus","venue":null,"work_id":"4a327bc0-ceb0-41f0-846d-7e2c9a005312","year":2022},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.325181Z"},"links":{"citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:6c2e59ecf022a5dea8d1d38574660d391fb19afbfcc47e545ce5f4aef0f304b9","observation_id":"bf4c2f2d-99e7-41fa-bc9b-777278648203","resolution":{"observed_at":"2026-08-15T21:37:53.534124Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11160","last_updated":"2024-09-16T12:07:48Z","snapshot_observed_at":"2026-08-16T14:51:25.608958Z","submitted_at":"2023-10-17T11:26:28Z","title":"Leveraging Diverse Semantic-based Audio Pretrained Models for Singing Voice Conversion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11160","snapshot_observed_at":"2026-08-15T21:37:53.328279Z","title":"Leveraging Content-based Features from Multiple Acoustic Models for Singing Voice Conversion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.328279Z"},"links":{"cited_paper":"/paper/2310.11160","citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:6702261badbaf9c75468829815684b15bcc11a51858634a1999965fce5736ce8","observation_id":"c7722ef2-217b-4872-b484-8c0a6fac21e5","resolution":{"observed_at":"2026-08-15T21:37:53.328279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:37:53.520299Z","title":"Amphion: An Open-Source Audio, Music and Speech Generation Toolkit","venue":null,"work_id":"c59dec25-3858-46c2-bc80-6f574c6a4b27","year":2024},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.331711Z"},"links":{"citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:149df4f7a1ed4ed3b4f3751dbe809054a441ab80ca338e9803b033f09bcd9841","observation_id":"63854892-6b78-48b9-9da1-3b2072fe2f86","resolution":{"observed_at":"2026-08-15T21:37:53.523992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:37:53.510128Z","title":"SinTechSVS: A Singing Technique Controllable Singing Voice Synthesis System","venue":null,"work_id":"e58beb41-5655-4acf-9a97-5af461ae1ab1","year":2024},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.334832Z"},"links":{"citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:7668bb88b8b7ed78f52e19b3dfdbac9bdab1555c0e5f42e8d65fe2f87ad50005","observation_id":"6cfcd07a-9011-4997-8a9a-5a0303b16291","resolution":{"observed_at":"2026-08-15T21:37:53.513913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:37:53.500420Z","title":"FT-GAN: Fine-Grained Tune Modeling for Chinese Opera Synthesis","venue":null,"work_id":"056542f0-a358-4a83-8e07-a7ddeb1363a0","year":2024},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.337830Z"},"links":{"citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:628f9dce9792ccd78c92710b98bd86a85a772b77444eb8e886fe2388563dfa0b","observation_id":"c8038f2f-76bb-44ec-bd11-ffc4cdd0cf36","resolution":{"observed_at":"2026-08-15T21:37:53.503895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:37:53.491308Z","title":"Dannenberg, Jie Fu, Chenghua Lin, Emmanouil Benetos, Wenhu Chen, Wei Xue, and Yike Guo","venue":null,"work_id":"c37724dd-0f52-4335-8231-c5a37893215b","year":2023},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.340963Z"},"links":{"citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:6659279c2c95ff7401c756c5a2a415c9aaa0955d9ee7786775626303ec5eb4a4","observation_id":"7ae7d721-0089-4d58-b726-9726e3f72e49","resolution":{"observed_at":"2026-08-15T21:37:53.494429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:37:53.344084Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.344084Z"},"links":{"citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:50bc6282aab98ae2348ecdc17535b790f6f050a625992363bc536eded998b8f4","observation_id":"89bd7c00-ed1e-4ce9-8c9f-ab5a3880443e","resolution":{"observed_at":"2026-08-15T21:37:53.344084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:37:53.348229Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.348229Z"},"links":{"citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:08bfee1daa09f021e1d18aa21c6872806a7a4f630e597a03e7b1ea88c1ebbaab","observation_id":"61ffcca6-5a94-4fbf-a598-5518627069fd","resolution":{"observed_at":"2026-08-15T21:37:53.348229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:37:53.351795Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.351795Z"},"links":{"citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:d7d622890a82e26883673e65d1f6a6ebe4469b12c96a8bd34e3e3bf4571ae45c","observation_id":"69d951fb-d5eb-4f9b-b115-57d435d7ea84","resolution":{"observed_at":"2026-08-15T21:37:53.351795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:37:53.355467Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-15T21:37:53.355467Z"},"links":{"citing_paper":"/paper/2505.09325"},"observation_digest":"sha256:7f735c6b36ade6687cc7f16a98f2e2ffcea71f670a5083bffa1d369ff864a055","observation_id":"8e5f34c8-252d-4e70-870d-29ab383bf756","resolution":{"observed_at":"2026-08-15T21:37:53.355467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.09325","last_updated":"2025-05-14T12:24:05Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-16T23:32:30.602743Z","submitted_at":"2025-05-14T12:24:05Z","title":"SingNet: Towards a Large-Scale, Diverse, and In-the-Wild Singing Voice Dataset"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":2,"verified_fuzzy":55},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 2 inbound Pith citation observations for arXiv:2505.09325."}