{"as_of":"2026-08-07T17:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1572995f2a1c23512de5c6311167270ea0cda9e4f1b99d0ee151d7e946ff8537","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:29:58.843755Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.21478/citation-record","integrity":"/paper/2506.21478/integrity","json":"/paper/2506.21478/citation-record.json","paper":"/paper/2506.21478"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-06T22:29:27.752921Z","title":"Beltagy, M","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-06T22:21:25.389863Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:27.752921Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:536244b901493866cf7187e819aeef0d9f37c2974506f2b277e45338526e313e","observation_id":"2b3c8989-e854-49da-bac1-d3c219f0dbf8","resolution":{"observed_at":"2026-08-06T22:29:27.752921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:30:00.462349Z","title":"Chandna, M","venue":null,"work_id":"9d3b39d2-e9be-42a8-8d17-2fd7ac441f41","year":2019},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-06T22:21:25.389863Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:27.780086Z"},"links":{"citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:3eb2aba3aa02502c8398277147261e0b26a4ac099502a5ca803143e1a3bc84ff","observation_id":"b8c953a1-c532-4193-9250-b09919d91fac","resolution":{"observed_at":"2026-08-06T22:30:00.473936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09660","last_updated":"2021-06-19T01:47:11Z","snapshot_observed_at":"2026-07-06T11:20:25.833561Z","submitted_at":"2021-06-17T17:09:21Z","title":"WaveGrad 2: Iterative Refinement for Text-to-Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09660","snapshot_observed_at":"2026-08-06T22:29:27.799528Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-06T22:21:25.389863Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:27.799528Z"},"links":{"cited_paper":"/paper/2106.09660","citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:8e0995e3caff1b7afee61ba6788b8fde135cc5eda9335c350bdb9e87e849a87e","observation_id":"87db912f-e779-4483-b3e4-4c278c4e85fd","resolution":{"observed_at":"2026-08-06T22:29:27.799528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:30:00.430567Z","title":"Chien, H.-M","venue":null,"work_id":"4aa8b73e-7d99-4ec4-9613-92b253091a98","year":1998},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-06T22:21:25.389863Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:27.805837Z"},"links":{"citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:368e27e9562a5f0814ccd1f661c109c7f45ee1166e1c8252b632405989a5dcec","observation_id":"1224f7fa-fc5e-41c3-af0e-8b1e750ec14c","resolution":{"observed_at":"2026-08-06T22:30:00.443769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:27.821531Z","title":"Dhariwal and A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-06T22:21:25.389863Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:27.821531Z"},"links":{"citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:1117973447f146dcf7080d8c06f7be31df35950241acf8c96958842bd6316290","observation_id":"388cbfd0-7a9d-486c-9e13-1b542ae0cff7","resolution":{"observed_at":"2026-08-06T22:29:27.821531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:27.839942Z","title":"Goodfellow, J","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-06T22:21:25.389863Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:27.839942Z"},"links":{"citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:52c8a346683f2aff181bc847265089b14d3e50a702ebd274d4f969e85ff8f993","observation_id":"a1f5ca68-4fa0-427e-8bb5-bdc2ffdc1b8a","resolution":{"observed_at":"2026-08-06T22:29:27.839942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:27.863893Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-06T22:21:25.389863Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:27.863893Z"},"links":{"citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:a1081138d700d0126f006f89af1a86cbc720d357c19b049349c59330eed497aa","observation_id":"d088dced-484e-41d4-82ee-a3e6333a3ced","resolution":{"observed_at":"2026-08-06T22:29:27.863893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:27.883593Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-06T22:21:25.389863Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:27.883593Z"},"links":{"citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:583115d07f2d3cdf1e95c9b90b1b29600a52eb9a37a04a87f2921a99dc283932","observation_id":"140dbe4d-9c6e-4c95-a600-5185f44206d6","resolution":{"observed_at":"2026-08-06T22:29:27.883593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:30:00.348616Z","title":null,"venue":null,"work_id":"866e479e-23fd-4514-b342-47ecee1c9c27","year":2019},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-06T22:21:25.389863Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:27.913585Z"},"links":{"citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:eb6b3416c34cc2a31c886141460e2931f449e2be16a9b2dce64078f3650fc843","observation_id":"a738d2de-94c2-4991-9542-eb6f92480836","resolution":{"observed_at":"2026-08-06T22:30:00.359931Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:30:00.319006Z","title":null,"venue":null,"work_id":"8e3a165a-9046-400f-b0c7-2c2ee09b48d6","year":2024},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-06T22:21:25.389863Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:27.934884Z"},"links":{"citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:84277eb3935cd0faddc8305314e3211eae62a041f1c7e35a5d557ec977a4743f","observation_id":"2e9ccb86-6580-4dfb-ba9d-2e2ee2eac120","resolution":{"observed_at":"2026-08-06T22:30:00.328112Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:30:00.293610Z","title":"Huang, E","venue":null,"work_id":"3449157b-69b7-407f-8347-9baf992dc894","year":2022},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-06T22:21:25.389863Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:27.956171Z"},"links":{"citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:10b1e0d9899114b0c9c953db881b2fe7bf75eb1d5382b9546342fd899b3f0348","observation_id":"768e828c-ce2c-43bf-941f-f87e7b3f50d8","resolution":{"observed_at":"2026-08-06T22:30:00.302451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.09934","last_updated":"2022-04-21T07:49:09Z","snapshot_observed_at":"2026-08-07T02:30:21.925645Z","submitted_at":"2022-04-21T07:49:09Z","title":"FastDiff: A Fast Conditional Diffusion Model for High-Quality Speech Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.09934","snapshot_observed_at":"2026-08-06T22:29:27.975790Z","title":"Huang, M","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-06T22:21:25.389863Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:27.975790Z"},"links":{"cited_paper":"/paper/2204.09934","citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:09c6c39b448123f867b17205514728dcccc81c90a165b662d583ff1498a5a335","observation_id":"2606b796-9326-4548-97b6-4bdaf6334104","resolution":{"observed_at":"2026-08-06T22:29:27.975790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:30:00.267577Z","title":"Huang, Z","venue":null,"work_id":"55c9728b-2c49-474b-af72-5d6f0b3ea532","year":2022},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-06T22:21:25.389863Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:27.999846Z"},"links":{"citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:4c18e91129d85931ff10e95d4b64e240ab8c96a9dcc0160d264eb734b984b472","observation_id":"32d8731d-1843-45da-8848-83eeb55c93b7","resolution":{"observed_at":"2026-08-06T22:30:00.276172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:30:00.237970Z","title":"Ito and L","venue":null,"work_id":"25e89995-18b5-465b-b349-0d90de77287a","year":2017},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-06T22:21:25.389863Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.009515Z"},"links":{"citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:ec7bc0d9fdd733ec71be880bc36fa6e2aa7a622a24750c0986cb65cf36954db3","observation_id":"f3b22ad5-5719-4e75-b424-27fd836f61ef","resolution":{"observed_at":"2026-08-06T22:30:00.249622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:28.029616Z","title":"Jadoul, B","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-06T22:21:25.389863Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.029616Z"},"links":{"citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:e1f675a804fc8e19fa2ad635ed07cb337733b2d9eb36fdd734aa777f56225419","observation_id":"db14a4f3-5af9-4c45-8a73-39a22cbc86a8","resolution":{"observed_at":"2026-08-06T22:29:28.029616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:30:00.205524Z","title":"Karras, M","venue":null,"work_id":"0143ef05-8c9c-4ca5-9435-164588ef031a","year":2021},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-06T22:21:25.389863Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.049250Z"},"links":{"citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:7a5945df1456a8c78f6c99b3ee83c39b805ef6d1c84f3f06fccfffa296be375a","observation_id":"57ced24d-4985-46c8-8d68-59106dc004c7","resolution":{"observed_at":"2026-08-06T22:30:00.215144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.11558","last_updated":"2024-06-13T14:48:58Z","snapshot_observed_at":"2026-07-06T13:23:51.555189Z","submitted_at":"2022-06-23T09:11:02Z","title":"Adversarial Multi-Task Learning for Disentangling Timbre and Pitch in Singing Voice Synthesis","version":2},"cited_work":{"arxiv_id":"2206.11558","doi":null,"metadata_source":"pith","pith_arxiv_id":"2206.11558","snapshot_observed_at":"2026-08-06T22:29:59.315412Z","title":"Adversarial Multi-Task Learning for Disentangling Timbre and Pitch in Singing Voice Synthesis","venue":"eess.AS","work_id":"8aa093ba-6010-4cf0-a95c-77c1265ae12b","year":2022},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-06T22:21:25.389863Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.054865Z"},"links":{"cited_paper":"/paper/2206.11558","citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:9412b59ab8e382b5906296e0e727b17c51e94436510ea7fcb40e84e5d1afbe6f","observation_id":"9f509ce2-f35a-4790-a552-42505cb1d616","resolution":{"observed_at":"2026-08-06T22:29:59.344754Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:30:00.168194Z","title":null,"venue":null,"work_id":"c2c42172-f0ae-4337-8fa5-e1f23c94f37d","year":2019},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-06T22:21:25.389863Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.079966Z"},"links":{"citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:fdf5aea62826c38431f37ca69a82cbf0c6cfba3300718e4f7db25e0442999b7f","observation_id":"300cded9-7b97-4885-bef7-906ede9667ce","resolution":{"observed_at":"2026-08-06T22:30:00.180560Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:30:00.126923Z","title":null,"venue":null,"work_id":"6c8b7344-1a68-4e23-98e7-5c46adee672e","year":2020},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-06T22:21:25.389863Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.095537Z"},"links":{"citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:8b750fb3ec610fb05fa343ea6f4e1ee1963e818c8e49c537f938f98258cddea9","observation_id":"e70cbfbf-bcc8-493a-8891-2509177661ff","resolution":{"observed_at":"2026-08-06T22:30:00.141857Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.09761","last_updated":"2021-03-30T19:48:38Z","snapshot_observed_at":"2026-07-06T09:57:19.117228Z","submitted_at":"2020-09-21T11:20:38Z","title":"DiffWave: A Versatile Diffusion Model for Audio Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.09761","snapshot_observed_at":"2026-08-06T22:29:28.113961Z","title":null,"venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-06T22:21:25.389863Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.113961Z"},"links":{"cited_paper":"/paper/2009.09761","citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:469d87c05c45d348c8b8fe322c1662ed51260ec472cd539b1bb80eabd3da3cd8","observation_id":"5bcb1bf9-bb90-4672-8a33-0ed0183bca5e","resolution":{"observed_at":"2026-08-06T22:29:28.113961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04658","last_updated":"2023-02-16T18:48:56Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:56:10Z","title":"BigVGAN: A Universal Neural Vocoder with Large-Scale Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04658","snapshot_observed_at":"2026-08-06T22:29:28.144770Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-06T22:21:25.389863Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.144770Z"},"links":{"cited_paper":"/paper/2206.04658","citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:fa6b77d75dc195538656a06aace449e5c9c92478ff82303f1126501d3e2e1cb3","observation_id":"9270443a-18f3-402d-b2b9-64bc1ce5d6ec","resolution":{"observed_at":"2026-08-06T22:29:28.144770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:30:00.095648Z","title":null,"venue":null,"work_id":"79ed2635-591d-47bb-bb0f-926e790df6f8","year":2022},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-06T22:21:25.389863Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.166256Z"},"links":{"citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:7b50e0be10676c1e5cc1de85e7be83180e02791fd46fd84fa81f092344b1c14f","observation_id":"bd41f50f-6018-42e0-a233-f1b06060bb33","resolution":{"observed_at":"2026-08-06T22:30:00.103983Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:30:00.025939Z","title":null,"venue":null,"work_id":"9b5aeaa0-0a98-4a2a-a5b8-752a9d17ae9c","year":2023},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-06T22:21:25.389863Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.186840Z"},"links":{"citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:4e14e65c52ae1c2eeecbb1731f3c72ce1046252519ed9e16cf76ba9a2d232306","observation_id":"50d9ddd4-e221-4495-8cdb-d3a3a98c1831","resolution":{"observed_at":"2026-08-06T22:30:00.054490Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.06261","last_updated":"2020-06-11T09:09:59Z","snapshot_observed_at":"2026-07-06T09:28:01.911061Z","submitted_at":"2020-06-11T09:09:59Z","title":"XiaoiceSing: A High-Quality and Integrated Singing Voice Synthesis System","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.06261","snapshot_observed_at":"2026-08-06T22:29:28.214431Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-06T22:21:25.389863Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.214431Z"},"links":{"cited_paper":"/paper/2006.06261","citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:cba307cd541a3793ee7f33bd3250d6a0cbada03e26c81f038807e4826836657d","observation_id":"879c9003-422b-4896-9fdc-319fdb77ce67","resolution":{"observed_at":"2026-08-06T22:29:28.214431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:59.957628Z","title":"Müller, A","venue":null,"work_id":"62a44184-30c9-4124-9b71-fde2fa4bc776","year":2022},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-06T22:21:25.389863Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.227547Z"},"links":{"citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:c11154efec40be9d7418bf89114aaaa727b5851786a8f271e66de384fd3cebef","observation_id":"6a5ec65d-1a09-4f40-bcb2-7b59d55067ff","resolution":{"observed_at":"2026-08-06T22:29:59.978201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.06868","last_updated":"2019-06-25T06:54:03Z","snapshot_observed_at":"2026-07-06T07:46:03.418654Z","submitted_at":"2019-04-15T06:23:44Z","title":"Singing voice synthesis based on convolutional neural networks","version":2},"cited_work":{"arxiv_id":"1904.06868","doi":null,"metadata_source":"pith","pith_arxiv_id":"1904.06868","snapshot_observed_at":"2026-08-06T22:29:59.170410Z","title":"Singing voice synthesis based on convolutional neural networks","venue":"eess.AS","work_id":"1352e3b2-c559-4c99-b29a-0836dfbaf43d","year":2019},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-06T22:21:25.389863Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.261900Z"},"links":{"cited_paper":"/paper/1904.06868","citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:32032ec9652bc8046dd0c9a70a53209e681df814f55a8dcb55e0d59de343db11","observation_id":"2440c8b2-79b3-4232-8ab1-bcf74940eb38","resolution":{"observed_at":"2026-08-06T22:29:59.199750Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:59.902001Z","title":"Popov, I","venue":null,"work_id":"4d783088-b954-4ba0-9535-ed9f8550099f","year":2021},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-06T22:21:25.389863Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.286079Z"},"links":{"citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:1d755b900d0c51be2e5fd8a349840d8b3a94bf0d7eb08fb05dde570082049f4e","observation_id":"ec0cd236-830d-4866-9b55-a729f8b29206","resolution":{"observed_at":"2026-08-06T22:29:59.932922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:59.864047Z","title":"Prenger, R","venue":null,"work_id":"5ded4bf4-173d-422e-9b30-f1875b9df2a0","year":2019},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-06T22:21:25.389863Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.312885Z"},"links":{"citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:c7077a670f345ec103d682ac6d4978fa907c4219e46feede7fedc832ad7cdf9f","observation_id":"0144e5b6-7abf-4902-a6dd-56d522e83c9c","resolution":{"observed_at":"2026-08-06T22:29:59.876383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-06T22:29:28.332966Z","title":"Ramesh, P","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-06T22:21:25.389863Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.332966Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:fc8c6b22809de02b43aea38663b985eeec949888b30a4c86ae765a25b36e23a9","observation_id":"baf91113-26ad-4f85-a243-621970d3c292","resolution":{"observed_at":"2026-08-06T22:29:28.332966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:59.808346Z","title":null,"venue":null,"work_id":"f36bb745-42e8-4f8f-bd86-1d4a1e1470e4","year":2022},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-06T22:21:25.389863Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.349696Z"},"links":{"citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:4872c4345f5c9fed10128ae403e2e3ba6f785e489392f512439030bec1e6c52b","observation_id":"14f82d62-596e-47ff-a4bd-501839b93d9d","resolution":{"observed_at":"2026-08-06T22:29:59.836088Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04558","last_updated":"2022-08-08T01:53:05Z","snapshot_observed_at":"2026-08-06T18:05:37.673476Z","submitted_at":"2020-06-08T13:05:40Z","title":"FastSpeech 2: Fast and High-Quality End-to-End Text to Speech","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04558","snapshot_observed_at":"2026-08-06T22:29:28.366767Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-06T22:21:25.389863Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.366767Z"},"links":{"cited_paper":"/paper/2006.04558","citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:19b4fc44f536663e67b56a86aeb0d380104f0c5ac94f132519b0957171b8f430","observation_id":"51258cdc-1a04-47bc-b851-77e66cfb4e41","resolution":{"observed_at":"2026-08-06T22:29:28.366767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:59.760385Z","title":null,"venue":null,"work_id":"cadce443-4ac9-4e06-a12b-cf5ac5a77a9c","year":1979},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-06T22:21:25.389863Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.411362Z"},"links":{"citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:efe77b4281a2fe0e76fdaedba0304dba2be85f25fbed99e775deead36c954ffc","observation_id":"49624944-1107-4a1a-8553-5de0724a95d1","resolution":{"observed_at":"2026-08-06T22:29:59.785013Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:59.695402Z","title":null,"venue":null,"work_id":"bce142fd-f31e-4dc4-aafa-092e68529d01","year":2001},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-06T22:21:25.389863Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.444908Z"},"links":{"citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:297638df6dc74bb6e1ee3c539bb87ef57ed1b1b1a26ae7155aa1de73dd74ad32","observation_id":"8cc1d15f-d98d-4d11-818d-969bc6a0d826","resolution":{"observed_at":"2026-08-06T22:29:59.721273Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:59.634248Z","title":"Saharia, J","venue":null,"work_id":"a65e2e49-b50a-4565-b420-2b100d2d831d","year":2022},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-06T22:21:25.389863Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.467372Z"},"links":{"citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:d6ed87eca3667454adc2d934ce65a5e50e1476ace9c3eacc5c6fe4a894d88372","observation_id":"cc097481-44fb-461b-96a6-9b6870812009","resolution":{"observed_at":"2026-08-06T22:29:59.653582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21641","last_updated":"2024-10-29T01:01:18Z","snapshot_observed_at":"2026-08-03T07:42:01.783813Z","submitted_at":"2024-10-29T01:01:18Z","title":"RDSinger: Reference-based Diffusion Network for Singing Voice Synthesis","version":1},"cited_work":{"arxiv_id":"2410.21641","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.21641","snapshot_observed_at":"2026-08-06T22:29:59.061885Z","title":"RDSinger: Reference-based Diffusion Network for Singing Voice Synthesis","venue":"cs.SD","work_id":"3f6a8a86-21e6-4511-9f46-9e266a86c935","year":2024},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-06T22:21:25.389863Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.484086Z"},"links":{"cited_paper":"/paper/2410.21641","citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:b22d4b85f55216b95b0b6a689e21d21be114eff98b069dc4b84f025588e09618","observation_id":"75551b59-e661-40f9-9b48-d5ab1385562a","resolution":{"observed_at":"2026-08-06T22:29:59.087886Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:59.574943Z","title":null,"venue":null,"work_id":"34dae179-968f-48dd-b8b3-b4026416c7c5","year":2011},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-06T22:21:25.389863Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.506584Z"},"links":{"citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:4eb8e18f06d5d6fd8f432f09313e68b7178c43db0778ae768bd5c8fef3c96385","observation_id":"93952d6d-f335-4f56-a2cb-4526fb5c709f","resolution":{"observed_at":"2026-08-06T22:29:59.599277Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-06T22:29:28.529788Z","title":"Van Den Oord, S","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-06T22:21:25.389863Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.529788Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:18c524c3a436a5ad96a45152f652d166b54230aa6ad59766b8f8bca6e12c74d9","observation_id":"3e671ec9-5621-4f95-986f-baeb49a49ede","resolution":{"observed_at":"2026-08-06T22:29:28.529788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.07429","last_updated":"2022-01-20T02:08:47Z","snapshot_observed_at":"2026-07-06T12:28:39.665369Z","submitted_at":"2022-01-19T06:12:47Z","title":"Opencpop: A High-Quality Open Source Chinese Popular Song Corpus for Singing Voice Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.07429","snapshot_observed_at":"2026-08-06T22:29:58.668681Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-06T22:21:25.389863Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:58.668681Z"},"links":{"cited_paper":"/paper/2201.07429","citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:7cb82d000b0b3afff1d0bc93f28450bf14737abfb6c68eca2851ae152d6097c3","observation_id":"476baf62-2e92-4420-8ec4-72780cde32d3","resolution":{"observed_at":"2026-08-06T22:29:58.668681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.10317","last_updated":"2020-06-18T07:20:11Z","snapshot_observed_at":"2026-07-06T09:30:17.443375Z","submitted_at":"2020-06-18T07:20:11Z","title":"Adversarially Trained Multi-Singer Sequence-To-Sequence Singing Synthesizer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.10317","snapshot_observed_at":"2026-08-06T22:29:58.689483Z","title":"Wu and J","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-06T22:21:25.389863Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:58.689483Z"},"links":{"cited_paper":"/paper/2006.10317","citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:cb1c36631951d6c7b45be495a0a7fc8ca4424cedf6ec944d920bc7ff4a840374","observation_id":"c106236e-0bff-4c85-ad23-b225aa866802","resolution":{"observed_at":"2026-08-06T22:29:58.689483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:59.525544Z","title":"Zhang, A","venue":null,"work_id":"0cd8b0b5-5ecd-4c6e-99d6-dd0cf27f564e","year":2023},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-06T22:21:25.389863Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:58.710008Z"},"links":{"citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:895a810007aa3cebbd35144683324abb86da7212690b3d3d8a6c0f0d2b2ccadd","observation_id":"617ff0f0-cd93-4a12-880c-708e1cf083b9","resolution":{"observed_at":"2026-08-06T22:29:59.544824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.02903","last_updated":"2022-11-05T13:35:00Z","snapshot_observed_at":"2026-08-03T00:45:37.535967Z","submitted_at":"2022-11-05T13:35:00Z","title":"VISinger 2: High-Fidelity End-to-End Singing Voice Synthesis Enhanced by Digital Signal Processing Synthesizer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.02903","snapshot_observed_at":"2026-08-06T22:29:58.757941Z","title":"Zhang, H","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-06T22:21:25.389863Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:58.757941Z"},"links":{"cited_paper":"/paper/2211.02903","citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:cb08864fd6e5e142a5cef4f562b1aeef3e85d5a2bf55ab5394c8525d3ebcb2b0","observation_id":"95ad80f0-f15c-4375-9879-0ddc38144496","resolution":{"observed_at":"2026-08-06T22:29:58.757941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:29:59.445459Z","title":"Zhang, R","venue":null,"work_id":"35bc0dfd-59a2-436d-a549-da1ccf1f97b6","year":2024},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-06T22:21:25.389863Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:58.811963Z"},"links":{"citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:dc045de1de3bf2d6382dc0bca4f7267114209b2bb21cac1ea8c2056ec7461f62","observation_id":"303cdbb7-360a-46b4-8e06-f32f1eea6c7b","resolution":{"observed_at":"2026-08-06T22:29:59.480755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15977","last_updated":"2025-05-30T10:11:27Z","snapshot_observed_at":"2026-08-06T21:08:20.761890Z","submitted_at":"2024-09-24T11:18:09Z","title":"TCSinger: Zero-Shot Singing Voice Synthesis with Style Transfer and Multi-Level Style Control","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15977","snapshot_observed_at":"2026-08-06T22:29:58.843755Z","title":"Zhang, Z","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-06T22:21:25.389863Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:58.843755Z"},"links":{"cited_paper":"/paper/2409.15977","citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:d4ffaaaf9918fff93cf8bfa37a46f21d53f8ec23eb4859e73d78751c455a919d","observation_id":"f04aaa5e-fc54-48e0-8e4c-3ec7c9930734","resolution":{"observed_at":"2026-08-06T22:29:58.843755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-06T22:21:25.389863Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":3,"verified_fuzzy":12},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2506.21478."}