{"as_of":"2026-08-20T07:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1b374c4317c9fdd34735f4d4139b12688360d3caf44928f484ae285a7bb529b6","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T05:43:00.320438Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T05:42:55.778574Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.13278","last_updated":"2026-07-16T07:52:59Z","snapshot_observed_at":"2026-08-07T14:59:00.272205Z","submitted_at":"2026-07-14T21:29:17Z","title":"Adapting Diffusion-Based Music Synthesis to Speech and Singing Voice Conversion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.13278","snapshot_observed_at":"2026-08-02T05:42:55.778574Z","title":"CAT”: Concatenation along the channel axis, “C.A","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13278","last_updated":"2026-07-16T07:52:59Z","snapshot_observed_at":"2026-08-07T14:59:00.272205Z","submitted_at":"2026-07-14T21:29:17Z","title":"Adapting Diffusion-Based Music Synthesis to Speech and Singing Voice Conversion","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T05:42:55.778574Z"},"links":{"cited_paper":"/paper/2607.13278","citing_paper":"/paper/2607.13278"},"observation_digest":"sha256:76edd020228b312010ac3b49180c93ec96e07edfd77892d4f074e98ebb0c8d24","observation_id":"eb5fb129-ac8e-4407-b9ae-82e023d955d6","resolution":{"observed_at":"2026-08-02T05:42:55.778574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2607.13278/citation-record","integrity":"/paper/2607.13278/integrity","json":"/paper/2607.13278/citation-record.json","paper":"/paper/2607.13278"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:42:55.624158Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13278","last_updated":"2026-07-16T07:52:59Z","snapshot_observed_at":"2026-08-07T14:59:00.272205Z","submitted_at":"2026-07-14T21:29:17Z","title":"Adapting Diffusion-Based Music Synthesis to Speech and Singing Voice Conversion","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T05:42:55.624158Z"},"links":{"citing_paper":"/paper/2607.13278"},"observation_digest":"sha256:e716b96bd04d920f806ccbaf54b7b93e85a54cd7aef380d1e519255cfb6df456","observation_id":"822ef207-e4a6-4da2-970a-b474c3715625","resolution":{"observed_at":"2026-08-02T05:42:55.624158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.13278","last_updated":"2026-07-16T07:52:59Z","snapshot_observed_at":"2026-08-07T14:59:00.272205Z","submitted_at":"2026-07-14T21:29:17Z","title":"Adapting Diffusion-Based Music Synthesis to Speech and Singing Voice Conversion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.13278","snapshot_observed_at":"2026-08-02T05:42:55.778574Z","title":"CAT”: Concatenation along the channel axis, “C.A","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13278","last_updated":"2026-07-16T07:52:59Z","snapshot_observed_at":"2026-08-07T14:59:00.272205Z","submitted_at":"2026-07-14T21:29:17Z","title":"Adapting Diffusion-Based Music Synthesis to Speech and Singing Voice Conversion","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T05:42:55.778574Z"},"links":{"cited_paper":"/paper/2607.13278","citing_paper":"/paper/2607.13278"},"observation_digest":"sha256:76edd020228b312010ac3b49180c93ec96e07edfd77892d4f074e98ebb0c8d24","observation_id":"eb5fb129-ac8e-4407-b9ae-82e023d955d6","resolution":{"observed_at":"2026-08-02T05:42:55.778574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:42:55.926675Z","title":"To convert the generated mel spectrogram into a waveform, we use an off-the-shelf BigVGAN vocoder [17]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13278","last_updated":"2026-07-16T07:52:59Z","snapshot_observed_at":"2026-08-07T14:59:00.272205Z","submitted_at":"2026-07-14T21:29:17Z","title":"Adapting Diffusion-Based Music Synthesis to Speech and Singing Voice Conversion","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T05:42:55.926675Z"},"links":{"citing_paper":"/paper/2607.13278"},"observation_digest":"sha256:af7deee74fe572a9f26319774aedc78c6f4bbc0ebc673aec71f9fd9b3b53d830","observation_id":"b1ad2883-6a7e-49b7-91ec-280ce6d5d601","resolution":{"observed_at":"2026-08-02T05:42:55.926675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:42:56.075313Z","title":"completely different person,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13278","last_updated":"2026-07-16T07:52:59Z","snapshot_observed_at":"2026-08-07T14:59:00.272205Z","submitted_at":"2026-07-14T21:29:17Z","title":"Adapting Diffusion-Based Music Synthesis to Speech and Singing Voice Conversion","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T05:42:56.075313Z"},"links":{"citing_paper":"/paper/2607.13278"},"observation_digest":"sha256:934673eb21bdea695b607f4de21be836fd637e8f58df3964ddab72027be3b1e3","observation_id":"38e0aa8e-3051-46be-9277-36a5a710f9d2","resolution":{"observed_at":"2026-08-02T05:42:56.075313Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:42:56.232755Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13278","last_updated":"2026-07-16T07:52:59Z","snapshot_observed_at":"2026-08-07T14:59:00.272205Z","submitted_at":"2026-07-14T21:29:17Z","title":"Adapting Diffusion-Based Music Synthesis to Speech and Singing Voice Conversion","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T05:42:56.232755Z"},"links":{"citing_paper":"/paper/2607.13278"},"observation_digest":"sha256:4da12b3aaebb0e350541f072ebe32d432fa64968f2b0a45bd0bef648075d2fb7","observation_id":"b436b76d-67cd-4684-97ed-1f98665be0b3","resolution":{"observed_at":"2026-08-02T05:42:56.232755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:42:56.428388Z","title":"500643750 (MU 2686/15-1)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13278","last_updated":"2026-07-16T07:52:59Z","snapshot_observed_at":"2026-08-07T14:59:00.272205Z","submitted_at":"2026-07-14T21:29:17Z","title":"Adapting Diffusion-Based Music Synthesis to Speech and Singing Voice Conversion","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T05:42:56.428388Z"},"links":{"citing_paper":"/paper/2607.13278"},"observation_digest":"sha256:c87b93a05ac3488d167d3782e3628d138753fb3014be79e00fc2f73111f01651","observation_id":"79cac068-3f77-428f-89b4-36304c6ec928","resolution":{"observed_at":"2026-08-02T05:42:56.428388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:42:56.554187Z","title":"Diffusion-based voice conversion with fast maximum likelihood sampling scheme,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13278","last_updated":"2026-07-16T07:52:59Z","snapshot_observed_at":"2026-08-07T14:59:00.272205Z","submitted_at":"2026-07-14T21:29:17Z","title":"Adapting Diffusion-Based Music Synthesis to Speech and Singing Voice Conversion","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T05:42:56.554187Z"},"links":{"citing_paper":"/paper/2607.13278"},"observation_digest":"sha256:c8c8d21740a2518044ff0cc8f05d47fe912646c6021faec519d34c3bd48c8b55","observation_id":"a3124169-3351-413d-8735-8adf27b72eff","resolution":{"observed_at":"2026-08-02T05:42:56.554187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:42:56.647106Z","title":"DiffSinger: Singing voice synthesis via shallow diffusion mechanism,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13278","last_updated":"2026-07-16T07:52:59Z","snapshot_observed_at":"2026-08-07T14:59:00.272205Z","submitted_at":"2026-07-14T21:29:17Z","title":"Adapting Diffusion-Based Music Synthesis to Speech and Singing Voice Conversion","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T05:42:56.647106Z"},"links":{"citing_paper":"/paper/2607.13278"},"observation_digest":"sha256:0b7da92d1ef28ee8a56998a1dda32754854c89046e02153868f8373243f2519a","observation_id":"ce2583b1-9106-4b56-9ace-c8cc9f1e9830","resolution":{"observed_at":"2026-08-02T05:42:56.647106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:42:57.697864Z","title":"An overview of voice conversion and its challenges: From statistical modeling to deep learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13278","last_updated":"2026-07-16T07:52:59Z","snapshot_observed_at":"2026-08-07T14:59:00.272205Z","submitted_at":"2026-07-14T21:29:17Z","title":"Adapting Diffusion-Based Music Synthesis to Speech and Singing Voice Conversion","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T05:42:57.697864Z"},"links":{"citing_paper":"/paper/2607.13278"},"observation_digest":"sha256:d5392eb0cd489bc1635735e0ac85bd0cceb282be0414d8bfaedee45d10139f62","observation_id":"2d357ad7-6517-4d73-a4a3-be1bbd797971","resolution":{"observed_at":"2026-08-02T05:42:57.697864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:42:56.872722Z","title":"Expres- siveSinger: Multilingual and multi-style score-based singing voice synthesis with expressive performance control,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13278","last_updated":"2026-07-16T07:52:59Z","snapshot_observed_at":"2026-08-07T14:59:00.272205Z","submitted_at":"2026-07-14T21:29:17Z","title":"Adapting Diffusion-Based Music Synthesis to Speech and Singing Voice Conversion","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T05:42:56.872722Z"},"links":{"citing_paper":"/paper/2607.13278"},"observation_digest":"sha256:fc95ed93b59e7724ec72415b157b0816eb6dadf887d4b04afe5b5271307a4866","observation_id":"2ce2fd71-6cdc-4853-89f0-1fd34bee60fe","resolution":{"observed_at":"2026-08-02T05:42:56.872722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:42:56.970918Z","title":"Everyone- Can-Sing: Zero-shot singing voice synthesis and conversion with speech reference,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13278","last_updated":"2026-07-16T07:52:59Z","snapshot_observed_at":"2026-08-07T14:59:00.272205Z","submitted_at":"2026-07-14T21:29:17Z","title":"Adapting Diffusion-Based Music Synthesis to Speech and Singing Voice Conversion","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T05:42:56.970918Z"},"links":{"citing_paper":"/paper/2607.13278"},"observation_digest":"sha256:75fc53c8b6250053bef79a716f1f7a9f6c3bac6cacdf53173a88342981e16676","observation_id":"44e14be7-b8a4-4ae8-9416-8da2c86accef","resolution":{"observed_at":"2026-08-02T05:42:56.970918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:42:57.072171Z","title":"Multi-instrument music synthesis with spectrogram diffusion,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13278","last_updated":"2026-07-16T07:52:59Z","snapshot_observed_at":"2026-08-07T14:59:00.272205Z","submitted_at":"2026-07-14T21:29:17Z","title":"Adapting Diffusion-Based Music Synthesis to Speech and Singing Voice Conversion","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T05:42:57.072171Z"},"links":{"citing_paper":"/paper/2607.13278"},"observation_digest":"sha256:181e954ec5e08514a733003824c1f316fc95bac703076a758a7a29f130c8d924","observation_id":"fe384600-68c8-4b51-84d5-18a79ac1b4b5","resolution":{"observed_at":"2026-08-02T05:42:57.072171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:42:57.167511Z","title":"Per- formance conditioning for diffusion-based multi-instrument music synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13278","last_updated":"2026-07-16T07:52:59Z","snapshot_observed_at":"2026-08-07T14:59:00.272205Z","submitted_at":"2026-07-14T21:29:17Z","title":"Adapting Diffusion-Based Music Synthesis to Speech and Singing Voice Conversion","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T05:42:57.167511Z"},"links":{"citing_paper":"/paper/2607.13278"},"observation_digest":"sha256:b5707c5597e389742becd59ca1249ca408a7c1d478535ead211da4e3ece2b53d","observation_id":"2139c2d0-8cf6-4b8d-89d6-88db99bac30d","resolution":{"observed_at":"2026-08-02T05:42:57.167511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:42:57.319193Z","title":"Multi- aspect conditioning for diffusion-based music synthesis: En- hancing realism and acoustic control,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13278","last_updated":"2026-07-16T07:52:59Z","snapshot_observed_at":"2026-08-07T14:59:00.272205Z","submitted_at":"2026-07-14T21:29:17Z","title":"Adapting Diffusion-Based Music Synthesis to Speech and Singing Voice Conversion","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T05:42:57.319193Z"},"links":{"citing_paper":"/paper/2607.13278"},"observation_digest":"sha256:15886097dbb32cef332d043218ab6b4574961bafd40db3a6a7c67825ba778380","observation_id":"d1d1a0fd-fec2-4f39-8284-b3fc423a2396","resolution":{"observed_at":"2026-08-02T05:42:57.319193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:42:57.520009Z","title":"StarGAN- VC: Non-parallel many-to-many voice conversion using star generative adversarial networks,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.13278","last_updated":"2026-07-16T07:52:59Z","snapshot_observed_at":"2026-08-07T14:59:00.272205Z","submitted_at":"2026-07-14T21:29:17Z","title":"Adapting Diffusion-Based Music Synthesis to Speech and Singing Voice Conversion","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T05:42:57.520009Z"},"links":{"citing_paper":"/paper/2607.13278"},"observation_digest":"sha256:92307f463a2bcb59cc9dfe37aab97c61e15ee1fe215ea1ab7aab9424e63babbf","observation_id":"50832927-8976-4a0d-8dfe-3419521ed9a9","resolution":{"observed_at":"2026-08-02T05:42:57.520009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:42:58.456060Z","title":"Simple and controllable music gen- eration,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13278","last_updated":"2026-07-16T07:52:59Z","snapshot_observed_at":"2026-08-07T14:59:00.272205Z","submitted_at":"2026-07-14T21:29:17Z","title":"Adapting Diffusion-Based Music Synthesis to Speech and Singing Voice Conversion","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T05:42:58.456060Z"},"links":{"citing_paper":"/paper/2607.13278"},"observation_digest":"sha256:4a791f41924504a6cd20d00cd9cb6505cea5f5d4400599a6317a60d014ac9cd0","observation_id":"2d42b982-0b89-4b26-bd28-e7411cdab9ad","resolution":{"observed_at":"2026-08-02T05:42:58.456060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:42:57.810125Z","title":"Matcha-TTS: A fast TTS architecture with conditional flow matching,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13278","last_updated":"2026-07-16T07:52:59Z","snapshot_observed_at":"2026-08-07T14:59:00.272205Z","submitted_at":"2026-07-14T21:29:17Z","title":"Adapting Diffusion-Based Music Synthesis to Speech and Singing Voice Conversion","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T05:42:57.810125Z"},"links":{"citing_paper":"/paper/2607.13278"},"observation_digest":"sha256:269e15af953e0a991de4e036fcb09d14e7b87c8c82c316e7263fe68990074093","observation_id":"440c842c-c683-4b6b-87a9-8bb36e92fefa","resolution":{"observed_at":"2026-08-02T05:42:57.810125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:42:57.912421Z","title":"FlowMac: Con- ditional flow matching for audio coding at low bit rates,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13278","last_updated":"2026-07-16T07:52:59Z","snapshot_observed_at":"2026-08-07T14:59:00.272205Z","submitted_at":"2026-07-14T21:29:17Z","title":"Adapting Diffusion-Based Music Synthesis to Speech and Singing Voice Conversion","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T05:42:57.912421Z"},"links":{"citing_paper":"/paper/2607.13278"},"observation_digest":"sha256:280846d20595a3fc4cf0291364f7d6613b22776180354fa8af1735a32674426c","observation_id":"5dea6aab-b77c-4113-afc9-4ff5e9f453ad","resolution":{"observed_at":"2026-08-02T05:42:57.912421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:42:58.015661Z","title":"PAD-VC: A prosody-aware decoder for any- to-few voice conversion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13278","last_updated":"2026-07-16T07:52:59Z","snapshot_observed_at":"2026-08-07T14:59:00.272205Z","submitted_at":"2026-07-14T21:29:17Z","title":"Adapting Diffusion-Based Music Synthesis to Speech and Singing Voice Conversion","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T05:42:58.015661Z"},"links":{"citing_paper":"/paper/2607.13278"},"observation_digest":"sha256:5716c18bcfc270671c2487fb962dd914474d87a1dab32f11a2cbe488a1c5b74e","observation_id":"318a15ba-d87d-430e-9436-5faabc834160","resolution":{"observed_at":"2026-08-02T05:42:58.015661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:42:58.132976Z","title":"High-fidelity neu- ral phonetic posteriorgrams,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13278","last_updated":"2026-07-16T07:52:59Z","snapshot_observed_at":"2026-08-07T14:59:00.272205Z","submitted_at":"2026-07-14T21:29:17Z","title":"Adapting Diffusion-Based Music Synthesis to Speech and Singing Voice Conversion","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T05:42:58.132976Z"},"links":{"citing_paper":"/paper/2607.13278"},"observation_digest":"sha256:ae2235042d02e749d975e5d92825e913d1c03850d65435cc65f6a1d119f1f4dc","observation_id":"c237d231-a133-4cc0-95a3-9354be1749ad","resolution":{"observed_at":"2026-08-02T05:42:58.132976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:42:58.276776Z","title":"SingStyle111: A multilingual singing dataset with style trans- fer,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13278","last_updated":"2026-07-16T07:52:59Z","snapshot_observed_at":"2026-08-07T14:59:00.272205Z","submitted_at":"2026-07-14T21:29:17Z","title":"Adapting Diffusion-Based Music Synthesis to Speech and Singing Voice Conversion","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T05:42:58.276776Z"},"links":{"citing_paper":"/paper/2607.13278"},"observation_digest":"sha256:e9a06f16a420ae880fff86e772735795d1e77945b921b33487ae9edee6327fc0","observation_id":"1cb7ec2d-9fe0-410b-a735-0a931cc6a2dd","resolution":{"observed_at":"2026-08-02T05:42:58.276776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:42:58.375252Z","title":"NaturalSpeech 2: Latent diffusion models are natural and zero-shot speech and singing synthesizers,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13278","last_updated":"2026-07-16T07:52:59Z","snapshot_observed_at":"2026-08-07T14:59:00.272205Z","submitted_at":"2026-07-14T21:29:17Z","title":"Adapting Diffusion-Based Music Synthesis to Speech and Singing Voice Conversion","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T05:42:58.375252Z"},"links":{"citing_paper":"/paper/2607.13278"},"observation_digest":"sha256:95b482803567b572dfb7198600f74f49bcb00112de831e799630a4f1d14c6a5d","observation_id":"b2c0a674-e693-429d-b027-96fc885a8b93","resolution":{"observed_at":"2026-08-02T05:42:58.375252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:42:58.866612Z","title":"Hybrid transformers for music source separation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13278","last_updated":"2026-07-16T07:52:59Z","snapshot_observed_at":"2026-08-07T14:59:00.272205Z","submitted_at":"2026-07-14T21:29:17Z","title":"Adapting Diffusion-Based Music Synthesis to Speech and Singing Voice Conversion","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T05:42:58.866612Z"},"links":{"citing_paper":"/paper/2607.13278"},"observation_digest":"sha256:fe4d407bc16abc50cf9a3361c2fb6831601cbb17803783b2726c5db10c7f8ad5","observation_id":"7cbb7213-1648-42e1-9a34-9a9891bf9155","resolution":{"observed_at":"2026-08-02T05:42:58.866612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:42:58.539092Z","title":"BigVGAN: A universal neural vocoder with large-scale train- ing,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13278","last_updated":"2026-07-16T07:52:59Z","snapshot_observed_at":"2026-08-07T14:59:00.272205Z","submitted_at":"2026-07-14T21:29:17Z","title":"Adapting Diffusion-Based Music Synthesis to Speech and Singing Voice Conversion","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T05:42:58.539092Z"},"links":{"citing_paper":"/paper/2607.13278"},"observation_digest":"sha256:67930cd8228d8c8d68bee0819b802600f01463f0ca17334d523def4797324f35","observation_id":"24d416ad-4ec7-4d13-9fc2-993f50786275","resolution":{"observed_at":"2026-08-02T05:42:58.539092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:42:58.597933Z","title":"FiLM: Visual reasoning with a general conditioning layer,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.13278","last_updated":"2026-07-16T07:52:59Z","snapshot_observed_at":"2026-08-07T14:59:00.272205Z","submitted_at":"2026-07-14T21:29:17Z","title":"Adapting Diffusion-Based Music Synthesis to Speech and Singing Voice Conversion","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T05:42:58.597933Z"},"links":{"citing_paper":"/paper/2607.13278"},"observation_digest":"sha256:d2a6e6ec30bd947ed7cad455a0b9fedca842ca8f2dc144dc05776cd77483ac72","observation_id":"cd3bd408-7748-41a0-a687-a1cea94706ed","resolution":{"observed_at":"2026-08-02T05:42:58.597933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-14T06:37:15.299690Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-02T05:42:58.648482Z","title":"Classifier-free diffusion guidance,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13278","last_updated":"2026-07-16T07:52:59Z","snapshot_observed_at":"2026-08-07T14:59:00.272205Z","submitted_at":"2026-07-14T21:29:17Z","title":"Adapting Diffusion-Based Music Synthesis to Speech and Singing Voice Conversion","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T05:42:58.648482Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2607.13278"},"observation_digest":"sha256:dd23db89b6441ff03fe14b34bce3c841d7b4846d302d77488cde22ab1235a670","observation_id":"f1559db2-605a-4496-976f-b60b999a59cb","resolution":{"observed_at":"2026-08-02T05:42:58.648482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:42:58.732592Z","title":"CREPE: A con- volutional representation for pitch estimation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.13278","last_updated":"2026-07-16T07:52:59Z","snapshot_observed_at":"2026-08-07T14:59:00.272205Z","submitted_at":"2026-07-14T21:29:17Z","title":"Adapting Diffusion-Based Music Synthesis to Speech and Singing Voice Conversion","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T05:42:58.732592Z"},"links":{"citing_paper":"/paper/2607.13278"},"observation_digest":"sha256:57cfb78f055fd3483dbd1115bb2f2df5f85c9fb6e42c55dacc990c1428f0673e","observation_id":"580ab115-1d8e-42ed-b35d-89d014d2cc0f","resolution":{"observed_at":"2026-08-02T05:42:58.732592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:42:58.791069Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech rep- resentations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.13278","last_updated":"2026-07-16T07:52:59Z","snapshot_observed_at":"2026-08-07T14:59:00.272205Z","submitted_at":"2026-07-14T21:29:17Z","title":"Adapting Diffusion-Based Music Synthesis to Speech and Singing Voice Conversion","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T05:42:58.791069Z"},"links":{"citing_paper":"/paper/2607.13278"},"observation_digest":"sha256:78de5fc200cd31e204c1cd82572c119ee43770ef09f64c23e0f1c05ab8a4921b","observation_id":"0c4afe25-a42c-4a74-b583-b12a696e6396","resolution":{"observed_at":"2026-08-02T05:42:58.791069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:42:58.862919Z","title":"XLS-R: Self-supervised cross-lingual speech representation learning at scale,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13278","last_updated":"2026-07-16T07:52:59Z","snapshot_observed_at":"2026-08-07T14:59:00.272205Z","submitted_at":"2026-07-14T21:29:17Z","title":"Adapting Diffusion-Based Music Synthesis to Speech and Singing Voice Conversion","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T05:42:58.862919Z"},"links":{"citing_paper":"/paper/2607.13278"},"observation_digest":"sha256:ffcefd9556819ef91a82057e14924e3035d94e2e2592ab26ca1b17c0f64583e5","observation_id":"d4eaf040-aed7-4ce3-8fc0-5753276e29a7","resolution":{"observed_at":"2026-08-02T05:42:58.862919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:42:59.612229Z","title":"Schubert Winterreise dataset: A multimodal scenario for music analysis,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13278","last_updated":"2026-07-16T07:52:59Z","snapshot_observed_at":"2026-08-07T14:59:00.272205Z","submitted_at":"2026-07-14T21:29:17Z","title":"Adapting Diffusion-Based Music Synthesis to Speech and Singing Voice Conversion","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T05:42:59.612229Z"},"links":{"citing_paper":"/paper/2607.13278"},"observation_digest":"sha256:ac46e77e7193fad500d5bdffaefe0deea071bf6b3154a22e80fde5d5f611f80f","observation_id":"01395bc0-fee1-4007-84c1-e179f7acdcc8","resolution":{"observed_at":"2026-08-02T05:42:59.612229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:42:58.891463Z","title":"Onsets and Frames: Dual-objective piano transcription,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.13278","last_updated":"2026-07-16T07:52:59Z","snapshot_observed_at":"2026-08-07T14:59:00.272205Z","submitted_at":"2026-07-14T21:29:17Z","title":"Adapting Diffusion-Based Music Synthesis to Speech and Singing Voice Conversion","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T05:42:58.891463Z"},"links":{"citing_paper":"/paper/2607.13278"},"observation_digest":"sha256:4599ea2f17496e3afdb63b3b3ba49b478f36e5064c191c528972cc246df90691","observation_id":"cd4cacfd-35e7-4c19-a9ec-32cb92157f3f","resolution":{"observed_at":"2026-08-02T05:42:58.891463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:42:58.926796Z","title":"Enabling factorized piano music modeling and generation with the MAESTRO dataset,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.13278","last_updated":"2026-07-16T07:52:59Z","snapshot_observed_at":"2026-08-07T14:59:00.272205Z","submitted_at":"2026-07-14T21:29:17Z","title":"Adapting Diffusion-Based Music Synthesis to Speech and Singing Voice Conversion","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T05:42:58.926796Z"},"links":{"citing_paper":"/paper/2607.13278"},"observation_digest":"sha256:68d1f0de0739ea636c89987ef64035b5288db146d871397b3d3fc5fd26f1031d","observation_id":"0a8d2515-8d64-43fb-a36b-e51a06485fcd","resolution":{"observed_at":"2026-08-02T05:42:58.926796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:42:59.044184Z","title":"Unaligned supervision for au- tomatic music transcription in the wild,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13278","last_updated":"2026-07-16T07:52:59Z","snapshot_observed_at":"2026-08-07T14:59:00.272205Z","submitted_at":"2026-07-14T21:29:17Z","title":"Adapting Diffusion-Based Music Synthesis to Speech and Singing Voice Conversion","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T05:42:59.044184Z"},"links":{"citing_paper":"/paper/2607.13278"},"observation_digest":"sha256:7b370e10cd8aa265a8d2c91571fef3451cb5e6b7bd8c468f74dba176c5e37993","observation_id":"87d8f3df-0168-4f5b-b70c-af3e5c8fd6d0","resolution":{"observed_at":"2026-08-02T05:42:59.044184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:42:59.145050Z","title":"Count The Notes: Histogram-based supervision for automatic music tran- scription,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13278","last_updated":"2026-07-16T07:52:59Z","snapshot_observed_at":"2026-08-07T14:59:00.272205Z","submitted_at":"2026-07-14T21:29:17Z","title":"Adapting Diffusion-Based Music Synthesis to Speech and Singing Voice Conversion","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T05:42:59.145050Z"},"links":{"citing_paper":"/paper/2607.13278"},"observation_digest":"sha256:0de8f95530dfe5d090bde4560752b72bdbad8066a988be26cdf953adc659f885","observation_id":"06b02c16-231e-4477-93b9-c10d75ee119c","resolution":{"observed_at":"2026-08-02T05:42:59.145050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:42:59.297638Z","title":"Towards learning a universal non-semantic representation of speech,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.13278","last_updated":"2026-07-16T07:52:59Z","snapshot_observed_at":"2026-08-07T14:59:00.272205Z","submitted_at":"2026-07-14T21:29:17Z","title":"Adapting Diffusion-Based Music Synthesis to Speech and Singing Voice Conversion","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T05:42:59.297638Z"},"links":{"citing_paper":"/paper/2607.13278"},"observation_digest":"sha256:6db18d0b14b76ecb981b081c4fc2b8d26db478330c5afabbd5e3bf6bfeb96338","observation_id":"8b0751c0-baeb-4bb5-8d7b-823e0dc3e948","resolution":{"observed_at":"2026-08-02T05:42:59.297638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:42:59.456524Z","title":"Bridging the training–inference gap in TTS: Training strategies for robust generative postprocessing for low-resource speakers,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13278","last_updated":"2026-07-16T07:52:59Z","snapshot_observed_at":"2026-08-07T14:59:00.272205Z","submitted_at":"2026-07-14T21:29:17Z","title":"Adapting Diffusion-Based Music Synthesis to Speech and Singing Voice Conversion","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T05:42:59.456524Z"},"links":{"citing_paper":"/paper/2607.13278"},"observation_digest":"sha256:064bf3e5093498fb2c785dc483b3db105f225feac3082557bcd802fca5f1c77c","observation_id":"8925945e-e0e5-447f-857b-55dee9589c88","resolution":{"observed_at":"2026-08-02T05:42:59.456524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:43:00.285800Z","title":"Jensen–Shannon divergence and Hilbert space embedding,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2607.13278","last_updated":"2026-07-16T07:52:59Z","snapshot_observed_at":"2026-08-07T14:59:00.272205Z","submitted_at":"2026-07-14T21:29:17Z","title":"Adapting Diffusion-Based Music Synthesis to Speech and Singing Voice Conversion","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T05:43:00.285800Z"},"links":{"citing_paper":"/paper/2607.13278"},"observation_digest":"sha256:05b48affc00dad9b10f59fa24cac36f89f890cfa315cecca62fcead5f97aa1d6","observation_id":"7edfae29-0b21-4f0f-8098-bf076fce0c03","resolution":{"observed_at":"2026-08-02T05:43:00.285800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:42:59.780120Z","title":"Fr ´echet Audio Distance: A reference-free metric for evaluating music enhancement algorithms,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.13278","last_updated":"2026-07-16T07:52:59Z","snapshot_observed_at":"2026-08-07T14:59:00.272205Z","submitted_at":"2026-07-14T21:29:17Z","title":"Adapting Diffusion-Based Music Synthesis to Speech and Singing Voice Conversion","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T05:42:59.780120Z"},"links":{"citing_paper":"/paper/2607.13278"},"observation_digest":"sha256:b631493e73616cb9cff96b44ec7c0cf70f3e126a1cba1fa302f1ce907977bc9c","observation_id":"7c290ee8-3722-419c-b744-c0c6dd63e50d","resolution":{"observed_at":"2026-08-02T05:42:59.780120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:42:59.892013Z","title":"ITU-R Rec. BS.1534-3: Method for the subjective assessment of interme- diate quality levels of coding systems,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.13278","last_updated":"2026-07-16T07:52:59Z","snapshot_observed_at":"2026-08-07T14:59:00.272205Z","submitted_at":"2026-07-14T21:29:17Z","title":"Adapting Diffusion-Based Music Synthesis to Speech and Singing Voice Conversion","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T05:42:59.892013Z"},"links":{"citing_paper":"/paper/2607.13278"},"observation_digest":"sha256:a2d939efb8e1cfe062204136b907002884ac4cff36a5cbace5d24e3a53a06cda","observation_id":"515f9d98-20ae-40a4-b573-73589c73d184","resolution":{"observed_at":"2026-08-02T05:42:59.892013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:42:59.902579Z","title":"webMUSHRA—a comprehen- sive framework for web-based listening tests,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.13278","last_updated":"2026-07-16T07:52:59Z","snapshot_observed_at":"2026-08-07T14:59:00.272205Z","submitted_at":"2026-07-14T21:29:17Z","title":"Adapting Diffusion-Based Music Synthesis to Speech and Singing Voice Conversion","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T05:42:59.902579Z"},"links":{"citing_paper":"/paper/2607.13278"},"observation_digest":"sha256:76c5ad5837d4d8342bcb71750422cc207ac2bf51c9960a1ce12bc545eaf55884","observation_id":"2001e496-a060-47f6-9528-ec8b0276afd6","resolution":{"observed_at":"2026-08-02T05:42:59.902579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:42:59.982555Z","title":"Melody transcription from music audio: Ap- proaches and evaluation,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2607.13278","last_updated":"2026-07-16T07:52:59Z","snapshot_observed_at":"2026-08-07T14:59:00.272205Z","submitted_at":"2026-07-14T21:29:17Z","title":"Adapting Diffusion-Based Music Synthesis to Speech and Singing Voice Conversion","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T05:42:59.982555Z"},"links":{"citing_paper":"/paper/2607.13278"},"observation_digest":"sha256:5559284e9c16dd32650226c03d35a0dce1ebc74656b291a1715ed1ece6ffa706","observation_id":"9a39fa90-9536-4978-a36b-f1ac3783d6e9","resolution":{"observed_at":"2026-08-02T05:42:59.982555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:43:00.083433Z","title":"Melody extraction from poly- phonic music signals using pitch contour characteristics,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.13278","last_updated":"2026-07-16T07:52:59Z","snapshot_observed_at":"2026-08-07T14:59:00.272205Z","submitted_at":"2026-07-14T21:29:17Z","title":"Adapting Diffusion-Based Music Synthesis to Speech and Singing Voice Conversion","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T05:43:00.083433Z"},"links":{"citing_paper":"/paper/2607.13278"},"observation_digest":"sha256:075093fbad20fd54d596de653e05c80455b3edffef715a1132ab8c3d70c58a3e","observation_id":"74c85c7e-8d73-4f46-a6a9-9d24319c01b5","resolution":{"observed_at":"2026-08-02T05:43:00.083433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:43:00.184615Z","title":"MIR EV AL: A transparent im- plementation of common MIR metrics,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.13278","last_updated":"2026-07-16T07:52:59Z","snapshot_observed_at":"2026-08-07T14:59:00.272205Z","submitted_at":"2026-07-14T21:29:17Z","title":"Adapting Diffusion-Based Music Synthesis to Speech and Singing Voice Conversion","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T05:43:00.184615Z"},"links":{"citing_paper":"/paper/2607.13278"},"observation_digest":"sha256:bc05fadfb8c87d11fe06acd807810419732c86635d78537c8a269cfa3f8ea2a0","observation_id":"55e81e26-1c9a-484b-a99b-b405e63efeee","resolution":{"observed_at":"2026-08-02T05:43:00.184615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:43:00.320438Z","title":"Markov processes over denumerable prod- ucts of spaces, describing large systems of automata,","venue":null,"work_id":null,"year":1969},"citing_paper":{"arxiv_id":"2607.13278","last_updated":"2026-07-16T07:52:59Z","snapshot_observed_at":"2026-08-07T14:59:00.272205Z","submitted_at":"2026-07-14T21:29:17Z","title":"Adapting Diffusion-Based Music Synthesis to Speech and Singing Voice Conversion","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T05:43:00.320438Z"},"links":{"citing_paper":"/paper/2607.13278"},"observation_digest":"sha256:8bc0d8e75997c70177b6fe0f9b5771e68b686b25bd8670a6ff5a5a94220f3493","observation_id":"59db7761-fe49-4ef4-8526-fb6d97597c6b","resolution":{"observed_at":"2026-08-02T05:43:00.320438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:42:56.746440Z","title":"11 020–11 028","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13278","last_updated":"2026-07-16T07:52:59Z","snapshot_observed_at":"2026-08-07T14:59:00.272205Z","submitted_at":"2026-07-14T21:29:17Z","title":"Adapting Diffusion-Based Music Synthesis to Speech and Singing Voice Conversion","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-02T05:42:56.746440Z"},"links":{"citing_paper":"/paper/2607.13278"},"observation_digest":"sha256:201684c67b44fcb3d8003e6fa37571eefee1a4ecc0fcf86d5a4d60606ff65700","observation_id":"e2b95b7c-ff9e-4100-a14d-dcee5e993cb1","resolution":{"observed_at":"2026-08-02T05:42:56.746440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.13278","last_updated":"2026-07-16T07:52:59Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T14:59:00.272205Z","submitted_at":"2026-07-14T21:29:17Z","title":"Adapting Diffusion-Based Music Synthesis to Speech and Singing Voice Conversion"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 1 inbound Pith citation observation for arXiv:2607.13278."}