{"as_of":"2026-08-20T10:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ccc14ee956c5f05cb50477cbe0587acca5238b12fc2092273e5037538f6b0b5a","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T21:47:38.884362Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.04722/citation-record","integrity":"/paper/2502.04722/integrity","json":"/paper/2502.04722/citation-record.json","paper":"/paper/2502.04722"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:47:39.545561Z","title":"Statis- tical singing voice conversion with direct waveform modification based on the spectrum differential,","venue":null,"work_id":"13d0c683-2fe9-4af1-93e1-d79a62ee2679","year":2014},"citing_paper":{"arxiv_id":"2502.04722","last_updated":"2025-02-07T07:46:19Z","snapshot_observed_at":"2026-08-19T09:44:57.796571Z","submitted_at":"2025-02-07T07:46:19Z","title":"Singing Voice Conversion with Accompaniment Using Self-Supervised Representation-Based Melody Features","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T21:47:38.767039Z"},"links":{"citing_paper":"/paper/2502.04722"},"observation_digest":"sha256:4abe5954f621e334d5a2aef7fd87f6ec9aa4a5885fcbbfe8c5411bfd91cf25b6","observation_id":"1a876234-d382-4d78-9eb0-bae2b43cd25d","resolution":{"observed_at":"2026-08-08T21:47:39.549002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:47:39.535684Z","title":"Applying voice conversion to concate- native singing-voice synthesis,","venue":null,"work_id":"4116cd64-bc58-4af2-a7fd-bfd56c03f563","year":2010},"citing_paper":{"arxiv_id":"2502.04722","last_updated":"2025-02-07T07:46:19Z","snapshot_observed_at":"2026-08-19T09:44:57.796571Z","submitted_at":"2025-02-07T07:46:19Z","title":"Singing Voice Conversion with Accompaniment Using Self-Supervised Representation-Based Melody Features","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T21:47:38.771066Z"},"links":{"citing_paper":"/paper/2502.04722"},"observation_digest":"sha256:ac21a61c691d1ab2bfda7f5b75a1be0b086fb7338721f9d68f0f36b6ff17a9df","observation_id":"1f2c4eee-d9b0-4903-b57d-60226089b912","resolution":{"observed_at":"2026-08-08T21:47:39.538996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:47:39.526610Z","title":"Statisti- cal singing voice conversion based on direct waveform modification with global variance,","venue":null,"work_id":"55e04f0e-7a58-487d-9126-d4f77fa692cc","year":2015},"citing_paper":{"arxiv_id":"2502.04722","last_updated":"2025-02-07T07:46:19Z","snapshot_observed_at":"2026-08-19T09:44:57.796571Z","submitted_at":"2025-02-07T07:46:19Z","title":"Singing Voice Conversion with Accompaniment Using Self-Supervised Representation-Based Melody Features","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T21:47:38.776699Z"},"links":{"citing_paper":"/paper/2502.04722"},"observation_digest":"sha256:4cdf45d34ac9627f39f28102f7aea4fbe7881e1fc3d9e5f10f503b6b6de27ebc","observation_id":"3bff0cd5-97cc-4b7e-864a-8e77c8abfabd","resolution":{"observed_at":"2026-08-08T21:47:39.529931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:47:39.517379Z","title":"One-to-many and many-to-one voice conversion based on eigenvoices,","venue":null,"work_id":"9bc46777-4f0c-4524-a834-15bbce606a8e","year":2007},"citing_paper":{"arxiv_id":"2502.04722","last_updated":"2025-02-07T07:46:19Z","snapshot_observed_at":"2026-08-19T09:44:57.796571Z","submitted_at":"2025-02-07T07:46:19Z","title":"Singing Voice Conversion with Accompaniment Using Self-Supervised Representation-Based Melody Features","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T21:47:38.780401Z"},"links":{"citing_paper":"/paper/2502.04722"},"observation_digest":"sha256:bee9f35ee0527341afcf59f5a24906937ddff86edd58293ad53650381b68b042","observation_id":"96236bf1-79f5-4534-9e39-b8bff5455fc8","resolution":{"observed_at":"2026-08-08T21:47:39.520597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:47:39.507997Z","title":"Ppg-based singing voice conversion with adversarial representation learning,","venue":null,"work_id":"51d42df7-3e43-44f6-80a5-f437d13b4549","year":2021},"citing_paper":{"arxiv_id":"2502.04722","last_updated":"2025-02-07T07:46:19Z","snapshot_observed_at":"2026-08-19T09:44:57.796571Z","submitted_at":"2025-02-07T07:46:19Z","title":"Singing Voice Conversion with Accompaniment Using Self-Supervised Representation-Based Melody Features","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T21:47:38.784278Z"},"links":{"citing_paper":"/paper/2502.04722"},"observation_digest":"sha256:c009f9bac344ef8a4a72141dbe2d00185e08e77e526d6262039d804c0a1769a3","observation_id":"2eb97cf9-4821-4d7a-9280-f6b6136afc39","resolution":{"observed_at":"2026-08-08T21:47:39.511418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:47:39.497973Z","title":"Phonetic pos- teriorgrams for many-to-one voice conversion without parallel data training,","venue":null,"work_id":"0ed1b6d1-2b51-4d7e-a012-3aa486821886","year":2016},"citing_paper":{"arxiv_id":"2502.04722","last_updated":"2025-02-07T07:46:19Z","snapshot_observed_at":"2026-08-19T09:44:57.796571Z","submitted_at":"2025-02-07T07:46:19Z","title":"Singing Voice Conversion with Accompaniment Using Self-Supervised Representation-Based Melody Features","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T21:47:38.787843Z"},"links":{"citing_paper":"/paper/2502.04722"},"observation_digest":"sha256:ba943ed568e6c4bb53d3a378b813e3a9975dee736664480e113e4a56ad1c5ca4","observation_id":"e8a91161-e1a9-48d1-8b0a-b1e46d96a370","resolution":{"observed_at":"2026-08-08T21:47:39.501697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:47:39.488017Z","title":"Vits-based singing voice conversion leveraging whisper and multi-scale f0 modeling,","venue":null,"work_id":"cf4ff874-ed6c-4b00-964f-51ef9b45e748","year":2023},"citing_paper":{"arxiv_id":"2502.04722","last_updated":"2025-02-07T07:46:19Z","snapshot_observed_at":"2026-08-19T09:44:57.796571Z","submitted_at":"2025-02-07T07:46:19Z","title":"Singing Voice Conversion with Accompaniment Using Self-Supervised Representation-Based Melody Features","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T21:47:38.791434Z"},"links":{"citing_paper":"/paper/2502.04722"},"observation_digest":"sha256:c075dcd8b4c7d1807bdcafa1eecf9287540c91e881b588ec348de8d4e7c919a8","observation_id":"8266b5f5-65c4-4d57-90f2-2dad5d9b5db4","resolution":{"observed_at":"2026-08-08T21:47:39.491859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:47:39.478484Z","title":"Self- supervised representations for singing voice conversion,","venue":null,"work_id":"63a10bd7-8b83-4246-b22b-325f379fd4a3","year":2023},"citing_paper":{"arxiv_id":"2502.04722","last_updated":"2025-02-07T07:46:19Z","snapshot_observed_at":"2026-08-19T09:44:57.796571Z","submitted_at":"2025-02-07T07:46:19Z","title":"Singing Voice Conversion with Accompaniment Using Self-Supervised Representation-Based Melody Features","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T21:47:38.794482Z"},"links":{"citing_paper":"/paper/2502.04722"},"observation_digest":"sha256:f200861a9c7cd26ea3079d611dc57075f8a47bd68062c28226a49233f8ac41fa","observation_id":"17dcc011-4a08-4216-973e-1dbba57cbb7e","resolution":{"observed_at":"2026-08-08T21:47:39.481796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2008.03009","last_updated":"2020-08-07T06:41:13Z","snapshot_observed_at":"2026-07-06T09:45:16.629116Z","submitted_at":"2020-08-07T06:41:13Z","title":"DurIAN-SC: Duration Informed Attention Network based Singing Voice Conversion System","version":1},"cited_work":{"arxiv_id":"2008.03009","doi":null,"metadata_source":"pith","pith_arxiv_id":"2008.03009","snapshot_observed_at":"2026-08-08T21:47:39.270037Z","title":"DurIAN-SC: Duration Informed Attention Network based Singing Voice Conversion System","venue":"eess.AS","work_id":"c2fe5629-54c6-42ad-8196-1cbff6811572","year":2020},"citing_paper":{"arxiv_id":"2502.04722","last_updated":"2025-02-07T07:46:19Z","snapshot_observed_at":"2026-08-19T09:44:57.796571Z","submitted_at":"2025-02-07T07:46:19Z","title":"Singing Voice Conversion with Accompaniment Using Self-Supervised Representation-Based Melody Features","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T21:47:38.797674Z"},"links":{"cited_paper":"/paper/2008.03009","citing_paper":"/paper/2502.04722"},"observation_digest":"sha256:803cbb517bcba9b8e0297cb6a238fbcba2caf7ed860bfd050ea3a8d819f00ea6","observation_id":"c99e0cc2-c77c-4a43-9a0a-09f7b3629de4","resolution":{"observed_at":"2026-08-08T21:47:39.273555Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:47:39.468667Z","title":"Hierarchical disentangled representation learning for singing voice conversion,","venue":null,"work_id":"fb706ee7-d25f-4e64-93ef-6495abe124cd","year":2021},"citing_paper":{"arxiv_id":"2502.04722","last_updated":"2025-02-07T07:46:19Z","snapshot_observed_at":"2026-08-19T09:44:57.796571Z","submitted_at":"2025-02-07T07:46:19Z","title":"Singing Voice Conversion with Accompaniment Using Self-Supervised Representation-Based Melody Features","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T21:47:38.801177Z"},"links":{"citing_paper":"/paper/2502.04722"},"observation_digest":"sha256:1512d39791603b1a90c706e6754c8356b01236e48b2f0fda8d47ede0e941b2d0","observation_id":"b06c27aa-b0fc-4604-baec-78435a381f87","resolution":{"observed_at":"2026-08-08T21:47:39.472219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:47:39.458787Z","title":"Fastsvc: Fast cross-domain singing voice conversion with feature-wise linear modulation,","venue":null,"work_id":"aa31b4c8-c656-40d5-ab92-b7f60c80bdf8","year":2021},"citing_paper":{"arxiv_id":"2502.04722","last_updated":"2025-02-07T07:46:19Z","snapshot_observed_at":"2026-08-19T09:44:57.796571Z","submitted_at":"2025-02-07T07:46:19Z","title":"Singing Voice Conversion with Accompaniment Using Self-Supervised Representation-Based Melody Features","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T21:47:38.804258Z"},"links":{"citing_paper":"/paper/2502.04722"},"observation_digest":"sha256:da1ebfb26325d35981c19eaed548d1a05620b6b9bfa76151140466396bfd5f5c","observation_id":"23b4fdbe-0a70-46a8-8ccc-d596fb3ef7e1","resolution":{"observed_at":"2026-08-08T21:47:39.462269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:47:39.448665Z","title":"Singing voice conversion with disentangled representations of singer and vocal tech- nique using variational autoencoders,","venue":null,"work_id":"e41e3a5a-ed40-402e-a439-739b879112b7","year":2020},"citing_paper":{"arxiv_id":"2502.04722","last_updated":"2025-02-07T07:46:19Z","snapshot_observed_at":"2026-08-19T09:44:57.796571Z","submitted_at":"2025-02-07T07:46:19Z","title":"Singing Voice Conversion with Accompaniment Using Self-Supervised Representation-Based Melody Features","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T21:47:38.807441Z"},"links":{"citing_paper":"/paper/2502.04722"},"observation_digest":"sha256:7cbb805f8cecfbaa5874ea2c4b48b53a519a21fa9f5df256cd5dc378a04eedad","observation_id":"0ff21ca2-239f-43fd-9356-a40025cc6f00","resolution":{"observed_at":"2026-08-08T21:47:39.452345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:47:39.437943Z","title":"Diffsvc: A diffusion probabilistic model for singing voice conversion,","venue":null,"work_id":"4a393da6-a0d0-474e-80b1-a1927b57f644","year":2021},"citing_paper":{"arxiv_id":"2502.04722","last_updated":"2025-02-07T07:46:19Z","snapshot_observed_at":"2026-08-19T09:44:57.796571Z","submitted_at":"2025-02-07T07:46:19Z","title":"Singing Voice Conversion with Accompaniment Using Self-Supervised Representation-Based Melody Features","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T21:47:38.810668Z"},"links":{"citing_paper":"/paper/2502.04722"},"observation_digest":"sha256:50aca0d27e3c27a6e17bad131aead3222b4968b525dffd400a59b1667f487adc","observation_id":"c7a6758b-2901-4b5a-9d90-19835695463e","resolution":{"observed_at":"2026-08-08T21:47:39.441474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:47:39.427763Z","title":"pyin: A fundamental frequency estimator using probabilistic threshold distributions,","venue":null,"work_id":"2dfd2e44-a2e3-4095-96a3-d69f90abe003","year":2014},"citing_paper":{"arxiv_id":"2502.04722","last_updated":"2025-02-07T07:46:19Z","snapshot_observed_at":"2026-08-19T09:44:57.796571Z","submitted_at":"2025-02-07T07:46:19Z","title":"Singing Voice Conversion with Accompaniment Using Self-Supervised Representation-Based Melody Features","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T21:47:38.813705Z"},"links":{"citing_paper":"/paper/2502.04722"},"observation_digest":"sha256:1e41c0799a386f5ccee95b58dc2a402bd218d51ca010b534f6afe35e885e1a64","observation_id":"ec8a8477-2d1f-4a5d-87a7-6795378de9c8","resolution":{"observed_at":"2026-08-08T21:47:39.431309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:47:39.417691Z","title":"Hifi-svc: Fast high fidelity cross-domain singing voice conversion,","venue":null,"work_id":"f3660780-ce58-4bdb-92d1-52f8f41a2110","year":2022},"citing_paper":{"arxiv_id":"2502.04722","last_updated":"2025-02-07T07:46:19Z","snapshot_observed_at":"2026-08-19T09:44:57.796571Z","submitted_at":"2025-02-07T07:46:19Z","title":"Singing Voice Conversion with Accompaniment Using Self-Supervised Representation-Based Melody Features","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T21:47:38.816655Z"},"links":{"citing_paper":"/paper/2502.04722"},"observation_digest":"sha256:ace9fb350bd6a2af32992d327f7b22e56e38cf4e90115df529b51e5d8c938d70","observation_id":"3b7e9c03-babd-43e7-aa46-87b817a64725","resolution":{"observed_at":"2026-08-08T21:47:39.421385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:47:39.407818Z","title":"Crepe: A convolutional representation for pitch estimation,","venue":null,"work_id":"40e9e424-a6c6-4fbb-815b-12c806afbd0c","year":2018},"citing_paper":{"arxiv_id":"2502.04722","last_updated":"2025-02-07T07:46:19Z","snapshot_observed_at":"2026-08-19T09:44:57.796571Z","submitted_at":"2025-02-07T07:46:19Z","title":"Singing Voice Conversion with Accompaniment Using Self-Supervised Representation-Based Melody Features","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T21:47:38.819918Z"},"links":{"citing_paper":"/paper/2502.04722"},"observation_digest":"sha256:da24eb8cd53ec1846fa6d2db179764643f932b37cd4ddd8bb19957b06d900d9e","observation_id":"40dc0a55-662d-44d5-8275-6594a328e181","resolution":{"observed_at":"2026-08-08T21:47:39.411272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04754","last_updated":"2021-10-10T10:27:20Z","snapshot_observed_at":"2026-08-16T17:50:34.162965Z","submitted_at":"2021-10-10T10:27:20Z","title":"Towards High-fidelity Singing Voice Conversion with Acoustic Reference and Contrastive Predictive Coding","version":1},"cited_work":{"arxiv_id":"2110.04754","doi":null,"metadata_source":"pith","pith_arxiv_id":"2110.04754","snapshot_observed_at":"2026-08-08T21:47:39.255739Z","title":"Towards High-fidelity Singing Voice Conversion with Acoustic Reference and Contrastive Predictive Coding","venue":"cs.SD","work_id":"f8a2834f-827d-455f-8487-8168dad4b158","year":2021},"citing_paper":{"arxiv_id":"2502.04722","last_updated":"2025-02-07T07:46:19Z","snapshot_observed_at":"2026-08-19T09:44:57.796571Z","submitted_at":"2025-02-07T07:46:19Z","title":"Singing Voice Conversion with Accompaniment Using Self-Supervised Representation-Based Melody Features","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T21:47:38.822990Z"},"links":{"cited_paper":"/paper/2110.04754","citing_paper":"/paper/2502.04722"},"observation_digest":"sha256:38c1bdfc48a04301603db50b81bc0694ed20429066cbb719e6f7d9b217f611f2","observation_id":"011c6730-1c71-4c52-8590-efd29cc71a2a","resolution":{"observed_at":"2026-08-08T21:47:39.260629Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:47:39.242002Z","title":"Adversarial speaker disentanglement using unannotated external data for self-supervised representation-based voice conversion,","venue":null,"work_id":"248d8e47-b076-4f50-b9f9-5b7c69ad28b6","year":2023},"citing_paper":{"arxiv_id":"2502.04722","last_updated":"2025-02-07T07:46:19Z","snapshot_observed_at":"2026-08-19T09:44:57.796571Z","submitted_at":"2025-02-07T07:46:19Z","title":"Singing Voice Conversion with Accompaniment Using Self-Supervised Representation-Based Melody Features","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T21:47:38.826602Z"},"links":{"citing_paper":"/paper/2502.04722"},"observation_digest":"sha256:930178102129266efafb52c36079064548cccf7f53a53d00c58487a00e99b562","observation_id":"4eadc8fc-4dec-4b93-8788-f0613961a8e7","resolution":{"observed_at":"2026-08-08T21:47:39.245662Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:47:39.398269Z","title":"Boosting self-supervised embeddings for speech enhancement,","venue":null,"work_id":"f7f590db-b759-4732-b6fd-0723094d90aa","year":2022},"citing_paper":{"arxiv_id":"2502.04722","last_updated":"2025-02-07T07:46:19Z","snapshot_observed_at":"2026-08-19T09:44:57.796571Z","submitted_at":"2025-02-07T07:46:19Z","title":"Singing Voice Conversion with Accompaniment Using Self-Supervised Representation-Based Melody Features","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T21:47:38.829587Z"},"links":{"citing_paper":"/paper/2502.04722"},"observation_digest":"sha256:ba403759749e99133875a7def6ec244e454de2fce6f89ad1b726d25cd7bf992e","observation_id":"b20bd879-dd47-4865-8602-ede7a879fbb4","resolution":{"observed_at":"2026-08-08T21:47:39.401611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:47:38.832614Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.04722","last_updated":"2025-02-07T07:46:19Z","snapshot_observed_at":"2026-08-19T09:44:57.796571Z","submitted_at":"2025-02-07T07:46:19Z","title":"Singing Voice Conversion with Accompaniment Using Self-Supervised Representation-Based Melody Features","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T21:47:38.832614Z"},"links":{"citing_paper":"/paper/2502.04722"},"observation_digest":"sha256:16a8ac58364589bf104fe7ba69947b90bb9c5fd3c3af9f7b0d79aa2629ae5a6e","observation_id":"fa17d025-227b-4a9f-8e99-f35feb0da5a9","resolution":{"observed_at":"2026-08-08T21:47:38.832614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:47:38.835945Z","title":"Wavlm: Large-scale self-supervised pre- training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04722","last_updated":"2025-02-07T07:46:19Z","snapshot_observed_at":"2026-08-19T09:44:57.796571Z","submitted_at":"2025-02-07T07:46:19Z","title":"Singing Voice Conversion with Accompaniment Using Self-Supervised Representation-Based Melody Features","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T21:47:38.835945Z"},"links":{"citing_paper":"/paper/2502.04722"},"observation_digest":"sha256:ac7144162e12058a942d56b4d668c8adb584dbdb61d9e97cb48ee8fecbcd43c1","observation_id":"8ca6fc15-2ffc-46e4-b7b8-1f606966012d","resolution":{"observed_at":"2026-08-08T21:47:38.835945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06237","last_updated":"2024-09-10T06:10:33Z","snapshot_observed_at":"2026-08-17T22:38:13.134751Z","submitted_at":"2024-09-10T06:10:33Z","title":"RobustSVC: HuBERT-based Melody Extractor and Adversarial Learning for Robust Singing Voice Conversion","version":1},"cited_work":{"arxiv_id":"2409.06237","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.06237","snapshot_observed_at":"2026-08-08T21:47:38.931205Z","title":"RobustSVC: HuBERT-based Melody Extractor and Adversarial Learning for Robust Singing Voice Conversion","venue":"cs.SD","work_id":"ffa8f753-d540-4246-98af-bf282ece0058","year":2024},"citing_paper":{"arxiv_id":"2502.04722","last_updated":"2025-02-07T07:46:19Z","snapshot_observed_at":"2026-08-19T09:44:57.796571Z","submitted_at":"2025-02-07T07:46:19Z","title":"Singing Voice Conversion with Accompaniment Using Self-Supervised Representation-Based Melody Features","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T21:47:38.839294Z"},"links":{"cited_paper":"/paper/2409.06237","citing_paper":"/paper/2502.04722"},"observation_digest":"sha256:2bedbacbcc44c39ff3e210a2adb16740337189d4b65d6d8eadc90ae04c3a6f6d","observation_id":"ae130da9-38a3-478e-82d4-780634b65ef8","resolution":{"observed_at":"2026-08-08T21:47:38.937367Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:47:39.376615Z","title":"Fastspeech 2: Fast and high-quality end-to-end text to speech,","venue":null,"work_id":"438e32c4-2c82-4b3b-ad2d-03b1d1374367","year":null},"citing_paper":{"arxiv_id":"2502.04722","last_updated":"2025-02-07T07:46:19Z","snapshot_observed_at":"2026-08-19T09:44:57.796571Z","submitted_at":"2025-02-07T07:46:19Z","title":"Singing Voice Conversion with Accompaniment Using Self-Supervised Representation-Based Melody Features","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T21:47:38.842732Z"},"links":{"citing_paper":"/paper/2502.04722"},"observation_digest":"sha256:631817b9b1aa82e884400c32085096fe8d636a7ecc8562c6e78b16a3f875ad24","observation_id":"713caa43-3cf7-4c0e-998c-3493f2303a6e","resolution":{"observed_at":"2026-08-08T21:47:39.380391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1610.07629","last_updated":"2017-02-09T16:29:09Z","snapshot_observed_at":"2026-08-17T22:36:32.307226Z","submitted_at":"2016-10-24T20:06:54Z","title":"A Learned Representation For Artistic Style","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1610.07629","snapshot_observed_at":"2026-08-08T21:47:38.846103Z","title":"A learned representation for artistic style,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.04722","last_updated":"2025-02-07T07:46:19Z","snapshot_observed_at":"2026-08-19T09:44:57.796571Z","submitted_at":"2025-02-07T07:46:19Z","title":"Singing Voice Conversion with Accompaniment Using Self-Supervised Representation-Based Melody Features","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T21:47:38.846103Z"},"links":{"cited_paper":"/paper/1610.07629","citing_paper":"/paper/2502.04722"},"observation_digest":"sha256:df182ebd62ab430fb65f800db092288e3781ff06127016272ed7308e56ab34a2","observation_id":"6fd45806-6b9d-4320-b890-c1a47f7a6987","resolution":{"observed_at":"2026-08-08T21:47:38.846103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:47:38.849521Z","title":"Hifi-gan: Generative adversarial networks for efficient and high fidelity speech synthesis,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.04722","last_updated":"2025-02-07T07:46:19Z","snapshot_observed_at":"2026-08-19T09:44:57.796571Z","submitted_at":"2025-02-07T07:46:19Z","title":"Singing Voice Conversion with Accompaniment Using Self-Supervised Representation-Based Melody Features","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T21:47:38.849521Z"},"links":{"citing_paper":"/paper/2502.04722"},"observation_digest":"sha256:2370b23df8f60eb083a375f09dd9cdac7a6260b05e6be2c08a3447c8266f826b","observation_id":"cdede67d-1f6e-4a79-b58c-fd4c856e3e16","resolution":{"observed_at":"2026-08-08T21:47:38.849521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:47:38.852721Z","title":"Natural tts synthesis by conditioning wavenet on mel spectrogram predictions,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.04722","last_updated":"2025-02-07T07:46:19Z","snapshot_observed_at":"2026-08-19T09:44:57.796571Z","submitted_at":"2025-02-07T07:46:19Z","title":"Singing Voice Conversion with Accompaniment Using Self-Supervised Representation-Based Melody Features","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T21:47:38.852721Z"},"links":{"citing_paper":"/paper/2502.04722"},"observation_digest":"sha256:59142765f626e0c397e0201352d68aa2d74eaad64b3f45e19d40af9b856aab00","observation_id":"9aa00d24-5b4e-4168-8354-02763d81c1a1","resolution":{"observed_at":"2026-08-08T21:47:38.852721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:47:39.355546Z","title":"Why does self-supervised learning for speech recognition benefit speaker recognition?","venue":null,"work_id":"0d921e12-31b5-4e5e-b78a-60188083e88a","year":2022},"citing_paper":{"arxiv_id":"2502.04722","last_updated":"2025-02-07T07:46:19Z","snapshot_observed_at":"2026-08-19T09:44:57.796571Z","submitted_at":"2025-02-07T07:46:19Z","title":"Singing Voice Conversion with Accompaniment Using Self-Supervised Representation-Based Melody Features","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T21:47:38.856291Z"},"links":{"citing_paper":"/paper/2502.04722"},"observation_digest":"sha256:22fe0553cd6f23a5fa0bb72c71ae340f8eb5b3620737b9f9cd747b3d7fbb0969","observation_id":"d7f5b3ef-0e5b-4df4-894f-c6b7a9723c01","resolution":{"observed_at":"2026-08-08T21:47:39.358882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:47:39.345737Z","title":"Musdb18-a corpus for music separation,","venue":null,"work_id":"32656965-f549-45e6-b224-54af33dae1e7","year":2017},"citing_paper":{"arxiv_id":"2502.04722","last_updated":"2025-02-07T07:46:19Z","snapshot_observed_at":"2026-08-19T09:44:57.796571Z","submitted_at":"2025-02-07T07:46:19Z","title":"Singing Voice Conversion with Accompaniment Using Self-Supervised Representation-Based Melody Features","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T21:47:38.859364Z"},"links":{"citing_paper":"/paper/2502.04722"},"observation_digest":"sha256:b00bc8bad3dfc759bf11cb66ecd2e227229823bf2f757bef49cbafd8123b478e","observation_id":"2ff78628-994c-43da-b15e-4db686c8b9af","resolution":{"observed_at":"2026-08-08T21:47:39.349262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:47:39.335996Z","title":"Multi-singer: Fast multi-singer singing voice vocoder with a large-scale corpus,","venue":null,"work_id":"5758c05e-4aa1-4b58-992e-8dca56758454","year":2021},"citing_paper":{"arxiv_id":"2502.04722","last_updated":"2025-02-07T07:46:19Z","snapshot_observed_at":"2026-08-19T09:44:57.796571Z","submitted_at":"2025-02-07T07:46:19Z","title":"Singing Voice Conversion with Accompaniment Using Self-Supervised Representation-Based Melody Features","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T21:47:38.862680Z"},"links":{"citing_paper":"/paper/2502.04722"},"observation_digest":"sha256:16516d4d9dd66d5ba300e6d172dfce6e83e2e38fb7045770e4c7b8c1f5f48f43","observation_id":"c09b179d-4888-46a2-9196-aaae99f607f4","resolution":{"observed_at":"2026-08-08T21:47:39.339535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.07429","last_updated":"2022-01-20T02:08:47Z","snapshot_observed_at":"2026-08-16T17:27:25.917677Z","submitted_at":"2022-01-19T06:12:47Z","title":"Opencpop: A High-Quality Open Source Chinese Popular Song Corpus for Singing Voice Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.07429","snapshot_observed_at":"2026-08-08T21:47:38.865624Z","title":"Opencpop: A high-quality open source chinese popular song corpus for singing voice synthesis,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04722","last_updated":"2025-02-07T07:46:19Z","snapshot_observed_at":"2026-08-19T09:44:57.796571Z","submitted_at":"2025-02-07T07:46:19Z","title":"Singing Voice Conversion with Accompaniment Using Self-Supervised Representation-Based Melody Features","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T21:47:38.865624Z"},"links":{"cited_paper":"/paper/2201.07429","citing_paper":"/paper/2502.04722"},"observation_digest":"sha256:36613798a647d20ec2bb4d3832077b137fec6c8949075abf73db86382062346f","observation_id":"0e916536-0397-4ef7-a521-228a36f18b7a","resolution":{"observed_at":"2026-08-08T21:47:38.865624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:47:39.326037Z","title":"Librispeech: an asr corpus based on public domain audio books,","venue":null,"work_id":"d8a28cf8-23ff-40ce-91ef-f25313ac7eb4","year":2015},"citing_paper":{"arxiv_id":"2502.04722","last_updated":"2025-02-07T07:46:19Z","snapshot_observed_at":"2026-08-19T09:44:57.796571Z","submitted_at":"2025-02-07T07:46:19Z","title":"Singing Voice Conversion with Accompaniment Using Self-Supervised Representation-Based Melody Features","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T21:47:38.869143Z"},"links":{"citing_paper":"/paper/2502.04722"},"observation_digest":"sha256:af6682d679e0e3df88eae2e99a3fbd52debc35ed03086d0b6c082630aa4c596e","observation_id":"6322b6d6-2b82-49ef-b2e1-c0bc6005c79e","resolution":{"observed_at":"2026-08-08T21:47:39.329505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:47:38.872142Z","title":"Catastrophic forgetting in connectionist networks,","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2502.04722","last_updated":"2025-02-07T07:46:19Z","snapshot_observed_at":"2026-08-19T09:44:57.796571Z","submitted_at":"2025-02-07T07:46:19Z","title":"Singing Voice Conversion with Accompaniment Using Self-Supervised Representation-Based Melody Features","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T21:47:38.872142Z"},"links":{"citing_paper":"/paper/2502.04722"},"observation_digest":"sha256:201b64d6f0aab369f4ec22e91857188c9513ff0d3abd93a926d27cdba3176bad","observation_id":"f4a6433f-bd64-4e4f-a9ad-949cf02b678c","resolution":{"observed_at":"2026-08-08T21:47:38.872142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:47:39.310681Z","title":"Dis- entangling content and fine-grained prosody information via hybrid asr bottleneck features for voice conversion,","venue":null,"work_id":"2f690228-1e01-484b-810a-81ccdeff8756","year":2022},"citing_paper":{"arxiv_id":"2502.04722","last_updated":"2025-02-07T07:46:19Z","snapshot_observed_at":"2026-08-19T09:44:57.796571Z","submitted_at":"2025-02-07T07:46:19Z","title":"Singing Voice Conversion with Accompaniment Using Self-Supervised Representation-Based Melody Features","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T21:47:38.875294Z"},"links":{"citing_paper":"/paper/2502.04722"},"observation_digest":"sha256:91ac2db455df68578df1e2ea07fdb262ccf25c5663791902af37a25f606fdd92","observation_id":"3f75cc1f-1443-45cc-b169-d12544b9d99c","resolution":{"observed_at":"2026-08-08T21:47:39.314290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:47:39.301116Z","title":"Wenet: Production oriented streaming and non- streaming end-to-end speech recognition toolkit,","venue":null,"work_id":"f7fbda71-2a9f-4d46-9040-692b7905e969","year":2021},"citing_paper":{"arxiv_id":"2502.04722","last_updated":"2025-02-07T07:46:19Z","snapshot_observed_at":"2026-08-19T09:44:57.796571Z","submitted_at":"2025-02-07T07:46:19Z","title":"Singing Voice Conversion with Accompaniment Using Self-Supervised Representation-Based Melody Features","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T21:47:38.878240Z"},"links":{"citing_paper":"/paper/2502.04722"},"observation_digest":"sha256:50100634585907f9149b73451eee9cffd9ec85ca373e800a1c90ef0f3d40d9b1","observation_id":"8fa7d95d-7263-4bdb-8dbc-99a38dfa8dd0","resolution":{"observed_at":"2026-08-08T21:47:39.304643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:47:39.290889Z","title":"Hybrid transformers for music source separation,","venue":null,"work_id":"364ea8a7-204d-48fd-89ec-4de8d6148b5f","year":2023},"citing_paper":{"arxiv_id":"2502.04722","last_updated":"2025-02-07T07:46:19Z","snapshot_observed_at":"2026-08-19T09:44:57.796571Z","submitted_at":"2025-02-07T07:46:19Z","title":"Singing Voice Conversion with Accompaniment Using Self-Supervised Representation-Based Melody Features","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T21:47:38.881361Z"},"links":{"citing_paper":"/paper/2502.04722"},"observation_digest":"sha256:37c6c1f605d00c6e370c7b003203c3190b6f2f250e26b446972f206589f53432","observation_id":"5456210c-a3be-4830-a7f1-a96f21744d59","resolution":{"observed_at":"2026-08-08T21:47:39.294837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:47:39.279974Z","title":"The singing voice conversion challenge 2023,","venue":null,"work_id":"7f1104c3-cd35-4487-84d6-5ba2c658bc4a","year":2023},"citing_paper":{"arxiv_id":"2502.04722","last_updated":"2025-02-07T07:46:19Z","snapshot_observed_at":"2026-08-19T09:44:57.796571Z","submitted_at":"2025-02-07T07:46:19Z","title":"Singing Voice Conversion with Accompaniment Using Self-Supervised Representation-Based Melody Features","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T21:47:38.884362Z"},"links":{"citing_paper":"/paper/2502.04722"},"observation_digest":"sha256:fd430d257b46bc6e89ab303278e5d494b1f963ae74dd220f5a9dd188077671ff","observation_id":"2c424ff9-356c-42f6-91a2-d3b67a1209e5","resolution":{"observed_at":"2026-08-08T21:47:39.283324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.04722","last_updated":"2025-02-07T07:46:19Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-19T09:44:57.796571Z","submitted_at":"2025-02-07T07:46:19Z","title":"Singing Voice Conversion with Accompaniment Using Self-Supervised Representation-Based Melody Features"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":4,"verified_fuzzy":25},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 0 inbound Pith citation observations for arXiv:2502.04722."}