{"as_of":"2026-08-06T12:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:53bd2fd37ea4d224fc8cf7d118ead3abb362419285e2bca34b614022f0d60a89","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T18:51:38.030059Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2604.05526/citation-record","integrity":"/paper/2604.05526/integrity","json":"/paper/2604.05526/citation-record.json","paper":"/paper/2604.05526"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2211.02903","last_updated":"2022-11-05T13:35:00Z","snapshot_observed_at":"2026-08-03T00:45:37.535967Z","submitted_at":"2022-11-05T13:35:00Z","title":"VISinger 2: High-Fidelity End-to-End Singing Voice Synthesis Enhanced by Digital Signal Processing Synthesizer","version":1},"cited_work":{"arxiv_id":"2211.02903","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2211.02903","snapshot_observed_at":"2026-07-02T00:46:24.581361Z","title":"Visinger 2: High-fidelity end-to-end singing voice synthesis enhanced by digital signal processing synthesizer","venue":null,"work_id":"1b70545b-6a4b-44c9-8841-6ad04529c008","year":2022},"citing_paper":{"arxiv_id":"2604.05526","last_updated":"2026-04-07T07:25:59Z","snapshot_observed_at":"2026-08-02T11:08:24.121491Z","submitted_at":"2026-04-07T07:25:59Z","title":"Controllable Singing Style Conversion with Boundary-Aware Information Bottleneck","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T18:51:38.030059Z"},"links":{"cited_paper":"/paper/2211.02903","citing_paper":"/paper/2604.05526"},"observation_digest":"sha256:a6ea7887ac626af8699a096c55fe4beb1aa3dcb6751d96d2ad83cca235884228","observation_id":"7b7fcdd8-0254-4175-a1ed-946551f27cb5","resolution":{"observed_at":"2026-05-10T23:50:51.817788Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffsvc: A diffusion probabilistic model for singing voice conversion","venue":null,"work_id":"61e0ac4f-2a05-4cde-a93b-910fb8770e57","year":2021},"citing_paper":{"arxiv_id":"2604.05526","last_updated":"2026-04-07T07:25:59Z","snapshot_observed_at":"2026-08-02T11:08:24.121491Z","submitted_at":"2026-04-07T07:25:59Z","title":"Controllable Singing Style Conversion with Boundary-Aware Information Bottleneck","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T18:51:38.030059Z"},"links":{"citing_paper":"/paper/2604.05526"},"observation_digest":"sha256:26c109ab88c6204513b98afa76dba2c49b559ed5afdda00ff3b984a9c21e7ff7","observation_id":"08b46a2e-a563-472f-9c87-e9c00c35949c","resolution":{"observed_at":"2026-05-16T14:02:58.960014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.15629","last_updated":"2026-05-28T05:02:31Z","snapshot_observed_at":"2026-08-04T16:07:41.349815Z","submitted_at":"2025-09-19T05:45:41Z","title":"An Extensive Analysis of the Singing Voice Conversion Challenge 2025 Evaluation Results","version":2},"cited_work":{"arxiv_id":"2509.15629","doi":"10.48550/arxiv.2509.15629","metadata_source":"pith","pith_arxiv_id":"2509.15629","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"The singing voice conversion challenge 2025: From singer identity conversion to singing style conversion","venue":"cs.SD","work_id":"e933a1a0-0469-4ef3-86ce-4eb09e011c16","year":2025},"citing_paper":{"arxiv_id":"2604.05526","last_updated":"2026-04-07T07:25:59Z","snapshot_observed_at":"2026-08-02T11:08:24.121491Z","submitted_at":"2026-04-07T07:25:59Z","title":"Controllable Singing Style Conversion with Boundary-Aware Information Bottleneck","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T18:51:38.030059Z"},"links":{"cited_paper":"/paper/2509.15629","citing_paper":"/paper/2604.05526"},"observation_digest":"sha256:80d25c9abcfa464d9813ad24d66fcd0fc6126d6bc39099523660da3fada50001","observation_id":"62616da6-a88e-4a34-98aa-476dbc770e38","resolution":{"observed_at":"2026-05-29T02:04:56.014870Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.13629","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"S ˆ2 voice: Style-aware autoregressive modeling with enhanced conditioning for singing style conversion","venue":null,"work_id":"e9c27cda-d202-4b1a-9747-9f6b41a69088","year":2026},"citing_paper":{"arxiv_id":"2604.05526","last_updated":"2026-04-07T07:25:59Z","snapshot_observed_at":"2026-08-02T11:08:24.121491Z","submitted_at":"2026-04-07T07:25:59Z","title":"Controllable Singing Style Conversion with Boundary-Aware Information Bottleneck","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T18:51:38.030059Z"},"links":{"citing_paper":"/paper/2604.05526"},"observation_digest":"sha256:d80a837efa6edfeb5ead9b6053eebcdd434c6204e03eebe50f187a90750e6dd9","observation_id":"81a14341-8b44-4d23-a67d-6711f924946d","resolution":{"observed_at":"2026-05-10T23:50:51.847594Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stylesinger: Style transfer for out-of- domain singing voice synthesis","venue":null,"work_id":"353f6917-d64f-45b8-bd09-2636afacfe2f","year":2024},"citing_paper":{"arxiv_id":"2604.05526","last_updated":"2026-04-07T07:25:59Z","snapshot_observed_at":"2026-08-02T11:08:24.121491Z","submitted_at":"2026-04-07T07:25:59Z","title":"Controllable Singing Style Conversion with Boundary-Aware Information Bottleneck","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T18:51:38.030059Z"},"links":{"citing_paper":"/paper/2604.05526"},"observation_digest":"sha256:d5881b7122e6933348bf597ffeb37b25c778d3e50e12e737d2652042c814e306","observation_id":"6d39cb8c-2eec-4b9f-a81c-a89e1e93588a","resolution":{"observed_at":"2026-05-16T14:02:58.958016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Singgan: Generative adversarial network for high- fidelity singing voice generation","venue":null,"work_id":"745fbb4e-eda9-469c-8a50-a520d6af595b","year":2022},"citing_paper":{"arxiv_id":"2604.05526","last_updated":"2026-04-07T07:25:59Z","snapshot_observed_at":"2026-08-02T11:08:24.121491Z","submitted_at":"2026-04-07T07:25:59Z","title":"Controllable Singing Style Conversion with Boundary-Aware Information Bottleneck","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T18:51:38.030059Z"},"links":{"citing_paper":"/paper/2604.05526"},"observation_digest":"sha256:8565b78a65d7f5c7c77ee9989a7894c2f2be074c43785e03403bcaf93227df80","observation_id":"9c003e9b-26c4-4d2e-b2f6-d79e64a0c1aa","resolution":{"observed_at":"2026-05-16T14:02:58.955496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-05T03:40:24.447729Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":"2312.15821","doi":"10.48550/arxiv.2312.15821","metadata_source":"pith","pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audiobox: Unified audio generation with natural language prompts","venue":"cs.SD","work_id":"f7d2982e-a068-43ac-85f8-a5d3fb631fa2","year":2023},"citing_paper":{"arxiv_id":"2604.05526","last_updated":"2026-04-07T07:25:59Z","snapshot_observed_at":"2026-08-02T11:08:24.121491Z","submitted_at":"2026-04-07T07:25:59Z","title":"Controllable Singing Style Conversion with Boundary-Aware Information Bottleneck","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T18:51:38.030059Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2604.05526"},"observation_digest":"sha256:75dcd23ba900da70cecc6d3c66516b7c7fb9c58e7e57d55513acefc522ee0651","observation_id":"42ed3b4b-f6c3-4c91-ba67-bc68f8dad714","resolution":{"observed_at":"2026-05-10T23:50:51.864433Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gtsinger: A global multi-technique singing corpus with realistic music scores for all singing tasks","venue":null,"work_id":"60f77e56-3cd1-4776-aa53-7384a9b5690a","year":2024},"citing_paper":{"arxiv_id":"2604.05526","last_updated":"2026-04-07T07:25:59Z","snapshot_observed_at":"2026-08-02T11:08:24.121491Z","submitted_at":"2026-04-07T07:25:59Z","title":"Controllable Singing Style Conversion with Boundary-Aware Information Bottleneck","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T18:51:38.030059Z"},"links":{"citing_paper":"/paper/2604.05526"},"observation_digest":"sha256:c500b528cdb05f3169233af69c17ad316e2a93f75a95a5cd457c23008f4118be","observation_id":"d12af909-299c-4fbb-a779-2fdad3c08230","resolution":{"observed_at":"2026-05-16T14:02:58.953522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15977","last_updated":"2025-05-30T10:11:27Z","snapshot_observed_at":"2026-07-06T19:21:08.143870Z","submitted_at":"2024-09-24T11:18:09Z","title":"TCSinger: Zero-Shot Singing Voice Synthesis with Style Transfer and Multi-Level Style Control","version":6},"cited_work":{"arxiv_id":"2409.15977","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.15977","snapshot_observed_at":"2026-07-02T00:46:24.625893Z","title":"Tcsinger: Zero-shot singing voice synthesis with style transfer and multi-level style control","venue":null,"work_id":"8a51dafc-f427-4b4d-8a7b-64fbfb354509","year":2024},"citing_paper":{"arxiv_id":"2604.05526","last_updated":"2026-04-07T07:25:59Z","snapshot_observed_at":"2026-08-02T11:08:24.121491Z","submitted_at":"2026-04-07T07:25:59Z","title":"Controllable Singing Style Conversion with Boundary-Aware Information Bottleneck","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T18:51:38.030059Z"},"links":{"cited_paper":"/paper/2409.15977","citing_paper":"/paper/2604.05526"},"observation_digest":"sha256:6cf21065e984e20644fb3adf3e01c518a598698072f3bef92d25e94e39dc397b","observation_id":"a8ec0d77-6217-4db6-b979-ad6e8d5e02f2","resolution":{"observed_at":"2026-05-10T23:50:51.900337Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.23945","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T16:09:56.366521Z","title":"Pointcot: A multi-modal benchmark for explicit 3d geometric reasoning","venue":null,"work_id":"05927f30-77e2-4f39-9a74-0325a1d948d1","year":2026},"citing_paper":{"arxiv_id":"2604.05526","last_updated":"2026-04-07T07:25:59Z","snapshot_observed_at":"2026-08-02T11:08:24.121491Z","submitted_at":"2026-04-07T07:25:59Z","title":"Controllable Singing Style Conversion with Boundary-Aware Information Bottleneck","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T18:51:38.030059Z"},"links":{"citing_paper":"/paper/2604.05526"},"observation_digest":"sha256:24bcbc847b9fae1e7b7b7a226dcd64b1159cb04caf29ace6e9d4bb871f28a6c5","observation_id":"c7091dac-b1c3-4c4b-a6ae-29f6e7789313","resolution":{"observed_at":"2026-05-10T23:50:51.886185Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.08251","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Not all queries need deep thought: Coficot for adaptive coarse-to-fine stateful refinement","venue":null,"work_id":"ed00af68-0c26-4ae5-9ac7-34fa453654da","year":2026},"citing_paper":{"arxiv_id":"2604.05526","last_updated":"2026-04-07T07:25:59Z","snapshot_observed_at":"2026-08-02T11:08:24.121491Z","submitted_at":"2026-04-07T07:25:59Z","title":"Controllable Singing Style Conversion with Boundary-Aware Information Bottleneck","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T18:51:38.030059Z"},"links":{"citing_paper":"/paper/2604.05526"},"observation_digest":"sha256:9a16a0cdd035019bb84c3d746d5d64fcbde200b128666c0aff4aad73645825a9","observation_id":"3fb468a1-8cd1-41e6-9f13-c1678757e75c","resolution":{"observed_at":"2026-05-10T23:50:51.600352Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cmhanet: A cross-modal hybrid attention network for point cloud registration","venue":null,"work_id":"e0ab2d88-f1c1-4174-8fb7-8f7a1d779902","year":2026},"citing_paper":{"arxiv_id":"2604.05526","last_updated":"2026-04-07T07:25:59Z","snapshot_observed_at":"2026-08-02T11:08:24.121491Z","submitted_at":"2026-04-07T07:25:59Z","title":"Controllable Singing Style Conversion with Boundary-Aware Information Bottleneck","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T18:51:38.030059Z"},"links":{"citing_paper":"/paper/2604.05526"},"observation_digest":"sha256:096db1b27bca121085fe59bfbb00f9d37f9463be62016cf5de569613cfda06a0","observation_id":"429cb5a6-2e25-497d-84c1-e862d28ceb63","resolution":{"observed_at":"2026-05-16T14:02:58.949220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Igasa: Integrated geometry-aware and skip-attention modules for enhanced point cloud registration","venue":null,"work_id":"27063b26-22a8-4bc3-93b2-a24d0e0eb507","year":2026},"citing_paper":{"arxiv_id":"2604.05526","last_updated":"2026-04-07T07:25:59Z","snapshot_observed_at":"2026-08-02T11:08:24.121491Z","submitted_at":"2026-04-07T07:25:59Z","title":"Controllable Singing Style Conversion with Boundary-Aware Information Bottleneck","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T18:51:38.030059Z"},"links":{"citing_paper":"/paper/2604.05526"},"observation_digest":"sha256:ac60a98918ef252b705df9efe9f41b43e8ecac0f0cf873ecc9feace73cf46667","observation_id":"fcaea4d5-583d-49b0-b0d5-271b50a89b21","resolution":{"observed_at":"2026-05-16T14:02:58.946909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hubert: Self-supervised speech rep- resentation learning by masked prediction of hidden units","venue":null,"work_id":"1d8b191e-fbc2-476e-8231-3620ec4323ad","year":2021},"citing_paper":{"arxiv_id":"2604.05526","last_updated":"2026-04-07T07:25:59Z","snapshot_observed_at":"2026-08-02T11:08:24.121491Z","submitted_at":"2026-04-07T07:25:59Z","title":"Controllable Singing Style Conversion with Boundary-Aware Information Bottleneck","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T18:51:38.030059Z"},"links":{"citing_paper":"/paper/2604.05526"},"observation_digest":"sha256:3b6e9acf28cd0ec58301f3c9eb0d9d92555c8eb8fe62769276eb2804567860ed","observation_id":"6b8e1cc8-8182-47f0-9ab2-17d3453e0755","resolution":{"observed_at":"2026-05-16T14:02:58.911516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Contentvec: An im- proved self-supervised speech representation by disentangling speakers","venue":null,"work_id":"a5c77b1a-2b0f-428e-bccf-6091b985e348","year":2022},"citing_paper":{"arxiv_id":"2604.05526","last_updated":"2026-04-07T07:25:59Z","snapshot_observed_at":"2026-08-02T11:08:24.121491Z","submitted_at":"2026-04-07T07:25:59Z","title":"Controllable Singing Style Conversion with Boundary-Aware Information Bottleneck","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T18:51:38.030059Z"},"links":{"citing_paper":"/paper/2604.05526"},"observation_digest":"sha256:ebb527c18673ce7f45a3f32a5a67dc4137cade39500f87bde74338a840e49d57","observation_id":"84a1be18-be20-4768-b846-3fffd0fab6dd","resolution":{"observed_at":"2026-05-16T14:02:58.908591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-02T20:06:32.256011Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":"2301.02111","doi":"10.48550/arxiv.2301.02111","metadata_source":"pith","pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","venue":"cs.CL","work_id":"de8fb688-dd63-4942-92f6-66d98d5b6db2","year":2023},"citing_paper":{"arxiv_id":"2604.05526","last_updated":"2026-04-07T07:25:59Z","snapshot_observed_at":"2026-08-02T11:08:24.121491Z","submitted_at":"2026-04-07T07:25:59Z","title":"Controllable Singing Style Conversion with Boundary-Aware Information Bottleneck","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T18:51:38.030059Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2604.05526"},"observation_digest":"sha256:d6d90199f1baf78b3b718cdad367cead403b0d50e33dbdb0dd2dfb4aa0baafdb","observation_id":"04b87d48-ae9f-4f0b-b171-95f4075104c7","resolution":{"observed_at":"2026-05-13T01:31:07.171839Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zero-shot voice conversion via self- supervised prosody representation learning","venue":null,"work_id":"acdb5117-8579-4286-a7df-1d8599a34fbe","year":2022},"citing_paper":{"arxiv_id":"2604.05526","last_updated":"2026-04-07T07:25:59Z","snapshot_observed_at":"2026-08-02T11:08:24.121491Z","submitted_at":"2026-04-07T07:25:59Z","title":"Controllable Singing Style Conversion with Boundary-Aware Information Bottleneck","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T18:51:38.030059Z"},"links":{"citing_paper":"/paper/2604.05526"},"observation_digest":"sha256:52af5afe6dbf4ca8e6b282374e15141d0b182d4375afe0c0ee3cefa3170c946c","observation_id":"a9ce8641-1e83-49a4-adcf-6add4ed69078","resolution":{"observed_at":"2026-05-16T14:02:58.917154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lm-vc: Zero- shot voice conversion via speech generation based on language models","venue":null,"work_id":"86e42d39-6619-454f-a8e9-933ebff688e9","year":2023},"citing_paper":{"arxiv_id":"2604.05526","last_updated":"2026-04-07T07:25:59Z","snapshot_observed_at":"2026-08-02T11:08:24.121491Z","submitted_at":"2026-04-07T07:25:59Z","title":"Controllable Singing Style Conversion with Boundary-Aware Information Bottleneck","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T18:51:38.030059Z"},"links":{"citing_paper":"/paper/2604.05526"},"observation_digest":"sha256:963654c13a72087980dc01d46e7b15fdaffb0040ce6e8ee403cf13e0e0e3ab96","observation_id":"767f857f-bb36-4d88-aaf3-8a7c9ab759b6","resolution":{"observed_at":"2026-05-16T14:02:58.929661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-07-06T20:34:29.976207Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"cited_work":{"arxiv_id":"2502.07243","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.07243","snapshot_observed_at":"2026-07-04T07:39:38.691071Z","title":"Semantic Distill","venue":null,"work_id":"ce2ef5e3-64bf-4fa4-9142-79398e23a22c","year":2025},"citing_paper":{"arxiv_id":"2604.05526","last_updated":"2026-04-07T07:25:59Z","snapshot_observed_at":"2026-08-02T11:08:24.121491Z","submitted_at":"2026-04-07T07:25:59Z","title":"Controllable Singing Style Conversion with Boundary-Aware Information Bottleneck","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T18:51:38.030059Z"},"links":{"cited_paper":"/paper/2502.07243","citing_paper":"/paper/2604.05526"},"observation_digest":"sha256:971b6453f686e93716ae28dbc9a105c7fbfcb07d2725d87fbdc1517fd28ef2f7","observation_id":"80a7b18a-b5da-4ab4-997e-a3a9b98d8558","resolution":{"observed_at":"2026-05-10T23:50:51.780513Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03100","last_updated":"2024-04-23T08:38:03Z","snapshot_observed_at":"2026-08-05T18:34:08.469382Z","submitted_at":"2024-03-05T16:35:25Z","title":"NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models","version":3},"cited_work":{"arxiv_id":"2403.03100","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.03100","snapshot_observed_at":"2026-07-04T11:59:50.976455Z","title":"Naturalspeech 3: Zero-shot speech synthesis with factorized codec and diffusion models","venue":null,"work_id":"4ac4c208-eb65-46ea-b155-1f2e74819809","year":2024},"citing_paper":{"arxiv_id":"2604.05526","last_updated":"2026-04-07T07:25:59Z","snapshot_observed_at":"2026-08-02T11:08:24.121491Z","submitted_at":"2026-04-07T07:25:59Z","title":"Controllable Singing Style Conversion with Boundary-Aware Information Bottleneck","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T18:51:38.030059Z"},"links":{"cited_paper":"/paper/2403.03100","citing_paper":"/paper/2604.05526"},"observation_digest":"sha256:2819452f36871494dc7471749fb6ec0402e9bad620a743f51a1cf61ed659285b","observation_id":"a5794d5e-8a2e-4073-b817-c69cbba768b0","resolution":{"observed_at":"2026-05-10T23:50:51.555347Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Matcha-tts: A fast tts architecture with conditional flow matching","venue":null,"work_id":"50f434db-63e7-4f91-87dc-8c88aa447aaf","year":2024},"citing_paper":{"arxiv_id":"2604.05526","last_updated":"2026-04-07T07:25:59Z","snapshot_observed_at":"2026-08-02T11:08:24.121491Z","submitted_at":"2026-04-07T07:25:59Z","title":"Controllable Singing Style Conversion with Boundary-Aware Information Bottleneck","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T18:51:38.030059Z"},"links":{"citing_paper":"/paper/2604.05526"},"observation_digest":"sha256:e9c8da4fc8de8081e3820f6f68868843bfaea4c50c5640ebe92f214ab9a68b25","observation_id":"1b3002e6-6aab-4794-9122-cf23a14acf08","resolution":{"observed_at":"2026-05-16T14:02:58.931828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12388","last_updated":"2025-07-04T07:21:48Z","snapshot_observed_at":"2026-07-06T20:53:22.766594Z","submitted_at":"2025-03-16T07:20:22Z","title":"Serenade: A Singing Style Conversion Framework Based On Audio Infilling","version":2},"cited_work":{"arxiv_id":"2503.12388","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12388","snapshot_observed_at":"2026-07-03T18:28:49.040260Z","title":"Serenade: A singing style conversion framework based on audio infilling","venue":null,"work_id":"a2055afa-5e67-4098-b8ec-6516496e35a3","year":2025},"citing_paper":{"arxiv_id":"2604.05526","last_updated":"2026-04-07T07:25:59Z","snapshot_observed_at":"2026-08-02T11:08:24.121491Z","submitted_at":"2026-04-07T07:25:59Z","title":"Controllable Singing Style Conversion with Boundary-Aware Information Bottleneck","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T18:51:38.030059Z"},"links":{"cited_paper":"/paper/2503.12388","citing_paper":"/paper/2604.05526"},"observation_digest":"sha256:28f907f8566c65fcc4d8001af24ef93ab9dcd936dc805698ed26f8a325ff9cf2","observation_id":"6ae962a2-10ff-41ea-a007-f7ab39b67c8f","resolution":{"observed_at":"2026-05-10T23:50:51.800131Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05282","last_updated":"2026-07-21T08:08:53Z","snapshot_observed_at":"2026-08-05T23:32:54.202480Z","submitted_at":"2025-08-07T11:26:40Z","title":"Not All Errors Are Created Equal: ASCoT Addresses Late-Stage Fragility in Efficient LLM Reasoning","version":6},"cited_work":{"arxiv_id":"2508.05282","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.05282","snapshot_observed_at":"2026-07-22T03:21:57.840860Z","title":"Ascot: An adaptive self-correctionchain-of-thoughtmethodforlate-stagefragilityinllms.arXivpreprint","venue":null,"work_id":"e66c5259-11df-4622-819b-931249aac2c7","year":2025},"citing_paper":{"arxiv_id":"2604.05526","last_updated":"2026-04-07T07:25:59Z","snapshot_observed_at":"2026-08-02T11:08:24.121491Z","submitted_at":"2026-04-07T07:25:59Z","title":"Controllable Singing Style Conversion with Boundary-Aware Information Bottleneck","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T18:51:38.030059Z"},"links":{"cited_paper":"/paper/2508.05282","citing_paper":"/paper/2604.05526"},"observation_digest":"sha256:cafaa5c8663a979e5ec77f552a25f1c185d98540f0d42241024a581a9de5d671","observation_id":"f14f8410-d76f-4b01-94fd-212084f851b7","resolution":{"observed_at":"2026-07-22T03:21:57.840860Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.13879","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chain-of-thought compression should not be blind: V-skip for efficient multimodal reasoning via dual-path anchoring","venue":null,"work_id":"a2629dc3-8861-4d56-b3c8-83ba4610ac94","year":2026},"citing_paper":{"arxiv_id":"2604.05526","last_updated":"2026-04-07T07:25:59Z","snapshot_observed_at":"2026-08-02T11:08:24.121491Z","submitted_at":"2026-04-07T07:25:59Z","title":"Controllable Singing Style Conversion with Boundary-Aware Information Bottleneck","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-10T18:51:38.030059Z"},"links":{"citing_paper":"/paper/2604.05526"},"observation_digest":"sha256:762af773ef2bee36d351d4c4ac2c42a1c42fe4d4399880ece70615164314ac32","observation_id":"14b70215-11c0-4f30-992a-ab95c06c547c","resolution":{"observed_at":"2026-05-10T23:50:51.584791Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Soundstream: An end-to-end neural audio codec","venue":null,"work_id":"cfa5c732-3904-40a0-a753-32124de9983d","year":2021},"citing_paper":{"arxiv_id":"2604.05526","last_updated":"2026-04-07T07:25:59Z","snapshot_observed_at":"2026-08-02T11:08:24.121491Z","submitted_at":"2026-04-07T07:25:59Z","title":"Controllable Singing Style Conversion with Boundary-Aware Information Bottleneck","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-10T18:51:38.030059Z"},"links":{"citing_paper":"/paper/2604.05526"},"observation_digest":"sha256:d701e348735435d0bd94d681a44fcbb91c443e6350ac9f6fab5ad1478b74f9ab","observation_id":"8282a6f7-c4e1-4a1d-9567-9c21e30b064d","resolution":{"observed_at":"2026-05-16T14:02:58.914312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2604.05526","last_updated":"2026-04-07T07:25:59Z","snapshot_observed_at":"2026-08-02T11:08:24.121491Z","submitted_at":"2026-04-07T07:25:59Z","title":"Controllable Singing Style Conversion with Boundary-Aware Information Bottleneck","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T18:51:38.030059Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2604.05526"},"observation_digest":"sha256:9953ea1f66456a3b3ca6940d050e362d8cbf86642698d1ea056ac36bc314e327","observation_id":"344fe637-5357-4c17-9763-3bb213d23851","resolution":{"observed_at":"2026-05-15T12:26:37.526122Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-01T10:20:49.367508Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":"2409.00750","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-07-04T12:19:49.609343Z","title":"Maskgct: Zero-shot text- to-speech with masked generative codec transformer","venue":null,"work_id":"1444247d-e7a0-465c-8c12-8cae0e2933dd","year":2024},"citing_paper":{"arxiv_id":"2604.05526","last_updated":"2026-04-07T07:25:59Z","snapshot_observed_at":"2026-08-02T11:08:24.121491Z","submitted_at":"2026-04-07T07:25:59Z","title":"Controllable Singing Style Conversion with Boundary-Aware Information Bottleneck","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T18:51:38.030059Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2604.05526"},"observation_digest":"sha256:232c42b7b3f0c1f7e90e134b0c7ec4449cb878b4f5e51348b041d6716a20a7f4","observation_id":"be168de6-39a7-449c-9b49-70883c5b8409","resolution":{"observed_at":"2026-05-10T23:50:51.681996Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-07-06T20:06:30.732685Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":"2412.10117","doi":"10.48550/arxiv.2412.10117","metadata_source":"pith","pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","venue":"cs.SD","work_id":"3af84775-3b81-4078-b553-52739aae03ba","year":2024},"citing_paper":{"arxiv_id":"2604.05526","last_updated":"2026-04-07T07:25:59Z","snapshot_observed_at":"2026-08-02T11:08:24.121491Z","submitted_at":"2026-04-07T07:25:59Z","title":"Controllable Singing Style Conversion with Boundary-Aware Information Bottleneck","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T18:51:38.030059Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2604.05526"},"observation_digest":"sha256:e04bb5935a9429760e185d3c9f3b4bda2527633af4a52fdf2a0c02f3aa930b50","observation_id":"9ee1aea3-9064-4b62-a470-4fd844b915ad","resolution":{"observed_at":"2026-05-13T06:19:09.677777Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:49.998415+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:49.998415+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards controllable speech synthesis in the era of large language models: A systematic survey","venue":null,"work_id":"bfef33a3-6b69-47f6-a9c0-138d2d6df3ee","year":2025},"citing_paper":{"arxiv_id":"2604.05526","last_updated":"2026-04-07T07:25:59Z","snapshot_observed_at":"2026-08-02T11:08:24.121491Z","submitted_at":"2026-04-07T07:25:59Z","title":"Controllable Singing Style Conversion with Boundary-Aware Information Bottleneck","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T18:51:38.030059Z"},"links":{"citing_paper":"/paper/2604.05526"},"observation_digest":"sha256:a7a1f424ef76b892fb61a017c25c85068e016d12bdd3b8e8ccb8e0d789dceef9","observation_id":"3c90cef9-6cd5-4598-a526-9f331cebc663","resolution":{"observed_at":"2026-05-16T14:02:58.944738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2604.05526","last_updated":"2026-04-07T07:25:59Z","snapshot_observed_at":"2026-08-02T11:08:24.121491Z","submitted_at":"2026-04-07T07:25:59Z","title":"Controllable Singing Style Conversion with Boundary-Aware Information Bottleneck","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-10T18:51:38.030059Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2604.05526"},"observation_digest":"sha256:09eb2a0047e7bbeb05f15ea1d57bc7208e303f913da9b796e3d46cf9cf662a39","observation_id":"7b746ee1-5cf6-4fdc-896d-83de4991f2b6","resolution":{"observed_at":"2026-05-10T23:50:51.643403Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vevo2: Bridging controllable speech and singing voice generation via unified prosody learning","venue":null,"work_id":"40cc32fc-6170-403f-ae1f-69b5dee90b0d","year":2025},"citing_paper":{"arxiv_id":"2604.05526","last_updated":"2026-04-07T07:25:59Z","snapshot_observed_at":"2026-08-02T11:08:24.121491Z","submitted_at":"2026-04-07T07:25:59Z","title":"Controllable Singing Style Conversion with Boundary-Aware Information Bottleneck","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T18:51:38.030059Z"},"links":{"citing_paper":"/paper/2604.05526"},"observation_digest":"sha256:94a461a5277b4ec9775fdd865ac04d5b3fa951a7dd79791ceab16903ce364157","observation_id":"9c1e25ad-3fa4-4c3e-a18a-a5fb0851309c","resolution":{"observed_at":"2026-05-16T14:02:58.951344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The singing voice conversion challenge 2023","venue":null,"work_id":"94c2c47c-8fc5-44c5-8f91-e09dfbf59e00","year":2023},"citing_paper":{"arxiv_id":"2604.05526","last_updated":"2026-04-07T07:25:59Z","snapshot_observed_at":"2026-08-02T11:08:24.121491Z","submitted_at":"2026-04-07T07:25:59Z","title":"Controllable Singing Style Conversion with Boundary-Aware Information Bottleneck","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T18:51:38.030059Z"},"links":{"citing_paper":"/paper/2604.05526"},"observation_digest":"sha256:a02308ddb6a964f85e5edb9c796297142b84df91c79e4de336903b02837fca63","observation_id":"a6ee3139-aa6e-4239-8ea7-ab1d1df828bd","resolution":{"observed_at":"2026-05-16T14:02:58.927457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Syki-svc: Advancing singing voice conversion with post- processing innovations and an open-source professional testset","venue":null,"work_id":"5a548a38-5f2e-43b7-894a-84cdcf55be05","year":2025},"citing_paper":{"arxiv_id":"2604.05526","last_updated":"2026-04-07T07:25:59Z","snapshot_observed_at":"2026-08-02T11:08:24.121491Z","submitted_at":"2026-04-07T07:25:59Z","title":"Controllable Singing Style Conversion with Boundary-Aware Information Bottleneck","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-10T18:51:38.030059Z"},"links":{"citing_paper":"/paper/2604.05526"},"observation_digest":"sha256:6648915c974461886db376d95c319b8d96bcb465c21e7336e1c7ba704b5c4777","observation_id":"073b057c-3591-41fd-a530-21908f42b6d6","resolution":{"observed_at":"2026-05-16T14:02:58.940509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vits-based singing voice conversion system with dspgan post-processing for svcc2023","venue":null,"work_id":"9efc648b-ece0-476a-b55d-3f29572bde49","year":2023},"citing_paper":{"arxiv_id":"2604.05526","last_updated":"2026-04-07T07:25:59Z","snapshot_observed_at":"2026-08-02T11:08:24.121491Z","submitted_at":"2026-04-07T07:25:59Z","title":"Controllable Singing Style Conversion with Boundary-Aware Information Bottleneck","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T18:51:38.030059Z"},"links":{"citing_paper":"/paper/2604.05526"},"observation_digest":"sha256:c6d28d55d1c0170aa5bd577067a81bd80dab8e496967cc5daa924c0a698b7440","observation_id":"929a7c72-39ba-473b-9df7-ca02805dfd54","resolution":{"observed_at":"2026-05-16T14:02:58.933937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dspgan: A gan-based universal vocoder for high-fidelity tts by time-frequency domain supervision from dsp","venue":null,"work_id":"0cf2f8cd-3ec2-4839-a93c-0ca92b42a383","year":2023},"citing_paper":{"arxiv_id":"2604.05526","last_updated":"2026-04-07T07:25:59Z","snapshot_observed_at":"2026-08-02T11:08:24.121491Z","submitted_at":"2026-04-07T07:25:59Z","title":"Controllable Singing Style Conversion with Boundary-Aware Information Bottleneck","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T18:51:38.030059Z"},"links":{"citing_paper":"/paper/2604.05526"},"observation_digest":"sha256:61e505dd09a6814389fcd8755c78595ff910ee5e1410c2607064f86cf3b84f1c","observation_id":"433ca02c-db8b-4906-bf86-2e0b55f267a0","resolution":{"observed_at":"2026-05-16T14:02:58.936184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15412","last_updated":"2023-06-28T01:53:37Z","snapshot_observed_at":"2026-08-05T14:08:17.696756Z","submitted_at":"2023-06-27T12:11:55Z","title":"RMVPE: A Robust Model for Vocal Pitch Estimation in Polyphonic Music","version":2},"cited_work":{"arxiv_id":"2306.15412","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.15412","snapshot_observed_at":"2026-07-04T12:09:49.469630Z","title":"Rmvpe: A robust model for vocal pitch estimation in polyphonic music","venue":null,"work_id":"95c87790-bf62-48af-923a-8d382aa82bae","year":2023},"citing_paper":{"arxiv_id":"2604.05526","last_updated":"2026-04-07T07:25:59Z","snapshot_observed_at":"2026-08-02T11:08:24.121491Z","submitted_at":"2026-04-07T07:25:59Z","title":"Controllable Singing Style Conversion with Boundary-Aware Information Bottleneck","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T18:51:38.030059Z"},"links":{"cited_paper":"/paper/2306.15412","citing_paper":"/paper/2604.05526"},"observation_digest":"sha256:e71742f87cb0dd66b5ee0011da33c0746b36ba1b3c8f74859a5cbd114bfe5a14","observation_id":"98c11499-8e44-4b17-8fb6-b4b90bfb0d15","resolution":{"observed_at":"2026-05-10T23:50:51.809436Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Singing voice synthesis with vibrato modeling and latent energy representation","venue":null,"work_id":"bfb2a9f8-98d6-4dfb-9f12-1972ed4326bf","year":2022},"citing_paper":{"arxiv_id":"2604.05526","last_updated":"2026-04-07T07:25:59Z","snapshot_observed_at":"2026-08-02T11:08:24.121491Z","submitted_at":"2026-04-07T07:25:59Z","title":"Controllable Singing Style Conversion with Boundary-Aware Information Bottleneck","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T18:51:38.030059Z"},"links":{"citing_paper":"/paper/2604.05526"},"observation_digest":"sha256:ce3b9aac6d013ec29de249d0de64aa040127a72d4ca9008c17d8660fd184818b","observation_id":"76e06000-e86e-4b39-9ce2-1281232fff51","resolution":{"observed_at":"2026-05-16T14:02:58.938225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":"7cc8b703-6bdf-4c60-a107-9b359bbe7417","year":2023},"citing_paper":{"arxiv_id":"2604.05526","last_updated":"2026-04-07T07:25:59Z","snapshot_observed_at":"2026-08-02T11:08:24.121491Z","submitted_at":"2026-04-07T07:25:59Z","title":"Controllable Singing Style Conversion with Boundary-Aware Information Bottleneck","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-10T18:51:38.030059Z"},"links":{"citing_paper":"/paper/2604.05526"},"observation_digest":"sha256:3e21ac0bb344e00866a2225b36529c46bc1be2fe6fbc0479cd443ca6e0a82cf6","observation_id":"71bfb580-d97d-4085-b5be-abfa72d64f77","resolution":{"observed_at":"2026-05-16T14:02:58.942579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15455","last_updated":"2022-07-05T07:47:22Z","snapshot_observed_at":"2026-08-04T17:29:16.369037Z","submitted_at":"2022-03-29T11:54:34Z","title":"WeNet 2.0: More Productive End-to-End Speech Recognition Toolkit","version":2},"cited_work":{"arxiv_id":"2203.15455","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.15455","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"WeNet 2.0: More productive end-to-end speech recognition toolkit","venue":null,"work_id":"164b8027-d4eb-4bf1-a25a-5ce28609ad1f","year":2022},"citing_paper":{"arxiv_id":"2604.05526","last_updated":"2026-04-07T07:25:59Z","snapshot_observed_at":"2026-08-02T11:08:24.121491Z","submitted_at":"2026-04-07T07:25:59Z","title":"Controllable Singing Style Conversion with Boundary-Aware Information Bottleneck","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T18:51:38.030059Z"},"links":{"cited_paper":"/paper/2203.15455","citing_paper":"/paper/2604.05526"},"observation_digest":"sha256:03a39e5c2d84084238d0e8b41f15a021530eb6f51c355c1cdb7a2625a3664ea0","observation_id":"46901124-85a7-4a14-9566-023019775f92","resolution":{"observed_at":"2026-05-10T23:50:51.626344Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Montreal forced aligner: Trainable text-speech align- ment using kaldi","venue":null,"work_id":"a65cfade-dc82-4ae4-9765-b427b369a9ff","year":2017},"citing_paper":{"arxiv_id":"2604.05526","last_updated":"2026-04-07T07:25:59Z","snapshot_observed_at":"2026-08-02T11:08:24.121491Z","submitted_at":"2026-04-07T07:25:59Z","title":"Controllable Singing Style Conversion with Boundary-Aware Information Bottleneck","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T18:51:38.030059Z"},"links":{"citing_paper":"/paper/2604.05526"},"observation_digest":"sha256:0bde738d1fe81bc87bf8ced1be0e1e7d0ea486192018c7c045a6595489028ede","observation_id":"b352c490-44a7-44fb-abf9-43844526a35f","resolution":{"observed_at":"2026-05-16T14:02:58.919633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vibrato learning in multi-singer singing voice synthesis","venue":null,"work_id":"f1d2e2c4-f0f7-499a-b7fc-8a8dca785c0b","year":2021},"citing_paper":{"arxiv_id":"2604.05526","last_updated":"2026-04-07T07:25:59Z","snapshot_observed_at":"2026-08-02T11:08:24.121491Z","submitted_at":"2026-04-07T07:25:59Z","title":"Controllable Singing Style Conversion with Boundary-Aware Information Bottleneck","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T18:51:38.030059Z"},"links":{"citing_paper":"/paper/2604.05526"},"observation_digest":"sha256:ab63eb8e7dc23a52b1d53d4fb04d0ff9b68b000f43f4cda2549a04ba1dec0668","observation_id":"350a03d9-fbcf-440b-9d69-137d65d5013d","resolution":{"observed_at":"2026-05-16T14:02:58.922600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hifi-gan: Generative adversarial networks for eﬀicient and high fidelity speech synthesis","venue":null,"work_id":"224364e5-79d9-41b6-9850-d59be32d2c9e","year":2020},"citing_paper":{"arxiv_id":"2604.05526","last_updated":"2026-04-07T07:25:59Z","snapshot_observed_at":"2026-08-02T11:08:24.121491Z","submitted_at":"2026-04-07T07:25:59Z","title":"Controllable Singing Style Conversion with Boundary-Aware Information Bottleneck","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T18:51:38.030059Z"},"links":{"citing_paper":"/paper/2604.05526"},"observation_digest":"sha256:f851813f31a111fe9b3a78594a3708139425b954b0a602d9d60ddfd4cfda75b3","observation_id":"55e2ab63-fae9-4482-a0c9-c4c16fd352d7","resolution":{"observed_at":"2026-05-16T14:02:58.924998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00332","last_updated":"2023-06-16T09:07:11Z","snapshot_observed_at":"2026-08-05T18:44:00.793642Z","submitted_at":"2023-03-01T08:50:31Z","title":"CAM++: A Fast and Efficient Network for Speaker Verification Using Context-Aware Masking","version":3},"cited_work":{"arxiv_id":"2303.00332","doi":"10.48550/arxiv.2303.00332","metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00332","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CAM++: A fast and efficient network for speaker verification using context- aware masking","venue":"arXiv (Cornell University)","work_id":"c8a23639-6945-4c53-8684-841dea831af8","year":2023},"citing_paper":{"arxiv_id":"2604.05526","last_updated":"2026-04-07T07:25:59Z","snapshot_observed_at":"2026-08-02T11:08:24.121491Z","submitted_at":"2026-04-07T07:25:59Z","title":"Controllable Singing Style Conversion with Boundary-Aware Information Bottleneck","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T18:51:38.030059Z"},"links":{"cited_paper":"/paper/2303.00332","citing_paper":"/paper/2604.05526"},"observation_digest":"sha256:6b97ab38c7e0df0aa522420471a7e9029af40a6df7a45e9baf461555bea4f2ce","observation_id":"99df1911-2c91-4c2a-862f-c308e9aada21","resolution":{"observed_at":"2026-05-10T23:50:51.793968Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.01812","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T22:26:37.233509Z","title":"Singmos-pro: An comprehensive benchmark for singing quality assessment","venue":null,"work_id":"bd0f47f2-0178-478f-b7ab-e4239bc63527","year":2025},"citing_paper":{"arxiv_id":"2604.05526","last_updated":"2026-04-07T07:25:59Z","snapshot_observed_at":"2026-08-02T11:08:24.121491Z","submitted_at":"2026-04-07T07:25:59Z","title":"Controllable Singing Style Conversion with Boundary-Aware Information Bottleneck","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T18:51:38.030059Z"},"links":{"citing_paper":"/paper/2604.05526"},"observation_digest":"sha256:a1288aa6a34e85fd3a1b810a75ac562b3d26e872c5a1c1950055a68dc8f890fd","observation_id":"f3507016-f6cf-4b09-927c-193a92c71fa2","resolution":{"observed_at":"2026-05-10T23:50:51.713914Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.05526","last_updated":"2026-04-07T07:25:59Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-02T11:08:24.121491Z","submitted_at":"2026-04-07T07:25:59Z","title":"Controllable Singing Style Conversion with Boundary-Aware Information Bottleneck"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":20,"verified_fuzzy":23},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2604.05526."}