{"as_of":"2026-08-04T19:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9984557070d854d4f912a23d55228088dd9aada88d07820498e3307d170bd36e","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T14:53:15.718359Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T14:53:15.718359Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-05-20T14:53:23.198073Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.17085","last_updated":"2026-05-16T17:01:47Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T17:01:47Z","title":"Taming Audio VAEs via Target-KL Regularization","version":1},"cited_work":{"arxiv_id":"2605.17085","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.17085","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Taming Audio VAEs via Target-KL Regularization","venue":"cs.SD","work_id":"4106ee89-e44f-46ac-bfd3-288ea9d1a197","year":2026},"citing_paper":{"arxiv_id":"2605.17085","last_updated":"2026-05-16T17:01:47Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T17:01:47Z","title":"Taming Audio VAEs via Target-KL Regularization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-20T14:53:15.718359Z"},"links":{"cited_paper":"/paper/2605.17085","citing_paper":"/paper/2605.17085"},"observation_digest":"sha256:f83095df64aec0ccd59443e18c16b4bd858909031bb74ebb7f7bc373a6ea110d","observation_id":"08e5bc35-139f-4b17-88df-1dfb9801d680","resolution":{"observed_at":"2026-05-20T14:53:23.199683Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2605.17085/citation-record","integrity":"/paper/2605.17085/integrity","json":"/paper/2605.17085/citation-record.json","paper":"/paper/2605.17085"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c346fb87-6c31-4578-9d21-a587139d9173","year":null},"citing_paper":{"arxiv_id":"2605.17085","last_updated":"2026-05-16T17:01:47Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T17:01:47Z","title":"Taming Audio VAEs via Target-KL Regularization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-20T14:53:15.718359Z"},"links":{"citing_paper":"/paper/2605.17085"},"observation_digest":"sha256:0d60058aae6894ad1cb9c977770092f2ed13ff604e7c9dfe09e394319de86f18","observation_id":"2801ff57-1e74-4225-b0f4-afd3a9f4636a","resolution":{"observed_at":"2026-05-20T14:53:23.496571Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4bdf2644-6284-4241-b771-474dd0b87b33","year":null},"citing_paper":{"arxiv_id":"2605.17085","last_updated":"2026-05-16T17:01:47Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T17:01:47Z","title":"Taming Audio VAEs via Target-KL Regularization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-20T14:53:15.718359Z"},"links":{"citing_paper":"/paper/2605.17085"},"observation_digest":"sha256:f577e4b0821091c090d48594b23e4b0d991aba700cb090d12404dfb6f307d45c","observation_id":"771bc962-b180-478b-a295-4c2b60751b29","resolution":{"observed_at":"2026-05-20T14:53:23.492603Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"bdf6200c-3269-4f17-950e-2f5388f304c6","year":null},"citing_paper":{"arxiv_id":"2605.17085","last_updated":"2026-05-16T17:01:47Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T17:01:47Z","title":"Taming Audio VAEs via Target-KL Regularization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-20T14:53:15.718359Z"},"links":{"citing_paper":"/paper/2605.17085"},"observation_digest":"sha256:f6d94e25248438238b096524eb29828d8e3042bd615d69190bb1893368bc0558","observation_id":"37ab0a92-c010-47af-95f0-b251a54e9137","resolution":{"observed_at":"2026-05-20T14:53:23.494633Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"bdd21ad3-735f-459a-aa6b-066a3d70fc7c","year":null},"citing_paper":{"arxiv_id":"2605.17085","last_updated":"2026-05-16T17:01:47Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T17:01:47Z","title":"Taming Audio VAEs via Target-KL Regularization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-20T14:53:15.718359Z"},"links":{"citing_paper":"/paper/2605.17085"},"observation_digest":"sha256:c0feb54a8a8934fdefe7603f0a98b422105380114f505eea737e4ff248ce476d","observation_id":"87d74ee6-96e8-40ac-bede-460fd3eb4ead","resolution":{"observed_at":"2026-05-20T14:53:23.490382Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.17085","last_updated":"2026-05-16T17:01:47Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T17:01:47Z","title":"Taming Audio VAEs via Target-KL Regularization","version":1},"cited_work":{"arxiv_id":"2605.17085","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.17085","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Taming Audio VAEs via Target-KL Regularization","venue":"cs.SD","work_id":"4106ee89-e44f-46ac-bfd3-288ea9d1a197","year":2026},"citing_paper":{"arxiv_id":"2605.17085","last_updated":"2026-05-16T17:01:47Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T17:01:47Z","title":"Taming Audio VAEs via Target-KL Regularization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-20T14:53:15.718359Z"},"links":{"cited_paper":"/paper/2605.17085","citing_paper":"/paper/2605.17085"},"observation_digest":"sha256:f83095df64aec0ccd59443e18c16b4bd858909031bb74ebb7f7bc373a6ea110d","observation_id":"08e5bc35-139f-4b17-88df-1dfb9801d680","resolution":{"observed_at":"2026-05-20T14:53:23.199683Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Model architecture Our model is built on the same framework of neural audio codec models, except we replace the quantization bottleneck with a gaus- sian regularization","venue":null,"work_id":"8b876ae9-c364-4297-b7da-2021814fd0b9","year":null},"citing_paper":{"arxiv_id":"2605.17085","last_updated":"2026-05-16T17:01:47Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T17:01:47Z","title":"Taming Audio VAEs via Target-KL Regularization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-20T14:53:15.718359Z"},"links":{"citing_paper":"/paper/2605.17085"},"observation_digest":"sha256:a4f975de9e13c93f11e8151df0ec79280ca21534d34f04d77a6530ca135ae4c6","observation_id":"684f0f92-7476-44c4-8ded-005f1e3a7e21","resolution":{"observed_at":"2026-05-20T14:53:23.528340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ce28b39c-b0e4-4730-840d-24fcceab6b0d","year":null},"citing_paper":{"arxiv_id":"2605.17085","last_updated":"2026-05-16T17:01:47Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T17:01:47Z","title":"Taming Audio VAEs via Target-KL Regularization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-20T14:53:15.718359Z"},"links":{"citing_paper":"/paper/2605.17085"},"observation_digest":"sha256:4dbe0899a8856709f5875a58910196e720e7aacdbb0630ce73e49c342f048948","observation_id":"2611bae7-9537-42a6-a7ee-8479da6ff6ae","resolution":{"observed_at":"2026-05-20T14:53:23.551137Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"This allows for direct comparison to discrete neural audio codecs and enables systematic study of the rate-distortion trade-off for continuous audio compres- sion models","venue":null,"work_id":"b074bd20-dcab-422a-bf87-61bbd2eb48e0","year":null},"citing_paper":{"arxiv_id":"2605.17085","last_updated":"2026-05-16T17:01:47Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T17:01:47Z","title":"Taming Audio VAEs via Target-KL Regularization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T14:53:15.718359Z"},"links":{"citing_paper":"/paper/2605.17085"},"observation_digest":"sha256:7722f80c46f104c3d9bb6eb06fcdc5732b71943a8eb1a913b2c851f987d36e21","observation_id":"91155a2c-46dd-4c89-8208-5490d10a79d8","resolution":{"observed_at":"2026-05-20T14:53:23.498854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Neural discrete representation learning","venue":null,"work_id":"e4cc85ce-9b15-4b67-906b-6de7e3c203c5","year":2017},"citing_paper":{"arxiv_id":"2605.17085","last_updated":"2026-05-16T17:01:47Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T17:01:47Z","title":"Taming Audio VAEs via Target-KL Regularization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-20T14:53:15.718359Z"},"links":{"citing_paper":"/paper/2605.17085"},"observation_digest":"sha256:40821ddd2a2fbe54e49d0adc39ec481b8ee72a001845fb14613c48e310a6016c","observation_id":"f3f913b4-64b3-4bad-affe-0c2bd62ec039","resolution":{"observed_at":"2026-05-20T14:53:23.545442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"bb3553a1-1781-42b0-acf4-ce4130367683","year":2022},"citing_paper":{"arxiv_id":"2605.17085","last_updated":"2026-05-16T17:01:47Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T17:01:47Z","title":"Taming Audio VAEs via Target-KL Regularization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-20T14:53:15.718359Z"},"links":{"citing_paper":"/paper/2605.17085"},"observation_digest":"sha256:103dcafea410c1436d3b0ac27a35d5d9ba619c3bb54e0bd2285c31a244999a6d","observation_id":"1ed826fb-88ba-4124-8c89-3ed2c5b9db55","resolution":{"observed_at":"2026-05-20T14:53:23.547408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Audiolm: a language modeling approach to audio generation","venue":null,"work_id":"fc3e9488-42da-4bfe-9e0e-477dcbf0c1c5","year":2023},"citing_paper":{"arxiv_id":"2605.17085","last_updated":"2026-05-16T17:01:47Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T17:01:47Z","title":"Taming Audio VAEs via Target-KL Regularization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-20T14:53:15.718359Z"},"links":{"citing_paper":"/paper/2605.17085"},"observation_digest":"sha256:3588e47f098d8d7f7da6bb46528eb0f206b942e4dd504f1c6b5467f99c086149","observation_id":"92576b4d-5b78-447a-ad0d-bee40344e3ca","resolution":{"observed_at":"2026-05-20T14:53:23.509831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stable audio open","venue":null,"work_id":"4f097874-9757-4b77-a9a6-8469ca2ed40f","year":2025},"citing_paper":{"arxiv_id":"2605.17085","last_updated":"2026-05-16T17:01:47Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T17:01:47Z","title":"Taming Audio VAEs via Target-KL Regularization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-20T14:53:15.718359Z"},"links":{"citing_paper":"/paper/2605.17085"},"observation_digest":"sha256:3e3f2ca64da30f3303c8b4a83490d4d29ed65a3b88bf44c60c693111308d785a","observation_id":"4770f34f-9e9f-4ada-8db9-fd99cd8978ec","resolution":{"observed_at":"2026-05-20T14:53:23.530193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-02T20:06:32.256011Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":"2301.02111","doi":"10.48550/arxiv.2301.02111","metadata_source":"pith","pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","venue":"cs.CL","work_id":"de8fb688-dd63-4942-92f6-66d98d5b6db2","year":2023},"citing_paper":{"arxiv_id":"2605.17085","last_updated":"2026-05-16T17:01:47Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T17:01:47Z","title":"Taming Audio VAEs via Target-KL Regularization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-20T14:53:15.718359Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2605.17085"},"observation_digest":"sha256:8425c4fb5adb5cbfc2fca6522e0cd03196a00a7a51eb66b52c0f87d382d45a72","observation_id":"77cf3431-ac9d-4fce-b064-c5ca517ad311","resolution":{"observed_at":"2026-05-20T14:53:23.187655Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04686","last_updated":"2023-07-12T17:06:41Z","snapshot_observed_at":"2026-07-06T15:52:13.602170Z","submitted_at":"2023-07-10T16:42:03Z","title":"VampNet: Music Generation via Masked Acoustic Token Modeling","version":2},"cited_work":{"arxiv_id":"2307.04686","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2307.04686","snapshot_observed_at":"2026-07-01T11:45:47.216407Z","title":"Vampnet: Music generation via masked acous- tic token modeling","venue":null,"work_id":"8fc0773f-1afa-4d1e-b92a-7550a4867ec1","year":2023},"citing_paper":{"arxiv_id":"2605.17085","last_updated":"2026-05-16T17:01:47Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T17:01:47Z","title":"Taming Audio VAEs via Target-KL Regularization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-20T14:53:15.718359Z"},"links":{"cited_paper":"/paper/2307.04686","citing_paper":"/paper/2605.17085"},"observation_digest":"sha256:42cb3bae9132d537bdcd80ea48b12070a7a235020d29ac56149f4254b8e200f9","observation_id":"fd56e338-9c70-4e3b-b60e-b98286b6bad7","resolution":{"observed_at":"2026-05-20T14:53:23.218495Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00750","last_updated":"2024-10-20T14:25:49Z","snapshot_observed_at":"2026-08-01T10:20:49.367508Z","submitted_at":"2024-09-01T15:26:30Z","title":"MaskGCT: Zero-Shot Text-to-Speech with Masked Generative Codec Transformer","version":3},"cited_work":{"arxiv_id":"2409.00750","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.00750","snapshot_observed_at":"2026-07-04T12:19:49.609343Z","title":"Maskgct: Zero-shot text- to-speech with masked generative codec transformer","venue":null,"work_id":"1444247d-e7a0-465c-8c12-8cae0e2933dd","year":2024},"citing_paper":{"arxiv_id":"2605.17085","last_updated":"2026-05-16T17:01:47Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T17:01:47Z","title":"Taming Audio VAEs via Target-KL Regularization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-20T14:53:15.718359Z"},"links":{"cited_paper":"/paper/2409.00750","citing_paper":"/paper/2605.17085"},"observation_digest":"sha256:14afc8455d764ae59be8c8d8e8354bdbabed4a5b69d5f27f71f0bd5743355834","observation_id":"b8583be2-aef0-4be5-98d7-8b637f38461b","resolution":{"observed_at":"2026-05-20T14:53:23.231264Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09636","last_updated":"2023-05-16T17:41:25Z","snapshot_observed_at":"2026-07-06T15:28:16.998343Z","submitted_at":"2023-05-16T17:41:25Z","title":"SoundStorm: Efficient Parallel Audio Generation","version":1},"cited_work":{"arxiv_id":"2305.09636","doi":"10.48550/arxiv.2305.09636","metadata_source":"pith","pith_arxiv_id":"2305.09636","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"AudioLM: A language modeling approach to audio generation.IEEE/ACM Trans","venue":"cs.SD","work_id":"c68926d8-7cb2-4b44-9b10-396551c6bb67","year":2023},"citing_paper":{"arxiv_id":"2605.17085","last_updated":"2026-05-16T17:01:47Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T17:01:47Z","title":"Taming Audio VAEs via Target-KL Regularization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-20T14:53:15.718359Z"},"links":{"cited_paper":"/paper/2305.09636","citing_paper":"/paper/2605.17085"},"observation_digest":"sha256:61d2aac30572df45aeda5b751de323e870f38b699723a07c1236dd92e2cc5763","observation_id":"76880868-1f65-483d-a52e-60e57fb1c33d","resolution":{"observed_at":"2026-05-20T14:53:23.221489Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":"1312.6114","doi":"10.2139/ssrn.4269703","metadata_source":"pith","pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Auto-Encoding Variational Bayes","venue":"stat.ML","work_id":"97d95295-30e1-42b4-bbf6-85f0fa4edb44","year":2013},"citing_paper":{"arxiv_id":"2605.17085","last_updated":"2026-05-16T17:01:47Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T17:01:47Z","title":"Taming Audio VAEs via Target-KL Regularization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-20T14:53:15.718359Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2605.17085"},"observation_digest":"sha256:10b017bc2df5d9436a3b097467ab0cd84d2b1debf7d360711feda6d8aeaef4cb","observation_id":"7d7aca55-741a-471d-add7-dd127d086ea2","resolution":{"observed_at":"2026-05-20T14:53:23.205869Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":"64773946-200d-4d83-a5ca-158820f57454","year":2020},"citing_paper":{"arxiv_id":"2605.17085","last_updated":"2026-05-16T17:01:47Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T17:01:47Z","title":"Taming Audio VAEs via Target-KL Regularization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-20T14:53:15.718359Z"},"links":{"citing_paper":"/paper/2605.17085"},"observation_digest":"sha256:be05df8ed6fca73d2f4a56d1974b1e7b45b36ffb8ce6551305fdc7e5e2930a81","observation_id":"7a56c53d-6cf0-4c59-af0d-26f022923b05","resolution":{"observed_at":"2026-05-20T14:53:23.543609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Au- dioLDM: Text-to-audio generation with latent diffusion mod- els","venue":null,"work_id":"81ff8c4f-e4ed-4c81-afde-17f1273be85c","year":2023},"citing_paper":{"arxiv_id":"2605.17085","last_updated":"2026-05-16T17:01:47Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T17:01:47Z","title":"Taming Audio VAEs via Target-KL Regularization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-20T14:53:15.718359Z"},"links":{"citing_paper":"/paper/2605.17085"},"observation_digest":"sha256:5dfe8220782199f277b494ba88e1e07b08eb0eabe67cc234b376c08d40151440","observation_id":"933421a4-e9a7-4c06-9768-f425aac0e273","resolution":{"observed_at":"2026-05-20T14:53:23.534344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling rectified flow transformers for high-resolution image synthesis","venue":null,"work_id":"6cb8288e-3eb3-4f2d-a9e2-034e99c90a4c","year":2024},"citing_paper":{"arxiv_id":"2605.17085","last_updated":"2026-05-16T17:01:47Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T17:01:47Z","title":"Taming Audio VAEs via Target-KL Regularization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-20T14:53:15.718359Z"},"links":{"citing_paper":"/paper/2605.17085"},"observation_digest":"sha256:aba46699fb870b46389ca31a00a97ca52a2c7408f90d8c326644b9a7f4fa22e1","observation_id":"2d4bb04f-ccf6-4b91-85a7-7c2c06ce171b","resolution":{"observed_at":"2026-05-20T14:53:23.518704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Soundstream: An end-to- end neural audio codec","venue":null,"work_id":"809222e1-8867-4839-bce2-c5ac44b70867","year":2021},"citing_paper":{"arxiv_id":"2605.17085","last_updated":"2026-05-16T17:01:47Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T17:01:47Z","title":"Taming Audio VAEs via Target-KL Regularization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-20T14:53:15.718359Z"},"links":{"citing_paper":"/paper/2605.17085"},"observation_digest":"sha256:bc428dc985179da5598a5ff66223e5f13df6a8722d76c9211a5379b5ce1247a3","observation_id":"83b4282f-b643-445d-bc11-3de7a17fbed1","resolution":{"observed_at":"2026-05-20T14:53:23.505528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"High-fidelity audio compression with improved rvqgan","venue":null,"work_id":"6e33816f-6a80-4619-8393-00aae66ea9ec","year":2023},"citing_paper":{"arxiv_id":"2605.17085","last_updated":"2026-05-16T17:01:47Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T17:01:47Z","title":"Taming Audio VAEs via Target-KL Regularization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-20T14:53:15.718359Z"},"links":{"citing_paper":"/paper/2605.17085"},"observation_digest":"sha256:4a093427296bc6a7d537c610dc8dd3b1bd95d2d606a2d247a48e91bd4dd71493","observation_id":"9d243bcb-1239-48e8-81cd-3fc20255b94c","resolution":{"observed_at":"2026-05-20T14:53:23.514421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In- terpreting rate-distortion of variational autoencoder and using model uncertainty for anomaly detection","venue":null,"work_id":"7a727cc2-dc7b-48a6-a12a-270e0a36d71d","year":2022},"citing_paper":{"arxiv_id":"2605.17085","last_updated":"2026-05-16T17:01:47Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T17:01:47Z","title":"Taming Audio VAEs via Target-KL Regularization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-20T14:53:15.718359Z"},"links":{"citing_paper":"/paper/2605.17085"},"observation_digest":"sha256:e1924a1fd19c8ac5b0f160cd60a3a6eac9c9561264813e5843b9215a0a1689e8","observation_id":"3a2cb772-818c-41ff-aa15-7eadf2cf56a9","resolution":{"observed_at":"2026-05-20T14:53:23.526220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.04866","last_updated":"2019-01-15T14:45:47Z","snapshot_observed_at":"2026-08-04T05:40:24.818792Z","submitted_at":"2019-01-15T14:45:47Z","title":"Practical Lossless Compression with Latent Variables using Bits Back Coding","version":1},"cited_work":{"arxiv_id":"1901.04866","doi":null,"metadata_source":"pith","pith_arxiv_id":"1901.04866","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Practical Lossless Compression with Latent Variables using Bits Back Coding","venue":"cs.LG","work_id":"30829eb9-e840-441d-b45c-762056f778ac","year":2019},"citing_paper":{"arxiv_id":"2605.17085","last_updated":"2026-05-16T17:01:47Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T17:01:47Z","title":"Taming Audio VAEs via Target-KL Regularization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-20T14:53:15.718359Z"},"links":{"cited_paper":"/paper/1901.04866","citing_paper":"/paper/2605.17085"},"observation_digest":"sha256:9b42ab91c59c50826fa40724094a80006cff15f35d3a1255ea8ba17d98634d70","observation_id":"88592c11-9e50-43de-ad61-c73f6bf38523","resolution":{"observed_at":"2026-05-20T14:53:23.237386Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.00464","last_updated":"2018-02-13T20:54:38Z","snapshot_observed_at":"2026-07-06T06:07:16.807271Z","submitted_at":"2017-11-01T17:58:43Z","title":"Fixing a Broken ELBO","version":3},"cited_work":{"arxiv_id":"1711.00464","doi":null,"metadata_source":"pith","pith_arxiv_id":"1711.00464","snapshot_observed_at":"2026-07-03T21:48:58.979165Z","title":"Fixing a Broken ELBO","venue":"cs.LG","work_id":"b52f462b-117d-4508-9613-ede04fa3245f","year":2017},"citing_paper":{"arxiv_id":"2605.17085","last_updated":"2026-05-16T17:01:47Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T17:01:47Z","title":"Taming Audio VAEs via Target-KL Regularization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-20T14:53:15.718359Z"},"links":{"cited_paper":"/paper/1711.00464","citing_paper":"/paper/2605.17085"},"observation_digest":"sha256:e855d21e433f2bcf7454d5a3d8d6b61036fd59f2799885021b1e3fe62f163612","observation_id":"e3159072-c9d8-4185-88e6-4e2bac5f83f3","resolution":{"observed_at":"2026-05-20T14:53:23.215261Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improved variational in- ference with inverse autoregressive flow","venue":null,"work_id":"a4439c4f-e44b-481b-97c9-d23c5ede9599","year":2016},"citing_paper":{"arxiv_id":"2605.17085","last_updated":"2026-05-16T17:01:47Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T17:01:47Z","title":"Taming Audio VAEs via Target-KL Regularization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-20T14:53:15.718359Z"},"links":{"citing_paper":"/paper/2605.17085"},"observation_digest":"sha256:6f0c51b113a5c0f7fe62c9e8bd57e7293ecdae0c4c2587b18edcc5cf08722150","observation_id":"bdb16ce2-de3e-455c-9a8a-64ca6abb24a0","resolution":{"observed_at":"2026-05-20T14:53:23.507725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An introduction to variational autoencoders","venue":null,"work_id":"d776a882-8e4c-438f-acdd-c47cdb100263","year":2019},"citing_paper":{"arxiv_id":"2605.17085","last_updated":"2026-05-16T17:01:47Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T17:01:47Z","title":"Taming Audio VAEs via Target-KL Regularization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-20T14:53:15.718359Z"},"links":{"citing_paper":"/paper/2605.17085"},"observation_digest":"sha256:f1c0358b9176d38dfc8cbb0bb2dd5406dc0271c25e5b439cdc76f220a2193581","observation_id":"c62bb11d-3d35-44f0-bea4-db2b52abbf64","resolution":{"observed_at":"2026-05-20T14:53:23.539824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04658","last_updated":"2023-02-16T18:48:56Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:56:10Z","title":"BigVGAN: A Universal Neural Vocoder with Large-Scale Training","version":2},"cited_work":{"arxiv_id":"2206.04658","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.04658","snapshot_observed_at":"2026-07-04T05:39:39.351499Z","title":"Bigvgan: A universal neural vocoder with large-scale training","venue":null,"work_id":"953c2238-9c78-4b7c-a435-58768d959ff6","year":2022},"citing_paper":{"arxiv_id":"2605.17085","last_updated":"2026-05-16T17:01:47Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T17:01:47Z","title":"Taming Audio VAEs via Target-KL Regularization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-20T14:53:15.718359Z"},"links":{"cited_paper":"/paper/2206.04658","citing_paper":"/paper/2605.17085"},"observation_digest":"sha256:75f9cc18906e9ba4d4a5f681b7be9e5f6f4bde1a27d2d612b58cf3144939771a","observation_id":"636c0cda-1aa7-491a-803c-a712e014276f","resolution":{"observed_at":"2026-05-20T14:53:23.209087Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":"2410.00037","doi":"10.1121/1.1906946","metadata_source":"pith","pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Moshi: a speech-text foundation model for real-time dialogue","venue":"eess.AS","work_id":"3104332b-d279-44c8-aaa7-3d5a13c01832","year":2024},"citing_paper":{"arxiv_id":"2605.17085","last_updated":"2026-05-16T17:01:47Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T17:01:47Z","title":"Taming Audio VAEs via Target-KL Regularization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-20T14:53:15.718359Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2605.17085"},"observation_digest":"sha256:cb4610d776d66846697adb5ca48ba66f8de070a4cb4aa8970d8955fafb792d72","observation_id":"c54fba4e-1e70-448e-97f0-4089dc6858d8","resolution":{"observed_at":"2026-05-20T14:53:23.212392Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Audio set: An ontology and human-labeled dataset for audio events","venue":null,"work_id":"6bb6099b-ed82-41f9-9a31-9c0d584443db","year":2017},"citing_paper":{"arxiv_id":"2605.17085","last_updated":"2026-05-16T17:01:47Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T17:01:47Z","title":"Taming Audio VAEs via Target-KL Regularization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-20T14:53:15.718359Z"},"links":{"citing_paper":"/paper/2605.17085"},"observation_digest":"sha256:3f78099c1dcd43897163632c64ed6b0a703b91a66f32179107c4e8497d7e00d3","observation_id":"9cf33edb-f31d-4617-8a83-2def3c1439e0","resolution":{"observed_at":"2026-05-20T14:53:23.500959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-07-06T22:09:18.804010Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"cited_work":{"arxiv_id":"2508.05207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.05207","snapshot_observed_at":"2026-07-04T14:59:54.992758Z","title":"Spectrostream: A versatile neural codec for general audio","venue":null,"work_id":"e5f1dc1c-004b-4bd0-963e-8a8e8bd157fa","year":2025},"citing_paper":{"arxiv_id":"2605.17085","last_updated":"2026-05-16T17:01:47Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T17:01:47Z","title":"Taming Audio VAEs via Target-KL Regularization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-20T14:53:15.718359Z"},"links":{"cited_paper":"/paper/2508.05207","citing_paper":"/paper/2605.17085"},"observation_digest":"sha256:8e59bed288f442f1ef332f623f6cb4392ccd30dc61070d95fa4f09cdc614dad6","observation_id":"20135b68-3616-4b79-bada-563d7092f5ab","resolution":{"observed_at":"2026-05-20T14:53:23.193610Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-03T16:47:47.192907Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":"2210.13438","doi":"10.48550/arxiv.2210.13438","metadata_source":"pith","pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"High Fidelity Neural Audio Compression","venue":"eess.AS","work_id":"bc645d2d-e9f2-4cb8-9a6d-bd557bc7a258","year":2022},"citing_paper":{"arxiv_id":"2605.17085","last_updated":"2026-05-16T17:01:47Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T17:01:47Z","title":"Taming Audio VAEs via Target-KL Regularization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-20T14:53:15.718359Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2605.17085"},"observation_digest":"sha256:a40e6b3e6c0b3a586e0092af3be96f3ceef74fd4808f07ecd99f3a4873b769b5","observation_id":"6b273d94-6d2f-4367-8629-6fd27bb371f1","resolution":{"observed_at":"2026-05-20T14:53:23.184582Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-19T16:22:25.658509+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T16:22:25.658509+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.00512","last_updated":"2022-06-07T09:17:35Z","snapshot_observed_at":"2026-07-06T12:33:23.843893Z","submitted_at":"2022-02-01T16:07:25Z","title":"Progressive Distillation for Fast Sampling of Diffusion Models","version":2},"cited_work":{"arxiv_id":"2202.00512","doi":"10.48550/arxiv.2202.00512","metadata_source":"pith","pith_arxiv_id":"2202.00512","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Progressive Distillation for Fast Sampling of Diffusion Models","venue":"cs.LG","work_id":"fd04f498-ff85-4de3-bcc7-31ef072b2ceb","year":2022},"citing_paper":{"arxiv_id":"2605.17085","last_updated":"2026-05-16T17:01:47Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T17:01:47Z","title":"Taming Audio VAEs via Target-KL Regularization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-20T14:53:15.718359Z"},"links":{"cited_paper":"/paper/2202.00512","citing_paper":"/paper/2605.17085"},"observation_digest":"sha256:61324d0aba35cc2f9768605c900fcb7aa347f11568b30b365be2073ac8ec7efb","observation_id":"a1ea9b96-7ea7-4f91-a008-fa96c690987a","resolution":{"observed_at":"2026-05-20T14:53:23.234423Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"sim- ple diffusion: End-to-end diffusion for high resolution im- ages","venue":null,"work_id":"1cf17519-5c92-43b6-8e15-15e6615c5b57","year":2023},"citing_paper":{"arxiv_id":"2605.17085","last_updated":"2026-05-16T17:01:47Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T17:01:47Z","title":"Taming Audio VAEs via Target-KL Regularization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-20T14:53:15.718359Z"},"links":{"citing_paper":"/paper/2605.17085"},"observation_digest":"sha256:c80a4b3c8f2348e21b56ee81898fd3876bb7cb8a14725432aa8eecfc02a0969f","observation_id":"c30fea26-bd78-456d-8ad6-14f4103c5604","resolution":{"observed_at":"2026-05-20T14:53:23.511990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Simple-tts: End-to-end text-to-speech synthesis with latent diffusion","venue":null,"work_id":"ec643d1d-6b00-4d8d-af21-6f7b58efe527","year":2023},"citing_paper":{"arxiv_id":"2605.17085","last_updated":"2026-05-16T17:01:47Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T17:01:47Z","title":"Taming Audio VAEs via Target-KL Regularization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-20T14:53:15.718359Z"},"links":{"citing_paper":"/paper/2605.17085"},"observation_digest":"sha256:a9c3bede1bf54445ce50c9e0f9f1f8608d37219f538684a10ab2f9288a3171bf","observation_id":"7262eaa6-04e7-4c77-96c1-8d0a3fb68ae6","resolution":{"observed_at":"2026-05-20T14:53:23.538092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":"c1cd3fc9-9838-4eed-b195-50e85fde4b2f","year":2023},"citing_paper":{"arxiv_id":"2605.17085","last_updated":"2026-05-16T17:01:47Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T17:01:47Z","title":"Taming Audio VAEs via Target-KL Regularization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-20T14:53:15.718359Z"},"links":{"citing_paper":"/paper/2605.17085"},"observation_digest":"sha256:fd896f641d0442b134b02c811a52202ebed3a529c41100f978f8914bd1534504","observation_id":"9c9e3d41-425b-40ee-987f-4911387a26f6","resolution":{"observed_at":"2026-05-20T14:53:23.532380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ditto-tts: Efficient and scalable zero-shot text-to-speech with diffusion transformer","venue":null,"work_id":"c0baa26c-7032-4e0f-8d1f-b08c4baa1488","year":2024},"citing_paper":{"arxiv_id":"2605.17085","last_updated":"2026-05-16T17:01:47Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T17:01:47Z","title":"Taming Audio VAEs via Target-KL Regularization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-20T14:53:15.718359Z"},"links":{"citing_paper":"/paper/2605.17085"},"observation_digest":"sha256:f2297b4fcaa723b8a2f680eb86df2500966046f4327ec617dad37cb5aec8b6dc","observation_id":"69d5631a-61d2-4e30-9e6a-6acd53f2c2cf","resolution":{"observed_at":"2026-05-20T14:53:23.524065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05551","last_updated":"2024-06-08T18:57:13Z","snapshot_observed_at":"2026-07-06T18:27:36.903877Z","submitted_at":"2024-06-08T18:57:13Z","title":"Autoregressive Diffusion Transformer for Text-to-Speech Synthesis","version":1},"cited_work":{"arxiv_id":"2406.05551","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.05551","snapshot_observed_at":"2026-07-03T03:27:35.627140Z","title":"Autoregressive diffusion transformer for text-to-speech synthesis","venue":null,"work_id":"5585ee67-b148-4f36-896c-88d83418d9f6","year":2024},"citing_paper":{"arxiv_id":"2605.17085","last_updated":"2026-05-16T17:01:47Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T17:01:47Z","title":"Taming Audio VAEs via Target-KL Regularization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-20T14:53:15.718359Z"},"links":{"cited_paper":"/paper/2406.05551","citing_paper":"/paper/2605.17085"},"observation_digest":"sha256:03cb7c751d96561c62eb4708809edc2a53ab4abf85fe25cb230e4de63d846955","observation_id":"054760b5-1092-498f-a46d-067d866ca8d2","resolution":{"observed_at":"2026-05-20T14:53:23.224858Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Byt5: Towards a token-free future with pre-trained byte-to- byte models","venue":null,"work_id":"ad5f3516-a4fe-4a15-88c5-be7f0af54b4a","year":2022},"citing_paper":{"arxiv_id":"2605.17085","last_updated":"2026-05-16T17:01:47Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T17:01:47Z","title":"Taming Audio VAEs via Target-KL Regularization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-20T14:53:15.718359Z"},"links":{"citing_paper":"/paper/2605.17085"},"observation_digest":"sha256:c68a4b17ef46bc0407e6c00eae2797817f8af0034b9916e0e7ea0410ca68d778","observation_id":"e0306326-c226-411b-a171-bd5f9c80c4fb","resolution":{"observed_at":"2026-05-20T14:53:23.521781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":"915a3855-2fab-44f5-ba38-ee0acf3a6e53","year":2020},"citing_paper":{"arxiv_id":"2605.17085","last_updated":"2026-05-16T17:01:47Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T17:01:47Z","title":"Taming Audio VAEs via Target-KL Regularization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-20T14:53:15.718359Z"},"links":{"citing_paper":"/paper/2605.17085"},"observation_digest":"sha256:c2b8a239412bcd39ddf4610f77098fa704df6c2b9c32c181c35b7d17a1cd17b4","observation_id":"9dd8e9e3-17a6-43e0-b1c3-47de3dde233d","resolution":{"observed_at":"2026-05-20T14:53:23.536255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Phonemizer: Text to phones transcription for multiple languages in python","venue":null,"work_id":"a60b5e19-5f26-443b-b349-93f861e2beb2","year":2021},"citing_paper":{"arxiv_id":"2605.17085","last_updated":"2026-05-16T17:01:47Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T17:01:47Z","title":"Taming Audio VAEs via Target-KL Regularization","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-20T14:53:15.718359Z"},"links":{"citing_paper":"/paper/2605.17085"},"observation_digest":"sha256:e8b4da574516f17a4de9453574f2df606110f4a536ac822306c25bbf62ba57da","observation_id":"6c3d5fca-e480-47fb-8de3-1a6bfa14f44e","resolution":{"observed_at":"2026-05-20T14:53:23.541832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2501.15907","doi":"10.48550/arxiv.2501.15907","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Emilia: A large-scale, extensive, multilin- gual, and diverse dataset for speech generation","venue":null,"work_id":"4a6ce565-770f-41dc-b23b-3f5f048bf113","year":2025},"citing_paper":{"arxiv_id":"2605.17085","last_updated":"2026-05-16T17:01:47Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T17:01:47Z","title":"Taming Audio VAEs via Target-KL Regularization","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-20T14:53:15.718359Z"},"links":{"citing_paper":"/paper/2605.17085"},"observation_digest":"sha256:bda7fe6901a1fb6c7ec00a593b43766349fffe29d3c28cc7a499fae0a49b656c","observation_id":"3c53ee44-f5df-41db-84f7-c92726aefef5","resolution":{"observed_at":"2026-05-20T14:53:23.227927Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09789","last_updated":"2024-12-13T02:07:21Z","snapshot_observed_at":"2026-07-06T20:06:17.706151Z","submitted_at":"2024-12-13T02:07:21Z","title":"SILA: Signal-to-Language Augmentation for Enhanced Control in Text-to-Audio Generation","version":1},"cited_work":{"arxiv_id":"2412.09789","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.09789","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sila: Signal-to-language augmen- tation for enhanced control in text-to-audio generation","venue":null,"work_id":"af9bcdfc-7b79-4a19-ae32-b25e4632e1c6","year":2024},"citing_paper":{"arxiv_id":"2605.17085","last_updated":"2026-05-16T17:01:47Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T17:01:47Z","title":"Taming Audio VAEs via Target-KL Regularization","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-20T14:53:15.718359Z"},"links":{"cited_paper":"/paper/2412.09789","citing_paper":"/paper/2605.17085"},"observation_digest":"sha256:d79584e40d99000c834a59df746a0af85bda9b9d5400bb44d02b21b65e2af171","observation_id":"3e4bfec1-d8dd-4d70-8845-cb42683db895","resolution":{"observed_at":"2026-05-20T14:53:23.240224Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sketch2sound: Controllable audio generation via time-varying signals and sonic imitations","venue":null,"work_id":"0d5dd016-07ff-45ec-a020-4f0cab5e200a","year":2025},"citing_paper":{"arxiv_id":"2605.17085","last_updated":"2026-05-16T17:01:47Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T17:01:47Z","title":"Taming Audio VAEs via Target-KL Regularization","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-20T14:53:15.718359Z"},"links":{"citing_paper":"/paper/2605.17085"},"observation_digest":"sha256:7f791b9bdcfea960f1a2c3854c2795b4cb3f220dac1efa51509c88b2f8751ac4","observation_id":"4492068a-99c8-41aa-b65c-f503dcfe9086","resolution":{"observed_at":"2026-05-20T14:53:23.503422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"FLAM: Frame-wise language-audio model- ing","venue":null,"work_id":"d9808fa5-d2d3-4c99-9653-abb2ecc87ae7","year":2025},"citing_paper":{"arxiv_id":"2605.17085","last_updated":"2026-05-16T17:01:47Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T17:01:47Z","title":"Taming Audio VAEs via Target-KL Regularization","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-20T14:53:15.718359Z"},"links":{"citing_paper":"/paper/2605.17085"},"observation_digest":"sha256:3fadda1736524533d6ffff0d0180503ecbfe39af7ddafd9f916c5abc16ec6817","observation_id":"2deef7fe-17c5-41e7-86e9-fd1420012cc4","resolution":{"observed_at":"2026-05-20T14:53:23.516502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling instruction- finetuned language models","venue":null,"work_id":"356f4e04-e893-4264-ad29-e24d6f22590a","year":2024},"citing_paper":{"arxiv_id":"2605.17085","last_updated":"2026-05-16T17:01:47Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T17:01:47Z","title":"Taming Audio VAEs via Target-KL Regularization","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-20T14:53:15.718359Z"},"links":{"citing_paper":"/paper/2605.17085"},"observation_digest":"sha256:cf3291a7820bd610554114fa57ef54f0fd3b0a7c1a9e128f016e20cb9e10938d","observation_id":"f9db439e-e46e-4f1f-ace9-3ae10376f717","resolution":{"observed_at":"2026-05-20T14:53:23.549390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":"2406.02430","doi":"10.48550/arxiv.2406.02430","metadata_source":"pith","pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-07-10T10:37:01.591529Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":"eess.AS","work_id":"6e88ee95-1133-4302-a142-cdf8f9456a8d","year":2024},"citing_paper":{"arxiv_id":"2605.17085","last_updated":"2026-05-16T17:01:47Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T17:01:47Z","title":"Taming Audio VAEs via Target-KL Regularization","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-20T14:53:15.718359Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2605.17085"},"observation_digest":"sha256:155b0b0bfaf5ec2cff1a4e6efcdf52319377313e5d66491f9c2e700b46ba8e1e","observation_id":"59e97aa2-3ac4-4d1f-b1a7-bde25cad6181","resolution":{"observed_at":"2026-05-20T14:53:23.190532Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15505","last_updated":"2023-10-12T07:55:05Z","snapshot_observed_at":"2026-07-06T16:24:17.829828Z","submitted_at":"2023-09-27T09:13:40Z","title":"Finite Scalar Quantization: VQ-VAE Made Simple","version":2},"cited_work":{"arxiv_id":"2309.15505","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.15505","snapshot_observed_at":"2026-07-10T02:16:42.481403Z","title":"Finite Scalar Quantization: VQ-VAE Made Simple","venue":"cs.CV","work_id":"34dd22bc-0de9-4e11-9a1b-1358e10fbfe1","year":2023},"citing_paper":{"arxiv_id":"2605.17085","last_updated":"2026-05-16T17:01:47Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T17:01:47Z","title":"Taming Audio VAEs via Target-KL Regularization","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-20T14:53:15.718359Z"},"links":{"cited_paper":"/paper/2309.15505","citing_paper":"/paper/2605.17085"},"observation_digest":"sha256:ee1ebfad0bedfcf4c496fe74b2ccab2280b3d8af3d8521c7e950ba7b66cd48b6","observation_id":"76bbbf21-7af8-4adf-9c7d-07e30845c50b","resolution":{"observed_at":"2026-05-20T14:53:23.196540Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06940","last_updated":"2025-06-18T04:35:42Z","snapshot_observed_at":"2026-07-06T19:30:26.233621Z","submitted_at":"2024-10-09T14:34:53Z","title":"Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think","version":4},"cited_work":{"arxiv_id":"2410.06940","doi":"10.48550/arxiv.2410.06940","metadata_source":"pith","pith_arxiv_id":"2410.06940","snapshot_observed_at":"2026-07-10T08:36:59.774135Z","title":"Representation Alignment for Generation: Training Diffusion Transformers Is Easier Than You Think","venue":"cs.CV","work_id":"1aff8ef8-079b-4afe-9e6a-148e6fd08e6a","year":2024},"citing_paper":{"arxiv_id":"2605.17085","last_updated":"2026-05-16T17:01:47Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T17:01:47Z","title":"Taming Audio VAEs via Target-KL Regularization","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-20T14:53:15.718359Z"},"links":{"cited_paper":"/paper/2410.06940","citing_paper":"/paper/2605.17085"},"observation_digest":"sha256:91c1262423967d3bdef4dbad082789339017c2a32d54cb070fca9c5168291143","observation_id":"6d3b93c9-7adf-4e9d-ae65-8fa20a0d5050","resolution":{"observed_at":"2026-05-20T14:53:23.202963Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.17085","last_updated":"2026-05-16T17:01:47Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T17:01:47Z","title":"Taming Audio VAEs via Target-KL Regularization"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":5,"verified_exact":17,"verified_fuzzy":25},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 1 inbound Pith citation observation for arXiv:2605.17085."}