{"as_of":"2026-08-15T03:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2661db0ac421dc933a644a052a9e74021fcc1f0bfbffdf852e1bcb55d7bec082","coverage":[{"denominator":78,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":78,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:32:48.158348Z","state":"measured"},{"denominator":78,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":78,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.08667/citation-record","integrity":"/paper/2608.08667/integrity","json":"/paper/2608.08667/citation-record.json","paper":"/paper/2608.08667"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:32:49.610944Z","title":"SoundStream: An End-to-End Neural Audio Codec","venue":null,"work_id":"36535dbd-41bc-45c6-858e-051da616bb5f","year":2021},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:47.839562Z"},"links":{"citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:4c63d13316e6fa7615b4ab7c92353d00c902df0499aff13dd1917c05c2aabe44","observation_id":"d2b59e89-d15c-4fee-bf0d-ad21db2c58f6","resolution":{"observed_at":"2026-08-14T04:32:49.614160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-09T07:12:13.721596Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-14T04:32:47.844577Z","title":"High Fidelity Neural Audio Compression","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:47.844577Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:bc9dcc0090dfb4b378376bea5b2f19258776d596739c79567fc68633a5a75cba","observation_id":"cfb1e325-496f-4b72-ac7c-cf182fc1f6fb","resolution":{"observed_at":"2026-08-14T04:32:47.844577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-14T04:32:47.848465Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:47.848465Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:1f44a9819e2f3ec2e00e992cf4817a4137637accf2184d08bcc48146d3cf7bba","observation_id":"eedf5e07-1a5f-4115-ba13-f91b73f997d6","resolution":{"observed_at":"2026-08-14T04:32:47.848465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05284","last_updated":"2024-01-30T04:49:16Z","snapshot_observed_at":"2026-08-13T15:19:04.329360Z","submitted_at":"2023-06-08T15:31:05Z","title":"Simple and Controllable Music Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05284","snapshot_observed_at":"2026-08-14T04:32:47.852011Z","title":"Simple and Controllable Music Generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:47.852011Z"},"links":{"cited_paper":"/paper/2306.05284","citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:4423ace9b2174cbfff24aff97842c2161a79e4c9eae7a21db373f45401dc4d5c","observation_id":"1452ac3a-e68b-402c-a1ba-a499c7043767","resolution":{"observed_at":"2026-08-14T04:32:47.852011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00704","last_updated":"2024-12-10T03:17:56Z","snapshot_observed_at":"2026-08-14T08:15:38.205949Z","submitted_at":"2023-10-01T15:49:46Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00704","snapshot_observed_at":"2026-08-14T04:32:47.857262Z","title":"UniAudio: An Audio Foundation Model Toward Universal Audio Generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:47.857262Z"},"links":{"cited_paper":"/paper/2310.00704","citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:0831368e74e60ce3cfb0bc4556f766204ac77c629205134b350cea67199191a4","observation_id":"7e491632-8991-4cc2-ad95-7b3ec1c2ca39","resolution":{"observed_at":"2026-08-14T04:32:47.857262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-14T04:32:47.861238Z","title":"Moshi: a speech-text foundation model for real-time dialogue","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:47.861238Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:e2f478261f80c9fec71c1925c505495684d999eaca49e507b28e7cd9d3ebf8ff","observation_id":"e8ddbbf9-7549-4140-81f6-76fd7ee31168","resolution":{"observed_at":"2026-08-14T04:32:47.861238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03143","last_updated":"2023-07-26T03:52:36Z","snapshot_observed_at":"2026-08-13T14:30:59.825464Z","submitted_at":"2022-09-07T13:40:08Z","title":"AudioLM: a Language Modeling Approach to Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03143","snapshot_observed_at":"2026-08-14T04:32:47.866569Z","title":"AudioLM: a Language Modeling Approach to Audio Generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:47.866569Z"},"links":{"cited_paper":"/paper/2209.03143","citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:34a4ab8da95a3a5bf03926e5a3528670cfa91d647608b08a9a7d18059b7ebe47","observation_id":"b6e4639d-ccf9-4e20-b76d-7e15b40a3572","resolution":{"observed_at":"2026-08-14T04:32:47.866569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:32:47.871352Z","title":"DiTAR: Diffusion Transformer Autoregressive Modeling for Speech Generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:47.871352Z"},"links":{"citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:2a70bc2dc4bcb27b325eb8596c3bc8a4e472e571fb85a9d89b97a5a89b1eff52","observation_id":"680aedd0-803b-4fae-9647-1e979396ba00","resolution":{"observed_at":"2026-08-14T04:32:47.871352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:32:47.874790Z","title":"Continuous Audio Language Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:47.874790Z"},"links":{"citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:330d8c57a6b5136549465531f917c3b8414a1ca8ee2179d35140b7ceda53c257","observation_id":"bba90d26-910c-41ad-b9f9-90b46d3d7161","resolution":{"observed_at":"2026-08-14T04:32:47.874790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:32:47.878575Z","title":"Cover and Joy A","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:47.878575Z"},"links":{"citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:f738ff851ced2f1a15bccefd7fedd314739561feac121571748a29eb7e0a7503","observation_id":"afa56b14-ca97-4c73-934b-d52173cce56f","resolution":{"observed_at":"2026-08-14T04:32:47.878575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10056","last_updated":"2024-06-14T14:13:18Z","snapshot_observed_at":"2026-08-12T23:42:39.206655Z","submitted_at":"2024-06-14T14:13:18Z","title":"UniAudio 1.5: Large Language Model-driven Audio Codec is A Few-shot Audio Task Learner","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10056","snapshot_observed_at":"2026-08-14T04:32:47.882061Z","title":"UniAudio 1.5: LLM-driven Audio Codec is A Few-shot Audio Task Learner","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:47.882061Z"},"links":{"cited_paper":"/paper/2406.10056","citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:85807d0cb40b8974aaaf950634fd8863bd35ebb20bb2c065bd0baac784266b61","observation_id":"c7c51330-02ac-4a8d-b75f-af6363632c44","resolution":{"observed_at":"2026-08-14T04:32:47.882061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:32:49.488231Z","title":"The Information Bottleneck Method","venue":null,"work_id":"6c6fffee-9fc9-4c9c-b416-de774b815c11","year":2000},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:47.886557Z"},"links":{"citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:fa200cd889e0d105944b14aed7d69a91e6edd5a8e51c343d05563fd2783e1692","observation_id":"aa80f50f-65e4-460b-88ca-a6960e769793","resolution":{"observed_at":"2026-08-14T04:32:49.491528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:32:49.478543Z","title":"High-Fidelity Audio Compression with Improved RVQGAN","venue":null,"work_id":"87ab6d0b-c8cd-421c-9741-507c683ab8cd","year":2023},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:47.890022Z"},"links":{"citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:3910fa59b3a908efba0d6c75849c86895068714a95fb4fb23829763997196b6a","observation_id":"1eead16d-e552-4c8d-8eb4-92aaee82e972","resolution":{"observed_at":"2026-08-14T04:32:49.482247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:32:47.893232Z","title":"Discrete Audio Tokens: More Than a Survey! https://arxiv.org/abs/2506.10274, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:47.893232Z"},"links":{"citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:6afbc7f30965d82da6623caf5827199b64e57a341cf08235ce9a67cd25cb5b55","observation_id":"3fbad04c-68e5-4345-b72c-69ed12b0b7cb","resolution":{"observed_at":"2026-08-14T04:32:47.893232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02765","last_updated":"2023-05-07T09:22:04Z","snapshot_observed_at":"2026-08-13T11:49:24.433450Z","submitted_at":"2023-05-04T12:11:13Z","title":"HiFi-Codec: Group-residual Vector quantization for High Fidelity Audio Codec","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02765","snapshot_observed_at":"2026-08-14T04:32:47.896329Z","title":"HiFi-Codec: Group-residual Vector quantization for High Fidelity Audio Codec","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:47.896329Z"},"links":{"cited_paper":"/paper/2305.02765","citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:5047ec0755fc2f09be388543dd668e1a71fc6e572373e9e939cb3e3769542329","observation_id":"a8b297a1-93e5-4c46-bbc7-961cfe1ca123","resolution":{"observed_at":"2026-08-14T04:32:47.896329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16532","last_updated":"2025-02-25T11:45:12Z","snapshot_observed_at":"2026-08-12T22:55:11.320450Z","submitted_at":"2024-08-29T13:43:36Z","title":"WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16532","snapshot_observed_at":"2026-08-14T04:32:47.899732Z","title":"WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:47.899732Z"},"links":{"cited_paper":"/paper/2408.16532","citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:2abc603faccb631f56b915e0a389c1f4726611638c0a0f1878b98a72c981ee4b","observation_id":"f76e66a9-2689-4c01-92e5-6c5640ddb264","resolution":{"observed_at":"2026-08-14T04:32:47.899732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.05377","last_updated":"2024-09-09T07:18:07Z","snapshot_observed_at":"2026-08-12T22:48:53.150999Z","submitted_at":"2024-09-09T07:18:07Z","title":"BigCodec: Pushing the Limits of Low-Bitrate Neural Speech Codec","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.05377","snapshot_observed_at":"2026-08-14T04:32:47.903185Z","title":"BigCodec: Pushing the Limits of Low-Bitrate Neural Speech Codec","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:47.903185Z"},"links":{"cited_paper":"/paper/2409.05377","citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:985e2c40f8792ffab1f29d8728a046125a701124b1537268927a9499c2534809","observation_id":"418150a3-dc47-4c54-890e-6f658235067d","resolution":{"observed_at":"2026-08-14T04:32:47.903185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15505","last_updated":"2023-10-12T07:55:05Z","snapshot_observed_at":"2026-07-06T16:24:17.829828Z","submitted_at":"2023-09-27T09:13:40Z","title":"Finite Scalar Quantization: VQ-VAE Made Simple","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15505","snapshot_observed_at":"2026-08-14T04:32:47.906647Z","title":"Finite Scalar Quantization: VQ-V AE Made Simple","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:47.906647Z"},"links":{"cited_paper":"/paper/2309.15505","citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:1ee598eddeeb04bd59b9bbe140c63355a9b391541fe4887024a4759d2491374e","observation_id":"e241e6a3-07c9-4bc7-a7d6-21f9e446c9f6","resolution":{"observed_at":"2026-08-14T04:32:47.906647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09636","last_updated":"2023-05-16T17:41:25Z","snapshot_observed_at":"2026-08-15T01:09:02.786646Z","submitted_at":"2023-05-16T17:41:25Z","title":"SoundStorm: Efficient Parallel Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.09636","snapshot_observed_at":"2026-08-14T04:32:47.910377Z","title":"SoundStorm: Efficient Parallel Audio Generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:47.910377Z"},"links":{"cited_paper":"/paper/2305.09636","citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:b4af3ea7306a7dbff62a0ac2f09b6e5a550f4d629f9c646bd131f8dcf3e50972","observation_id":"6133a4c6-3614-43f3-8784-4bcd3ebf1084","resolution":{"observed_at":"2026-08-14T04:32:47.910377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04577","last_updated":"2024-03-05T09:12:35Z","snapshot_observed_at":"2026-08-13T04:45:56.006574Z","submitted_at":"2024-01-09T14:29:39Z","title":"Masked Audio Generation using a Single Non-Autoregressive Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04577","snapshot_observed_at":"2026-08-14T04:32:47.913437Z","title":"Masked Audio Generation using a Single Non-Autoregressive Transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:47.913437Z"},"links":{"cited_paper":"/paper/2401.04577","citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:6604be556688606efa28526ba8ae0586daed12da0e2f70b5c4401f0a3c54349a","observation_id":"de8e945f-6794-4d3c-8279-d13c0ea79703","resolution":{"observed_at":"2026-08-14T04:32:47.913437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.06209","last_updated":"2021-09-13T18:29:12Z","snapshot_observed_at":"2026-08-13T18:32:43.081420Z","submitted_at":"2021-08-07T06:29:36Z","title":"W2v-BERT: Combining Contrastive Learning and Masked Language Modeling for Self-Supervised Speech Pre-Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.06209","snapshot_observed_at":"2026-08-14T04:32:47.916888Z","title":"w2v-BERT: Combining Contrastive Learning and Masked Language Modeling for Self-Supervised Speech Pre-Training.https://arxiv.org/abs/2108.06209, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:47.916888Z"},"links":{"cited_paper":"/paper/2108.06209","citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:ea9f467ea66feaad08df715c0f2fe4e2b65a82810ff7e703e8232026543aea42","observation_id":"ce1932c2-443a-457c-b121-0823992a3ee5","resolution":{"observed_at":"2026-08-14T04:32:47.916888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-15T00:22:53.406062Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-08-14T04:32:47.920580Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:47.920580Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:0563139e0652ffb72c0c93c18e866091c81cb8ada370bf4274692d016a8920e5","observation_id":"ce5fab92-d7ab-452b-8292-797e3f8cf7d9","resolution":{"observed_at":"2026-08-14T04:32:47.920580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00933","last_updated":"2024-09-02T04:13:20Z","snapshot_observed_at":"2026-08-12T22:53:24.225314Z","submitted_at":"2024-09-02T04:13:20Z","title":"SoCodec: A Semantic-Ordered Multi-Stream Speech Codec for Efficient Language Model Based Text-to-Speech Synthesis","version":1},"cited_work":{"arxiv_id":"2409.00933","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.00933","snapshot_observed_at":"2026-08-14T04:32:49.058495Z","title":"SoCodec: A Semantic-Ordered Multi-Stream Speech Codec for Efficient Language Model Based Text-to-Speech Synthesis","venue":"cs.SD","work_id":"c2ae37dd-37b0-406d-9084-d9ab40d4aab7","year":2024},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:47.923864Z"},"links":{"cited_paper":"/paper/2409.00933","citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:266c019de03ff2ad025dbdec8abb8382b41c687f82fa57e4b4953816c8c81006","observation_id":"2fab2696-b580-4295-94d8-0f055aad8f63","resolution":{"observed_at":"2026-08-14T04:32:49.061753Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00233","last_updated":"2024-11-28T12:31:04Z","snapshot_observed_at":"2026-08-13T00:17:59.506062Z","submitted_at":"2024-04-30T22:51:36Z","title":"SemantiCodec: An Ultra Low Bitrate Semantic Audio Codec for General Sound","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00233","snapshot_observed_at":"2026-08-14T04:32:47.927340Z","title":"SemantiCodec: An Ultra Low Bitrate Semantic Audio Codec for General Sound","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:47.927340Z"},"links":{"cited_paper":"/paper/2405.00233","citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:ed32d93d3aa3e043208514c02bad6d39e648300363c6b2248286fe1859c1fd00","observation_id":"a1c8901e-0f0d-4fb5-821c-77d2bf1fb045","resolution":{"observed_at":"2026-08-14T04:32:47.927340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.17175","last_updated":"2024-11-27T11:47:45Z","snapshot_observed_at":"2026-08-12T22:54:34.967899Z","submitted_at":"2024-08-30T10:24:07Z","title":"Codec Does Matter: Exploring the Semantic Shortcoming of Codec for Audio Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.17175","snapshot_observed_at":"2026-08-14T04:32:47.933751Z","title":"Codec Does Matter: Exploring the Semantic Shortcoming of Codec for Audio Language Model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:47.933751Z"},"links":{"cited_paper":"/paper/2408.17175","citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:b2f6cbd377e71b55f4f69054606df0288c518e8fb7ab93937afb5de5cb0d4bf9","observation_id":"fe5adde9-4640-45d3-b736-5a4b7939f957","resolution":{"observed_at":"2026-08-14T04:32:47.933751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.07447","last_updated":"2021-06-14T14:14:28Z","snapshot_observed_at":"2026-08-14T02:57:29.926620Z","submitted_at":"2021-06-14T14:14:28Z","title":"HuBERT: Self-Supervised Speech Representation Learning by Masked Prediction of Hidden Units","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.07447","snapshot_observed_at":"2026-08-14T04:32:47.948785Z","title":"HuBERT: Self-Supervised Speech Representation Learning by Masked Prediction of Hidden Units","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:47.948785Z"},"links":{"cited_paper":"/paper/2106.07447","citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:a01f11844ac57b9f5cc7a1bf4f9fb08286cb742b5bb6b2d5e8d805e1c1b92bac","observation_id":"d49c1e6b-732d-4b39-9099-322895f7ec7b","resolution":{"observed_at":"2026-08-14T04:32:47.948785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:32:47.952821Z","title":"WavLM: Large-Scale Self-Supervised Pre-Training for Full Stack Speech Processing","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:47.952821Z"},"links":{"citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:1ff8a2bd6bd027251505a0cbb8608fed1c221803fef31a70e48c55ab503d7758","observation_id":"0bde1496-b9f9-4427-b04e-13ff8dd373a2","resolution":{"observed_at":"2026-08-14T04:32:47.952821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:32:47.957531Z","title":"MOSS-Audio-Tokenizer: Scaling Audio Tokenizers for Future Audio Foundation Models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:47.957531Z"},"links":{"citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:2f12e9ab17ab7c6acfc0c865a4bf1ea80403cd74f9d4f8a88371c3ad3d477636","observation_id":"fc6cf0c3-0130-4677-bd7b-856b8021eaa1","resolution":{"observed_at":"2026-08-14T04:32:47.957531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10344","last_updated":"2025-04-14T15:51:56Z","snapshot_observed_at":"2026-08-07T16:05:50.273054Z","submitted_at":"2025-04-14T15:51:56Z","title":"ALMTokenizer: A Low-bitrate and Semantic-rich Audio Codec Tokenizer for Audio Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10344","snapshot_observed_at":"2026-08-14T04:32:47.960877Z","title":"ALMTokenizer: A Low-bitrate and Semantic-rich Audio Codec Tokenizer for Audio Language Modeling.https://arxiv.org/abs/2504.10344, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:47.960877Z"},"links":{"cited_paper":"/paper/2504.10344","citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:0da255cbbe96d1a362c0d7924419a963dea4806f1f8b0ffe7b4e60fc0bc3dba8","observation_id":"5c749d68-1735-49ff-8fa5-439b9cdb195d","resolution":{"observed_at":"2026-08-14T04:32:47.960877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:32:49.467697Z","title":"Fewer-token Neural Speech Codec with Time-invariant Codes","venue":null,"work_id":"58b6f301-dfe0-493b-a889-88c929b2667c","year":2024},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:47.964418Z"},"links":{"citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:4ba0c38f5c3d600f7f58b1bdfd932dad4e2c11b4dac5bedf51ec25e3f97e9e78","observation_id":"8cc305a7-31ff-49e2-aa1c-8c4aac5e2a48","resolution":{"observed_at":"2026-08-14T04:32:49.472237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11228","last_updated":"2025-02-11T10:35:04Z","snapshot_observed_at":"2026-08-12T22:43:11.108313Z","submitted_at":"2024-09-17T14:21:02Z","title":"Learning Source Disentanglement in Neural Audio Codec","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11228","snapshot_observed_at":"2026-08-14T04:32:47.967536Z","title":"Learning Source Disentanglement in Neural Audio Codec.https://arxiv.org/abs/2409.11228,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:47.967536Z"},"links":{"cited_paper":"/paper/2409.11228","citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:f9b60f754d064fef305a167ce58764ba89152069f0f7303862f9f6858f3ac120","observation_id":"710342e8-7526-40e8-b051-35247d38dce7","resolution":{"observed_at":"2026-08-14T04:32:47.967536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03100","last_updated":"2024-04-23T08:38:03Z","snapshot_observed_at":"2026-08-13T04:02:54.961180Z","submitted_at":"2024-03-05T16:35:25Z","title":"NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03100","snapshot_observed_at":"2026-08-14T04:32:47.972389Z","title":"NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:47.972389Z"},"links":{"cited_paper":"/paper/2403.03100","citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:e55810269e3154e5c8addc9c64e00df882fcb8fb760c2a57bcaf7e3ba992b9c6","observation_id":"0d93c519-337d-4f78-aefc-0f3d941c7728","resolution":{"observed_at":"2026-08-14T04:32:47.972389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-08-10T17:49:50.848957Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-14T04:32:47.977209Z","title":"CosyV oice: A Scalable Multilingual Zero-shot TTS Synthesizer based on Supervised Semantic Tokens.https://arxiv.org/abs/2407.05407, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:47.977209Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:ce53c0494fed9f469618c467fc23056dc568a375fa4f3c872a8e2ddc6eee7bd1","observation_id":"7b7d3346-a2e6-4982-a0b7-84125d828276","resolution":{"observed_at":"2026-08-14T04:32:47.977209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-14T04:32:47.982218Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:47.982218Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:edcf349afc9dcf596e7827668ff04265b56b0abb6fc2cda4fa270ccf0936c4bb","observation_id":"3c7dffe6-19b0-40ab-ab93-6df36700500a","resolution":{"observed_at":"2026-08-14T04:32:47.982218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14358","last_updated":"2024-07-31T16:22:42Z","snapshot_observed_at":"2026-08-13T20:36:55.364632Z","submitted_at":"2024-07-19T14:40:23Z","title":"Stable Audio Open","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14358","snapshot_observed_at":"2026-08-14T04:32:47.986595Z","title":"Stable Audio Open.https://arxiv.org/abs/2407.14358, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:47.986595Z"},"links":{"cited_paper":"/paper/2407.14358","citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:e4afb048a427de6a003f030e46187e90693a6487d55fb4021e1f8f3c9e82447f","observation_id":"033e1daf-d353-4952-8593-68c7cffb7fd9","resolution":{"observed_at":"2026-08-14T04:32:47.986595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09116","last_updated":"2023-05-30T16:09:10Z","snapshot_observed_at":"2026-08-13T12:00:01.755113Z","submitted_at":"2023-04-18T16:31:59Z","title":"NaturalSpeech 2: Latent Diffusion Models are Natural and Zero-Shot Speech and Singing Synthesizers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.09116","snapshot_observed_at":"2026-08-14T04:32:47.991814Z","title":"NaturalSpeech 2: Latent Diffusion Models are Natural and Zero-Shot Speech and Singing Synthesizers.arXiv preprint arXiv:2304.09116, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:47.991814Z"},"links":{"cited_paper":"/paper/2304.09116","citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:439716f7484e13d0ee71f8cda7f669f0dfcadbabfa76e4e2d8a82ffbd6f55140","observation_id":"74619dc8-a967-49db-b4d2-5365e11688ff","resolution":{"observed_at":"2026-08-14T04:32:47.991814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12661","last_updated":"2023-01-30T04:44:34Z","snapshot_observed_at":"2026-08-14T11:04:12.790129Z","submitted_at":"2023-01-30T04:44:34Z","title":"Make-An-Audio: Text-To-Audio Generation with Prompt-Enhanced Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12661","snapshot_observed_at":"2026-08-14T04:32:47.995431Z","title":"Make-An-Audio: Text-To-Audio Generation with Prompt-Enhanced Diffusion Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:47.995431Z"},"links":{"cited_paper":"/paper/2301.12661","citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:2f47a441598bea4afbd6b9c090810badc61ea29c02ac4aa5cc24eb695f0b6ceb","observation_id":"02d37584-975e-4631-9d6e-7f81ba866280","resolution":{"observed_at":"2026-08-14T04:32:47.995431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:32:47.998963Z","title":"DashengTokenizer: One layer is enough for unified audio understanding and generation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:47.998963Z"},"links":{"citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:8bad01486e3915190ffa123a03b265dd6b67339fdb30632bce6732a10f710928","observation_id":"26ae9252-f018-422c-9de0-40b23401c289","resolution":{"observed_at":"2026-08-14T04:32:47.998963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.06407","last_updated":"2026-05-07T15:17:24Z","snapshot_observed_at":"2026-08-11T15:47:31.941279Z","submitted_at":"2026-05-07T15:17:24Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","version":1},"cited_work":{"arxiv_id":"2605.06407","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.06407","snapshot_observed_at":"2026-08-14T04:32:48.780569Z","title":"WavCube: Unifying Speech Representation for Understanding and Generation via Semantic-Acoustic Joint Modeling","venue":"eess.AS","work_id":"93b5afb1-29d7-4674-b30c-785644c1d10c","year":2026},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:48.002062Z"},"links":{"cited_paper":"/paper/2605.06407","citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:68ef1dbed5473f201e4c8ff739afc170823aea5123c9fc8ab7bc288587a16c37","observation_id":"aed3a8ba-eff8-4564-9320-224800260784","resolution":{"observed_at":"2026-08-14T04:32:48.784735Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:32:48.005428Z","title":"Ming-UniAudio: Speech LLM for Joint Understanding, Generation and Editing with Unified Representation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:48.005428Z"},"links":{"citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:85bd1fd2816604a8566d6592b074c00250d4165d5522216c63cfa71834086f7f","observation_id":"2eecf9e9-4ac7-4739-aef3-27d356176657","resolution":{"observed_at":"2026-08-14T04:32:48.005428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.27840","last_updated":"2026-05-27T01:56:45Z","snapshot_observed_at":"2026-08-04T06:27:21.447155Z","submitted_at":"2026-05-27T01:56:45Z","title":"LoSATok: Low-dimensional Semantic-Acoustic Tokenizer for Cross-Domain Audio Understanding and Generation","version":1},"cited_work":{"arxiv_id":"2605.27840","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.27840","snapshot_observed_at":"2026-08-14T04:32:48.731697Z","title":"LoSATok: Low-dimensional Semantic-Acoustic Tokenizer for Cross-Domain Audio Understanding and Generation","venue":"eess.AS","work_id":"aee00476-62a4-46ca-8cac-2ad76437f32e","year":2026},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:48.008835Z"},"links":{"cited_paper":"/paper/2605.27840","citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:66838dcb15128d7e1443a606d0caf29d46ecf98360ec70d40ac1ed871c2cc433","observation_id":"40e40133-7778-4238-a3be-cf5ab78ed5ca","resolution":{"observed_at":"2026-08-14T04:32:48.735854Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-14T04:32:48.013264Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:48.013264Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:75e7db88b8a118410971e4092dcac5fc8d5680ef1f9da5ac8302e7951c9a7284","observation_id":"7b5a52d9-2c0b-48f0-9dff-202af3ada8be","resolution":{"observed_at":"2026-08-14T04:32:48.013264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15687","last_updated":"2023-10-19T13:23:28Z","snapshot_observed_at":"2026-08-14T20:49:18.413710Z","submitted_at":"2023-06-23T16:23:24Z","title":"Voicebox: Text-Guided Multilingual Universal Speech Generation at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15687","snapshot_observed_at":"2026-08-14T04:32:48.017504Z","title":"V oicebox: Text-Guided Multilingual Universal Speech Generation at Scale.https://arxiv.org/ abs/2306.15687, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:48.017504Z"},"links":{"cited_paper":"/paper/2306.15687","citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:c4d81d36bb9a68b3fc6fb51684c94f0a9383baea55a9fc4907b9897ea8f11d56","observation_id":"bbde2eef-b8a9-41e2-9698-44f2f76c5e36","resolution":{"observed_at":"2026-08-14T04:32:48.017504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:32:49.455649Z","title":"GIVT: Generative Infinite-V ocabulary Transformers","venue":null,"work_id":"1bfad5c5-b9b3-4b9b-9632-5e8d99a25604","year":2024},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:48.021121Z"},"links":{"citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:2de455141c18547c728be8788db453f6fc77786c5ff0bf057f8acff8eb5230e6","observation_id":"ee5b1124-7fb4-4fe3-b88b-661b823849cb","resolution":{"observed_at":"2026-08-14T04:32:49.459255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:32:49.447156Z","title":"Autoregressive Image Generation without Vector Quantization","venue":null,"work_id":"98f53060-b08e-4031-8c32-8e680d185f19","year":2024},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:48.024464Z"},"links":{"citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:2227904968f38f9d2b2924d74909ab1ffffc5a2abf882506f5e7b3cc52903efa","observation_id":"68a66f64-d066-4465-8ea1-a405c4fcd8c5","resolution":{"observed_at":"2026-08-14T04:32:49.450189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:32:48.027469Z","title":"Hyperspherical Latents Improve Continuous-Token Autoregressive Generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:48.027469Z"},"links":{"citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:57184a69fab9537eb7fb8aec339b61233144a00f1b8221f5f17b45ea877dad69","observation_id":"91e01e7c-9497-4c35-9fc3-4ad627ebc00b","resolution":{"observed_at":"2026-08-14T04:32:48.027469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.04200","last_updated":"2022-02-08T23:54:06Z","snapshot_observed_at":"2026-08-13T16:44:31.818439Z","submitted_at":"2022-02-08T23:54:06Z","title":"MaskGIT: Masked Generative Image Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.04200","snapshot_observed_at":"2026-08-14T04:32:48.037218Z","title":"MaskGIT: Masked Generative Image Transformer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:48.037218Z"},"links":{"cited_paper":"/paper/2202.04200","citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:d1ca9772b4bf71141d8f58d85dd2126447ea019311ced6bcb1122248ee248da5","observation_id":"e0b217a0-0fd8-4229-af2f-fb3244eee52d","resolution":{"observed_at":"2026-08-14T04:32:48.037218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:32:48.046526Z","title":"Denoising Diffusion Probabilistic Models.Advances in Neural Information Processing Systems, 33:6840–6851, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:48.046526Z"},"links":{"citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:744e5b191455a89cf5ecc3ca5f3a1838bb9b08c650dc4746b917f9fc132709c6","observation_id":"0cb337cd-8f82-4908-8d8b-8a0ec5dd4e6e","resolution":{"observed_at":"2026-08-14T04:32:48.046526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.01192","last_updated":"2021-09-09T22:36:33Z","snapshot_observed_at":"2026-08-11T13:59:02.346778Z","submitted_at":"2021-02-01T21:41:40Z","title":"Generative Spoken Language Modeling from Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.01192","snapshot_observed_at":"2026-08-14T04:32:48.049500Z","title":"On Generative Spoken Language Modeling from Raw Audio","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:48.049500Z"},"links":{"cited_paper":"/paper/2102.01192","citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:b23ea1751b5dbc9b10a65122df4b959989d1b793822d0c9abd302e052a1617ca","observation_id":"a2e3b1db-8c91-4c9d-b78e-28678519f5bb","resolution":{"observed_at":"2026-08-14T04:32:48.049500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13009","last_updated":"2024-01-30T11:52:51Z","snapshot_observed_at":"2026-08-13T11:37:18.162598Z","submitted_at":"2023-05-22T13:12:16Z","title":"Textually Pretrained Speech Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13009","snapshot_observed_at":"2026-08-14T04:32:48.053372Z","title":"Textually Pretrained Speech Language Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:48.053372Z"},"links":{"cited_paper":"/paper/2305.13009","citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:511db8343d2f829c8a7208e9c71ed865fdf12269af9950d7b8b1652b9bd78476","observation_id":"9c6e7a43-219d-442a-a9be-318988926923","resolution":{"observed_at":"2026-08-14T04:32:48.053372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11325","last_updated":"2023-01-26T18:58:53Z","snapshot_observed_at":"2026-08-14T02:16:19.922733Z","submitted_at":"2023-01-26T18:58:53Z","title":"MusicLM: Generating Music From Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11325","snapshot_observed_at":"2026-08-14T04:32:48.056851Z","title":"MusicLM: Generating Music From Text.https://arxiv.org/abs/2301.11325, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:48.056851Z"},"links":{"cited_paper":"/paper/2301.11325","citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:cc9b5c7d43c38cdcfb702281788259052b4503cef42fde884f45a85fa83d65b2","observation_id":"7af9cea4-6af8-4ac6-8bbd-8c18142e4867","resolution":{"observed_at":"2026-08-14T04:32:48.056851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.09983","last_updated":"2023-04-28T07:45:43Z","snapshot_observed_at":"2026-08-13T15:00:01.766919Z","submitted_at":"2022-07-20T15:41:47Z","title":"Diffsound: Discrete Diffusion Model for Text-to-sound Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.09983","snapshot_observed_at":"2026-08-14T04:32:48.060493Z","title":"Diffsound: Discrete Diffusion Model for Text-to-sound Generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:48.060493Z"},"links":{"cited_paper":"/paper/2207.09983","citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:f5d52e201d37e84d7ce5d5dabbc389caadbae80a696cb44aa9524f3d39414d25","observation_id":"919576c7-bfbd-4e15-811f-af3c294d908c","resolution":{"observed_at":"2026-08-14T04:32:48.060493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.13662","last_updated":"2023-06-25T11:42:52Z","snapshot_observed_at":"2026-08-13T12:54:19.561672Z","submitted_at":"2023-01-31T14:26:52Z","title":"InstructTTS: Modelling Expressive TTS in Discrete Latent Space with Natural Language Style Prompt","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.13662","snapshot_observed_at":"2026-08-14T04:32:48.063945Z","title":"InstructTTS: Modelling Expressive TTS in Discrete Latent Space with Natural Language Style Prompt.https://arxiv.org/abs/2301.13662, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:48.063945Z"},"links":{"cited_paper":"/paper/2301.13662","citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:edae58f2d61628735ffa845354ffe25db3ed99c8d4ce948c7f723e93d84928b6","observation_id":"992b07fb-5507-4222-ac29-6a397499279c","resolution":{"observed_at":"2026-08-14T04:32:48.063945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18009","last_updated":"2024-09-12T17:45:37Z","snapshot_observed_at":"2026-08-12T23:34:52.090775Z","submitted_at":"2024-06-26T01:38:37Z","title":"E2 TTS: Embarrassingly Easy Fully Non-Autoregressive Zero-Shot TTS","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18009","snapshot_observed_at":"2026-08-14T04:32:48.067554Z","title":"E2 TTS: Embarrassingly Easy Fully Non-Autoregressive Zero-Shot TTS","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:48.067554Z"},"links":{"cited_paper":"/paper/2406.18009","citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:c892c272bb716af0fd2c206c07a1cd0925eccf92a5bbad49a608669084d9734a","observation_id":"0e6decfd-b6b7-4b0d-9cd1-16704eff6bf9","resolution":{"observed_at":"2026-08-14T04:32:48.067554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-01T23:52:25.071174Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06885","snapshot_observed_at":"2026-08-14T04:32:48.072180Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:48.072180Z"},"links":{"cited_paper":"/paper/2410.06885","citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:2e33fabf1a4d76e87500c887d683e7c609a30c329704ac394ce5c98ea12aba87","observation_id":"a0bde76f-c503-4a1f-9568-0732554a0d40","resolution":{"observed_at":"2026-08-14T04:32:48.072180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:32:49.431604Z","title":"Autoregressive Speech Synthesis without Vector Quantization","venue":null,"work_id":"27a8b0cc-0b7a-4ad2-84d7-959c98a426f3","year":2025},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:48.075627Z"},"links":{"citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:2d19690d612c2296c7fff36a3beb4e510ffe6747ae54cd5af9989482d3b1b5b2","observation_id":"3592ff85-663b-4f84-b3af-417b3b73eb0b","resolution":{"observed_at":"2026-08-14T04:32:49.434571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19205","last_updated":"2025-08-26T17:09:12Z","snapshot_observed_at":"2026-08-10T16:18:01.080043Z","submitted_at":"2025-08-26T17:09:12Z","title":"VibeVoice Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.19205","snapshot_observed_at":"2026-08-14T04:32:48.078597Z","title":"VibeV oice Technical Report.https://arxiv.org/abs/2508.19205, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:48.078597Z"},"links":{"cited_paper":"/paper/2508.19205","citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:358e2bd8dd705017918461287a0628e76bfd5f4eaf7f56b938fe0868ba894f1d","observation_id":"afc55e3d-a429-488d-a0ce-a9232926b084","resolution":{"observed_at":"2026-08-14T04:32:48.078597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14294","snapshot_observed_at":"2026-08-14T04:32:48.082086Z","title":"DASB — Discrete Audio and Speech Benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:48.082086Z"},"links":{"cited_paper":"/paper/2406.14294","citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:0a650a36ccd665dbbde39956c83365caa7840598685054d13f0475ba0678231f","observation_id":"14f27a22-bbf6-415a-801c-83a19178a63f","resolution":{"observed_at":"2026-08-14T04:32:48.082086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:32:48.085412Z","title":"TADA: A Generative Framework for Speech Modeling via Text-Acoustic Dual Alignment","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:48.085412Z"},"links":{"citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:df3ea8997c3c29e786e1802a52cae2c9266705ea3b119cbd4233447f71d2b593","observation_id":"695ee055-b283-4777-965a-4ecb5687dd40","resolution":{"observed_at":"2026-08-14T04:32:48.085412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:32:48.088518Z","title":"FlexiCodec: A Dynamic Neural Audio Codec for Low Frame Rates","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:48.088518Z"},"links":{"citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:ad5eb130141308114be4f8eae782415b882d4a291505439ba061b2544b45d959","observation_id":"586f54b3-7fb0-4dbc-9409-73fcce1625d8","resolution":{"observed_at":"2026-08-14T04:32:48.088518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:32:49.422724Z","title":"Signal Estimation from Modified Short-Time Fourier Transform, 1984","venue":null,"work_id":"07ea2d48-dd67-4056-834c-67691cdf62b3","year":1984},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:48.091664Z"},"links":{"citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:ead57ada5fe5501aee029908678367b5b1370a53ef85e8e74b2a02ce9b73023b","observation_id":"3dac3314-cccf-4292-8650-377336324588","resolution":{"observed_at":"2026-08-14T04:32:49.426137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-08-13T01:24:25.628327Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-14T04:32:48.094769Z","title":"WaveNet: A Generative Model for Raw Audio","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:48.094769Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:39479c9b5b29542591a644a7aa68df9ec1cdecac6c09ff3c17fd2ef10c97e4a6","observation_id":"90ad8a82-fbf4-4465-9083-21d17a99227b","resolution":{"observed_at":"2026-08-14T04:32:48.094769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.05646","last_updated":"2020-10-23T09:12:04Z","snapshot_observed_at":"2026-07-06T10:03:33.857220Z","submitted_at":"2020-10-12T12:33:43Z","title":"HiFi-GAN: Generative Adversarial Networks for Efficient and High Fidelity Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.05646","snapshot_observed_at":"2026-08-14T04:32:48.098151Z","title":"HiFi-GAN: GANs for Efficient and High Fidelity Speech Synthesis","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:48.098151Z"},"links":{"cited_paper":"/paper/2010.05646","citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:ef93a090553bb2794d6696bc5ffad34aca27e75a1b31b9a24ccbbea14fe8e86f","observation_id":"fedec146-001e-4fd3-a522-7f5592eb1cef","resolution":{"observed_at":"2026-08-14T04:32:48.098151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.05884","last_updated":"2018-02-16T01:28:23Z","snapshot_observed_at":"2026-08-14T20:03:06.478622Z","submitted_at":"2017-12-16T00:51:40Z","title":"Natural TTS Synthesis by Conditioning WaveNet on Mel Spectrogram Predictions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.05884","snapshot_observed_at":"2026-08-14T04:32:48.101601Z","title":"Natural TTS Synthesis by Conditioning WaveNet on Mel Spectrogram Predictions","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:48.101601Z"},"links":{"cited_paper":"/paper/1712.05884","citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:2917b044100ecbe2a4e63a1020cca4f76e48b908a5484a941ff4671ecbf4b35c","observation_id":"12333eaf-8c9b-4265-8eb5-e5a2924e9724","resolution":{"observed_at":"2026-08-14T04:32:48.101601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06103","last_updated":"2021-06-11T01:07:12Z","snapshot_observed_at":"2026-08-13T19:05:29.137882Z","submitted_at":"2021-06-11T01:07:12Z","title":"Conditional Variational Autoencoder with Adversarial Learning for End-to-End Text-to-Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06103","snapshot_observed_at":"2026-08-14T04:32:48.105338Z","title":"Conditional Variational Autoencoder with Adversarial Learning for End-to-End Text-to-Speech","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:48.105338Z"},"links":{"cited_paper":"/paper/2106.06103","citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:b569621e56e20024522212f8a59c500587eecec586673a5eab5c609e67b3f1b0","observation_id":"d3082628-f791-459d-a9f3-4393e90dbd7d","resolution":{"observed_at":"2026-08-14T04:32:48.105338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:32:48.108713Z","title":"A Scale for the Measurement of the Psychological Magnitude Pitch","venue":null,"work_id":null,"year":1937},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:48.108713Z"},"links":{"citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:c86c9a43e960eb9ee4e9a45e89fb95795719eda2cc975249f094932529d6c555","observation_id":"3ebdef5a-ff7f-4971-8a60-b3fcdc44870e","resolution":{"observed_at":"2026-08-14T04:32:48.108713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:32:48.114746Z","title":"Comparison of Parametric Representations for Monosyllabic Word Recognition in Continuously Spoken Sentences","venue":null,"work_id":null,"year":1980},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:48.114746Z"},"links":{"citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:ce6092c37d998a2687c357816589b9905bc6de57e43acb610aba0606c54189fa","observation_id":"6a6fa749-8f53-4560-bb0e-e2523e919cb4","resolution":{"observed_at":"2026-08-14T04:32:48.114746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:32:49.414058Z","title":"WaveGrad: Estimating Gradients for Waveform Generation","venue":null,"work_id":"81bb93b1-7390-43df-91f5-1ebcc0175645","year":2009},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:48.118320Z"},"links":{"citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:61a3116083a0412b75cfcb45e5784ad3de1bb82e012dd258e25d6bd13b19ced3","observation_id":"b8d7505e-0465-4e84-a12b-19c646290737","resolution":{"observed_at":"2026-08-14T04:32:49.417145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:32:49.404339Z","title":"DiffWave: A Versatile Diffusion Model for Audio Synthesis","venue":null,"work_id":"61135e3e-07a9-402f-bd74-6f7b8c863de8","year":2009},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:48.121489Z"},"links":{"citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:5e0733fc4334b2f6f02cbd2e5c235469475a28eef8659d02d3fa7e03b0cc5c3a","observation_id":"5b0935a2-50dc-4572-a1b2-e851afb857f5","resolution":{"observed_at":"2026-08-14T04:32:49.407635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15835","last_updated":"2025-05-21T16:55:34Z","snapshot_observed_at":"2026-08-13T11:18:33.922832Z","submitted_at":"2024-07-22T17:51:53Z","title":"dMel: Speech Tokenization made Simple","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15835","snapshot_observed_at":"2026-08-14T04:32:48.124613Z","title":"dMel: Speech Tokenization made Simple.https://arxiv.org/abs/2407.15835, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:48.124613Z"},"links":{"cited_paper":"/paper/2407.15835","citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:3901473ef6039668da888f7e4354aa4ce72ef3945ff0ceea5690cbdb03d4db7a","observation_id":"a72bbb14-e7c8-4620-a0b5-4e100feb541b","resolution":{"observed_at":"2026-08-14T04:32:48.124613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.06337","last_updated":"2021-08-05T10:06:27Z","snapshot_observed_at":"2026-08-13T19:23:25.887419Z","submitted_at":"2021-05-13T14:47:44Z","title":"Grad-TTS: A Diffusion Probabilistic Model for Text-to-Speech","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.06337","snapshot_observed_at":"2026-08-14T04:32:48.127905Z","title":"Grad-TTS: A Diffusion Probabilistic Model for Text-to-Speech","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:48.127905Z"},"links":{"cited_paper":"/paper/2105.06337","citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:6188e9e9ad4cb35a997f64d6a35d356c983b5edce9a0fa5625d5125b8293cf6a","observation_id":"b3fbabab-de1d-447a-af47-08297b6e5b09","resolution":{"observed_at":"2026-08-14T04:32:48.127905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.02446","last_updated":"2022-03-22T04:53:48Z","snapshot_observed_at":"2026-08-05T09:15:55.577673Z","submitted_at":"2021-05-06T05:21:42Z","title":"DiffSinger: Singing Voice Synthesis via Shallow Diffusion Mechanism","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.02446","snapshot_observed_at":"2026-08-14T04:32:48.131468Z","title":"DiffSinger: Singing V oice Synthesis via Shallow Diffusion Mechanism","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:48.131468Z"},"links":{"cited_paper":"/paper/2105.02446","citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:d31c6ac271f18761c5d5a1a2133e40c49e7e07487979cd4e8fa407eaba977ce1","observation_id":"9781d73b-e82d-432b-877d-83190c2d1675","resolution":{"observed_at":"2026-08-14T04:32:48.131468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.neuron.2011.06.032","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:32:48.187255Z","title":"Sound Texture Perception via Statistics of the Auditory Periphery: Evidence from Sound Synthesis.https://doi.org/10.1016/j.neuron.2011.06.032, 2011","venue":null,"work_id":"5a4657fc-c7d5-41e3-ae6a-ca0e4efff1e4","year":2011},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:48.135457Z"},"links":{"citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:4cb951e6725b7420e668836a04d5036daca43b26ae8ddce881f6aad43c697c73","observation_id":"e800c94e-5a30-402a-bb39-9e4aaf69d7ca","resolution":{"observed_at":"2026-08-14T04:32:48.194458Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.00937","last_updated":"2018-05-30T14:58:27Z","snapshot_observed_at":"2026-08-14T20:17:29.355571Z","submitted_at":"2017-11-02T21:14:44Z","title":"Neural Discrete Representation Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.00937","snapshot_observed_at":"2026-08-14T04:32:48.140267Z","title":"Neural Discrete Representation Learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:48.140267Z"},"links":{"cited_paper":"/paper/1711.00937","citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:64ae93885336a892059082596b058ceada1c225be2a4534e2d24bfdbdb6aeda8","observation_id":"454ad516-7a76-4550-b4c9-12049203e106","resolution":{"observed_at":"2026-08-14T04:32:48.140267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14411","last_updated":"2024-10-18T12:24:05Z","snapshot_observed_at":"2026-08-12T22:20:08.175893Z","submitted_at":"2024-10-18T12:24:05Z","title":"SNAC: Multi-Scale Neural Audio Codec","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.14411","snapshot_observed_at":"2026-08-14T04:32:48.145931Z","title":"SNAC: Multi-Scale Neural Audio Codec.https://arxiv.org/abs/2410.14411, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:48.145931Z"},"links":{"cited_paper":"/paper/2410.14411","citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:aff6a9b9e10959ee0768ae3d3405835ac19bea25c9dac8e1cafafa7b18cc3d94","observation_id":"4bc48978-6e4c-4923-b962-f8b1e1fb50c9","resolution":{"observed_at":"2026-08-14T04:32:48.145931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:32:49.394817Z","title":"An Image is Worth 32 Tokens for Reconstruction and Generation","venue":null,"work_id":"d6c3da7a-aaa3-4ea3-ace6-ddcaaedff85d","year":2024},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:48.151323Z"},"links":{"citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:353104829750d38a306dd03264c260369d48c4b78433bc2882a0ae3cadf509df","observation_id":"78417bdc-e7b6-4707-afd5-1877e1372cdd","resolution":{"observed_at":"2026-08-14T04:32:49.398032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13967","last_updated":"2025-06-04T12:56:23Z","snapshot_observed_at":"2026-08-07T18:04:12.028140Z","submitted_at":"2025-02-19T18:59:44Z","title":"FlexTok: Resampling Images into 1D Token Sequences of Flexible Length","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13967","snapshot_observed_at":"2026-08-14T04:32:48.155154Z","title":"FlexTok: Resampling Images into 1D Token Sequences of Flexible Length","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:48.155154Z"},"links":{"cited_paper":"/paper/2502.13967","citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:c7c8b8e1b52c5ef1774c232493b2149b9d5772d9d8f53356a45aaf6d4837524d","observation_id":"9600fbcc-9f63-44c7-a359-952eb896998d","resolution":{"observed_at":"2026-08-14T04:32:48.155154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.06089","last_updated":"2021-03-10T14:42:31Z","snapshot_observed_at":"2026-08-07T00:20:05.002017Z","submitted_at":"2021-03-10T14:42:31Z","title":"Variable-rate discrete representation learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.06089","snapshot_observed_at":"2026-08-14T04:32:48.158348Z","title":"Variable-rate discrete representation learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:48.158348Z"},"links":{"cited_paper":"/paper/2103.06089","citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:43366f1400df7bb7d3ed6c76797dcb06a55b69df2cd2a71e875b20769c556b5b","observation_id":"7282f635-559e-47c4-891b-d17a25385c20","resolution":{"observed_at":"2026-08-14T04:32:48.158348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies"},"reference_resolution":{"displayed":78,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":63,"verified_exact":4,"verified_fuzzy":11},"total_outbound_references":78},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 78 of 78 outbound references and 0 inbound Pith citation observations for arXiv:2608.08667."}