{"as_of":"2026-08-08T12:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b0ee29a3d6e26d90900169d1c04cf65856feeb415daa08cfd65a0e0a91151f36","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T19:37:53.994131Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T19:37:50.680596Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.09201","snapshot_observed_at":"2026-08-04T19:37:50.680596Z","title":"Speech conveys semantic Shilei zhang is the corresponding author","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:50.680596Z"},"links":{"cited_paper":"/paper/2509.09201","citing_paper":"/paper/2509.09201"},"observation_digest":"sha256:4a5e1be06b53e43e10b948997c1ef174729e76732455fa0a8038ada15e377487","observation_id":"418f8ce1-a402-44c1-90ce-25eb16f76ea9","resolution":{"observed_at":"2026-08-04T19:37:50.680596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.09201/citation-record","integrity":"/paper/2509.09201/integrity","json":"/paper/2509.09201/citation-record.json","paper":"/paper/2509.09201"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.09201","snapshot_observed_at":"2026-08-04T19:37:50.680596Z","title":"Speech conveys semantic Shilei zhang is the corresponding author","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:50.680596Z"},"links":{"cited_paper":"/paper/2509.09201","citing_paper":"/paper/2509.09201"},"observation_digest":"sha256:4a5e1be06b53e43e10b948997c1ef174729e76732455fa0a8038ada15e377487","observation_id":"418f8ce1-a402-44c1-90ce-25eb16f76ea9","resolution":{"observed_at":"2026-08-04T19:37:50.680596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:50.725994Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:50.725994Z"},"links":{"citing_paper":"/paper/2509.09201"},"observation_digest":"sha256:5d235024e1f6f278b354ff66d517ce966ed083a6a657a290448699aae9cf47f8","observation_id":"51ebac8a-437c-4215-9974-fe6f2ad2e220","resolution":{"observed_at":"2026-08-04T19:37:50.725994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:50.757211Z","title":"Based on the differences in the physical generation mechanisms, it can be assumed that speech signal and background sound signal are mutually independent [31]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:50.757211Z"},"links":{"citing_paper":"/paper/2509.09201"},"observation_digest":"sha256:7af77959d95cccabf89a84ea41d24d7448e1e54e98ab3e9b05d72a7285edfb8c","observation_id":"d8b17411-afa8-4976-9d98-db076111a33b","resolution":{"observed_at":"2026-08-04T19:37:50.757211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:50.818276Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:50.818276Z"},"links":{"citing_paper":"/paper/2509.09201"},"observation_digest":"sha256:e6c79f3e9194ae3469a79a1923db82a65a285a6399b9457d0755ed27eb5d2a98","observation_id":"d759351c-a47f-49b0-ae0f-79cb43032097","resolution":{"observed_at":"2026-08-04T19:37:50.818276Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:50.870202Z","title":"front-end separation + back-end processing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:50.870202Z"},"links":{"citing_paper":"/paper/2509.09201"},"observation_digest":"sha256:b0677f2884bdeb6f2bdce0463bd80cac458079815436b6d14ac41d3640efa2e3","observation_id":"72f25802-bf56-4d13-895e-b50624272a68","resolution":{"observed_at":"2026-08-04T19:37:50.870202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:50.927592Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:50.927592Z"},"links":{"citing_paper":"/paper/2509.09201"},"observation_digest":"sha256:963f0b0f9e33d305566667ceba9aa9a2258cfa3de1a553bdebd7688982021a99","observation_id":"767b99ed-9000-425b-bb18-2a081141b7e3","resolution":{"observed_at":"2026-08-04T19:37:50.927592Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:51.015687Z","title":"The experimental results confirm that the representations are sufficiently disentangled, enabling controllable feature selection tailored to diverse downstream tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:51.015687Z"},"links":{"citing_paper":"/paper/2509.09201"},"observation_digest":"sha256:07466d1f581fbf7af9534018e97f8b650896702a325665d296f6b0675645787a","observation_id":"d74fee62-8daa-43f8-866d-6477696a3bba","resolution":{"observed_at":"2026-08-04T19:37:51.015687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-08-07T01:18:02.068918Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-08-04T19:37:51.101392Z","title":"Audiopalm: A large language model that can speak and listen,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:51.101392Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2509.09201"},"observation_digest":"sha256:dfc9dd448da7d2c771c15ac8ec6fdc41fbc51a194c8256662a416923f406af06","observation_id":"3e72c3ac-f75b-48d2-aed9-0dd507bb38bf","resolution":{"observed_at":"2026-08-04T19:37:51.101392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:51.183385Z","title":"Audit: Audio editing by follow- ing instructions with latent diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:51.183385Z"},"links":{"citing_paper":"/paper/2509.09201"},"observation_digest":"sha256:b6e48ac4566ac8c8f45c106467cc986c83866bf770a22aeeb3a6f5dd4b02879a","observation_id":"a000a9fd-0dd0-4ee8-9670-f95db715c479","resolution":{"observed_at":"2026-08-04T19:37:51.183385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:51.260311Z","title":"Superm2m: Supervised and mixture-to-mixture co-learning for speech enhancement and noise-robust asr,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:51.260311Z"},"links":{"citing_paper":"/paper/2509.09201"},"observation_digest":"sha256:b2958bd3744388d2d20c929e45688d71acbe36784d59560270e0573244e1d5a1","observation_id":"0093045f-152c-4769-ac0d-64635a00c715","resolution":{"observed_at":"2026-08-04T19:37:51.260311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:51.322124Z","title":"Preserving background sound in noise-robust voice conversion via multi-task learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:51.322124Z"},"links":{"citing_paper":"/paper/2509.09201"},"observation_digest":"sha256:fc047ce3cef96ede0829ed66554aded5650c554d1cb6f5e4a8d95ab9ae977158","observation_id":"8c819585-5800-4c7e-8115-d2922fb1edba","resolution":{"observed_at":"2026-08-04T19:37:51.322124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:51.405886Z","title":"Supervised speech separation based on deep learning: An overview,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:51.405886Z"},"links":{"citing_paper":"/paper/2509.09201"},"observation_digest":"sha256:2502e935e35e93a247043b3ce60999af342578df97c73d44f30d8bd8980a823c","observation_id":"c2c04314-f074-4cb2-bc94-9e63231eff77","resolution":{"observed_at":"2026-08-04T19:37:51.405886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:51.476825Z","title":"Complex spectral mapping for single-and multi-channel speech enhancement and robust asr,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:51.476825Z"},"links":{"citing_paper":"/paper/2509.09201"},"observation_digest":"sha256:da51d28aa6b7b2533bc48c4f71a720485cd5cd7b38b84096813dac2bc52c05e5","observation_id":"675636fe-b5ad-4936-ae5f-1fda4a9b4368","resolution":{"observed_at":"2026-08-04T19:37:51.476825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:51.519961Z","title":"Speech enhancement with lstm recurrent neural networks and its application to noise- robust asr,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:51.519961Z"},"links":{"citing_paper":"/paper/2509.09201"},"observation_digest":"sha256:07151cb0d086ae8d8a4049f13c8bbdfa0e435c19f027cadec488576633311513","observation_id":"7636640a-1529-434f-8adf-e9212ee8de43","resolution":{"observed_at":"2026-08-04T19:37:51.519961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:51.571480Z","title":"Deep neural networks for speech enhancement and speech recognition: A systematic review,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:51.571480Z"},"links":{"citing_paper":"/paper/2509.09201"},"observation_digest":"sha256:be8adc310268427f25d2e68042eed7cbc7eef652ba8da6a69e446cb735f4ca54","observation_id":"0919e23d-e6ec-4f44-ba40-89530926a584","resolution":{"observed_at":"2026-08-04T19:37:51.571480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:51.650758Z","title":"Attention-based latent features for jointly trained end-to-end automatic speech recognition with modified speech enhancement,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:51.650758Z"},"links":{"citing_paper":"/paper/2509.09201"},"observation_digest":"sha256:0bb09a0d93998492144b47f7d23c1855762eee702331f55c1e6bc08db5c0321e","observation_id":"8e8b811f-e6a9-42c5-adea-5d923a969839","resolution":{"observed_at":"2026-08-04T19:37:51.650758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:51.734805Z","title":"Phonetic feature encoding in human superior temporal gyrus,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:51.734805Z"},"links":{"citing_paper":"/paper/2509.09201"},"observation_digest":"sha256:01e371174addd05c0fc8492cc2b8191ed7e8e068d00d4c3f30c73b12d99d6344","observation_id":"0b3eaef0-d7cd-412e-89ea-c3cb7eabf06b","resolution":{"observed_at":"2026-08-04T19:37:51.734805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:51.791267Z","title":"Representation of temporal sound features in the human auditory cortex,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:51.791267Z"},"links":{"citing_paper":"/paper/2509.09201"},"observation_digest":"sha256:8682cabfcfa687357967305f282e15e44b0656e21472f89ac3684e83f9be48ec","observation_id":"304a0721-9c83-40a0-acce-11fd71c31963","resolution":{"observed_at":"2026-08-04T19:37:51.791267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-03T16:47:47.192907Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-04T19:37:51.875056Z","title":"High fidelity neural audio compression,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:51.875056Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2509.09201"},"observation_digest":"sha256:d41e472bd20609ad8466cd71f5974b88f14dc6a087446f8d64458eff59b7b2aa","observation_id":"288879da-e5ce-4acf-9ef9-f8d101a3c88a","resolution":{"observed_at":"2026-08-04T19:37:51.875056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:51.951394Z","title":"High-fidelity au- dio compression with improved rvqgan,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:51.951394Z"},"links":{"citing_paper":"/paper/2509.09201"},"observation_digest":"sha256:7b6a7a1d82b32db6704b6b206fb96b677ddc23751373ce5d60991e4d8c84a672","observation_id":"a70cc88a-458a-4e35-bd7a-f1b01a6c237e","resolution":{"observed_at":"2026-08-04T19:37:51.951394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20067","last_updated":"2025-02-27T13:16:41Z","snapshot_observed_at":"2026-08-07T17:42:59.278834Z","submitted_at":"2025-02-27T13:16:41Z","title":"UniCodec: Unified Audio Codec with Single Domain-Adaptive Codebook","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20067","snapshot_observed_at":"2026-08-04T19:37:51.994459Z","title":"Unicodec: Unified audio codec with single domain-adaptive codebook,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:51.994459Z"},"links":{"cited_paper":"/paper/2502.20067","citing_paper":"/paper/2509.09201"},"observation_digest":"sha256:8b891f1f1e7b45cef626f50d82dad7d5d16eb169077a8b31934e556c36081d1d","observation_id":"143f1e17-f16f-4f2d-b198-ec8a76fb5623","resolution":{"observed_at":"2026-08-04T19:37:51.994459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03100","last_updated":"2024-04-23T08:38:03Z","snapshot_observed_at":"2026-08-07T23:22:31.422843Z","submitted_at":"2024-03-05T16:35:25Z","title":"NaturalSpeech 3: Zero-Shot Speech Synthesis with Factorized Codec and Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03100","snapshot_observed_at":"2026-08-04T19:37:52.044394Z","title":"Naturalspeech 3: Zero-shot speech synthesis with factorized codec and diffusion models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:52.044394Z"},"links":{"cited_paper":"/paper/2403.03100","citing_paper":"/paper/2509.09201"},"observation_digest":"sha256:6ebd96f8c4d37fe9ad8cc77dd9fa55e6a2c599af43e5f0d015d9931df55dde9f","observation_id":"7dfd02ad-5cab-496b-9e6d-33fe1fbad1e6","resolution":{"observed_at":"2026-08-04T19:37:52.044394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-07T03:22:13.424379Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-08-04T19:37:52.109011Z","title":"Speechtokenizer: Unified speech tok- enizer for speech large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:52.109011Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2509.09201"},"observation_digest":"sha256:b5a7935f552c311c880786a01596611809bdc9dcb29e7cccac34221d3887bf52","observation_id":"9d390e1d-3709-4354-a1b9-ec425eae07b5","resolution":{"observed_at":"2026-08-04T19:37:52.109011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-04T19:37:52.181884Z","title":"Moshi: a speech-text foun- dation model for real-time dialogue,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:52.181884Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2509.09201"},"observation_digest":"sha256:bbfc3db9a1be876b65046f249100be45b327bbd631ca1914233fa1180a4d304b","observation_id":"d2aa8661-24bb-4b08-835d-a182292dc5d0","resolution":{"observed_at":"2026-08-04T19:37:52.181884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:52.245258Z","title":"Dualcodec: A low-frame-rate, semantically-enhanced neural audio codec for speech generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:52.245258Z"},"links":{"citing_paper":"/paper/2509.09201"},"observation_digest":"sha256:68611ad01a5ebd5e08963ba0a2cf7feee76cb1f0a44dd6f7422d5eeb6d2921d9","observation_id":"bfb54c71-31ca-47cd-bcd4-8373d8efd4c3","resolution":{"observed_at":"2026-08-04T19:37:52.245258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:52.315157Z","title":"Brain plasticity under early auditory deprivation: evidence from congenital hearing-impaired people,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:52.315157Z"},"links":{"citing_paper":"/paper/2509.09201"},"observation_digest":"sha256:65d9624485c7856feb1b6b4ec3893da251af713f114288e154e45723fe26da9a","observation_id":"48c2eb87-df7c-4182-adba-3d8e8ad3215a","resolution":{"observed_at":"2026-08-04T19:37:52.315157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:52.370793Z","title":"A tutorial on mpeg/audio compression,","venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:52.370793Z"},"links":{"citing_paper":"/paper/2509.09201"},"observation_digest":"sha256:3b60fc6bfe46e19f4c25619cb73766baa198eb6ba1feea4331b69ab072d9ce74","observation_id":"f3acf3a7-62b6-4c28-9b30-641c07a98d23","resolution":{"observed_at":"2026-08-04T19:37:52.370793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:52.454439Z","title":"Soundstream: An end-to-end neural audio codec,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:52.454439Z"},"links":{"citing_paper":"/paper/2509.09201"},"observation_digest":"sha256:cfd4d62b62cf61c590e5139bcc7ddeed7c71410318fee512e5bf67ba607db5f4","observation_id":"cf877525-a0bb-42e4-b250-0bafe52deed8","resolution":{"observed_at":"2026-08-04T19:37:52.454439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02765","last_updated":"2023-05-07T09:22:04Z","snapshot_observed_at":"2026-08-06T10:45:04.364170Z","submitted_at":"2023-05-04T12:11:13Z","title":"HiFi-Codec: Group-residual Vector quantization for High Fidelity Audio Codec","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02765","snapshot_observed_at":"2026-08-04T19:37:52.501429Z","title":"Hifi- codec: Group-residual vector quantization for high fi- delity audio codec,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:52.501429Z"},"links":{"cited_paper":"/paper/2305.02765","citing_paper":"/paper/2509.09201"},"observation_digest":"sha256:dbf7a63b4b74f855c2ef1457ae66acb1c1b00e658d4c7a7a3a32d997a1f8afb4","observation_id":"eccc40f4-61df-481b-af0b-307de4dfe04a","resolution":{"observed_at":"2026-08-04T19:37:52.501429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:52.561461Z","title":"Flow-vae vc: end-to-end flow framework with contrastive loss for zero-shot voice conversion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:52.561461Z"},"links":{"citing_paper":"/paper/2509.09201"},"observation_digest":"sha256:0617bea110e4d73118ccdd802a72d47efabf154c1fcf6a7d1fdc0e1040022a68","observation_id":"2d2e3a6a-f07b-4d3d-893a-fa92edcd6f4e","resolution":{"observed_at":"2026-08-04T19:37:52.561461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:52.614490Z","title":"Hubert: Self-supervised speech rep- resentation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:52.614490Z"},"links":{"citing_paper":"/paper/2509.09201"},"observation_digest":"sha256:ffe8278fca00732ce363894aa010edaa5412cb2caf08de8d1ccde8725c80ded8","observation_id":"bbc9e49c-ef69-47f3-9146-bd6ef4331b1a","resolution":{"observed_at":"2026-08-04T19:37:52.614490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:52.643574Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:52.643574Z"},"links":{"citing_paper":"/paper/2509.09201"},"observation_digest":"sha256:2cee0aaa63b3f64c5f138228e756ce764ef89c478301bb2f21cfd4da9d191c25","observation_id":"5f859916-789d-445a-8fa7-feb35227b639","resolution":{"observed_at":"2026-08-04T19:37:52.643574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:52.726141Z","title":"Wavlm: Large-scale self-supervised pre-training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:52.726141Z"},"links":{"citing_paper":"/paper/2509.09201"},"observation_digest":"sha256:ea96e0b7c1c76f21b852d221e3f04316059dbfc2ed04ad42148e1138697a4620","observation_id":"fdc269f3-687d-46b1-bfab-0830b3832565","resolution":{"observed_at":"2026-08-04T19:37:52.726141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.06849","last_updated":"2022-03-14T04:26:40Z","snapshot_observed_at":"2026-07-06T12:47:24.314191Z","submitted_at":"2022-03-14T04:26:40Z","title":"SUPERB-SG: Enhanced Speech processing Universal PERformance Benchmark for Semantic and Generative Capabilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.06849","snapshot_observed_at":"2026-08-04T19:37:52.768658Z","title":"Superb-sg: Enhanced speech processing universal per- formance benchmark for semantic and generative capa- bilities,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:52.768658Z"},"links":{"cited_paper":"/paper/2203.06849","citing_paper":"/paper/2509.09201"},"observation_digest":"sha256:667d0d0aa30571684af27fbbcac6356133100728e30356901aa2f45f6feb5912","observation_id":"987f8729-1321-4bef-bda1-a959f73e3152","resolution":{"observed_at":"2026-08-04T19:37:52.768658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00169","last_updated":"2024-07-22T09:53:44Z","snapshot_observed_at":"2026-08-02T05:10:10.209271Z","submitted_at":"2023-08-31T23:26:10Z","title":"RepCodec: A Speech Representation Codec for Speech Tokenization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00169","snapshot_observed_at":"2026-08-04T19:37:52.824678Z","title":"Rep- codec: A speech representation codec for speech tok- enization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:52.824678Z"},"links":{"cited_paper":"/paper/2309.00169","citing_paper":"/paper/2509.09201"},"observation_digest":"sha256:0e7629bc55912c3e73f5e0d49595998d759b009eb730843d415bca4abd31444d","observation_id":"308b81e9-2564-4b84-92a7-c3107e254bc9","resolution":{"observed_at":"2026-08-04T19:37:52.824678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:52.878282Z","title":"Funcodec: A fundamental, reproducible and integrable open-source toolkit for neural speech codec,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:52.878282Z"},"links":{"citing_paper":"/paper/2509.09201"},"observation_digest":"sha256:60c563c5f041b2d8f3d3747e1ad610fa4f7426862e43296b8adc71ba3bc34cfa","observation_id":"c4672b52-6489-4b5d-9fc1-6ca23d2aeb53","resolution":{"observed_at":"2026-08-04T19:37:52.878282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:52.907602Z","title":"Semanticodec: An ul- tra low bitrate semantic audio codec for general sound,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:52.907602Z"},"links":{"citing_paper":"/paper/2509.09201"},"observation_digest":"sha256:25013e857a17b87c92f1d7954b44d8d9e84aa5530608ec124ff20e66a8df8aaa","observation_id":"5538d06b-21be-4960-9335-9ed3868c6660","resolution":{"observed_at":"2026-08-04T19:37:52.907602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:52.960879Z","title":"Sixty years of frequency-domain monaural speech en- hancement: From traditional to deep learning methods,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:52.960879Z"},"links":{"citing_paper":"/paper/2509.09201"},"observation_digest":"sha256:faf85f1a9fe2f78cfbac00540dcf8e5c5bf3b1f1383fdb182ea606d2bee59941","observation_id":"fd8a5c3f-1518-47c4-a32f-e3ac2de11812","resolution":{"observed_at":"2026-08-04T19:37:52.960879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:53.007585Z","title":"A review of vector quantization techniques,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:53.007585Z"},"links":{"citing_paper":"/paper/2509.09201"},"observation_digest":"sha256:d51f0261df0fad2a4a7d75b29430affd52c42b13f3cdf4a85006c897ede6ea98","observation_id":"0c42ae0b-25e4-466e-a677-449103f0395c","resolution":{"observed_at":"2026-08-04T19:37:53.007585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:53.066979Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:53.066979Z"},"links":{"citing_paper":"/paper/2509.09201"},"observation_digest":"sha256:8a608b8ee3e90f225c16e9ee7b278a475067405ff3a9f3262c1b300b3423df4a","observation_id":"3ac3e4db-175f-410b-80f3-72ee20d7fc32","resolution":{"observed_at":"2026-08-04T19:37:53.066979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:53.096021Z","title":"Neural dis- crete representation learning,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:53.096021Z"},"links":{"citing_paper":"/paper/2509.09201"},"observation_digest":"sha256:05dbb7fb08ee69ef168483a7e753ffc391c04398cfdef19227df85d216c344bc","observation_id":"c7d849c3-24ba-4204-89b7-9c77de90223e","resolution":{"observed_at":"2026-08-04T19:37:53.096021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11567","last_updated":"2021-04-22T07:51:51Z","snapshot_observed_at":"2026-08-06T10:12:55.155871Z","submitted_at":"2020-10-22T09:54:22Z","title":"AISHELL-3: A Multi-speaker Mandarin TTS Corpus and the Baselines","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11567","snapshot_observed_at":"2026-08-04T19:37:53.149135Z","title":"Aishell-3: A multi-speaker mandarin tts corpus and the baselines,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:53.149135Z"},"links":{"cited_paper":"/paper/2010.11567","citing_paper":"/paper/2509.09201"},"observation_digest":"sha256:446fde46aea3c4533d668e0f509286925d5ff3f9b32bdae8caf237d9d40efb58","observation_id":"3fe8a6d4-6c3c-4f6e-a61e-b88ac4cb3a0d","resolution":{"observed_at":"2026-08-04T19:37:53.149135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.02882","last_updated":"2019-04-05T06:05:00Z","snapshot_observed_at":"2026-08-07T13:32:24.356336Z","submitted_at":"2019-04-05T06:05:00Z","title":"LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.02882","snapshot_observed_at":"2026-08-04T19:37:53.193305Z","title":"Lib- ritts: A corpus derived from librispeech for text-to- speech,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:53.193305Z"},"links":{"cited_paper":"/paper/1904.02882","citing_paper":"/paper/2509.09201"},"observation_digest":"sha256:8b168161058de193593a723fbd1a6504f519e26bb2221dfade2e81ad884eb3ab","observation_id":"0ff7203d-9946-4890-96b3-d0be7e7a1bb0","resolution":{"observed_at":"2026-08-04T19:37:53.193305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:53.249521Z","title":"The voice bank corpus: Design, collection and data analysis of a large regional accent speech database,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:53.249521Z"},"links":{"citing_paper":"/paper/2509.09201"},"observation_digest":"sha256:46d7dea21861839486cdaa10f5d6bd1374595be5bc935cdc88d1ab0de6936491","observation_id":"b08ec887-b932-4c57-99aa-ded01908740d","resolution":{"observed_at":"2026-08-04T19:37:53.249521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:53.336254Z","title":"The design for the wall street journal- based,","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:53.336254Z"},"links":{"citing_paper":"/paper/2509.09201"},"observation_digest":"sha256:3b3435172803057bdea8f033fb0c396c9ddf79ac429e89935abe5014cf8558d9","observation_id":"0c2628a5-a575-43e7-ad54-c9f4e6319597","resolution":{"observed_at":"2026-08-04T19:37:53.336254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:53.415756Z","title":"Esc: Dataset for environmental sound classification,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:53.415756Z"},"links":{"citing_paper":"/paper/2509.09201"},"observation_digest":"sha256:def4493fe61b44e86fcda9f1b8aa7b31032196cd3324b60fecaf04169740d398","observation_id":"2ade5bfd-d711-4079-85fb-10545fbdb348","resolution":{"observed_at":"2026-08-04T19:37:53.415756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.13981","last_updated":"2020-10-18T04:36:21Z","snapshot_observed_at":"2026-07-31T23:56:07.410341Z","submitted_at":"2020-05-16T23:48:37Z","title":"The INTERSPEECH 2020 Deep Noise Suppression Challenge: Datasets, Subjective Testing Framework, and Challenge Results","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.13981","snapshot_observed_at":"2026-08-04T19:37:53.473571Z","title":"The interspeech 2020 deep noise suppression challenge: Datasets, subjective test- ing framework, and challenge results,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:53.473571Z"},"links":{"cited_paper":"/paper/2005.13981","citing_paper":"/paper/2509.09201"},"observation_digest":"sha256:36925e0bca50cb2ea48d9cc479632673ec3cd74c70c156307f72e434cd2afbf1","observation_id":"ed606094-3758-4290-9f32-7b616663d3b6","resolution":{"observed_at":"2026-08-04T19:37:53.473571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:53.530768Z","title":"First stereo audio source separation evaluation campaign: data, algorithms and results,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:53.530768Z"},"links":{"citing_paper":"/paper/2509.09201"},"observation_digest":"sha256:740bfebc858235f4ca035df54779eb71555a91d4039c03ba56a12bccde68e2ff","observation_id":"03832718-d907-4723-86a0-1af4f5511876","resolution":{"observed_at":"2026-08-04T19:37:53.530768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:53.584010Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:53.584010Z"},"links":{"citing_paper":"/paper/2509.09201"},"observation_digest":"sha256:3f938ccba178e91139051ebe929d6ad02ec4e7b0c92abe1ad7733c01f3279155","observation_id":"9d4956ab-1ef7-4e02-b000-f4c7185a9688","resolution":{"observed_at":"2026-08-04T19:37:53.584010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:53.644016Z","title":"Dnsmos: A non-intrusive perceptual objective speech quality metric to evaluate noise suppressors,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:53.644016Z"},"links":{"citing_paper":"/paper/2509.09201"},"observation_digest":"sha256:262ca8f7d1786388799c480a7dd79afc2fd3aaa61b5ee1332fceb79a99355101","observation_id":"7f27f1f1-edb8-4ca8-b669-ec4ca13cbc3d","resolution":{"observed_at":"2026-08-04T19:37:53.644016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:53.669090Z","title":"Inter-subnet: Speech enhancement with subband in- teraction,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:53.669090Z"},"links":{"citing_paper":"/paper/2509.09201"},"observation_digest":"sha256:647c98d8368e33390d3ddf90edb97bd85c7f5fde6f521897decd9e35ca906c3f","observation_id":"0df59a6a-045c-4892-b56a-b72933812da5","resolution":{"observed_at":"2026-08-04T19:37:53.669090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:53.722918Z","title":"Storm: A diffusion-based stochastic regeneration model for speech enhancement and dereverberation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:53.722918Z"},"links":{"citing_paper":"/paper/2509.09201"},"observation_digest":"sha256:33b2986c9bd131e7eb9816fdaa1f4b662af1efc2277170c48fcab0f3676c7939","observation_id":"ce48057c-768d-4a47-ac92-b8fc049ae857","resolution":{"observed_at":"2026-08-04T19:37:53.722918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:53.774367Z","title":"Selm: Speech enhancement using discrete tokens and language mod- els,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:53.774367Z"},"links":{"citing_paper":"/paper/2509.09201"},"observation_digest":"sha256:7b4ed39d5959954e66797a8cd40a6f767ee5f7c51770d3022c1145a2c8ff8b38","observation_id":"4c826304-4843-4d75-8b72-968118a0e324","resolution":{"observed_at":"2026-08-04T19:37:53.774367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:37:53.831514Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:53.831514Z"},"links":{"citing_paper":"/paper/2509.09201"},"observation_digest":"sha256:70444dcdb3ed0806c1b46c70d3135333ec812a892818d4fda2ee9928fc122e66","observation_id":"5ca5a13c-4aa2-47f2-825c-8cc2979366aa","resolution":{"observed_at":"2026-08-04T19:37:53.831514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07801","last_updated":"2024-06-12T01:35:46Z","snapshot_observed_at":"2026-07-06T18:29:17.280082Z","submitted_at":"2024-06-12T01:35:46Z","title":"PolySpeech: Exploring Unified Multitask Speech Models for Competitiveness with Single-task Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07801","snapshot_observed_at":"2026-08-04T19:37:53.886688Z","title":"Polyspeech: Exploring unified multi- task speech models for competitiveness with single-task models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:53.886688Z"},"links":{"cited_paper":"/paper/2406.07801","citing_paper":"/paper/2509.09201"},"observation_digest":"sha256:8e566ff6ff186a39f7c69f4bf56d90d1b5926f9f2d8d199366968b00a3c1d6e8","observation_id":"34b8bdc9-f242-4121-ac11-2ed83fb76510","resolution":{"observed_at":"2026-08-04T19:37:53.886688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-04T19:37:53.944636Z","title":"Neural codec lan- guage models are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:53.944636Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2509.09201"},"observation_digest":"sha256:3ceaed2ea23b0cdfb69f0978b7ebddbb2b75f52e8e6698cc684708a0a366a205","observation_id":"f489a456-69c3-44f8-9163-9a4a535cf71a","resolution":{"observed_at":"2026-08-04T19:37:53.944636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-04T19:37:53.994131Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-04T19:37:53.994131Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2509.09201"},"observation_digest":"sha256:3807141b5caeac5d5a5f2209b2393e967a2ac05aeda88847fbb178880f9f1d3f","observation_id":"c6eee5b8-c5b0-4fd9-b5d5-aeff362fc939","resolution":{"observed_at":"2026-08-04T19:37:53.994131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.09201","last_updated":"2025-09-11T07:14:18Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-08T05:22:34.464459Z","submitted_at":"2025-09-11T07:14:18Z","title":"DeCodec: Rethinking Audio Codecs as Universal Disentangled Representation Learners"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":55,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 1 inbound Pith citation observation for arXiv:2509.09201."}