{"as_of":"2026-08-08T15:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c6be7db63461d77c009d6fcb4aebfae1d1197b5f09c86031f9e70fd777d49b6a","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T23:33:19.743287Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T23:33:19.656344Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T14:59:54.992758Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-06T19:47:09.134710Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05207","snapshot_observed_at":"2026-08-05T23:33:19.656344Z","title":"Additionally, a discriminator is used solely for adver- sarial learning, which we will describe in Section 3","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-06T19:47:09.134710Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T23:33:19.656344Z"},"links":{"cited_paper":"/paper/2508.05207","citing_paper":"/paper/2508.05207"},"observation_digest":"sha256:3be70d3bfe1130a220ccdfc22c4d9d073ac3c2c228f48fb19df6f72f79a01e80","observation_id":"e200ab57-0403-4138-9ffa-c999d9a924c8","resolution":{"observed_at":"2026-08-05T23:33:19.656344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-06T19:47:09.134710Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"cited_work":{"arxiv_id":"2508.05207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.05207","snapshot_observed_at":"2026-07-04T14:59:54.992758Z","title":"Spectrostream: A versatile neural codec for general audio","venue":null,"work_id":"e5f1dc1c-004b-4bd0-963e-8a8e8bd157fa","year":2025},"citing_paper":{"arxiv_id":"2605.17085","last_updated":"2026-05-16T17:01:47Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T17:01:47Z","title":"Taming Audio VAEs via Target-KL Regularization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-20T14:53:15.718359Z"},"links":{"cited_paper":"/paper/2508.05207","citing_paper":"/paper/2605.17085"},"observation_digest":"sha256:cf223cdaae29fe999bb81aace61653a30bb25aeff27c893d27f32afc8f4ba348","observation_id":"20135b68-3616-4b79-bada-563d7092f5ab","resolution":{"observed_at":"2026-05-20T14:53:23.193610Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-06T19:47:09.134710Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"cited_work":{"arxiv_id":"2508.05207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.05207","snapshot_observed_at":"2026-07-04T14:59:54.992758Z","title":"Spectrostream: A versatile neural codec for general audio","venue":null,"work_id":"e5f1dc1c-004b-4bd0-963e-8a8e8bd157fa","year":2025},"citing_paper":{"arxiv_id":"2606.06357","last_updated":"2026-06-04T16:25:07Z","snapshot_observed_at":"2026-07-06T23:46:10.612537Z","submitted_at":"2026-06-04T16:25:07Z","title":"F3-Tokenizer: Taming Audio Autoencoder Latents for Understanding and Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-27T23:36:27.369551Z"},"links":{"cited_paper":"/paper/2508.05207","citing_paper":"/paper/2606.06357"},"observation_digest":"sha256:d23c0ae677e5d66296a7904dbd78d9cc91112e4549d8a664cddcddc725b72648","observation_id":"b2cc25e2-41b0-46ab-befa-0627564b6e5a","resolution":{"observed_at":"2026-07-02T15:47:06.024654Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-06T19:47:09.134710Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"cited_work":{"arxiv_id":"2508.05207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.05207","snapshot_observed_at":"2026-07-04T14:59:54.992758Z","title":"Spectrostream: A versatile neural codec for general audio","venue":null,"work_id":"e5f1dc1c-004b-4bd0-963e-8a8e8bd157fa","year":2025},"citing_paper":{"arxiv_id":"2606.27320","last_updated":"2026-06-25T17:33:09Z","snapshot_observed_at":"2026-08-03T01:51:36.685656Z","submitted_at":"2026-06-25T17:33:09Z","title":"Elastic Time: Dynamic Frame Rate Bottlenecks for Neural Audio Coding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T02:08:02.803410Z"},"links":{"cited_paper":"/paper/2508.05207","citing_paper":"/paper/2606.27320"},"observation_digest":"sha256:af1dd3a18384786e0cb0ec0f6a2fee016c215aa71d596767370fb1d5aa9c53b1","observation_id":"fa6bc4a9-da85-414c-939f-4e0da604a108","resolution":{"observed_at":"2026-07-04T14:59:54.994613Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.05207/citation-record","integrity":"/paper/2508.05207/integrity","json":"/paper/2508.05207/citation-record.json","paper":"/paper/2508.05207"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:33:22.515481Z","title":"The de- velopment of SoundStream [1] was a key development that unlocked the potential of autogressive audio generation with standard language-modeling objectives [2]","venue":null,"work_id":"20e22483-f3da-4396-9359-8b3f39c83a84","year":null},"citing_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-06T19:47:09.134710Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T23:33:19.652938Z"},"links":{"citing_paper":"/paper/2508.05207"},"observation_digest":"sha256:82210aa2de850f7cffa630203362cdcd95519e6495c3de7d58f1d77bb810f214","observation_id":"7c464923-91f2-4025-b754-ec05b9daf525","resolution":{"observed_at":"2026-08-05T23:33:22.596166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-06T19:47:09.134710Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05207","snapshot_observed_at":"2026-08-05T23:33:19.656344Z","title":"Additionally, a discriminator is used solely for adver- sarial learning, which we will describe in Section 3","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-06T19:47:09.134710Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T23:33:19.656344Z"},"links":{"cited_paper":"/paper/2508.05207","citing_paper":"/paper/2508.05207"},"observation_digest":"sha256:3be70d3bfe1130a220ccdfc22c4d9d073ac3c2c228f48fb19df6f72f79a01e80","observation_id":"e200ab57-0403-4138-9ffa-c999d9a924c8","resolution":{"observed_at":"2026-08-05T23:33:19.656344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:33:22.354565Z","title":"Unlike [17], we do not use the wave-based discrimina- tor [18]","venue":null,"work_id":"eb2d7440-2011-4a42-a33d-8d125021a720","year":2048},"citing_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-06T19:47:09.134710Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T23:33:19.659453Z"},"links":{"citing_paper":"/paper/2508.05207"},"observation_digest":"sha256:89747e174fe135c3e63e83858067b45507ec74cfee787a7205dcedfb7cc30fd1","observation_id":"3f62aa91-0962-45fe-b91f-23e15d13c7da","resolution":{"observed_at":"2026-08-05T23:33:22.427339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:33:22.159455Z","title":"Both the generator and the discriminators are updated exactly once in each step","venue":null,"work_id":"437e814a-ec74-4a9c-a992-ab332dc4f879","year":null},"citing_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-06T19:47:09.134710Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T23:33:19.662441Z"},"links":{"citing_paper":"/paper/2508.05207"},"observation_digest":"sha256:1387ec112989a0e0ef2e6f2c0712bd84060b109e70927a63ba03bd01d84020e9","observation_id":"e15ce3c1-5de2-44b4-8759-2a767f3afccd","resolution":{"observed_at":"2026-08-05T23:33:22.253700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:33:22.036886Z","title":"A key innovation of our model lies in its 2D con- volutional architecture, which operates directly on the time- frequency representation","venue":null,"work_id":"987883a1-ebbf-49cc-a843-1d4cdbf52405","year":null},"citing_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-06T19:47:09.134710Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T23:33:19.665753Z"},"links":{"citing_paper":"/paper/2508.05207"},"observation_digest":"sha256:9b2098b53f6689f13e0442bba720c0c05f6c7bb4801d6c77d8210c074af09265","observation_id":"23c07c69-1ecf-4932-8924-20f963bafe2a","resolution":{"observed_at":"2026-08-05T23:33:22.093003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:33:21.851588Z","title":"Soundstream: An end-to-end neural audio codec,","venue":null,"work_id":"133af9b7-598e-4792-88bf-338907c6d475","year":2021},"citing_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-06T19:47:09.134710Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T23:33:19.669589Z"},"links":{"citing_paper":"/paper/2508.05207"},"observation_digest":"sha256:11335d3c1f035fc2b605dbcef92dd4c245aac6ab0e88db5c05432da24cf52878","observation_id":"e80fe371-4b62-44bb-b593-b5b970936ad7","resolution":{"observed_at":"2026-08-05T23:33:21.955459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:33:21.599014Z","title":"Audiolm: A language modeling ap- proach to audio generation,","venue":null,"work_id":"3b0c458b-39a3-42f7-8f9e-7031e6763827","year":2023},"citing_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-06T19:47:09.134710Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T23:33:19.672459Z"},"links":{"citing_paper":"/paper/2508.05207"},"observation_digest":"sha256:6aeefcaa437f6f403c1e484e02dde5dcb2243e06203e4bc623d038e7fe3bfabe","observation_id":"1f36ce13-882b-425f-ae5c-70fcd1ea6d74","resolution":{"observed_at":"2026-08-05T23:33:21.705949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:33:19.675147Z","title":"High fidelity neural audio compression,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-06T19:47:09.134710Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T23:33:19.675147Z"},"links":{"citing_paper":"/paper/2508.05207"},"observation_digest":"sha256:25ba20499a315e871a5583ab65e01854c6cf388fccf07071933c752cbaf52020","observation_id":"0974b518-d5fd-417c-bc8d-33ecc50a4a36","resolution":{"observed_at":"2026-08-05T23:33:19.675147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:33:21.375943Z","title":"High-fidelity audio compression with improved RVQGAN,","venue":null,"work_id":"eb48035d-1031-42b3-9698-b795dc4cdf53","year":2023},"citing_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-06T19:47:09.134710Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T23:33:19.678169Z"},"links":{"citing_paper":"/paper/2508.05207"},"observation_digest":"sha256:f82cd62c220763baf31d44975c7aec2fe27f3608e5c859b16169e0ec8ea106ca","observation_id":"6f369632-7091-42a2-8800-300f7e21cf91","resolution":{"observed_at":"2026-08-05T23:33:21.497743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:33:21.129198Z","title":"Moshi: a speech-text foundation model for real-time dialogue,","venue":null,"work_id":"dabed8d6-c015-4f39-9359-f120717b593b","year":2024},"citing_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-06T19:47:09.134710Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T23:33:19.681853Z"},"links":{"citing_paper":"/paper/2508.05207"},"observation_digest":"sha256:9a9ead7e7bb8b4cd61a9e5ae612d9b784d717f9737e2b556cb33db15566c1464","observation_id":"12464c7a-ba1f-41c0-b0ea-e66387278c50","resolution":{"observed_at":"2026-08-05T23:33:21.243096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:33:20.960248Z","title":"Fo- calcodec: Low-bitrate speech coding via focal modulation net- works,","venue":null,"work_id":"fcb9dc98-b4a1-46c0-9ed8-4e60710f3b64","year":2025},"citing_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-06T19:47:09.134710Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T23:33:19.684989Z"},"links":{"citing_paper":"/paper/2508.05207"},"observation_digest":"sha256:5bdd9cddbb8c3feed696780aa428eaa2b470db77d5b5d1e1a5572891422fb7fc","observation_id":"bb9933dd-52c1-4bef-9e9a-c83a5b1990c1","resolution":{"observed_at":"2026-08-05T23:33:21.049575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:33:20.714575Z","title":"FlowDec: A flow- based full-band general audio codec with high percep- tual quality,","venue":null,"work_id":"e7631d80-7ea3-4166-a04a-8da76eb673b3","year":2025},"citing_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-06T19:47:09.134710Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T23:33:19.687582Z"},"links":{"citing_paper":"/paper/2508.05207"},"observation_digest":"sha256:df5645579d4288251a237df4c5cebe43d821ce279e35f8621548e8314cfaabd2","observation_id":"48c297d5-4eef-4e5c-8b06-0843d46f1920","resolution":{"observed_at":"2026-08-05T23:33:20.816294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.06720","last_updated":"2020-07-29T01:53:16Z","snapshot_observed_at":"2026-08-07T13:50:20.304437Z","submitted_at":"2020-05-14T05:05:22Z","title":"Streaming keyword spotting on mobile devices","version":2},"cited_work":{"arxiv_id":"2005.06720","doi":null,"metadata_source":"pith","pith_arxiv_id":"2005.06720","snapshot_observed_at":"2026-08-05T23:33:19.808703Z","title":"Streaming keyword spotting on mobile devices","venue":"eess.AS","work_id":"5bde61b3-e78e-4c07-a0c5-bccd66a72752","year":2020},"citing_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-06T19:47:09.134710Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T23:33:19.690050Z"},"links":{"cited_paper":"/paper/2005.06720","citing_paper":"/paper/2508.05207"},"observation_digest":"sha256:395f6bf90abaa2682e5e9f146941753332abf68ef4b118853873369636ae4ec3","observation_id":"19f95d28-7696-4534-91b2-42480e7f4f32","resolution":{"observed_at":"2026-08-05T23:33:19.815592Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:33:20.480886Z","title":"SEANet: A multi-modal speech enhancement network,","venue":null,"work_id":"66015496-bc6e-4674-b242-c02e44bd5159","year":2020},"citing_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-06T19:47:09.134710Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T23:33:19.693615Z"},"links":{"citing_paper":"/paper/2508.05207"},"observation_digest":"sha256:afbf9b5f26613dee811f2ab39a0dfe739cf7fd2d266200226a0945df00e1701d","observation_id":"5cae8b5f-7a0e-4f59-ad40-b5d30cf1e953","resolution":{"observed_at":"2026-08-05T23:33:20.600843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09636","last_updated":"2023-05-16T17:41:25Z","snapshot_observed_at":"2026-08-06T19:45:49.830925Z","submitted_at":"2023-05-16T17:41:25Z","title":"SoundStorm: Efficient Parallel Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.09636","snapshot_observed_at":"2026-08-05T23:33:19.696010Z","title":"Soundstorm: Efficient parallel au- dio generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-06T19:47:09.134710Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T23:33:19.696010Z"},"links":{"cited_paper":"/paper/2305.09636","citing_paper":"/paper/2508.05207"},"observation_digest":"sha256:fdecf36e9e0b1baf2b1dc61825b756cdb41d5693746ad1c6f3d56a4c126870c7","observation_id":"7da8ff5b-219d-4922-ae0e-deb83331618f","resolution":{"observed_at":"2026-08-05T23:33:19.696010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04229","last_updated":"2024-02-06T18:36:52Z","snapshot_observed_at":"2026-08-07T03:55:52.770411Z","submitted_at":"2024-02-06T18:36:52Z","title":"MusicRL: Aligning Music Generation to Human Preferences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04229","snapshot_observed_at":"2026-08-05T23:33:19.698892Z","title":"Musicrl: Aligning music generation to hu- man preferences,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-06T19:47:09.134710Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T23:33:19.698892Z"},"links":{"cited_paper":"/paper/2402.04229","citing_paper":"/paper/2508.05207"},"observation_digest":"sha256:06e760c9c0034037b12b2e006318fd0aa465d4d8581a9477488b409cfca5a902","observation_id":"b7b7ff75-c35a-4ac1-9019-bee20efc893b","resolution":{"observed_at":"2026-08-05T23:33:19.698892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11325","last_updated":"2023-01-26T18:58:53Z","snapshot_observed_at":"2026-07-06T14:45:00.730733Z","submitted_at":"2023-01-26T18:58:53Z","title":"MusicLM: Generating Music From Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11325","snapshot_observed_at":"2026-08-05T23:33:19.701844Z","title":"Musiclm: Generating music from text,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-06T19:47:09.134710Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T23:33:19.701844Z"},"links":{"cited_paper":"/paper/2301.11325","citing_paper":"/paper/2508.05207"},"observation_digest":"sha256:df910f523c10fdd757f08f25b2ada8d285e860ef6777a58b6c1f712aa24931f8","observation_id":"7180966e-065d-4023-8728-156dd5dac211","resolution":{"observed_at":"2026-08-05T23:33:19.701844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:33:20.217463Z","title":"Weight normalization: A sim- ple reparameterization to accelerate training of deep neural net- works,","venue":null,"work_id":"de0e8b65-55ce-4932-a312-f3ed2d5bb947","year":2016},"citing_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-06T19:47:09.134710Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T23:33:19.704661Z"},"links":{"citing_paper":"/paper/2508.05207"},"observation_digest":"sha256:992af049974b36c72240037b40c343d0ae3d3030483a598691a0b2125cbf9c0f","observation_id":"e92dc22c-4c24-4db6-bd5e-bdb9ecdf617c","resolution":{"observed_at":"2026-08-05T23:33:20.347269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-05T23:33:19.707384Z","title":"Layer normalization,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-06T19:47:09.134710Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T23:33:19.707384Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2508.05207"},"observation_digest":"sha256:b9f4958f247a1dcbdf57dd2e28150a772e12344cd508e8d7d9ed9aad290a4734","observation_id":"34e3d981-dd61-4ef7-869e-521e64fb2f1a","resolution":{"observed_at":"2026-08-05T23:33:19.707384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:33:20.070553Z","title":"Fast and accurate deep network learning by exponential linear units (ELUs),","venue":null,"work_id":"91986d21-0000-4930-b4c2-a6f93c4d4e69","year":2016},"citing_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-06T19:47:09.134710Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T23:33:19.710230Z"},"links":{"citing_paper":"/paper/2508.05207"},"observation_digest":"sha256:078e4d75fcf4b7a3d60a2405f03c0d31f486f06ae1ef95762d40afb2c15f6202","observation_id":"2a4eb047-f888-49fc-a1f5-8bf3e860aac3","resolution":{"observed_at":"2026-08-05T23:33:20.126988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:33:19.950523Z","title":"Rectifier nonlinear- ities improve neural network acoustic models,","venue":null,"work_id":"b0e933eb-2e4a-49d0-aa0e-d7defc7e7d72","year":2013},"citing_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-06T19:47:09.134710Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T23:33:19.713185Z"},"links":{"citing_paper":"/paper/2508.05207"},"observation_digest":"sha256:9103a49d9a8b2b07e87f960f8f02b015b6a07bc1008ba164298942e46aa0eaef","observation_id":"bd8da1e8-f09e-4cd0-a970-ec72d6bd0448","resolution":{"observed_at":"2026-08-05T23:33:19.992087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.09584","last_updated":"2020-04-20T19:19:26Z","snapshot_observed_at":"2026-08-05T04:43:49.261929Z","submitted_at":"2020-04-20T19:19:26Z","title":"ViSQOL v3: An Open Source Production Ready Objective Speech and Audio Metric","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.09584","snapshot_observed_at":"2026-08-05T23:33:19.737744Z","title":"Visqol v3: An open source production ready objective speech and audio metric,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-06T19:47:09.134710Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T23:33:19.737744Z"},"links":{"cited_paper":"/paper/2004.09584","citing_paper":"/paper/2508.05207"},"observation_digest":"sha256:f1773c823dc63b60960787aee068ed9bb0e36ce47aa13e9d1501bfe96712dd90","observation_id":"d8601910-cbbe-48a3-9f91-084b05f3dc41","resolution":{"observed_at":"2026-08-05T23:33:19.737744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:33:19.934442Z","title":"Mel- GAN: Generative adversarial networks for conditional wave- form synthesis,","venue":null,"work_id":"9f634464-5aad-43d1-af2e-bcda3c454cb4","year":2019},"citing_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-06T19:47:09.134710Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T23:33:19.722201Z"},"links":{"citing_paper":"/paper/2508.05207"},"observation_digest":"sha256:0751c919fcb3e7f294f969042efbc93ccf4e0a2f3d1bea73fa0b3a5b19cabfd2","observation_id":"054d0725-59d0-462d-a96a-4a0e4b9694e8","resolution":{"observed_at":"2026-08-05T23:33:19.941283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:33:19.917616Z","title":"Hifi-gan: Generative adversarial networks for efficient and high fidelity speech synthesis,","venue":null,"work_id":"56468745-fd98-4bcf-b16a-3965f7f93044","year":2020},"citing_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-06T19:47:09.134710Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T23:33:19.726088Z"},"links":{"citing_paper":"/paper/2508.05207"},"observation_digest":"sha256:78ef87b73a40233fcae5aeb46eca1db2c2fef47ae16631ef4ac48d9533570569","observation_id":"a266bad2-600b-4564-907e-04a530907fca","resolution":{"observed_at":"2026-08-05T23:33:19.922920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:33:19.901025Z","title":"Generative adversarial nets,","venue":null,"work_id":"1a3729dc-a29b-40bd-861f-fe350b4d2d3a","year":2014},"citing_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-06T19:47:09.134710Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T23:33:19.729063Z"},"links":{"citing_paper":"/paper/2508.05207"},"observation_digest":"sha256:b2bf31546cc97ce216e2d190ce3b5c34b82432b853d2184c4810802d29b458bc","observation_id":"45ef31af-4c71-4aa4-ae12-89c02a060bf7","resolution":{"observed_at":"2026-08-05T23:33:19.907832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:33:19.884464Z","title":"A spectral energy distance for parallel speech synthesis,","venue":null,"work_id":"a8e5fd17-40ba-4777-86bb-8a5843da8c66","year":2020},"citing_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-06T19:47:09.134710Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T23:33:19.731868Z"},"links":{"citing_paper":"/paper/2508.05207"},"observation_digest":"sha256:29ba7b9613b5aa1d5a3395c39907c5e71e7a2787eeb8467eba77f4cf69983053","observation_id":"52fdf571-3564-4a2d-9612-49b1abf593a1","resolution":{"observed_at":"2026-08-05T23:33:19.889665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:33:19.867295Z","title":"Adam: A method for stochastic opti- mization","venue":null,"work_id":"3f1ced3f-8888-4533-8318-d8b9c5efc345","year":2015},"citing_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-06T19:47:09.134710Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T23:33:19.735039Z"},"links":{"citing_paper":"/paper/2508.05207"},"observation_digest":"sha256:4616153657131838b37e0f634efeec8837c0cbf37d53725c1182d1c2669d93fd","observation_id":"055f1448-0dc3-4760-9cd1-9895f10f4850","resolution":{"observed_at":"2026-08-05T23:33:19.874354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:33:19.850881Z","title":"Visqol: The virtual speech quality objective listener,","venue":null,"work_id":"680a058a-0010-4be6-bff6-fc2abde247a1","year":2012},"citing_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-06T19:47:09.134710Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T23:33:19.740508Z"},"links":{"citing_paper":"/paper/2508.05207"},"observation_digest":"sha256:11fcbf0cc7c8ceac1eac3ec869c59f2331bba7a07bb7666ba5446dbdd1f8bdb4","observation_id":"b5b16f5f-dc56-4c85-8af2-c79286ac22f4","resolution":{"observed_at":"2026-08-05T23:33:19.855888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:33:19.830202Z","title":"The MUSDB18 corpus for music separation,","venue":null,"work_id":"e61385af-6077-495f-bbe1-1e0cc3d85ee0","year":2017},"citing_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-06T19:47:09.134710Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T23:33:19.743287Z"},"links":{"citing_paper":"/paper/2508.05207"},"observation_digest":"sha256:3645f6134a9825f30d8d2b3c1a0a1793fc3ba80e9cb878a0770f78be7daff33b","observation_id":"5d134de1-f0eb-4cca-b647-d575347d1f5f","resolution":{"observed_at":"2026-08-05T23:33:19.838150Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.08933","last_updated":"2020-07-02T13:57:33Z","snapshot_observed_at":"2026-07-06T08:58:52.372748Z","submitted_at":"2020-02-20T18:30:36Z","title":"Wavesplit: End-to-End Speech Separation by Speaker Clustering","version":2},"cited_work":{"arxiv_id":"2002.08933","doi":null,"metadata_source":"pith","pith_arxiv_id":"2002.08933","snapshot_observed_at":"2026-08-05T23:33:19.770354Z","title":"Wavesplit: End-to-End Speech Separation by Speaker Clustering","venue":"eess.AS","work_id":"92d74153-fdcd-430e-b002-f5ee33984c54","year":2020},"citing_paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","snapshot_observed_at":"2026-08-06T19:47:09.134710Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-05T23:33:19.719206Z"},"links":{"cited_paper":"/paper/2002.08933","citing_paper":"/paper/2508.05207"},"observation_digest":"sha256:370810632de3c264eb80a42bd8ef8c70d071850fa358d5fc894141f36fa45916","observation_id":"c1c6205c-badc-4ad4-a03e-050f796a4e24","resolution":{"observed_at":"2026-08-05T23:33:19.776450Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.05207","last_updated":"2025-08-07T09:44:00Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-06T19:47:09.134710Z","submitted_at":"2025-08-07T09:44:00Z","title":"SpectroStream: A Versatile Neural Codec for General Audio"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":7,"verified_exact":1,"verified_fuzzy":20},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 4 inbound Pith citation observations for arXiv:2508.05207."}