{"as_of":"2026-08-06T06:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b248d8886fc59ae60fc67e394a03aeeeef5555ae9cc1bf07cbace236c5ac3bce","coverage":[{"denominator":75,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":75,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-24T00:26:57.419537Z","state":"measured"},{"denominator":84,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":84,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T11:41:01.619120Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-09T06:36:02.212511Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"cited_work":{"arxiv_id":"2406.14294","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.14294","snapshot_observed_at":"2026-07-09T06:36:02.212511Z","title":"DASB - Discrete Audio and Speech Benchmark","venue":"cs.SD","work_id":"bad19d0f-5776-4401-9759-d4523eed24c7","year":2024},"citing_paper":{"arxiv_id":"2504.08528","last_updated":"2026-04-07T06:11:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-11T13:40:53Z","title":"On The Landscape of Spoken Language Models: A Comprehensive Survey","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-22T20:44:57.476464Z"},"links":{"cited_paper":"/paper/2406.14294","citing_paper":"/paper/2504.08528"},"observation_digest":"sha256:90a18b90c9a7b83a884a1d1b9d52cfd3ad3506af18117448cc48e98e4792c0a8","observation_id":"7a10a063-3204-4ff9-a0a3-3b95c7d7218d","resolution":{"observed_at":"2026-05-22T20:45:08.140406Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14294","snapshot_observed_at":"2026-08-05T11:41:01.619120Z","title":"D.; Duret, J.; Ploujnikov, A.; Subakan, C.; and Ravanelli, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02349","last_updated":"2025-09-04T14:25:57Z","snapshot_observed_at":"2026-08-05T11:40:56.040966Z","submitted_at":"2025-09-02T14:15:22Z","title":"AudioCodecBench: A Comprehensive Benchmark for Audio Codec Evaluation","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T11:41:01.619120Z"},"links":{"cited_paper":"/paper/2406.14294","citing_paper":"/paper/2509.02349"},"observation_digest":"sha256:a4aa86b8bd7b2f68e2be9c167d451b4c7c49f5b65a53bca4b9a0bd54c8417f60","observation_id":"9f7dcdd6-2138-4130-9629-02d504a92f00","resolution":{"observed_at":"2026-08-05T11:41:01.619120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14294","snapshot_observed_at":"2026-08-05T11:29:02.089391Z","title":"Mousavi, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.02771","last_updated":"2025-09-02T19:20:06Z","snapshot_observed_at":"2026-08-05T11:29:00.334912Z","submitted_at":"2025-09-02T19:20:06Z","title":"Analysis of Speaker Verification Performance Trade-offs with Neural Audio Codec Transmission","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T11:29:02.089391Z"},"links":{"cited_paper":"/paper/2406.14294","citing_paper":"/paper/2509.02771"},"observation_digest":"sha256:3b04cfce724051bb4417f69905680db3d61743effbe3bef35ceaa2cab28c786f","observation_id":"cb31279b-701c-4689-9928-3e354ea8e814","resolution":{"observed_at":"2026-08-05T11:29:02.089391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14294","snapshot_observed_at":"2026-08-05T10:53:40.339604Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.05359","last_updated":"2025-09-03T18:11:53Z","snapshot_observed_at":"2026-08-05T10:53:32.792941Z","submitted_at":"2025-09-03T18:11:53Z","title":"An Empirical Analysis of Discrete Unit Representations in Speech Language Modeling Pre-training","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T10:53:40.339604Z"},"links":{"cited_paper":"/paper/2406.14294","citing_paper":"/paper/2509.05359"},"observation_digest":"sha256:1a610f25f7288b9ff3b20f1225665990b8ce90cbf1a008037873430781407d22","observation_id":"9127ad96-fd4a-4e9c-b4af-12c39d7984c8","resolution":{"observed_at":"2026-08-05T10:53:40.339604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"cited_work":{"arxiv_id":"2406.14294","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.14294","snapshot_observed_at":"2026-07-09T06:36:02.212511Z","title":"DASB - Discrete Audio and Speech Benchmark","venue":"cs.SD","work_id":"bad19d0f-5776-4401-9759-d4523eed24c7","year":2024},"citing_paper":{"arxiv_id":"2509.22220","last_updated":"2026-04-13T11:56:11Z","snapshot_observed_at":"2026-08-02T12:47:50.534468Z","submitted_at":"2025-09-26T11:32:51Z","title":"StableToken: A Noise-Robust Semantic Speech Tokenizer for Resilient SpeechLLMs","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-18T12:57:04.450462Z"},"links":{"cited_paper":"/paper/2406.14294","citing_paper":"/paper/2509.22220"},"observation_digest":"sha256:0bfb6b3eb156751e424f70834f05396301d95fe5a34fcebca652e0c842286997","observation_id":"2edffd4a-e698-4036-bcf2-a75547165f30","resolution":{"observed_at":"2026-05-18T13:01:24.351659Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"cited_work":{"arxiv_id":"2406.14294","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.14294","snapshot_observed_at":"2026-07-09T06:36:02.212511Z","title":"DASB - Discrete Audio and Speech Benchmark","venue":"cs.SD","work_id":"bad19d0f-5776-4401-9759-d4523eed24c7","year":2024},"citing_paper":{"arxiv_id":"2605.31521","last_updated":"2026-05-29T16:36:21Z","snapshot_observed_at":"2026-07-06T23:40:42.277618Z","submitted_at":"2026-05-29T16:36:21Z","title":"UniAudio-Token: Empowering Semantic Speech Tokenizers with General Audio Perception","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T22:26:20.100595Z"},"links":{"cited_paper":"/paper/2406.14294","citing_paper":"/paper/2605.31521"},"observation_digest":"sha256:5c556a8df18f73995d991736e92bd227ee2a840c0382a2f7354bb426fb5d7f73","observation_id":"c1637969-f234-4c78-9fe8-b2521552ec14","resolution":{"observed_at":"2026-06-28T22:32:44.576420Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"cited_work":{"arxiv_id":"2406.14294","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.14294","snapshot_observed_at":"2026-07-09T06:36:02.212511Z","title":"DASB - Discrete Audio and Speech Benchmark","venue":"cs.SD","work_id":"bad19d0f-5776-4401-9759-d4523eed24c7","year":2024},"citing_paper":{"arxiv_id":"2606.27627","last_updated":"2026-06-26T00:53:49Z","snapshot_observed_at":"2026-08-01T15:25:39.721188Z","submitted_at":"2026-06-26T00:53:49Z","title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-29T00:56:43.991936Z"},"links":{"cited_paper":"/paper/2406.14294","citing_paper":"/paper/2606.27627"},"observation_digest":"sha256:7f5d595af085ed4f03d1a3190cfcb25ea767ef102503174fd61f0039d4e4bac0","observation_id":"f81e9906-fbc7-48d2-b33d-e21087082546","resolution":{"observed_at":"2026-06-29T01:02:56.239274Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"cited_work":{"arxiv_id":"2406.14294","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.14294","snapshot_observed_at":"2026-07-09T06:36:02.212511Z","title":"DASB - Discrete Audio and Speech Benchmark","venue":"cs.SD","work_id":"bad19d0f-5776-4401-9759-d4523eed24c7","year":2024},"citing_paper":{"arxiv_id":"2607.07579","last_updated":"2026-07-11T10:19:38Z","snapshot_observed_at":"2026-08-02T23:05:13.204756Z","submitted_at":"2026-07-08T16:03:44Z","title":"Text-Independent Speaker Verification Using Discrete Audio Tokens","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-09T06:26:45.962895Z"},"links":{"cited_paper":"/paper/2406.14294","citing_paper":"/paper/2607.07579"},"observation_digest":"sha256:7b5652e1e9039b0926bff113dbbbda2dae575ba20693665616189e57fadeacfe","observation_id":"7c82dd32-a45d-4026-9a6d-5528445a6d95","resolution":{"observed_at":"2026-07-09T06:36:02.215111Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14294","snapshot_observed_at":"2026-07-14T15:43:46.809326Z","title":"Dasb-discrete audio and speech benchmark,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.07579","last_updated":"2026-07-11T10:19:38Z","snapshot_observed_at":"2026-08-02T23:05:13.204756Z","submitted_at":"2026-07-08T16:03:44Z","title":"Text-Independent Speaker Verification Using Discrete Audio Tokens","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-14T15:43:46.809326Z"},"links":{"cited_paper":"/paper/2406.14294","citing_paper":"/paper/2607.07579"},"observation_digest":"sha256:d20447219cf6fc75447396d738572540332cda4b75b2d2f5ef475ca25b967494","observation_id":"16c8ef31-d6ae-4f02-87cf-2d42377653f3","resolution":{"observed_at":"2026-07-14T15:43:46.809326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.14294/citation-record","integrity":"/paper/2406.14294/integrity","json":"/paper/2406.14294/citation-record.json","paper":"/paper/2406.14294"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fundamentals of Speech Recognition","venue":null,"work_id":"55e95a0e-96bd-40eb-b93b-e9b14b432a39","year":1993},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:8809a62a638c35b2179155a868455c43e744473b9c97213ef153399a312010ff","observation_id":"15c469c2-91df-4fbb-a195-4a58ce3ce92b","resolution":{"observed_at":"2026-05-24T00:28:40.234372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations","venue":null,"work_id":"6968e136-9e82-464b-8af5-56016e130a14","year":2020},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:59b896f30ba6f72e833bfd26c435368d1d424caac099706e7a11cf751637ee23","observation_id":"13e199f1-2279-4d4b-91d2-1935c9b58de4","resolution":{"observed_at":"2026-05-24T00:28:40.100173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"WavLM: Large-scale self-supervised pre-training for full stack speech processing","venue":null,"work_id":"fc9acf07-076e-4355-96d5-dc4026ea179a","year":2022},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:b450315f34af61bfa81f339382a7f44bec8dbfdf6fe84da011fc95561855d9dd","observation_id":"a6cf519b-f990-451a-821d-99fb361eb3ea","resolution":{"observed_at":"2026-05-24T00:28:40.132627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"HuBERT: Self-supervised speech representation learning by masked prediction of hidden units","venue":null,"work_id":"ec8dd963-6f4b-4294-99d9-5daff67ad318","year":2021},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:3d96e0a25040a69631d555488fe2927678f5e4175b3cef0e85a1e26a56b29820","observation_id":"2b909b64-7f53-439b-b256-e607c973aa57","resolution":{"observed_at":"2026-05-24T00:28:40.284575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Speech resynthesis from discrete disentangled self-supervised representations","venue":null,"work_id":"9acc2445-9773-4abf-b5a6-c833e00d2f57","year":2021},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:7428c8da9e370a0dd6665ab02e23c4e1eb876a896c51d6d594858b4a1a6988e5","observation_id":"0d5c2de1-6f10-4e47-8de4-43e537d6a67f","resolution":{"observed_at":"2026-05-24T00:28:40.125574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Phonetic analysis of self-supervised representations of English speech","venue":null,"work_id":"f549f1e3-efbd-4768-994c-c97253a214d0","year":2022},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:6a2e0837a98ac11c6ba14f885677f3b44a9854e8b2a8cd571d520adf5108cb77","observation_id":"8d849d4c-ac8a-458d-9d70-98bc83c7e5f2","resolution":{"observed_at":"2026-05-24T00:28:40.202045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"w2v-BERT: Combining contrastive learning and masked language modeling for self-supervised speech pre-training","venue":null,"work_id":"5f5cf8df-ff17-4c6e-b247-d9d7b2467fe7","year":2021},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:82644307b76de5910e97fe6d6332a0bf3e8bfa314d06b3cf9d79ad497d29b3c1","observation_id":"70ce8680-2492-4182-b08a-062b7b6f52ee","resolution":{"observed_at":"2026-05-24T00:28:40.180620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SpeechTokenizer: Unified speech tokenizer for speech large language models","venue":null,"work_id":"c3ab8f3b-0fc8-412b-833a-01c69e79d1d9","year":2024},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:aee038ab7defebc3d9d431a828b2fea74d2ced62363e8c6f519fbe17f9ac6bad","observation_id":"8c993e73-6d70-4c7b-9087-54428fe589bd","resolution":{"observed_at":"2026-05-24T00:28:40.183800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07405","last_updated":"2023-10-07T02:56:00Z","snapshot_observed_at":"2026-07-06T16:18:17.458740Z","submitted_at":"2023-09-14T03:18:24Z","title":"FunCodec: A Fundamental, Reproducible and Integrable Open-source Toolkit for Neural Speech Codec","version":2},"cited_work":{"arxiv_id":"2309.07405","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.07405","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Funcodec: A fundamental, reproducible and integrable open-source toolkit for neural speech codec","venue":null,"work_id":"4380c1f0-2f4c-4943-9fc3-90fbb69c9136","year":2023},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"cited_paper":"/paper/2309.07405","citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:00c6b165814b9d42831343e798a83b2f92e7083d2af634944dbb8b01a57e123f","observation_id":"9b041203-250c-4ff5-8dc3-10ede7c1c9bd","resolution":{"observed_at":"2026-05-24T00:28:39.544200Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-02T11:57:18.735747Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":"2307.09288","doi":"10.24963/ijcai.2025/706","metadata_source":"pith","pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","venue":"cs.CL","work_id":"68a5177f-d644-44c1-bd4f-4e5278c22f5d","year":2023},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:0923e75007553a9144708db173cb20f742e1ee90d867b9786b735b79540e7359","observation_id":"1703c728-23b5-4fcd-b342-a4b5afd9bd3a","resolution":{"observed_at":"2026-05-24T00:28:39.538282Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"PaLM: scaling language modeling with pathways","venue":null,"work_id":"8da96179-1d19-4dc1-ba67-95e118f3b2a6","year":2024},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:f828f17ddb52acbec0f38203c7fb5593817fa90b9c3f4095b490d009a0d34db0","observation_id":"a86bf53d-c91e-4c10-8af2-ce7c2673e813","resolution":{"observed_at":"2026-05-24T00:28:40.194849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"BERT: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":"ce55cec3-2fce-4524-b305-b2e0f046d428","year":2019},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:d1fbaf6e87956e10c9ad6daefb6c5f1952b12612b252a23f332ea5c7a7f3e4f5","observation_id":"8a502682-a56e-454f-9839-88bb324ab983","resolution":{"observed_at":"2026-05-24T00:28:40.173959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GPT understands, too","venue":null,"work_id":"ccebd199-87cb-4c4c-9e2d-2ce4a2f4fe6a","year":2023},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:11dff5f89903dd9e4768aac04dcab65ff9c92527207c41eccbcc76397eb7e9f2","observation_id":"61f6c2c0-9f45-4c68-8b5d-71fa8bfa427a","resolution":{"observed_at":"2026-05-24T00:28:40.241841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Neural discrete representation learning","venue":null,"work_id":"9fcb6610-24d4-4988-9c90-73a54e49d5fb","year":2017},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:311e65e82128213f60a37b9b5304d752f92b9ea7400f499077e1acc155ba6017","observation_id":"ca64e0c5-6ded-4842-8553-06062cf62582","resolution":{"observed_at":"2026-05-24T00:28:40.170126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-08-02T02:42:46.945082Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":"2306.12925","doi":"10.21437/interspeech.2019-1873","metadata_source":"pith","pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","venue":"cs.CL","work_id":"a828d91a-9395-420e-825d-6858006f228e","year":2023},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:c7f425246bf79d15429e7192ab0cfbf33310403309a50729f7bd4a42a8da4f31","observation_id":"d49019ca-98ee-4907-bd2b-a437cbe31600","resolution":{"observed_at":"2026-05-24T00:28:39.570123Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04673","last_updated":"2024-07-03T02:38:03Z","snapshot_observed_at":"2026-08-02T08:46:39.076208Z","submitted_at":"2023-10-07T03:17:59Z","title":"LauraGPT: Listen, Attend, Understand, and Regenerate Audio with GPT","version":4},"cited_work":{"arxiv_id":"2310.04673","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.04673","snapshot_observed_at":"2026-07-04T12:19:49.665222Z","title":"LauraGPT: Listen, attend, understand, and regenerate audio with GPT","venue":null,"work_id":"a479dd09-3927-4bab-8173-9e7e7b244d80","year":2023},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"cited_paper":"/paper/2310.04673","citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:de4efb34f2cd7c15cad913635a54c3b3e43beb2ef410a16a57d9c4f683bbdfc4","observation_id":"1bbd4f02-3816-436a-89c4-61a94360561b","resolution":{"observed_at":"2026-05-24T00:28:39.499589Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16107","last_updated":"2023-05-25T14:39:47Z","snapshot_observed_at":"2026-07-06T15:33:23.984280Z","submitted_at":"2023-05-25T14:39:47Z","title":"VioLA: Unified Codec Language Models for Speech Recognition, Synthesis, and Translation","version":1},"cited_work":{"arxiv_id":"2305.16107","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.16107","snapshot_observed_at":"2026-07-08T00:04:22.442888Z","title":"VioLA: Unified codec language models for speech recognition, synthesis, and translation","venue":"cs.CL","work_id":"fd8f0395-84f0-4d6f-9327-ed3a0cd62ff2","year":2023},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"cited_paper":"/paper/2305.16107","citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:f4975164ae2630d1eca66069367b1078e5517c23c9d051ef21276ceadfe4f1fc","observation_id":"c3e9db4e-2e37-4824-b626-ded906c5e4eb","resolution":{"observed_at":"2026-05-24T00:28:39.518355Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06873","last_updated":"2024-06-25T18:38:28Z","snapshot_observed_at":"2026-07-06T16:05:47.011408Z","submitted_at":"2023-08-14T01:01:19Z","title":"SpeechX: Neural Codec Language Model as a Versatile Speech Transformer","version":2},"cited_work":{"arxiv_id":"2308.06873","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.06873","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SpeechX: Neural codec language model as a versatile speech transformer","venue":null,"work_id":"5077483b-4a04-4dae-8329-c776a4cca40e","year":2023},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"cited_paper":"/paper/2308.06873","citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:261a437bf585d3def47166d27593a0e643143fd0c9e09fbb5f770c5a9a8b5251","observation_id":"fe4fb7ae-2b50-49c3-b335-f09f4c821bf1","resolution":{"observed_at":"2026-05-24T00:28:39.564746Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11325","last_updated":"2023-01-26T18:58:53Z","snapshot_observed_at":"2026-07-06T14:45:00.730733Z","submitted_at":"2023-01-26T18:58:53Z","title":"MusicLM: Generating Music From Text","version":1},"cited_work":{"arxiv_id":"2301.11325","doi":"10.48550/arxiv.2301.11325","metadata_source":"pith","pith_arxiv_id":"2301.11325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MusicLM: Generating Music From Text","venue":"cs.SD","work_id":"15e6566e-1c36-468f-966e-823248cbf87f","year":2023},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"cited_paper":"/paper/2301.11325","citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:57913517053f5db320e48e7e7a668add1b714d01bc3d239f989af7447e580a07","observation_id":"9336088c-dd6c-45f7-b706-52e8b9d35f21","resolution":{"observed_at":"2026-05-24T00:28:39.493046Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"AudioGen: Textually guided audio generation","venue":null,"work_id":"cd167b68-fc39-4665-bb50-6e8596591fab","year":2023},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:d345f262bc6968b92b263ff44252c242a28c297e1b2ebc28b4c8be85f59fd650","observation_id":"f34d4102-5c32-4525-bbba-77d67e58c8ee","resolution":{"observed_at":"2026-05-24T00:28:40.088490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":"2312.11805","doi":"10.1038/nrn2888","metadata_source":"pith","pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini: A Family of Highly Capable Multimodal Models","venue":"cs.CL","work_id":"83f7c85b-3f11-450f-ac0c-64d9745220b2","year":2023},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:0ca2cd4eb9ff9f7b2881c25a13e97a13417ba802cedb6ce166bb968a151d716c","observation_id":"878435e1-6813-4057-ad83-7a42e56610e0","resolution":{"observed_at":"2026-05-24T00:28:39.549993Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Goodfellow, Yoshua Bengio, and Aaron Courville","venue":null,"work_id":"92815916-f5ae-4104-82b3-9f719cc19eed","year":2016},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:945da42b6efca291a6234f8d985406ccff3565332345b64cd54911da78dc14db","observation_id":"0f4cde97-5bae-4f8d-8ab7-bf17bab37015","resolution":{"observed_at":"2026-05-24T00:28:40.288456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13071","last_updated":"2024-09-18T12:02:47Z","snapshot_observed_at":"2026-07-06T17:32:52.500465Z","submitted_at":"2024-02-20T15:13:38Z","title":"Codec-SUPERB: An In-Depth Analysis of Sound Codec Models","version":3},"cited_work":{"arxiv_id":"2402.13071","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.13071","snapshot_observed_at":"2026-07-03T16:08:37.467174Z","title":"Codec-SUPERB: An in-depth analysis of sound codec models","venue":null,"work_id":"5a0b5479-4572-48da-84ee-1dfcc4ba4ec8","year":2024},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"cited_paper":"/paper/2402.13071","citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:456f1eccb255084ff1aa095db1341fc0a5a1986f312431292933e6524f2a6c76","observation_id":"8996c608-6bc4-4311-a090-db38c9c41f0e","resolution":{"observed_at":"2026-05-24T00:28:39.559949Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Puvvada, Nithin Rao Koluguri, Kunal Dhawan, Jagadeesh Balam, and Boris Ginsburg","venue":null,"work_id":"96915cd7-a38d-4c19-bf85-622329764cd9","year":2024},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:86feff0cb8349a189879ad8cb2bf9a54c7a3334571f8750f05a5781a62a060bf","observation_id":"d223c66e-8160-421a-afde-b92740b529ff","resolution":{"observed_at":"2026-05-24T00:28:40.238645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SELM: Speech enhancement using discrete tokens and language models","venue":null,"work_id":"9e2d7195-e808-4662-8b4c-00111398edf8","year":2024},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:a7afd64febb6e9cce5930f10905ed417d2b15daa5ab320a28e2aea445b5f606f","observation_id":"392c0a12-3309-446c-ba66-694ea6585373","resolution":{"observed_at":"2026-05-24T00:28:40.220672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DUB: Discrete unit back-translation for speech translation","venue":null,"work_id":"0a2af223-bc79-42aa-9607-d0104e1aa4ca","year":2023},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:1a2d42f132a44e4d4160ef97b77d612249a9491bcd02b1ea0c8e1327638761c8","observation_id":"e79beb42-96e6-4af2-bf28-fac0fb5b4083","resolution":{"observed_at":"2026-05-24T00:28:40.152518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exploring speech recognition, translation, and understanding with discrete speech units: A comparative study","venue":null,"work_id":"634acc39-b184-4dc7-a002-be61fab4396a","year":2024},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:fc0806aa1e51833ed40ee8c146b9886a39b0c32f353febb7269c43749238689a","observation_id":"e8ac3259-7c6d-4c37-a02d-019b4ed5beac","resolution":{"observed_at":"2026-05-24T00:28:40.156112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"High fidelity neural audio compression","venue":null,"work_id":"89bf34d1-47ce-4189-ad79-febb935db8d2","year":2023},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:6bcd88cfa9c233509391b174e4cb6a9d5100ec6ca970f2e6e2516f7205fad322","observation_id":"ac437fc5-dfcf-4075-9840-1cfd8b0587b4","resolution":{"observed_at":"2026-05-24T00:28:40.217015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"High-fidelity au- dio compression with improved RVQGAN","venue":null,"work_id":"83df8dd2-06c5-41ef-b2a7-aea73c74bbcc","year":2023},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:f9896c278468787179fe6a289f1a84b4916a176234f3739c736bbd6cafe572c7","observation_id":"e271ce55-f24b-41c9-8df4-e7079c5b4ff4","resolution":{"observed_at":"2026-05-24T00:28:40.209632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Speech self-supervised representation benchmarking: Are we doing it right? In Interspeech, pages 2873–2877","venue":null,"work_id":"f99a1ad1-2d35-4c8c-8734-4df464be49b9","year":2023},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:e94c52fd9497e8f2cb826b2d5bd852f3509014d2d65c10937e3bc3cb10ee6326","observation_id":"0062d389-d0ef-4c9a-ba48-659baf9bc9ad","resolution":{"observed_at":"2026-05-24T00:28:40.159847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-04T07:20:14.379561Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":"2106.04624","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-07-07T20:34:09.733636Z","title":"SpeechBrain: A general- purpose speech toolkit","venue":"eess.AS","work_id":"21b4460f-26ae-410a-a409-f69a6b2005da","year":2021},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:5e98180dc56a50b09bc74da9b073a81f848e226ab1c9930412175c67d6b8ed52","observation_id":"03ff4e08-5398-4fa5-8d4f-0ee3c7af1055","resolution":{"observed_at":"2026-05-24T00:28:39.555237Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Exploration of efficient end-to-end ASR using discretized input from self-supervised learning","venue":null,"work_id":"d2bb4fd6-d086-479b-be41-369cff5695f4","year":2023},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:e5ec195406f93ae693a1d3750b30e441043622200a740b30cf0b3d3802670517","observation_id":"d41dd303-ca44-4c34-9297-eb1c6b811810","resolution":{"observed_at":"2026-05-24T00:28:40.191380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards universal speech discrete tokens: A case study for ASR and TTS","venue":null,"work_id":"5a4152f2-03d6-410d-b60f-f78115dd2438","year":2024},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:fd714020e4c9dfe6408cba126beca3c50db0e55b1251edabb280d52db008b610","observation_id":"8890de73-44e7-4326-a5f1-27877e582cb6","resolution":{"observed_at":"2026-05-24T00:28:40.280909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"TokenSplit: Using discrete speech representations for direct, refined, and transcript- conditioned speech separation and recognition","venue":null,"work_id":"55bf8379-a25f-4f22-a1f9-b8def6013a76","year":2023},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:266dc687bedbc0fa20243f630279a1d2dfbcdd4835aa7b48459ccc473933d56e","observation_id":"d61da613-17a8-4691-9ccd-770888baa129","resolution":{"observed_at":"2026-05-24T00:28:40.115703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Evaluating text-to-speech synthesis from a large discrete token-based speech language model","venue":null,"work_id":"b7c9f205-a5ba-460b-a1f9-f3d189559ce7","year":2024},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:77683277966ede05ebbd90ee1f3414536f4ad53807c307e66f2fe0373446fab3","observation_id":"bba4bfbe-998e-45fc-b7ba-6ff79f8fe659","resolution":{"observed_at":"2026-05-24T00:28:40.135838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-02T20:06:32.256011Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":"2301.02111","doi":"10.48550/arxiv.2301.02111","metadata_source":"pith","pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","venue":"cs.CL","work_id":"de8fb688-dd63-4942-92f6-66d98d5b6db2","year":2023},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:f513e982e26edcf4cdffe85378a421129305357a2b5f047fc5fce86588ee7581","observation_id":"dfb0188f-cdd3-4cdc-9bcc-16a8bbe3cb0e","resolution":{"observed_at":"2026-05-24T00:28:39.486547Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Speak, read and prompt: High-fidelity text-to-speech with minimal supervision","venue":null,"work_id":"80df0b0e-bbeb-476c-8211-9a0377a3ed46","year":2023},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:912c32b6f4a4b0c2c40b0cf9534fbe7fb5396e74153c7f0914e646addda83656","observation_id":"d8d99b98-5bf0-4d82-94e7-b88a3502ee16","resolution":{"observed_at":"2026-05-24T00:28:40.119265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How should we extract discrete audio tokens from self-supervised models?","venue":null,"work_id":"5d2ef297-0f5c-4710-81a4-9635275dbea8","year":2024},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:22d9e4fef263361f1d1d40fabaa60c738d3e821c443ba08f4d5c04ee92f7b022","observation_id":"d6bbc6a9-16ca-4732-b4d1-9a1c5f56c263","resolution":{"observed_at":"2026-05-24T00:28:40.258681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lin, Andy T","venue":null,"work_id":"3edf317d-5cf7-4818-9c4d-461ac62cc7c0","year":2021},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:647c5e49ecfb6bcefc073d665f82a1deca3f50cf4e8f9c38976fb3573f2e2fa1","observation_id":"cc938772-cfdc-4df5-b454-5dcb5f94863d","resolution":{"observed_at":"2026-05-24T00:28:40.231027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Definition of the Opus audio codec","venue":null,"work_id":"23df80f3-9466-4b1d-b38f-55e140edbf17","year":2012},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:89118e16bba0a455d40ff58a2bd6bbfca638b9a7be5064720ef6e93d63ce0e37","observation_id":"1b64a4e4-8c7c-4cba-b1cf-629a9e320b0e","resolution":{"observed_at":"2026-05-24T00:28:40.227762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Overview of the EVS codec architecture","venue":null,"work_id":"d02865a3-3fee-4dc7-b2b3-9ab3511f57db","year":2015},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:b6f1573f4a83dda7d42feb5f0b9db1659fed01cee59df73aac80e87e05c5d669","observation_id":"1b3903e7-e8a8-4a85-af80-b8238cc91f44","resolution":{"observed_at":"2026-05-24T00:28:40.277353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SoundStream: An end-to-end neural audio codec","venue":null,"work_id":"9c622021-e85f-4051-81b3-24a7e161f42c","year":2021},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:3d41e77fa241011b2089cf8ce685d45d12b53691f2184a8338b3827b6f455af5","observation_id":"efeb3452-7187-4465-9513-0c0801748e96","resolution":{"observed_at":"2026-05-24T00:28:40.107742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"AudioLM: A language modeling approach to audio generation","venue":null,"work_id":"b4cb4e08-d410-4d6f-9907-ed6eb791ae46","year":2023},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:f11977799362caf1a0df86f3b4e79a6b1e0b854ea8794b1a1d647c6c38c8394b","observation_id":"7c292212-8511-461c-9b90-db99a7ffb753","resolution":{"observed_at":"2026-05-24T00:28:40.112172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02765","last_updated":"2023-05-07T09:22:04Z","snapshot_observed_at":"2026-08-02T20:49:45.467656Z","submitted_at":"2023-05-04T12:11:13Z","title":"HiFi-Codec: Group-residual Vector quantization for High Fidelity Audio Codec","version":2},"cited_work":{"arxiv_id":"2305.02765","doi":"10.48550/arxiv.2305.02765","metadata_source":"pith","pith_arxiv_id":"2305.02765","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hifi-codec: Group-residual vector quantization for high fidelity audio codec","venue":"cs.SD","work_id":"b1993988-663c-4e53-a60e-4a29006bc48a","year":2023},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"cited_paper":"/paper/2305.02765","citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:61414fc86b85bf14c4776a2497e1d9a9653709cc2af8c0c11c0f319b12b814ca","observation_id":"2db04592-9e87-449a-86a0-452f6c8ee9a9","resolution":{"observed_at":"2026-05-24T00:28:39.528794Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Free English and Czech telephone speech corpus shared under the CC-BY-SA 3.0 license","venue":null,"work_id":"20f87ae5-f749-4330-bc1a-46c7423816b1","year":2014},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:f55a74a7ae7f1034661e875d2de33df7b117ae262d0e70c5aa850607f8a67268","observation_id":"9b449366-08cc-4d67-8ff4-aa9cd165b1b5","resolution":{"observed_at":"2026-05-24T00:28:40.129075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ContextNet: Improving convolutional neural networks for automatic speech recognition with global context","venue":null,"work_id":"27a11b3d-b8e4-4be6-bcb2-e0ff10f2df92","year":2020},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:d3a0557c25a33427d768d01d014eda8ddfa52127d00140efce5c1740f03e3d54","observation_id":"f7074f1a-e99f-4cb3-933a-0546eda1a35e","resolution":{"observed_at":"2026-05-24T00:28:40.266311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Common V oice: A massively-multilingual speech corpus","venue":null,"work_id":"85d25cd3-c31a-41fc-a096-ea1304436e2c","year":2020},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:8de6b346d9291f90e428443b07a60bc3383863a9b6260d6a59a85467080070eb","observation_id":"1f521a2d-c557-4ab2-b634-123841be39db","resolution":{"observed_at":"2026-05-24T00:28:40.262750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"V oxCeleb: A large-scale speaker identification dataset","venue":null,"work_id":"2482eb86-de36-4e3b-8a16-9164e8b081f0","year":2017},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:320aec093d7c1095aa1271168ec998ab621a7ef9f0a2ab2bfa3f58d0a5633293","observation_id":"8729b9ce-8ecb-4755-a157-e84fb85e0029","resolution":{"observed_at":"2026-05-24T00:28:40.103616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"X-vectors: Robust DNN embeddings for speaker recognition","venue":null,"work_id":"c5307ab4-bae4-4e38-a906-5fc2833e3017","year":2018},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:4909a3a90c9e640ee8d72b0bc9d44918d5f55342a658c7d3f375a3cb2fa162ee","observation_id":"bdfd1d56-55f3-411e-8832-00afc782003f","resolution":{"observed_at":"2026-05-24T00:28:40.122468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Additive margin softmax for face verification","venue":null,"work_id":"d07498db-79ab-47a8-8b56-3d9ad28d24e6","year":2018},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:174ee94f92d667413c7da15cf8e27a29f33267db30b9c202748978cb2855cb78","observation_id":"696670d3-987a-4bd7-9571-498ce8557aab","resolution":{"observed_at":"2026-05-24T00:28:40.139489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ECAPA-TDNN: Emphasized channel attention, propagation and aggregation in TDNN based speaker verification","venue":null,"work_id":"4ca4c68c-b399-41f1-827e-ced02ed6801f","year":2020},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:cd0785a28d3236fbd794a85901dcbfa83a9123ccc54b80dae6abd72fc45ca82a","observation_id":"ac1e7933-f980-4694-8c89-a01c31ac370e","resolution":{"observed_at":"2026-05-24T00:28:40.251568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"IEMOCAP: Interactive emotional dyadic motion capture database","venue":null,"work_id":"878a3000-6e9a-44a5-b895-9ec1266b6d7d","year":2008},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:5a123ce354596911d4f85be8b29258b52dd4bffcc086839a70743e2f941ae931","observation_id":"2753980d-eb41-47d6-ab9b-a298d4ddd2d1","resolution":{"observed_at":"2026-05-24T00:28:40.269814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SLURP: A spoken language understanding resource package","venue":null,"work_id":"d9d47dd4-eebf-4ca3-b55a-dd8caeb01d46","year":2020},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:36e518276963658821b6e0e1de5a017493fd861c765c1f35fd4fc1529b70fc58","observation_id":"3bbca81a-38a8-45c3-b377-7e9043e4e2cf","resolution":{"observed_at":"2026-05-24T00:28:40.198549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.03209","last_updated":"2018-04-09T19:58:17Z","snapshot_observed_at":"2026-07-06T06:32:32.083176Z","submitted_at":"2018-04-09T19:58:17Z","title":"Speech Commands: A Dataset for Limited-Vocabulary Speech Recognition","version":1},"cited_work":{"arxiv_id":"1804.03209","doi":"10.48550/arxiv.1804.03209","metadata_source":"pith","pith_arxiv_id":"1804.03209","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Speech Commands: A Dataset for Limited-Vocabulary Speech Recognition","venue":"cs.CL","work_id":"f4d53a51-5741-47e1-b328-d6503065d1bd","year":2018},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"cited_paper":"/paper/1804.03209","citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:cf1e4f080c38412f401dfc17c4728d333ddb1b5589ec521728c5c69d94efd4fe","observation_id":"beca2592-7b99-4ae7-bb51-172f3bb9e107","resolution":{"observed_at":"2026-05-24T00:28:39.506695Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Investigating RNN-based speech enhancement methods for noise-robust text-to-speech","venue":null,"work_id":"1d378956-58ba-445b-8963-35ccb2efaf17","year":2016},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:514c274902f3bb92fecf932c1f7e6be3675d99e8f624c7009d4181db612038de","observation_id":"08fd36c0-2714-4c6d-b832-fb2fa54d4521","resolution":{"observed_at":"2026-05-24T00:28:40.273789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Conformer: Convolution-augmented transformer for speech recognition","venue":null,"work_id":"d6a68990-cdc3-457c-bc2c-5a1db05cd931","year":2020},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:f50b0706a1b56a47f25e4bab0856e4453dd60735875cec84d7318a00907df1cd","observation_id":"4cbc90bf-2d93-4b8d-a6ca-2b620b60cfe6","resolution":{"observed_at":"2026-05-24T00:28:40.187329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DNSMOS P.835: A non-intrusive perceptual objective speech quality metric to evaluate noise suppressors","venue":null,"work_id":"ea5d4475-ffef-43a3-9536-4426eb8108f6","year":2022},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:bb45983468eac98953ab584f9613e9f2f5ba538ffa3c263cf0be6d25863a4900","observation_id":"17039ad2-f2c4-4338-ac63-6725dc75cf54","resolution":{"observed_at":"2026-05-24T00:28:40.245085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sequential multi-frame neural beamforming for speech separation and enhancement","venue":null,"work_id":"9800288a-9a44-4983-add2-79e153eabac7","year":2021},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:0a061faa4feef34b88f9f1724def48f76185c321998ac6ede7ca2c4e7f7f75c9","observation_id":"728b533b-f475-46da-b564-61f7f90b1b76","resolution":{"observed_at":"2026-05-24T00:28:40.177334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":"2212.04356","doi":"10.48550/arxiv.2212.04356","metadata_source":"pith","pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","venue":"eess.AS","work_id":"ed5fbefe-24bf-436f-98c1-68e9114360bf","year":2022},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:ddb7d94bc2c41b3c79456a1c4eae0b8342183f984481cafe6098fda10eabcff1","observation_id":"e3f41e3d-44d2-462e-8ef7-e2a26197d103","resolution":{"observed_at":"2026-05-24T00:28:39.523430Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-03T20:38:04.271886+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T20:38:04.271886+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-04T10:15:33.124350Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":"2005.11262","doi":null,"metadata_source":"pith","pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-07-10T12:57:07.566849Z","title":"LibriMix: An open-source dataset for generalizable speech separation","venue":"eess.AS","work_id":"53c02064-c23e-434f-825d-3b1af09a75aa","year":2020},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:1fc397397bf27b7c4e5240e2f770636894732fe9d6d9f799adab99f6af7fd768","observation_id":"5332612a-c249-475b-b45f-46194f927f85","resolution":{"observed_at":"2026-05-24T00:28:39.512180Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kolbæk, D","venue":null,"work_id":"8c9abf34-b3ab-4896-95c4-8d0eeae4aeba","year":1901},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:b95f4446e506050a75c80e567c038e84f3e8b985072cca72a0c1ac1739cfbe6c","observation_id":"08c5f7d4-328e-4f45-b086-74f70d493221","resolution":{"observed_at":"2026-05-24T00:28:40.162502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":"1d35d7aa-3d1e-4969-80a4-b32763891208","year":2017},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:e4d9a32fcf39592c85d3fedef279c984cc65ddd380a2b057b08fd9d6529c5b38","observation_id":"4e96f246-c73d-4e38-969f-1db824fa6678","resolution":{"observed_at":"2026-05-24T00:28:40.255111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The LJ speech dataset","venue":null,"work_id":"ae7080fe-6588-4db5-9a2b-c519d1ef594e","year":2017},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:460c3499b0b5fbdd16c277027d436a3b3c6c33dd81046c7317df9640d8417f41","observation_id":"e3178b6d-9be5-40bb-baec-8be39f299650","resolution":{"observed_at":"2026-05-24T00:28:40.223867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"UTMOS: UTokyo-SaruLab System for V oiceMOS Challenge 2022","venue":null,"work_id":"6a82b5c0-86df-4d78-a11a-1362d4e37279","year":2022},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:a82a50661175668a597858ba494dd104ae88e158713f6253ba5ff80e917d9450","observation_id":"5421ef39-58ad-42b0-a393-29c4bf81ab23","resolution":{"observed_at":"2026-05-24T00:28:40.096920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A comparison of discrete and soft speech units for improved voice conversion","venue":null,"work_id":"c535c857-7405-44b6-80b2-1c8a465cb55b","year":2022},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:47e9a601533f49576350f5ca57a3092e7909198d83322f81eef304c21ca2aa58","observation_id":"78d5c962-7ff3-423b-926c-c96e48e8c04e","resolution":{"observed_at":"2026-05-24T00:28:40.084365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gebru, Dejan Markovi ´c, and Alexander Richard","venue":null,"work_id":"9e71e17b-06cd-4bc4-8078-c93520f183b8","year":2023},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:2945ad39d064d438c82d0f8a390a26879ccad7e0661b6d224c9427fb50e9a8d7","observation_id":"fcaae5e3-9967-45b6-8701-063e49613ee3","resolution":{"observed_at":"2026-05-24T00:28:40.248489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ICASSP 2023 deep noise suppression challenge","venue":null,"work_id":"f5eab52d-fb7e-4474-9a27-d088bfc70e22","year":2023},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:3de3fd1b29f022b936de4329671ff600b7c81e513d360df10332658ead7641f4","observation_id":"fcb2830f-346e-4df1-b33e-94cb24161d44","resolution":{"observed_at":"2026-05-24T00:28:40.146255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Audio Set: An ontology and human-labeled dataset for audio events","venue":null,"work_id":"54def3fb-0a54-405d-9f43-9aa01aca62a3","year":2017},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:ae3ebc5298885a2dc08f608bf6ccf2071503d014dd43b6bbeedd849709907a70","observation_id":"0c858094-83eb-40f1-84a6-7d5900267575","resolution":{"observed_at":"2026-05-24T00:28:40.213448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"FSD50K: an open dataset of human-labeled sound events","venue":null,"work_id":"a22e407e-d215-4679-b8ff-444b1f3a9745","year":2021},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:cdda79f61fc1642941ccb7de214844c74d861bc7a0a1e31f6d692975f320b58c","observation_id":"8edd5644-5573-4186-895d-bc025d0813c5","resolution":{"observed_at":"2026-05-24T00:28:40.093017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The MTG-Jamendo dataset for automatic music tagging","venue":null,"work_id":"0933b6d9-2a32-4454-bc45-0798c15a2f3f","year":2019},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:78b2f9a2b4913eb172d51040fb78b93709fcc1ac6aa6f56314546140be541136","observation_id":"8a4da591-7b4b-4eb8-8f98-788a4136c2bb","resolution":{"observed_at":"2026-05-24T00:28:40.142921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"1e46bdc4-abb1-4d30-9142-b2dc461bd647","year":2014},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:18b05abc91d461c15d4a9aebe556ca5bf2918e3981c75f5630fa1f9c54d126a6","observation_id":"3a7d9e73-d2ad-4b91-8772-94b8c34cd542","resolution":{"observed_at":"2026-05-24T00:28:40.149411Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CSTR VCTK Corpus: English multi- speaker corpus for CSTR voice cloning toolkit (version 0.92)","venue":null,"work_id":"70c5508f-e85b-47c3-9552-7dc50c65b99c","year":2019},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:5b62250243500e9a0a2ed4a7b4a926f48134459894b597da6943787f4543e73f","observation_id":"18b2400e-55ef-4dcb-9c80-e27031a228f9","resolution":{"observed_at":"2026-05-24T00:28:40.205787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.5281/zenodo.1117372","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"I., and Bittner, R","venue":"Zenodo (CERN European Organization for Nuclear Research)","work_id":"83dcdd7d-17d5-4e9c-9e8a-5b4ddd37274d","year":2017},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:bbcfb12cb83eaf0b39ff621a1ff40862aee02ff91b2922cb8a66b08c7be96474","observation_id":"10e9b2d1-babb-4432-9c04-e17a3ab65b7f","resolution":{"observed_at":"2026-05-24T00:28:39.268137Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-14T06:49:56.95395+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T06:49:56.95395+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Weiss, Mike Schuster, Navdeep Jaitly, Zongheng Yang, Zhifeng Chen, Yu Zhang, Yuxuan Wang, Rj Skerrv-Ryan, Rif A","venue":null,"work_id":"366fd013-b9fe-4e17-b2d8-026f70bda3f3","year":2018},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:3fde939b486204f536028f93aa32858cc1be26819c954a2522709cad601350e8","observation_id":"6656e935-0029-4694-a116-4d5582943028","resolution":{"observed_at":"2026-05-24T00:28:40.166268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"record/4274930","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Not Converged","venue":null,"work_id":"90948689-c703-48a2-b4cd-0ae098140e09","year":2018},"citing_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-24T00:26:57.419537Z"},"links":{"citing_paper":"/paper/2406.14294"},"observation_digest":"sha256:2f1ee14cd5f4048683d2cff45795545fe27580e8a5dbf264d5a86c96cff3496d","observation_id":"29e9a675-7200-468e-8b7a-93fd7d99f902","resolution":{"observed_at":"2026-05-24T00:28:39.533841Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","latest_version":4,"primary_category":"cs.SD","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark"},"reference_resolution":{"displayed":75,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":1,"verified_exact":15,"verified_fuzzy":57},"total_outbound_references":75},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 75 of 75 outbound references and 9 inbound Pith citation observations for arXiv:2406.14294."}