{"as_of":"2026-08-21T07:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9f871d157369c5400d84288ace246c919793e417c4880396f1c6890dd5e6470b","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:10:55.387892Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:10:52.835278Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T15:10:55.683469Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.16207","last_updated":"2025-05-22T04:20:51Z","snapshot_observed_at":"2026-08-15T23:31:45.578930Z","submitted_at":"2025-05-22T04:20:51Z","title":"Differentiable K-means for Fully-optimized Discrete Token-based ASR","version":1},"cited_work":{"arxiv_id":"2505.16207","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16207","snapshot_observed_at":"2026-08-07T15:10:55.683469Z","title":"Differentiable K-means for Fully-optimized Discrete Token-based ASR","venue":"cs.SD","work_id":"c89cb37a-1905-499a-b080-7aac4fc1e76f","year":2025},"citing_paper":{"arxiv_id":"2505.16207","last_updated":"2025-05-22T04:20:51Z","snapshot_observed_at":"2026-08-15T23:31:45.578930Z","submitted_at":"2025-05-22T04:20:51Z","title":"Differentiable K-means for Fully-optimized Discrete Token-based ASR","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:52.835278Z"},"links":{"cited_paper":"/paper/2505.16207","citing_paper":"/paper/2505.16207"},"observation_digest":"sha256:a731e644bb6cff328c28803cb030ab8dae88a77a27a226eb22d2525cd36177af","observation_id":"f1cfce28-0f52-4773-be74-502355752e03","resolution":{"observed_at":"2026-08-07T15:10:55.770093Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.16207/citation-record","integrity":"/paper/2505.16207/integrity","json":"/paper/2505.16207/citation-record.json","paper":"/paper/2505.16207"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.16207","last_updated":"2025-05-22T04:20:51Z","snapshot_observed_at":"2026-08-15T23:31:45.578930Z","submitted_at":"2025-05-22T04:20:51Z","title":"Differentiable K-means for Fully-optimized Discrete Token-based ASR","version":1},"cited_work":{"arxiv_id":"2505.16207","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16207","snapshot_observed_at":"2026-08-07T15:10:55.683469Z","title":"Differentiable K-means for Fully-optimized Discrete Token-based ASR","venue":"cs.SD","work_id":"c89cb37a-1905-499a-b080-7aac4fc1e76f","year":2025},"citing_paper":{"arxiv_id":"2505.16207","last_updated":"2025-05-22T04:20:51Z","snapshot_observed_at":"2026-08-15T23:31:45.578930Z","submitted_at":"2025-05-22T04:20:51Z","title":"Differentiable K-means for Fully-optimized Discrete Token-based ASR","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:52.835278Z"},"links":{"cited_paper":"/paper/2505.16207","citing_paper":"/paper/2505.16207"},"observation_digest":"sha256:a731e644bb6cff328c28803cb030ab8dae88a77a27a226eb22d2525cd36177af","observation_id":"f1cfce28-0f52-4773-be74-502355752e03","resolution":{"observed_at":"2026-08-07T15:10:55.770093Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:11:01.185675Z","title":"text-like","venue":null,"work_id":"bac0d3e6-7a14-44d6-8505-43f3e2932cc3","year":null},"citing_paper":{"arxiv_id":"2505.16207","last_updated":"2025-05-22T04:20:51Z","snapshot_observed_at":"2026-08-15T23:31:45.578930Z","submitted_at":"2025-05-22T04:20:51Z","title":"Differentiable K-means for Fully-optimized Discrete Token-based ASR","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:52.878398Z"},"links":{"citing_paper":"/paper/2505.16207"},"observation_digest":"sha256:07bb6b519747815f95636cb3e09c8a0dd8933761f08363494654bfd132a81610","observation_id":"928ddb08-67b1-4428-b947-e4d4642a4bdf","resolution":{"observed_at":"2026-08-07T15:11:01.223458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:11:01.027966Z","title":"Experimental Setup Our experiments were conducted using ESPnet [24], follow- ing the basic configurations described in [11, 12]","venue":null,"work_id":"281db231-482c-4f0d-98ff-5f127a8d302e","year":2000},"citing_paper":{"arxiv_id":"2505.16207","last_updated":"2025-05-22T04:20:51Z","snapshot_observed_at":"2026-08-15T23:31:45.578930Z","submitted_at":"2025-05-22T04:20:51Z","title":"Differentiable K-means for Fully-optimized Discrete Token-based ASR","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:52.938863Z"},"links":{"citing_paper":"/paper/2505.16207"},"observation_digest":"sha256:7c0d9b974ab81fb2fc7614bc52d32d225abb9a0092654a2db8d8ecb40fc94cc7","observation_id":"52ee6ffb-43c4-44f5-a162-0ba8fff96a0a","resolution":{"observed_at":"2026-08-07T15:11:01.109058Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:11:00.865420Z","title":"Since SSL fea- ture spaces are changed by finetuning, they are divided by the averaged L2 norm for normalization","venue":null,"work_id":"b7a08b37-b125-4be3-b7fd-e688cd6fedee","year":null},"citing_paper":{"arxiv_id":"2505.16207","last_updated":"2025-05-22T04:20:51Z","snapshot_observed_at":"2026-08-15T23:31:45.578930Z","submitted_at":"2025-05-22T04:20:51Z","title":"Differentiable K-means for Fully-optimized Discrete Token-based ASR","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:52.992325Z"},"links":{"citing_paper":"/paper/2505.16207"},"observation_digest":"sha256:606cc0fde8e6bc2103f635f7c4116ee31531a80a62d2e3c32d7d21f2cfb3a44a","observation_id":"c3693fa1-7ab1-414d-87cb-91c77c021b21","resolution":{"observed_at":"2026-08-07T15:11:00.947796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:11:00.686831Z","title":"If the tokens are robust to sub- tle pronunciation variations and represent more phoneme-like symbols, the sequence increases the repetition and TSL will be shorter","venue":null,"work_id":"367625eb-6d3f-4753-84e5-9f28a85d5793","year":null},"citing_paper":{"arxiv_id":"2505.16207","last_updated":"2025-05-22T04:20:51Z","snapshot_observed_at":"2026-08-15T23:31:45.578930Z","submitted_at":"2025-05-22T04:20:51Z","title":"Differentiable K-means for Fully-optimized Discrete Token-based ASR","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:53.015897Z"},"links":{"citing_paper":"/paper/2505.16207"},"observation_digest":"sha256:7142c74735ca36610fbcc6ebafbc045b269e0decc1df1da0fda5af8acf9f8b5b","observation_id":"db5454fc-05f2-4791-b01f-603eb1be61ca","resolution":{"observed_at":"2026-08-07T15:11:00.761096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:11:00.577475Z","title":"A lower value indicates the robustness of discrete tokens to non-linguistic information","venue":null,"work_id":"e4cfcf58-918e-4112-9c77-874b4cd944db","year":2000},"citing_paper":{"arxiv_id":"2505.16207","last_updated":"2025-05-22T04:20:51Z","snapshot_observed_at":"2026-08-15T23:31:45.578930Z","submitted_at":"2025-05-22T04:20:51Z","title":"Differentiable K-means for Fully-optimized Discrete Token-based ASR","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:53.065910Z"},"links":{"citing_paper":"/paper/2505.16207"},"observation_digest":"sha256:ffc31ea427d954a2fcf5b93ed3cfa7f90f83e52c87ba4656f8f8bde4f6127933","observation_id":"d6ec492a-7324-409f-8ec9-34b1710e5d41","resolution":{"observed_at":"2026-08-07T15:11:00.636731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:11:00.443595Z","title":"As a result, ASR performance improved and the obtained tokens exhibited more phonetic characteristics with purer linguistic information","venue":null,"work_id":"371f8f1b-a8a9-41ff-b7db-40078ced4afe","year":null},"citing_paper":{"arxiv_id":"2505.16207","last_updated":"2025-05-22T04:20:51Z","snapshot_observed_at":"2026-08-15T23:31:45.578930Z","submitted_at":"2025-05-22T04:20:51Z","title":"Differentiable K-means for Fully-optimized Discrete Token-based ASR","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:53.142380Z"},"links":{"citing_paper":"/paper/2505.16207"},"observation_digest":"sha256:716785bc9363492367a3feb251ad7721f31f5e3198c7bd5bb9275175df6a4ff8","observation_id":"cc51e29c-a7be-4e72-a5a1-cbdf16791131","resolution":{"observed_at":"2026-08-07T15:11:00.480261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:11:00.300833Z","title":"Self-supervised speech representation learning: A review,","venue":null,"work_id":"db02ad34-d8da-45c9-94ca-90dc3fc840d9","year":2022},"citing_paper":{"arxiv_id":"2505.16207","last_updated":"2025-05-22T04:20:51Z","snapshot_observed_at":"2026-08-15T23:31:45.578930Z","submitted_at":"2025-05-22T04:20:51Z","title":"Differentiable K-means for Fully-optimized Discrete Token-based ASR","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:53.217025Z"},"links":{"citing_paper":"/paper/2505.16207"},"observation_digest":"sha256:59ff17810faf420697d3b6b2b3fa90f0d1777ac1287b469a3736e8569153634e","observation_id":"227f0549-601a-44d6-abdf-62c6e8b33aa7","resolution":{"observed_at":"2026-08-07T15:11:00.386016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:11:00.155213Z","title":"HuBERT: Self- supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":"b22f2d6f-0ad3-42f8-8890-2925a2f7b8ee","year":2021},"citing_paper":{"arxiv_id":"2505.16207","last_updated":"2025-05-22T04:20:51Z","snapshot_observed_at":"2026-08-15T23:31:45.578930Z","submitted_at":"2025-05-22T04:20:51Z","title":"Differentiable K-means for Fully-optimized Discrete Token-based ASR","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:53.281559Z"},"links":{"citing_paper":"/paper/2505.16207"},"observation_digest":"sha256:49c20cfdb11ee72f203f97ad66942ceb8d8eb2d6f206deb89a5a4034d5c65860","observation_id":"2f98c313-ca16-4d1e-9dd3-470326a12abc","resolution":{"observed_at":"2026-08-07T15:11:00.216651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:11:00.018821Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representa- tions,","venue":null,"work_id":"14caaabc-b659-4401-96f0-9589af26f4f8","year":2020},"citing_paper":{"arxiv_id":"2505.16207","last_updated":"2025-05-22T04:20:51Z","snapshot_observed_at":"2026-08-15T23:31:45.578930Z","submitted_at":"2025-05-22T04:20:51Z","title":"Differentiable K-means for Fully-optimized Discrete Token-based ASR","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:53.342778Z"},"links":{"citing_paper":"/paper/2505.16207"},"observation_digest":"sha256:86a39c8b8c01f2475b5a8459c456f0f97bc5268b9c6e321547602e070b915246","observation_id":"7e99129f-e404-41d3-bc2b-c1ee42d8ed7a","resolution":{"observed_at":"2026-08-07T15:11:00.100231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:59.740243Z","title":"WavLM: Large-scale self-supervised pre-training for full stack speech process- ing,","venue":null,"work_id":"a4f8a9ca-aa35-4662-bb53-3f28a20ab0a7","year":2021},"citing_paper":{"arxiv_id":"2505.16207","last_updated":"2025-05-22T04:20:51Z","snapshot_observed_at":"2026-08-15T23:31:45.578930Z","submitted_at":"2025-05-22T04:20:51Z","title":"Differentiable K-means for Fully-optimized Discrete Token-based ASR","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:53.411380Z"},"links":{"citing_paper":"/paper/2505.16207"},"observation_digest":"sha256:fade698811eba98c8d26b87317fc2930ef8c1d88e8d8e1ec4c0ed8bb3a92ad2c","observation_id":"f6ee3d29-918c-4b18-860d-9746aaa49d3e","resolution":{"observed_at":"2026-08-07T15:10:59.882795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:59.520202Z","title":"w2v-BERT: Combining contrastive learning and masked language modeling for self- supervised speech pre-training,","venue":null,"work_id":"99c3cae6-2b4a-4beb-bef0-8fa35c4ca7f1","year":2021},"citing_paper":{"arxiv_id":"2505.16207","last_updated":"2025-05-22T04:20:51Z","snapshot_observed_at":"2026-08-15T23:31:45.578930Z","submitted_at":"2025-05-22T04:20:51Z","title":"Differentiable K-means for Fully-optimized Discrete Token-based ASR","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:53.480457Z"},"links":{"citing_paper":"/paper/2505.16207"},"observation_digest":"sha256:231f50176dbf82aad30e2a7ec62965ffd0da8ce131b37c9996f7788329cce175","observation_id":"1518c7c8-41f0-4d4a-bef7-e7267c39e4be","resolution":{"observed_at":"2026-08-07T15:10:59.635877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:59.297140Z","title":"SUPERB: Speech processing universal performance benchmark,","venue":null,"work_id":"0f793a08-9502-4ffa-8c9f-2a7b557cc1ff","year":2021},"citing_paper":{"arxiv_id":"2505.16207","last_updated":"2025-05-22T04:20:51Z","snapshot_observed_at":"2026-08-15T23:31:45.578930Z","submitted_at":"2025-05-22T04:20:51Z","title":"Differentiable K-means for Fully-optimized Discrete Token-based ASR","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:53.568099Z"},"links":{"citing_paper":"/paper/2505.16207"},"observation_digest":"sha256:73c3be95bdfcb6030d83fc6f0adc97d6e0b2dff26ce98ebc2d828d918e5db22c","observation_id":"f36e9891-ffdb-487d-9e99-9fab34ab8abb","resolution":{"observed_at":"2026-08-07T15:10:59.398067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:59.085671Z","title":"The Interspeech 2024 challenge on speech processing using discrete units,","venue":null,"work_id":"efb75b09-92b2-46e9-ad69-a467b737e914","year":2024},"citing_paper":{"arxiv_id":"2505.16207","last_updated":"2025-05-22T04:20:51Z","snapshot_observed_at":"2026-08-15T23:31:45.578930Z","submitted_at":"2025-05-22T04:20:51Z","title":"Differentiable K-means for Fully-optimized Discrete Token-based ASR","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:53.619171Z"},"links":{"citing_paper":"/paper/2505.16207"},"observation_digest":"sha256:98b27ff6f81153e227dffa87d35319c641523ca657bb36384542afee1148675a","observation_id":"dd2be09d-4af9-4fb7-8e1a-bcb50e4ea8e1","resolution":{"observed_at":"2026-08-07T15:10:59.182121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:58.869905Z","title":"Speechgpt: Empowering large language models with intrinsic cross-modal conversational abili- ties,","venue":null,"work_id":"9c3671d4-71c9-494b-b9ea-2731749ec03f","year":2023},"citing_paper":{"arxiv_id":"2505.16207","last_updated":"2025-05-22T04:20:51Z","snapshot_observed_at":"2026-08-15T23:31:45.578930Z","submitted_at":"2025-05-22T04:20:51Z","title":"Differentiable K-means for Fully-optimized Discrete Token-based ASR","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:53.700798Z"},"links":{"citing_paper":"/paper/2505.16207"},"observation_digest":"sha256:d1166a07b12ebee3a442487f1ccc0e07e4de49db898dfbc5470eeddc924b44c8","observation_id":"7681dfc2-b7c0-4d01-a47e-64f51a05f780","resolution":{"observed_at":"2026-08-07T15:10:58.971469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:58.649837Z","title":"V oxtlm: Unified decoder- only models for consolidating speech recognition, synthesis and speech, text continuation tasks,","venue":null,"work_id":"ccccc2d6-5db5-4262-aa6b-a863325d6cc1","year":2024},"citing_paper":{"arxiv_id":"2505.16207","last_updated":"2025-05-22T04:20:51Z","snapshot_observed_at":"2026-08-15T23:31:45.578930Z","submitted_at":"2025-05-22T04:20:51Z","title":"Differentiable K-means for Fully-optimized Discrete Token-based ASR","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:53.796254Z"},"links":{"citing_paper":"/paper/2505.16207"},"observation_digest":"sha256:73e132a8c8d37ea23aff88728aef109b14fffa6013c6df44764fbaf559524ac8","observation_id":"a7c0a7f9-76ed-4f7e-bb05-13caa0df2fb5","resolution":{"observed_at":"2026-08-07T15:10:58.737889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-08-07T01:18:02.068918Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-08-07T15:10:53.895183Z","title":"Au- diopalm: A large language model that can speak and listen,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16207","last_updated":"2025-05-22T04:20:51Z","snapshot_observed_at":"2026-08-15T23:31:45.578930Z","submitted_at":"2025-05-22T04:20:51Z","title":"Differentiable K-means for Fully-optimized Discrete Token-based ASR","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:53.895183Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2505.16207"},"observation_digest":"sha256:d83db2c479bbd9793c0775a321f025c0dbe8aa60fbe4b9b3c99d4648ec7f8921","observation_id":"9f92d21a-5a7b-491f-8171-acc4d3eddcec","resolution":{"observed_at":"2026-08-07T15:10:53.895183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:54.009045Z","title":"Ex- ploration of efficient end-to-end ASR using discretized input from self-supervised learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16207","last_updated":"2025-05-22T04:20:51Z","snapshot_observed_at":"2026-08-15T23:31:45.578930Z","submitted_at":"2025-05-22T04:20:51Z","title":"Differentiable K-means for Fully-optimized Discrete Token-based ASR","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:54.009045Z"},"links":{"citing_paper":"/paper/2505.16207"},"observation_digest":"sha256:324d3615cfcb8b7e81722153eb6b8fb8bc87dca62d5c94d620358b747d572075","observation_id":"26fc4fb4-a03b-4697-951a-01522e8b6a29","resolution":{"observed_at":"2026-08-07T15:10:54.009045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:58.454776Z","title":"Exploring speech recognition, translation, and understanding with discrete speech units: A com- parative study,","venue":null,"work_id":"9023f72d-aa64-426f-a48c-cb214bd36e62","year":2024},"citing_paper":{"arxiv_id":"2505.16207","last_updated":"2025-05-22T04:20:51Z","snapshot_observed_at":"2026-08-15T23:31:45.578930Z","submitted_at":"2025-05-22T04:20:51Z","title":"Differentiable K-means for Fully-optimized Discrete Token-based ASR","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:54.089381Z"},"links":{"citing_paper":"/paper/2505.16207"},"observation_digest":"sha256:5cc6390ec3444c587ea6cc0ab4a249cfd9601333ca31c5cd1146047399c827a8","observation_id":"d493f9cb-5ea7-4bff-8328-4e08260d25a1","resolution":{"observed_at":"2026-08-07T15:10:58.551490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:58.247425Z","title":"Towards universal speech discrete tokens: A case study for ASR and TTS,","venue":null,"work_id":"913e391b-9bde-421a-b8bb-6de59970ad6a","year":2024},"citing_paper":{"arxiv_id":"2505.16207","last_updated":"2025-05-22T04:20:51Z","snapshot_observed_at":"2026-08-15T23:31:45.578930Z","submitted_at":"2025-05-22T04:20:51Z","title":"Differentiable K-means for Fully-optimized Discrete Token-based ASR","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:54.199883Z"},"links":{"citing_paper":"/paper/2505.16207"},"observation_digest":"sha256:7a188286d7c3220fc44baabae92819077d7dd42be2d756941329aee7cbfbf76c","observation_id":"ec1ca78a-c709-446f-ab53-2c17e4b99dab","resolution":{"observed_at":"2026-08-07T15:10:58.329663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:57.997892Z","title":"Estimating the completeness of discrete speech units,","venue":null,"work_id":"1087c94d-af9b-4afb-b4f8-aaeb7428ee4a","year":2024},"citing_paper":{"arxiv_id":"2505.16207","last_updated":"2025-05-22T04:20:51Z","snapshot_observed_at":"2026-08-15T23:31:45.578930Z","submitted_at":"2025-05-22T04:20:51Z","title":"Differentiable K-means for Fully-optimized Discrete Token-based ASR","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:54.307981Z"},"links":{"citing_paper":"/paper/2505.16207"},"observation_digest":"sha256:9cdc96a1c03bf2e5887a7fb4f3f5b6d8d118e26bce91d1a3fcc72d1689009537","observation_id":"3085bb31-4c5e-4d55-975c-5bc8f7d14021","resolution":{"observed_at":"2026-08-07T15:10:58.109481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:57.800998Z","title":"Deep clus- tering with concrete k-means,","venue":null,"work_id":"3e6dca00-1fe3-4739-b559-93bce0ae4028","year":2020},"citing_paper":{"arxiv_id":"2505.16207","last_updated":"2025-05-22T04:20:51Z","snapshot_observed_at":"2026-08-15T23:31:45.578930Z","submitted_at":"2025-05-22T04:20:51Z","title":"Differentiable K-means for Fully-optimized Discrete Token-based ASR","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:54.363887Z"},"links":{"citing_paper":"/paper/2505.16207"},"observation_digest":"sha256:2f40a622f02aea56109d49f55e190bdc6cb9d8947ab49c557a1ef3edea375805","observation_id":"36be1581-0257-4491-9082-9dc116de05aa","resolution":{"observed_at":"2026-08-07T15:10:57.876285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:57.620034Z","title":"Neural discrete represen- tation learning,","venue":null,"work_id":"e0a8aef4-0b70-41a9-a1fd-d8c787877f91","year":2017},"citing_paper":{"arxiv_id":"2505.16207","last_updated":"2025-05-22T04:20:51Z","snapshot_observed_at":"2026-08-15T23:31:45.578930Z","submitted_at":"2025-05-22T04:20:51Z","title":"Differentiable K-means for Fully-optimized Discrete Token-based ASR","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:54.404806Z"},"links":{"citing_paper":"/paper/2505.16207"},"observation_digest":"sha256:9bf858d2603e2bf200317277d0d01c8175d711786be8959184cb71e55c592257","observation_id":"8004c3a5-aa60-40c5-b3c0-58d9a083e9ba","resolution":{"observed_at":"2026-08-07T15:10:57.726262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:57.484826Z","title":"How should we extract dis- crete audio tokens from self-supervised models?","venue":null,"work_id":"e3bec479-d923-4540-a255-a7550709a615","year":2024},"citing_paper":{"arxiv_id":"2505.16207","last_updated":"2025-05-22T04:20:51Z","snapshot_observed_at":"2026-08-15T23:31:45.578930Z","submitted_at":"2025-05-22T04:20:51Z","title":"Differentiable K-means for Fully-optimized Discrete Token-based ASR","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:54.463268Z"},"links":{"citing_paper":"/paper/2505.16207"},"observation_digest":"sha256:fccaa40e479226bb1449bf6e313bde97ff81ae537c47385c0c86205f79985cd4","observation_id":"629bab09-6ffe-4300-a63e-cd0736cb34aa","resolution":{"observed_at":"2026-08-07T15:10:57.535744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:54.504219Z","title":"MMM: Multi-layer multi-residual multi-stream discrete speech represen- tation from self-supervised learning model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16207","last_updated":"2025-05-22T04:20:51Z","snapshot_observed_at":"2026-08-15T23:31:45.578930Z","submitted_at":"2025-05-22T04:20:51Z","title":"Differentiable K-means for Fully-optimized Discrete Token-based ASR","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:54.504219Z"},"links":{"citing_paper":"/paper/2505.16207"},"observation_digest":"sha256:8ae238199d29ed1a17233afbaba23643155e134fe1cbadfc11fd4a6bc210f55c","observation_id":"b8d2a27f-2b09-4095-a9e6-e51c4f73be12","resolution":{"observed_at":"2026-08-07T15:10:54.504219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:54.517916Z","title":"Joint CTC-attention based end-to-end speech recognition using multi-task learning,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.16207","last_updated":"2025-05-22T04:20:51Z","snapshot_observed_at":"2026-08-15T23:31:45.578930Z","submitted_at":"2025-05-22T04:20:51Z","title":"Differentiable K-means for Fully-optimized Discrete Token-based ASR","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:54.517916Z"},"links":{"citing_paper":"/paper/2505.16207"},"observation_digest":"sha256:90ed9bd56b3e9dcbeff1f490a3e7b899fb8b64ebb54d9511ebe3702436f4a3a7","observation_id":"3f377d43-3815-4020-87b3-da3059c3f78f","resolution":{"observed_at":"2026-08-07T15:10:54.517916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1211.3711","last_updated":"2012-11-14T19:25:21Z","snapshot_observed_at":"2026-08-15T00:39:21.296689Z","submitted_at":"2012-11-14T19:25:21Z","title":"Sequence Transduction with Recurrent Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1211.3711","snapshot_observed_at":"2026-08-07T15:10:54.588280Z","title":"Sequence transduction with recurrent neural net- works,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2505.16207","last_updated":"2025-05-22T04:20:51Z","snapshot_observed_at":"2026-08-15T23:31:45.578930Z","submitted_at":"2025-05-22T04:20:51Z","title":"Differentiable K-means for Fully-optimized Discrete Token-based ASR","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:54.588280Z"},"links":{"cited_paper":"/paper/1211.3711","citing_paper":"/paper/2505.16207"},"observation_digest":"sha256:ecb794cd21b4733237398300fe0f43bc764723badec730f34a7a28b31c81852b","observation_id":"0ff2eebf-bd59-4945-8472-38db5cdac336","resolution":{"observed_at":"2026-08-07T15:10:54.588280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:57.308008Z","title":"Owsm v3.1: Better and faster open whisper-style speech models based on e-branchformer,","venue":null,"work_id":"82659336-9e11-401b-b83c-f72ce002922d","year":2024},"citing_paper":{"arxiv_id":"2505.16207","last_updated":"2025-05-22T04:20:51Z","snapshot_observed_at":"2026-08-15T23:31:45.578930Z","submitted_at":"2025-05-22T04:20:51Z","title":"Differentiable K-means for Fully-optimized Discrete Token-based ASR","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:54.653549Z"},"links":{"citing_paper":"/paper/2505.16207"},"observation_digest":"sha256:8b6da4eb227eec2b1a0d2f224780e50a74a6dde29a81d820fdbcad968c1df5ee","observation_id":"9599407a-c585-4869-aed8-c3c127a52b0f","resolution":{"observed_at":"2026-08-07T15:10:57.378971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:57.205934Z","title":"Comparing discrete and continuous space llms for speech recognition,","venue":null,"work_id":"6bdd18a7-0930-4416-bde1-25d2bb78fdc4","year":2024},"citing_paper":{"arxiv_id":"2505.16207","last_updated":"2025-05-22T04:20:51Z","snapshot_observed_at":"2026-08-15T23:31:45.578930Z","submitted_at":"2025-05-22T04:20:51Z","title":"Differentiable K-means for Fully-optimized Discrete Token-based ASR","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:54.701130Z"},"links":{"citing_paper":"/paper/2505.16207"},"observation_digest":"sha256:f858fcb35c97286c6c6df886274bacb24babeedc18f62f597ce3c04ce05326bf","observation_id":"277b2d82-4125-493b-bfb8-3142d859fde0","resolution":{"observed_at":"2026-08-07T15:10:57.281794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:57.015667Z","title":"Categorical reparameterization with gumbel-softmax,","venue":null,"work_id":"49d2a5b1-f769-4334-ab63-bcc3c0ee92f5","year":2017},"citing_paper":{"arxiv_id":"2505.16207","last_updated":"2025-05-22T04:20:51Z","snapshot_observed_at":"2026-08-15T23:31:45.578930Z","submitted_at":"2025-05-22T04:20:51Z","title":"Differentiable K-means for Fully-optimized Discrete Token-based ASR","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:54.780291Z"},"links":{"citing_paper":"/paper/2505.16207"},"observation_digest":"sha256:7964ec9f9f843334ec840d2326f942a6b2104a6d9fe08ae9e732fcd1a7100e84","observation_id":"ab6c8e5b-b829-4c12-b934-30680781e62e","resolution":{"observed_at":"2026-08-07T15:10:57.105007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:56.844662Z","title":"ESPnet: End-to-end speech processing toolkit,","venue":null,"work_id":"b5b82ff1-63b1-47da-b5ff-91ad6b3255b2","year":2018},"citing_paper":{"arxiv_id":"2505.16207","last_updated":"2025-05-22T04:20:51Z","snapshot_observed_at":"2026-08-15T23:31:45.578930Z","submitted_at":"2025-05-22T04:20:51Z","title":"Differentiable K-means for Fully-optimized Discrete Token-based ASR","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:54.847056Z"},"links":{"citing_paper":"/paper/2505.16207"},"observation_digest":"sha256:36c90f3d7c47523eb6c90629245b29eac437e23948bbdfa99820f52831f84d27","observation_id":"f249e5c0-c45e-4807-8205-89182a142208","resolution":{"observed_at":"2026-08-07T15:10:56.922623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:54.889744Z","title":"Lib- rispeech: An asr corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.16207","last_updated":"2025-05-22T04:20:51Z","snapshot_observed_at":"2026-08-15T23:31:45.578930Z","submitted_at":"2025-05-22T04:20:51Z","title":"Differentiable K-means for Fully-optimized Discrete Token-based ASR","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:54.889744Z"},"links":{"citing_paper":"/paper/2505.16207"},"observation_digest":"sha256:f6e35b014141a2598bd654ab6675d4026c01182af4ea659a011860ccb4ff72f7","observation_id":"dfa20a09-c8f3-4312-aac6-be7aaa8c6130","resolution":{"observed_at":"2026-08-07T15:10:54.889744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:56.637780Z","title":"On generative spoken language modeling from raw audio,","venue":null,"work_id":"8a87fc04-5b64-4d8f-894f-43a60a394e54","year":2021},"citing_paper":{"arxiv_id":"2505.16207","last_updated":"2025-05-22T04:20:51Z","snapshot_observed_at":"2026-08-15T23:31:45.578930Z","submitted_at":"2025-05-22T04:20:51Z","title":"Differentiable K-means for Fully-optimized Discrete Token-based ASR","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:54.931386Z"},"links":{"citing_paper":"/paper/2505.16207"},"observation_digest":"sha256:bc65dc2aa7a5fae2e739aa366b38faf3bca65ca7cdc7d2c6e4e7b0c08665b190","observation_id":"1087512b-a9a1-46a3-9d84-970ef88badac","resolution":{"observed_at":"2026-08-07T15:10:56.726453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"crid/1881146","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:55.552304Z","title":"TIMIT acoustic-phonetic continuous speech corpus,","venue":null,"work_id":"5f699f9d-f318-4cf6-b476-b22bdaf212bb","year":1993},"citing_paper":{"arxiv_id":"2505.16207","last_updated":"2025-05-22T04:20:51Z","snapshot_observed_at":"2026-08-15T23:31:45.578930Z","submitted_at":"2025-05-22T04:20:51Z","title":"Differentiable K-means for Fully-optimized Discrete Token-based ASR","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:54.999328Z"},"links":{"citing_paper":"/paper/2505.16207"},"observation_digest":"sha256:81d80a671d7ab5e5765cfa0f65afab51a04d628965834b21794505fb069cb4c9","observation_id":"6ecf95b6-9f5e-40f1-a94b-36e200fe3efc","resolution":{"observed_at":"2026-08-07T15:10:55.625579Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:56.489640Z","title":"Natural TTS synthesis by con- ditioning wavenet on mel spectrogram predictions,","venue":null,"work_id":"9d406a3b-2554-4eb2-b326-153514b65d96","year":2018},"citing_paper":{"arxiv_id":"2505.16207","last_updated":"2025-05-22T04:20:51Z","snapshot_observed_at":"2026-08-15T23:31:45.578930Z","submitted_at":"2025-05-22T04:20:51Z","title":"Differentiable K-means for Fully-optimized Discrete Token-based ASR","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:55.064485Z"},"links":{"citing_paper":"/paper/2505.16207"},"observation_digest":"sha256:f332dab3eb8770f1fe9084d8f4975be4b04c864d10a0e96007e7efd41d3fc75d","observation_id":"28e8532e-1a2d-4471-9da4-a9ad12654439","resolution":{"observed_at":"2026-08-07T15:10:56.580418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:55.099028Z","title":"The LJ speech dataset,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.16207","last_updated":"2025-05-22T04:20:51Z","snapshot_observed_at":"2026-08-15T23:31:45.578930Z","submitted_at":"2025-05-22T04:20:51Z","title":"Differentiable K-means for Fully-optimized Discrete Token-based ASR","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:55.099028Z"},"links":{"citing_paper":"/paper/2505.16207"},"observation_digest":"sha256:21d8665e57b8bb1bfbc5fd9ff2c2d63896cc42d3dcf8530f9fad0a66b133055c","observation_id":"31fe7b07-04ea-4942-91ac-be3e41bf9b71","resolution":{"observed_at":"2026-08-07T15:10:55.099028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:56.370440Z","title":"Parallel wavegan: A fast waveform generation model based on generative adversarial net- works with multi-resolution spectrogram,","venue":null,"work_id":"414a6749-1d89-4322-93d9-f0320dad8b76","year":2020},"citing_paper":{"arxiv_id":"2505.16207","last_updated":"2025-05-22T04:20:51Z","snapshot_observed_at":"2026-08-15T23:31:45.578930Z","submitted_at":"2025-05-22T04:20:51Z","title":"Differentiable K-means for Fully-optimized Discrete Token-based ASR","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:55.117280Z"},"links":{"citing_paper":"/paper/2505.16207"},"observation_digest":"sha256:2a423fbe2383b5a1daa3ea3d68f9e7df56341f50bc88bae4335d2c378483424a","observation_id":"24874937-ce16-4351-8098-07bc72a7194b","resolution":{"observed_at":"2026-08-07T15:10:56.413190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:56.196471Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":"5d397a74-d10e-4f54-b495-834ad3fb0c27","year":2023},"citing_paper":{"arxiv_id":"2505.16207","last_updated":"2025-05-22T04:20:51Z","snapshot_observed_at":"2026-08-15T23:31:45.578930Z","submitted_at":"2025-05-22T04:20:51Z","title":"Differentiable K-means for Fully-optimized Discrete Token-based ASR","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:55.174372Z"},"links":{"citing_paper":"/paper/2505.16207"},"observation_digest":"sha256:1d69052200f41864e0a654d773db4caa7a21ab3567a15633797df5553cc52509","observation_id":"c8b70b88-a058-4d89-866a-3c1def88f3a0","resolution":{"observed_at":"2026-08-07T15:10:56.304037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:56.054875Z","title":"CSTR VCTK cor- pus: English multi-speaker corpus for cstr voice cloning toolkit,","venue":null,"work_id":"2ff15f00-d99a-4a3e-ac9f-1e5abe53e4c4","year":2017},"citing_paper":{"arxiv_id":"2505.16207","last_updated":"2025-05-22T04:20:51Z","snapshot_observed_at":"2026-08-15T23:31:45.578930Z","submitted_at":"2025-05-22T04:20:51Z","title":"Differentiable K-means for Fully-optimized Discrete Token-based ASR","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:55.250943Z"},"links":{"citing_paper":"/paper/2505.16207"},"observation_digest":"sha256:3251bddd4652fe560218b224c44488a009a25d281102d28fa0f7a6f6de1a8754","observation_id":"5b488939-e834-456e-9b6d-aee5774e51b4","resolution":{"observed_at":"2026-08-07T15:10:56.118434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:55.944066Z","title":"UTMOS: UTokyo-SaruLab system for V oiceMOS challenge 2022,","venue":null,"work_id":"c421edda-3bf9-410c-b8c1-d9f64a3670c5","year":2022},"citing_paper":{"arxiv_id":"2505.16207","last_updated":"2025-05-22T04:20:51Z","snapshot_observed_at":"2026-08-15T23:31:45.578930Z","submitted_at":"2025-05-22T04:20:51Z","title":"Differentiable K-means for Fully-optimized Discrete Token-based ASR","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:55.311454Z"},"links":{"citing_paper":"/paper/2505.16207"},"observation_digest":"sha256:f3eb73007fdfc92592094145465963b5ed57b425089c9cd3bef2e4dfd7629b01","observation_id":"3b701dad-5d7f-48c5-8cb9-26126bf63447","resolution":{"observed_at":"2026-08-07T15:10:56.004267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:10:55.818728Z","title":"ML-SUPERB: Multilingual speech universal performance benchmark,","venue":null,"work_id":"b47b73f8-56b0-487e-9405-7e39fba35929","year":2023},"citing_paper":{"arxiv_id":"2505.16207","last_updated":"2025-05-22T04:20:51Z","snapshot_observed_at":"2026-08-15T23:31:45.578930Z","submitted_at":"2025-05-22T04:20:51Z","title":"Differentiable K-means for Fully-optimized Discrete Token-based ASR","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:10:55.387892Z"},"links":{"citing_paper":"/paper/2505.16207"},"observation_digest":"sha256:80ab6594bdc100c8b2cf7f7ad2015d1c4b58d091f308bd6e277a290a2548437d","observation_id":"b4ffa12a-f856-4eef-afc2-87f659bfdc5b","resolution":{"observed_at":"2026-08-07T15:10:55.864629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.16207","last_updated":"2025-05-22T04:20:51Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-15T23:31:45.578930Z","submitted_at":"2025-05-22T04:20:51Z","title":"Differentiable K-means for Fully-optimized Discrete Token-based ASR"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":2,"verified_fuzzy":31},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 1 inbound Pith citation observation for arXiv:2505.16207."}