{"as_of":"2026-08-08T04:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9a5b8443e9dbb7a7ccad9dd9ff211fe3fec57fc92e725ce608c97b4d1ae07513","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:35:38.605780Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:35:33.841116Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-18T22:21:53.596123Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.01845","last_updated":"2025-06-02T16:30:38Z","snapshot_observed_at":"2026-08-07T11:30:15.509193Z","submitted_at":"2025-06-02T16:30:38Z","title":"On-device Streaming Discrete Speech Units","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01845","snapshot_observed_at":"2026-08-07T11:35:33.841116Z","title":"universal audio feature","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01845","last_updated":"2025-06-02T16:30:38Z","snapshot_observed_at":"2026-08-07T11:30:15.509193Z","submitted_at":"2025-06-02T16:30:38Z","title":"On-device Streaming Discrete Speech Units","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:33.841116Z"},"links":{"cited_paper":"/paper/2506.01845","citing_paper":"/paper/2506.01845"},"observation_digest":"sha256:a95abd79f1fffc429c27ed13ebff8656669500259d10eb0bcce80263dfb0c3af","observation_id":"3b3040d7-d133-4d99-99b7-a3186741704a","resolution":{"observed_at":"2026-08-07T11:35:33.841116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01845","last_updated":"2025-06-02T16:30:38Z","snapshot_observed_at":"2026-08-07T11:30:15.509193Z","submitted_at":"2025-06-02T16:30:38Z","title":"On-device Streaming Discrete Speech Units","version":1},"cited_work":{"arxiv_id":"2506.01845","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01845","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On-device streaming discrete speech units","venue":null,"work_id":"013f5dd4-affd-4be5-9058-1b5d967f2e26","year":2025},"citing_paper":{"arxiv_id":"2508.12301","last_updated":"2026-04-05T10:23:00Z","snapshot_observed_at":"2026-07-06T22:14:01.538942Z","submitted_at":"2025-08-17T09:32:40Z","title":"WhisperRT -- Turning Whisper into a Causal Streaming Model","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-18T22:16:51.917336Z"},"links":{"cited_paper":"/paper/2506.01845","citing_paper":"/paper/2508.12301"},"observation_digest":"sha256:631ffe76c90d8a6b0287d27010dd366023a3e97b90f767e27245f45fa6c2f5a8","observation_id":"908b712e-f978-4af9-8ab2-a9e54b3f0ad2","resolution":{"observed_at":"2026-05-18T22:21:53.598627Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.01845/citation-record","integrity":"/paper/2506.01845/integrity","json":"/paper/2506.01845/citation-record.json","paper":"/paper/2506.01845"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.01845","last_updated":"2025-06-02T16:30:38Z","snapshot_observed_at":"2026-08-07T11:30:15.509193Z","submitted_at":"2025-06-02T16:30:38Z","title":"On-device Streaming Discrete Speech Units","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01845","snapshot_observed_at":"2026-08-07T11:35:33.841116Z","title":"universal audio feature","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01845","last_updated":"2025-06-02T16:30:38Z","snapshot_observed_at":"2026-08-07T11:30:15.509193Z","submitted_at":"2025-06-02T16:30:38Z","title":"On-device Streaming Discrete Speech Units","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:33.841116Z"},"links":{"cited_paper":"/paper/2506.01845","citing_paper":"/paper/2506.01845"},"observation_digest":"sha256:a95abd79f1fffc429c27ed13ebff8656669500259d10eb0bcce80263dfb0c3af","observation_id":"3b3040d7-d133-4d99-99b7-a3186741704a","resolution":{"observed_at":"2026-08-07T11:35:33.841116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:35:46.426421Z","title":"To evaluate the predicted DSUs, we focus on the discrete ASR system","venue":null,"work_id":"948c482c-2513-414f-a589-00b4588a4b73","year":null},"citing_paper":{"arxiv_id":"2506.01845","last_updated":"2025-06-02T16:30:38Z","snapshot_observed_at":"2026-08-07T11:30:15.509193Z","submitted_at":"2025-06-02T16:30:38Z","title":"On-device Streaming Discrete Speech Units","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:33.878111Z"},"links":{"citing_paper":"/paper/2506.01845"},"observation_digest":"sha256:3f750e98b823a87962cb8ec92243b6df9912ff36769790be799fac72c3c972a3","observation_id":"fd7be342-39df-4441-b9a5-af3cb23e0db8","resolution":{"observed_at":"2026-08-07T11:35:46.515002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:35:46.266748Z","title":"However, this issue can be mitigated by limiting the future window size of the S2U module","venue":null,"work_id":"76406ceb-b092-4325-b625-eaf5972f328a","year":null},"citing_paper":{"arxiv_id":"2506.01845","last_updated":"2025-06-02T16:30:38Z","snapshot_observed_at":"2026-08-07T11:30:15.509193Z","submitted_at":"2025-06-02T16:30:38Z","title":"On-device Streaming Discrete Speech Units","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:33.930393Z"},"links":{"citing_paper":"/paper/2506.01845"},"observation_digest":"sha256:a0d33e1a6076f8725018130e7d3713460d3910c8df653febdbfc86e5f0a02343","observation_id":"b7b9d3b1-8a94-428f-8a22-75b492385509","resolution":{"observed_at":"2026-08-07T11:35:46.327654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:35:46.098253Z","title":"Since the number of layers has a linear relationship with computational cost, reduc- ing them benefits resource-constrained on-device applications","venue":null,"work_id":"b2d86991-c97b-455c-87e8-03cf33bc9536","year":null},"citing_paper":{"arxiv_id":"2506.01845","last_updated":"2025-06-02T16:30:38Z","snapshot_observed_at":"2026-08-07T11:30:15.509193Z","submitted_at":"2025-06-02T16:30:38Z","title":"On-device Streaming Discrete Speech Units","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:33.987559Z"},"links":{"citing_paper":"/paper/2506.01845"},"observation_digest":"sha256:143acc790f61c0d1ebce7c3957e2eb39ed8c1acb71934f8b0e1b40c26e8aa7ce","observation_id":"b195da30-838c-4d25-b2e7-ccdc6181ee2c","resolution":{"observed_at":"2026-08-07T11:35:46.174810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:35:45.952182Z","title":"Also, by applying such, we produce a Pareto optimal curve that represents the trade-off between the computational over- head and the downstream performance","venue":null,"work_id":"d2dac2b8-4d96-4526-bff5-b6d33eebe3e6","year":null},"citing_paper":{"arxiv_id":"2506.01845","last_updated":"2025-06-02T16:30:38Z","snapshot_observed_at":"2026-08-07T11:30:15.509193Z","submitted_at":"2025-06-02T16:30:38Z","title":"On-device Streaming Discrete Speech Units","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:34.070482Z"},"links":{"citing_paper":"/paper/2506.01845"},"observation_digest":"sha256:9376d27b8ce42c47745c677962509ccc637ee97deec0217ce27b38179c13ef11","observation_id":"9ee2a7ed-9fc7-4c27-98c5-c9e0f55ab937","resolution":{"observed_at":"2026-08-07T11:35:46.016337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:35:45.802695Z","title":"Knowledge distillation (KD) is of- ten used to reduce the size of S3Ms, such as DistilHuBERT","venue":null,"work_id":"10601bae-ebbf-4d14-81e6-d32cb05cee26","year":null},"citing_paper":{"arxiv_id":"2506.01845","last_updated":"2025-06-02T16:30:38Z","snapshot_observed_at":"2026-08-07T11:30:15.509193Z","submitted_at":"2025-06-02T16:30:38Z","title":"On-device Streaming Discrete Speech Units","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:34.124317Z"},"links":{"citing_paper":"/paper/2506.01845"},"observation_digest":"sha256:43904a6d7538ec95be5fd793d8271e05c034650f7924b189ce392b51eba2e63c","observation_id":"ca88d02a-26d2-4804-a677-28f69b6e1438","resolution":{"observed_at":"2026-08-07T11:35:45.865362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:35:45.460604Z","title":"How- ever, current methods for generating DSUs rely on full speech input and computationally heavy S3Ms","venue":null,"work_id":"de3f1552-6a71-409c-9096-0acf8a9872e7","year":null},"citing_paper":{"arxiv_id":"2506.01845","last_updated":"2025-06-02T16:30:38Z","snapshot_observed_at":"2026-08-07T11:30:15.509193Z","submitted_at":"2025-06-02T16:30:38Z","title":"On-device Streaming Discrete Speech Units","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:34.288721Z"},"links":{"citing_paper":"/paper/2506.01845"},"observation_digest":"sha256:a139ce92c608d24a69284fabffcf7f15033d4cc0ccf7a8d0bac7f4a2b7db6d2e","observation_id":"6a63d6b9-9db6-4ab7-bc41-edc36e66e719","resolution":{"observed_at":"2026-08-07T11:35:45.550467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:35:45.290749Z","title":null,"venue":null,"work_id":"333402ca-a0f9-4762-b0cf-96b902b93ec4","year":null},"citing_paper":{"arxiv_id":"2506.01845","last_updated":"2025-06-02T16:30:38Z","snapshot_observed_at":"2026-08-07T11:30:15.509193Z","submitted_at":"2025-06-02T16:30:38Z","title":"On-device Streaming Discrete Speech Units","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:34.357562Z"},"links":{"citing_paper":"/paper/2506.01845"},"observation_digest":"sha256:1e867f02afebd99153d5ce494f35fa4e5730ece2b360eda9340b93d00d019db5","observation_id":"1b6685b7-021a-4d33-ad1e-93762220c499","resolution":{"observed_at":"2026-08-07T11:35:45.371764Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-08-07T01:18:02.068918Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-08-07T11:35:35.097715Z","title":"Au- dioPaLM: A large language model that can speak and listen,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01845","last_updated":"2025-06-02T16:30:38Z","snapshot_observed_at":"2026-08-07T11:30:15.509193Z","submitted_at":"2025-06-02T16:30:38Z","title":"On-device Streaming Discrete Speech Units","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:35.097715Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2506.01845"},"observation_digest":"sha256:205345d57e6789367ed4200759aab88fdd04059c29324cd9c109559bd4d8fe8d","observation_id":"883af9d9-3cfa-4aed-a84b-952631c2eb17","resolution":{"observed_at":"2026-08-07T11:35:35.097715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:35:45.108227Z","title":"Self-supervised speech representation learning: A review,","venue":null,"work_id":"e53cf399-ce78-4203-b6f8-0ec9bfdc7fae","year":2022},"citing_paper":{"arxiv_id":"2506.01845","last_updated":"2025-06-02T16:30:38Z","snapshot_observed_at":"2026-08-07T11:30:15.509193Z","submitted_at":"2025-06-02T16:30:38Z","title":"On-device Streaming Discrete Speech Units","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:34.418993Z"},"links":{"citing_paper":"/paper/2506.01845"},"observation_digest":"sha256:19222c4fbeb1535ebdca50bfd12c89ce583937dda7bb6538bd2de3b5b5c60d09","observation_id":"bb8e25f6-e0ee-4362-a085-1085116cd7e9","resolution":{"observed_at":"2026-08-07T11:35:45.203174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:35:44.932386Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representa- tions,","venue":null,"work_id":"6af2d558-9a8b-450f-8bbf-702bf0fdc834","year":2020},"citing_paper":{"arxiv_id":"2506.01845","last_updated":"2025-06-02T16:30:38Z","snapshot_observed_at":"2026-08-07T11:30:15.509193Z","submitted_at":"2025-06-02T16:30:38Z","title":"On-device Streaming Discrete Speech Units","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:34.480352Z"},"links":{"citing_paper":"/paper/2506.01845"},"observation_digest":"sha256:3d77b13a979d170c884d68173fc1ca64fcc2a0537bdcfe4f77488daaeeb6a81a","observation_id":"d0349d48-e10b-46b9-b2b3-95aa9672037f","resolution":{"observed_at":"2026-08-07T11:35:45.014093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:35:44.718020Z","title":"WavLM: Large-scale self- supervised pre-training for full stack speech processing,","venue":null,"work_id":"7b0942df-6d75-4643-b087-fa5c8434a203","year":2022},"citing_paper":{"arxiv_id":"2506.01845","last_updated":"2025-06-02T16:30:38Z","snapshot_observed_at":"2026-08-07T11:30:15.509193Z","submitted_at":"2025-06-02T16:30:38Z","title":"On-device Streaming Discrete Speech Units","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:34.541577Z"},"links":{"citing_paper":"/paper/2506.01845"},"observation_digest":"sha256:d6e00a13ed069b5598ed7fc1fe9311ca541d81b9bc23abca08149d91f6f09ddc","observation_id":"b1a38999-104f-4bd6-b490-f4c4186463eb","resolution":{"observed_at":"2026-08-07T11:35:44.823996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:35:44.528264Z","title":"Exploration of efficient end- to-end asr using discretized input from self-supervised learning,","venue":null,"work_id":"bdf99da7-87af-48ec-9f8d-91e18df5d604","year":2023},"citing_paper":{"arxiv_id":"2506.01845","last_updated":"2025-06-02T16:30:38Z","snapshot_observed_at":"2026-08-07T11:30:15.509193Z","submitted_at":"2025-06-02T16:30:38Z","title":"On-device Streaming Discrete Speech Units","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:34.631478Z"},"links":{"citing_paper":"/paper/2506.01845"},"observation_digest":"sha256:433f6b8f82f5d4956d0aabdf1fa33c2b8ccb733572e455d45a7737e064cbad4d","observation_id":"a2fefbab-f650-4fac-b5c1-b5778469abb2","resolution":{"observed_at":"2026-08-07T11:35:44.626961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:35:44.307085Z","title":"Exploring speech recognition, translation, and understanding with discrete speech units: A com- parative study,","venue":null,"work_id":"0d7d69a0-ef37-4298-820d-04cee99b34af","year":2024},"citing_paper":{"arxiv_id":"2506.01845","last_updated":"2025-06-02T16:30:38Z","snapshot_observed_at":"2026-08-07T11:30:15.509193Z","submitted_at":"2025-06-02T16:30:38Z","title":"On-device Streaming Discrete Speech Units","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:34.698008Z"},"links":{"citing_paper":"/paper/2506.01845"},"observation_digest":"sha256:0661d326c691799d049d888aab2c822f41e9a86683f2c310bfddc9ec4402391a","observation_id":"8addd65c-ff24-4e71-a487-140226bb057b","resolution":{"observed_at":"2026-08-07T11:35:44.407510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:35:44.110355Z","title":"The Interspeech 2024 Challenge on Speech Processing Using Discrete Units,","venue":null,"work_id":"3d8baada-f878-4eef-969d-8ee342c8664f","year":2024},"citing_paper":{"arxiv_id":"2506.01845","last_updated":"2025-06-02T16:30:38Z","snapshot_observed_at":"2026-08-07T11:30:15.509193Z","submitted_at":"2025-06-02T16:30:38Z","title":"On-device Streaming Discrete Speech Units","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:34.817297Z"},"links":{"citing_paper":"/paper/2506.01845"},"observation_digest":"sha256:75451561c4c0f91aa44fa820652c7a0df1d7037f6fa69c4ab533f88a358424db","observation_id":"2659ddbf-a1be-4096-9366-39b9c74fa523","resolution":{"observed_at":"2026-08-07T11:35:44.203084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:35:43.927066Z","title":"AudioLM: a language modeling approach to audio generation,","venue":null,"work_id":"abc768ba-3862-45a9-bc93-0a970f050d3c","year":2023},"citing_paper":{"arxiv_id":"2506.01845","last_updated":"2025-06-02T16:30:38Z","snapshot_observed_at":"2026-08-07T11:30:15.509193Z","submitted_at":"2025-06-02T16:30:38Z","title":"On-device Streaming Discrete Speech Units","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:34.921663Z"},"links":{"citing_paper":"/paper/2506.01845"},"observation_digest":"sha256:739d00eb760518083ae9d781104409109ec092268fb3098b4cc577d9b3e9fb17","observation_id":"4a07b900-ead9-493f-b5b7-aeb5743b252e","resolution":{"observed_at":"2026-08-07T11:35:44.001591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:35:43.771811Z","title":"SpeechGPT: Empowering large language models with intrinsic cross-modal conversational abili- ties,","venue":null,"work_id":"484632cf-42b8-43d9-b219-8f0b5206d43e","year":2023},"citing_paper":{"arxiv_id":"2506.01845","last_updated":"2025-06-02T16:30:38Z","snapshot_observed_at":"2026-08-07T11:30:15.509193Z","submitted_at":"2025-06-02T16:30:38Z","title":"On-device Streaming Discrete Speech Units","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:34.994945Z"},"links":{"citing_paper":"/paper/2506.01845"},"observation_digest":"sha256:107e38b5244faca785fbe9e6f9643a5f162f76a654dbdec2103905d39c2678a3","observation_id":"e1038a45-d8ee-476a-8752-ae87d5c6a854","resolution":{"observed_at":"2026-08-07T11:35:43.843634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:35:42.021292Z","title":"PARP: Prune, adjust and re-prune for self-supervised speech recognition,","venue":null,"work_id":"cf9e8a34-bd21-4059-94b9-4a8e32f2a82f","year":2021},"citing_paper":{"arxiv_id":"2506.01845","last_updated":"2025-06-02T16:30:38Z","snapshot_observed_at":"2026-08-07T11:30:15.509193Z","submitted_at":"2025-06-02T16:30:38Z","title":"On-device Streaming Discrete Speech Units","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:36.170734Z"},"links":{"citing_paper":"/paper/2506.01845"},"observation_digest":"sha256:8ddd30a8e9ceff9b6cad8a1985a8dcb1ed2b0a6d56419f12e8688ed45a0312a5","observation_id":"916bc0c0-d73e-4d5f-b63d-516cf1bcf51e","resolution":{"observed_at":"2026-08-07T11:35:42.107692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:35:43.560697Z","title":"Discrete speech unit ex- traction via independent component analysis,","venue":null,"work_id":"63216639-d2ff-433c-890c-0d6ab63bd6b3","year":2024},"citing_paper":{"arxiv_id":"2506.01845","last_updated":"2025-06-02T16:30:38Z","snapshot_observed_at":"2026-08-07T11:30:15.509193Z","submitted_at":"2025-06-02T16:30:38Z","title":"On-device Streaming Discrete Speech Units","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:35.182471Z"},"links":{"citing_paper":"/paper/2506.01845"},"observation_digest":"sha256:d5810b9867dd94ac93c9355b0619179bcf0a6c808b5ded9e839c53fe252ced19","observation_id":"0d9a634d-c28b-4afb-b631-224e242920ca","resolution":{"observed_at":"2026-08-07T11:35:43.662951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:35:43.401487Z","title":"AnyGPT: Unified multimodal LLM with discrete sequence modeling,","venue":null,"work_id":"9839e22a-ee19-4c28-8f8b-34b5526b98da","year":2024},"citing_paper":{"arxiv_id":"2506.01845","last_updated":"2025-06-02T16:30:38Z","snapshot_observed_at":"2026-08-07T11:30:15.509193Z","submitted_at":"2025-06-02T16:30:38Z","title":"On-device Streaming Discrete Speech Units","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:35.264669Z"},"links":{"citing_paper":"/paper/2506.01845"},"observation_digest":"sha256:49201a1954f48af7efcc5cc7035956d675b9abd7b64ee15db4246f2ec758346e","observation_id":"d30ae050-9d65-48c5-a60a-99dd72168338","resolution":{"observed_at":"2026-08-07T11:35:43.474147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:35:43.151929Z","title":"Anonymizing dysarthric speech: Investigating the effects of voice conversion on pathological information preservation,","venue":null,"work_id":"b835ba14-24c5-4135-b1a3-8c25b7d6b434","year":2024},"citing_paper":{"arxiv_id":"2506.01845","last_updated":"2025-06-02T16:30:38Z","snapshot_observed_at":"2026-08-07T11:30:15.509193Z","submitted_at":"2025-06-02T16:30:38Z","title":"On-device Streaming Discrete Speech Units","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:35.358550Z"},"links":{"citing_paper":"/paper/2506.01845"},"observation_digest":"sha256:3d16506067564f8e4b29d3fe215ac75ac868cf62cf5f2e66c493eb536dd233ba","observation_id":"919ad50c-538a-4515-8b99-dd899e645a30","resolution":{"observed_at":"2026-08-07T11:35:43.258749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:35:42.935872Z","title":"Self-supervised speech representations are more phonetic than semantic,","venue":null,"work_id":"0f8872ee-80a6-45c0-9e17-c300f52378fd","year":2024},"citing_paper":{"arxiv_id":"2506.01845","last_updated":"2025-06-02T16:30:38Z","snapshot_observed_at":"2026-08-07T11:30:15.509193Z","submitted_at":"2025-06-02T16:30:38Z","title":"On-device Streaming Discrete Speech Units","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:35.465539Z"},"links":{"citing_paper":"/paper/2506.01845"},"observation_digest":"sha256:0e554aa85ed455e816f8d2a107a6e7cb228be05d84d45212fbe4707ef8012537","observation_id":"abc90dcf-0751-421d-90f5-3809f408c2a0","resolution":{"observed_at":"2026-08-07T11:35:43.039086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:35:42.749189Z","title":"Comparative layer-wise analy- sis of self-supervised speech models,","venue":null,"work_id":"df5fc9ee-f00c-4045-9b0e-ce3f185408a9","year":2023},"citing_paper":{"arxiv_id":"2506.01845","last_updated":"2025-06-02T16:30:38Z","snapshot_observed_at":"2026-08-07T11:30:15.509193Z","submitted_at":"2025-06-02T16:30:38Z","title":"On-device Streaming Discrete Speech Units","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:35.579769Z"},"links":{"citing_paper":"/paper/2506.01845"},"observation_digest":"sha256:321b96cb08cb43128b68887b195af3166b327beb9ee5c1526aa936c7733fe5d9","observation_id":"cc2f1b35-f9d0-476f-8d31-9ac1e0d3da60","resolution":{"observed_at":"2026-08-07T11:35:42.819444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:35:42.607694Z","title":"Leveraging Allophony in Self- Supervised Speech Models for Atypical Pronunciation Assess- ment,","venue":null,"work_id":"a613865a-53e0-4711-8ee8-2489ccab8e58","year":2025},"citing_paper":{"arxiv_id":"2506.01845","last_updated":"2025-06-02T16:30:38Z","snapshot_observed_at":"2026-08-07T11:30:15.509193Z","submitted_at":"2025-06-02T16:30:38Z","title":"On-device Streaming Discrete Speech Units","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:35.730501Z"},"links":{"citing_paper":"/paper/2506.01845"},"observation_digest":"sha256:25fe4173555fefce250871bf171f52c252f09663838a0ea1375857f3da77b284","observation_id":"85d66725-ab20-470e-abfb-8c5fc79aa576","resolution":{"observed_at":"2026-08-07T11:35:42.684788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:35:42.420945Z","title":"Understanding probe be- haviors through variational bounds of mutual information,","venue":null,"work_id":"99db4420-6a5b-4775-b9cc-40b674bdca37","year":2024},"citing_paper":{"arxiv_id":"2506.01845","last_updated":"2025-06-02T16:30:38Z","snapshot_observed_at":"2026-08-07T11:30:15.509193Z","submitted_at":"2025-06-02T16:30:38Z","title":"On-device Streaming Discrete Speech Units","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:35.897040Z"},"links":{"citing_paper":"/paper/2506.01845"},"observation_digest":"sha256:cfb63201861e79e662196fecb9a5c6848f080dd941035286b71e2e8bbef7aa7e","observation_id":"59c1d868-181c-4fe9-88c8-cba105d943c4","resolution":{"observed_at":"2026-08-07T11:35:42.498374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:35:42.225424Z","title":"HuBERT: Self- supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":"f6bce3a2-38ef-4635-b803-a867407239db","year":2021},"citing_paper":{"arxiv_id":"2506.01845","last_updated":"2025-06-02T16:30:38Z","snapshot_observed_at":"2026-08-07T11:30:15.509193Z","submitted_at":"2025-06-02T16:30:38Z","title":"On-device Streaming Discrete Speech Units","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:36.021547Z"},"links":{"citing_paper":"/paper/2506.01845"},"observation_digest":"sha256:dd36c5e60dc0ee53a3f68313d6c1c02b82b3a9de5235c332db4f120ce5cb3eb7","observation_id":"93cfc809-ae91-446a-be94-c1dee10b9a23","resolution":{"observed_at":"2026-08-07T11:35:42.315454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:35:40.598651Z","title":"Streaming automatic speech recog- nition with the transformer model,","venue":null,"work_id":"03de1eaa-faf8-4cc7-a1eb-bc105f59fe0f","year":2020},"citing_paper":{"arxiv_id":"2506.01845","last_updated":"2025-06-02T16:30:38Z","snapshot_observed_at":"2026-08-07T11:30:15.509193Z","submitted_at":"2025-06-02T16:30:38Z","title":"On-device Streaming Discrete Speech Units","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:37.351221Z"},"links":{"citing_paper":"/paper/2506.01845"},"observation_digest":"sha256:2acb9806dacb7e139005c9f07c18eecefae1f4f63cc0cebdeb49cba0246d6756","observation_id":"cad73ed6-e25f-47ee-a5fa-70c4061fbdc0","resolution":{"observed_at":"2026-08-07T11:35:40.673957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:35:41.847881Z","title":"Structured pruning of self- supervised pre-trained models for speech recognition and under- standing,","venue":null,"work_id":"6142bde5-5ab6-48ff-8dd0-4f6198a556ce","year":2023},"citing_paper":{"arxiv_id":"2506.01845","last_updated":"2025-06-02T16:30:38Z","snapshot_observed_at":"2026-08-07T11:30:15.509193Z","submitted_at":"2025-06-02T16:30:38Z","title":"On-device Streaming Discrete Speech Units","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:36.341680Z"},"links":{"citing_paper":"/paper/2506.01845"},"observation_digest":"sha256:c1b0ff7797994f6627ae77c2d40275e801a9b9c9a612303f19db03b57f5ce182","observation_id":"c597c76b-7e9a-4baa-819f-0f44d0b3d551","resolution":{"observed_at":"2026-08-07T11:35:41.942362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:35:41.628656Z","title":"Lib- rispeech: an asr corpus based on public domain audio books,","venue":null,"work_id":"e1745314-7f0c-4a64-a59a-dfc5243528d9","year":2015},"citing_paper":{"arxiv_id":"2506.01845","last_updated":"2025-06-02T16:30:38Z","snapshot_observed_at":"2026-08-07T11:30:15.509193Z","submitted_at":"2025-06-02T16:30:38Z","title":"On-device Streaming Discrete Speech Units","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:36.515042Z"},"links":{"citing_paper":"/paper/2506.01845"},"observation_digest":"sha256:991d04b81656aba0246be6744be3dac7d78ec74a175375b14598eade8a17f400","observation_id":"1c848c50-5e5d-4087-b73b-1cd5c6ed27eb","resolution":{"observed_at":"2026-08-07T11:35:41.728612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:35:45.646290Z","title":"Techniques like pruning [18, 19] and quantization [32] is also used","venue":null,"work_id":"530f6320-e000-435c-8c69-b8afce5c7d96","year":null},"citing_paper":{"arxiv_id":"2506.01845","last_updated":"2025-06-02T16:30:38Z","snapshot_observed_at":"2026-08-07T11:30:15.509193Z","submitted_at":"2025-06-02T16:30:38Z","title":"On-device Streaming Discrete Speech Units","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:34.203012Z"},"links":{"citing_paper":"/paper/2506.01845"},"observation_digest":"sha256:132f77d203bd383fc22c1f70c96a8ec053a5b9395520bd0a4bb7fbe8f114ae5c","observation_id":"f2c8a963-77d6-4eea-a8c2-d15d2b146235","resolution":{"observed_at":"2026-08-07T11:35:45.714856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:35:41.442568Z","title":"ML-SUPERB: Multilin- gual Speech Universal PERformance Benchmark,","venue":null,"work_id":"e12b758d-1707-4c7b-b432-9271526a7cca","year":2023},"citing_paper":{"arxiv_id":"2506.01845","last_updated":"2025-06-02T16:30:38Z","snapshot_observed_at":"2026-08-07T11:30:15.509193Z","submitted_at":"2025-06-02T16:30:38Z","title":"On-device Streaming Discrete Speech Units","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:36.633996Z"},"links":{"citing_paper":"/paper/2506.01845"},"observation_digest":"sha256:61bd8b3d4005813d4f859e82946bc613d11301a33db05f8cb952f4e521cb6794","observation_id":"6836055f-0aac-4321-89eb-00f044bc6033","resolution":{"observed_at":"2026-08-07T11:35:41.521738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:35:41.263414Z","title":"calflops: a FLOPs and params calculate tool for neu- ral networks,","venue":null,"work_id":"89a4b762-d17b-4a8c-b0ff-4c84b6bf01d2","year":2023},"citing_paper":{"arxiv_id":"2506.01845","last_updated":"2025-06-02T16:30:38Z","snapshot_observed_at":"2026-08-07T11:30:15.509193Z","submitted_at":"2025-06-02T16:30:38Z","title":"On-device Streaming Discrete Speech Units","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:36.761029Z"},"links":{"citing_paper":"/paper/2506.01845"},"observation_digest":"sha256:7c02d1d6efde0fa5d09af66bf21956f86a83c344444eec31e6a40dbe8128d6ca","observation_id":"df10f0e3-a7f8-4700-bfb4-17008181fa40","resolution":{"observed_at":"2026-08-07T11:35:41.353450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:35:41.087240Z","title":"E-branchformer: Branchformer with enhanced merging for speech recognition,","venue":null,"work_id":"9dbe7617-0a53-4a0a-8c0b-0482b2433003","year":2022},"citing_paper":{"arxiv_id":"2506.01845","last_updated":"2025-06-02T16:30:38Z","snapshot_observed_at":"2026-08-07T11:30:15.509193Z","submitted_at":"2025-06-02T16:30:38Z","title":"On-device Streaming Discrete Speech Units","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:36.875636Z"},"links":{"citing_paper":"/paper/2506.01845"},"observation_digest":"sha256:6a47e0b2901ace98d0b8e79748002c8f6c5226739b3cb3e08d77e18f02b93026","observation_id":"d5b472c5-242c-40d1-a0e6-e305f3aa9582","resolution":{"observed_at":"2026-08-07T11:35:41.169934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:35:40.944490Z","title":"Attention is all you need,","venue":null,"work_id":"e54e32eb-9b1c-4546-9de3-1ad43c3d95c8","year":2017},"citing_paper":{"arxiv_id":"2506.01845","last_updated":"2025-06-02T16:30:38Z","snapshot_observed_at":"2026-08-07T11:30:15.509193Z","submitted_at":"2025-06-02T16:30:38Z","title":"On-device Streaming Discrete Speech Units","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:36.991123Z"},"links":{"citing_paper":"/paper/2506.01845"},"observation_digest":"sha256:d732813a7575350cd26670a1a8bcb347bf0d32df3c218feccddba6e1ef2a48d6","observation_id":"81c4a3de-5ea5-46e4-90bc-14a2bacc25d9","resolution":{"observed_at":"2026-08-07T11:35:41.018802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:35:37.116265Z","title":"Decoupled weight decay regulariza- tion,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.01845","last_updated":"2025-06-02T16:30:38Z","snapshot_observed_at":"2026-08-07T11:30:15.509193Z","submitted_at":"2025-06-02T16:30:38Z","title":"On-device Streaming Discrete Speech Units","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:37.116265Z"},"links":{"citing_paper":"/paper/2506.01845"},"observation_digest":"sha256:f29d6a5ef2f398e9428e8b01abe638ab7a4d1e63b75f1effdc4517f9750b1102","observation_id":"e2e3b421-4941-4942-99f8-6c13fe1b1fba","resolution":{"observed_at":"2026-08-07T11:35:37.116265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:35:40.767825Z","title":"A time-restricted self- attention layer for asr,","venue":null,"work_id":"65b9e9b1-000f-45a7-be1a-37fd1b00b9e0","year":2018},"citing_paper":{"arxiv_id":"2506.01845","last_updated":"2025-06-02T16:30:38Z","snapshot_observed_at":"2026-08-07T11:30:15.509193Z","submitted_at":"2025-06-02T16:30:38Z","title":"On-device Streaming Discrete Speech Units","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:37.234692Z"},"links":{"citing_paper":"/paper/2506.01845"},"observation_digest":"sha256:d4d92655d8ba9e5a5912ece619d9dec76c0495f326358c898f37245f0ec43e0d","observation_id":"4f22b8d0-8eaf-49b9-a87a-e16a0c9da93e","resolution":{"observed_at":"2026-08-07T11:35:40.841618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:35:40.457773Z","title":"SUPERB: Speech Processing Universal PERformance Benchmark,","venue":null,"work_id":"60f63e16-c6c9-42e7-81a6-7c2b889dd2e2","year":2021},"citing_paper":{"arxiv_id":"2506.01845","last_updated":"2025-06-02T16:30:38Z","snapshot_observed_at":"2026-08-07T11:30:15.509193Z","submitted_at":"2025-06-02T16:30:38Z","title":"On-device Streaming Discrete Speech Units","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:37.446796Z"},"links":{"citing_paper":"/paper/2506.01845"},"observation_digest":"sha256:7a494b84087f05e44988497f8f7188c2cb42d73702f7c6e62d234e80a759efa7","observation_id":"5de08d89-b382-4417-b5a3-8275f762d20c","resolution":{"observed_at":"2026-08-07T11:35:40.519694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:35:40.298737Z","title":"wav2vec-S: Adapting pre-trained speech models for streaming,","venue":null,"work_id":"37237b0c-354d-45eb-86a4-7c8e47b43643","year":2024},"citing_paper":{"arxiv_id":"2506.01845","last_updated":"2025-06-02T16:30:38Z","snapshot_observed_at":"2026-08-07T11:30:15.509193Z","submitted_at":"2025-06-02T16:30:38Z","title":"On-device Streaming Discrete Speech Units","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:37.536603Z"},"links":{"citing_paper":"/paper/2506.01845"},"observation_digest":"sha256:020803f9ff78a997ab12ad62bf8a315266d35f3e047369f9c6509ac0c5adb9d6","observation_id":"4e696492-252e-4194-bdfa-935cdea04107","resolution":{"observed_at":"2026-08-07T11:35:40.362670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:35:40.117686Z","title":"DistilHuBERT: Speech Representation Learning by Layer-wise Distillation of Hidden- unit BERT,","venue":null,"work_id":"b57c1e8c-7d53-443d-8b05-b1b751c122c5","year":2022},"citing_paper":{"arxiv_id":"2506.01845","last_updated":"2025-06-02T16:30:38Z","snapshot_observed_at":"2026-08-07T11:30:15.509193Z","submitted_at":"2025-06-02T16:30:38Z","title":"On-device Streaming Discrete Speech Units","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:37.621595Z"},"links":{"citing_paper":"/paper/2506.01845"},"observation_digest":"sha256:c30944927c29046ea4cb20aebada85afa79e9ab1247586528eae93ff753d36ac","observation_id":"1a26bfc3-6eba-4726-8fad-12891fd93bcf","resolution":{"observed_at":"2026-08-07T11:35:40.230176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:35:39.972766Z","title":"FitHuBERT: Going thinner and deeper for knowledge distillation of speech self-supervised learn- ing,","venue":null,"work_id":"48d12709-2d8f-4dd6-9d3a-09a2e3a4e753","year":2022},"citing_paper":{"arxiv_id":"2506.01845","last_updated":"2025-06-02T16:30:38Z","snapshot_observed_at":"2026-08-07T11:30:15.509193Z","submitted_at":"2025-06-02T16:30:38Z","title":"On-device Streaming Discrete Speech Units","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:37.700430Z"},"links":{"citing_paper":"/paper/2506.01845"},"observation_digest":"sha256:51744cb594fda581072f463ac4cb727d5eab8c65eca9c83b6334a3e335d543fe","observation_id":"aeba3496-4a71-412e-a4af-ef70cab8972a","resolution":{"observed_at":"2026-08-07T11:35:40.040098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:35:39.810650Z","title":"Adaptive compression of supervised and self-supervised models for green speech recognition,","venue":null,"work_id":"6753e995-2f35-404a-b50a-e0985903a2a4","year":2025},"citing_paper":{"arxiv_id":"2506.01845","last_updated":"2025-06-02T16:30:38Z","snapshot_observed_at":"2026-08-07T11:30:15.509193Z","submitted_at":"2025-06-02T16:30:38Z","title":"On-device Streaming Discrete Speech Units","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:37.813703Z"},"links":{"citing_paper":"/paper/2506.01845"},"observation_digest":"sha256:2bdbc6368900a055fe80dafebf8b161df33551384d3c05fce69fa65175254390","observation_id":"3a370e26-a96a-4a7e-858e-ce90a52634d1","resolution":{"observed_at":"2026-08-07T11:35:39.892453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:35:39.681260Z","title":"Soundstream: An end- to-end neural audio codec,","venue":null,"work_id":"c79f87a0-22d3-4036-9fd3-3288e8607aa9","year":2021},"citing_paper":{"arxiv_id":"2506.01845","last_updated":"2025-06-02T16:30:38Z","snapshot_observed_at":"2026-08-07T11:30:15.509193Z","submitted_at":"2025-06-02T16:30:38Z","title":"On-device Streaming Discrete Speech Units","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:37.916027Z"},"links":{"citing_paper":"/paper/2506.01845"},"observation_digest":"sha256:c5072b25014212b4428d8470a010bc1dc8b69c80f90b7b57ca36be555c4fc997","observation_id":"5eceb7eb-0847-4ffc-a6f0-8c450b93715f","resolution":{"observed_at":"2026-08-07T11:35:39.734384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:35:38.031930Z","title":"High fidelity neural audio compression,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01845","last_updated":"2025-06-02T16:30:38Z","snapshot_observed_at":"2026-08-07T11:30:15.509193Z","submitted_at":"2025-06-02T16:30:38Z","title":"On-device Streaming Discrete Speech Units","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:38.031930Z"},"links":{"citing_paper":"/paper/2506.01845"},"observation_digest":"sha256:c7a2b5eb30fe1404e3ccf84121a984fecdbcb5b69e710bba83712f59c1827276","observation_id":"050abf2a-59eb-45ec-82d8-03ace57cc6e9","resolution":{"observed_at":"2026-08-07T11:35:38.031930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:35:39.500673Z","title":"ESPnet-Codec: Comprehensive train- ing and evaluation of neural codecs for audio, music, and speech,","venue":null,"work_id":"7bccb0b3-f345-4c0d-b07b-664b45ec6680","year":2024},"citing_paper":{"arxiv_id":"2506.01845","last_updated":"2025-06-02T16:30:38Z","snapshot_observed_at":"2026-08-07T11:30:15.509193Z","submitted_at":"2025-06-02T16:30:38Z","title":"On-device Streaming Discrete Speech Units","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:38.096955Z"},"links":{"citing_paper":"/paper/2506.01845"},"observation_digest":"sha256:125a3489a8e131fed46a95e18a2cc63419771a1368b5161fa2dced6f25134265","observation_id":"8ea671ed-c414-4979-ac6d-3f853db954b4","resolution":{"observed_at":"2026-08-07T11:35:39.583033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:35:39.356582Z","title":"Neural discrete representa- tion learning,","venue":null,"work_id":"4098c691-2228-4bb7-88d7-8bcad2155f58","year":2017},"citing_paper":{"arxiv_id":"2506.01845","last_updated":"2025-06-02T16:30:38Z","snapshot_observed_at":"2026-08-07T11:30:15.509193Z","submitted_at":"2025-06-02T16:30:38Z","title":"On-device Streaming Discrete Speech Units","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:38.167171Z"},"links":{"citing_paper":"/paper/2506.01845"},"observation_digest":"sha256:8c1cb8dd4368e877725e4def345f22198461e07009416d3780d67f367be108e2","observation_id":"8154b962-78ad-4326-af30-5f2a6dab1602","resolution":{"observed_at":"2026-08-07T11:35:39.421530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:35:39.186249Z","title":"Distilling hubert with lstms via decoupled knowledge distillation,","venue":null,"work_id":"583929d1-41f0-4379-88e6-008f365e4f84","year":2024},"citing_paper":{"arxiv_id":"2506.01845","last_updated":"2025-06-02T16:30:38Z","snapshot_observed_at":"2026-08-07T11:30:15.509193Z","submitted_at":"2025-06-02T16:30:38Z","title":"On-device Streaming Discrete Speech Units","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:38.285199Z"},"links":{"citing_paper":"/paper/2506.01845"},"observation_digest":"sha256:a3c31e460ef9144339340c89794e4fdca4d8487cb69a1ca30a3788e4b00be57d","observation_id":"6eaa95f1-0deb-4bcf-a909-f9a53f1c2f9b","resolution":{"observed_at":"2026-08-07T11:35:39.265094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:35:39.038873Z","title":"Knowledge distillation from self- supervised representation learning model with discrete speech units for any-to-any streaming voice conversion,","venue":null,"work_id":"64486c8a-2ee7-4e0d-b23b-7416e1938b5b","year":2024},"citing_paper":{"arxiv_id":"2506.01845","last_updated":"2025-06-02T16:30:38Z","snapshot_observed_at":"2026-08-07T11:30:15.509193Z","submitted_at":"2025-06-02T16:30:38Z","title":"On-device Streaming Discrete Speech Units","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:38.379141Z"},"links":{"citing_paper":"/paper/2506.01845"},"observation_digest":"sha256:3a7fdd2bbc893a918387b155ff7197d9667bb0ae1b02ac3b6418235de11996d5","observation_id":"70bdf51d-a647-4d23-a17d-dd84c784539e","resolution":{"observed_at":"2026-08-07T11:35:39.098412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:35:38.902758Z","title":"Speechtokenizer: Unified speech tokenizer for speech language models,","venue":null,"work_id":"48ed7976-11f7-479b-bd7b-7fd6a5280b46","year":2024},"citing_paper":{"arxiv_id":"2506.01845","last_updated":"2025-06-02T16:30:38Z","snapshot_observed_at":"2026-08-07T11:30:15.509193Z","submitted_at":"2025-06-02T16:30:38Z","title":"On-device Streaming Discrete Speech Units","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:38.448545Z"},"links":{"citing_paper":"/paper/2506.01845"},"observation_digest":"sha256:103556a494c813e1bc554a992b3bb366c01389399679bac6771defead35d9cc3","observation_id":"d1f994b4-9f6f-420d-be44-2b1665970710","resolution":{"observed_at":"2026-08-07T11:35:38.958854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-07T11:35:38.525748Z","title":"Moshi: a speech- text foundation model for real-time dialogue,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01845","last_updated":"2025-06-02T16:30:38Z","snapshot_observed_at":"2026-08-07T11:30:15.509193Z","submitted_at":"2025-06-02T16:30:38Z","title":"On-device Streaming Discrete Speech Units","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:38.525748Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2506.01845"},"observation_digest":"sha256:e6ca81383ed03a02eb7c35a1f0e5f1e8ee1fb9cee751f5123aaef590d850088d","observation_id":"de6e815b-53b2-4c54-8b57-1be42abe5d1f","resolution":{"observed_at":"2026-08-07T11:35:38.525748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:35:38.775594Z","title":"We denote various attention window configurations as the number of left, center, and right frames, i.e., [l, c = 1 , r]","venue":null,"work_id":"cfcbbad1-0e3c-474e-bbd0-2003cbabb3e6","year":null},"citing_paper":{"arxiv_id":"2506.01845","last_updated":"2025-06-02T16:30:38Z","snapshot_observed_at":"2026-08-07T11:30:15.509193Z","submitted_at":"2025-06-02T16:30:38Z","title":"On-device Streaming Discrete Speech Units","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T11:35:38.605780Z"},"links":{"citing_paper":"/paper/2506.01845"},"observation_digest":"sha256:0d394887f2b7dcdc27a21fe3e2de4100473509f4768ac431af0768329b2f07da","observation_id":"82907e2b-c766-4208-846a-79b7f705f2a1","resolution":{"observed_at":"2026-08-07T11:35:38.820837Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.01845","last_updated":"2025-06-02T16:30:38Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-07T11:30:15.509193Z","submitted_at":"2025-06-02T16:30:38Z","title":"On-device Streaming Discrete Speech Units"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":0,"verified_fuzzy":43},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 2 inbound Pith citation observations for arXiv:2506.01845."}