{"as_of":"2026-08-08T16:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3aef603e5b40727a03e258f6d713d86077a970d435ed66bb0ed20f1363a7da67","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:36:46.248344Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:36:41.638006Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T12:48:12.260808Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-07T18:35:24.185731Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14470","snapshot_observed_at":"2026-08-07T15:36:41.638006Z","title":"Acoustic tokenizersaim to compress speech into discrete rep- arXiv:2505.14470v2 [cs.SD] 4 Jun 2025 resentations optimized for high-fidelity reconstruction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-07T18:35:24.185731Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:41.638006Z"},"links":{"cited_paper":"/paper/2505.14470","citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:99cc89b85649a50ee82425ca5f2405c87142820f713c644e170b929ca3df7d51","observation_id":"fd002efa-0613-4dbf-80fe-94327ad589b8","resolution":{"observed_at":"2026-08-07T15:36:41.638006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-07T18:35:24.185731Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"cited_work":{"arxiv_id":"2505.14470","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14470","snapshot_observed_at":"2026-07-03T12:48:12.260808Z","title":"Past: Phonetic-acoustic speech tok- enizer,","venue":null,"work_id":"00d843a2-7aa4-4bef-9143-d17e145d8739","year":2025},"citing_paper":{"arxiv_id":"2606.11631","last_updated":"2026-06-10T03:49:54Z","snapshot_observed_at":"2026-08-02T17:57:49.398213Z","submitted_at":"2026-06-10T03:49:54Z","title":"Benchmarking Neural Speech Compression from a Rate-Distortion Perspective","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-06-27T08:43:35.279033Z"},"links":{"cited_paper":"/paper/2505.14470","citing_paper":"/paper/2606.11631"},"observation_digest":"sha256:83bb6ac00a337b5cd0406ae0f0afb0352fd2c5b74cd56f4066fe0231ab2f8028","observation_id":"af391476-d310-4819-81f2-fea65bdf6141","resolution":{"observed_at":"2026-07-03T12:48:12.262338Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.14470/citation-record","integrity":"/paper/2505.14470/integrity","json":"/paper/2505.14470/citation-record.json","paper":"/paper/2505.14470"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:52.328683Z","title":"These models usually operate over acoustic tokens or phonetic speech tokens (also known as semantic tokens)","venue":null,"work_id":"bfc4a6ea-7fc1-45b8-8046-69013f6b4308","year":null},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-07T18:35:24.185731Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:41.113789Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:96e3165987f7b422698654677627c1b3f6bfce01f2ab992949933f520e583106","observation_id":"6d1d0618-b4ee-44a9-8e73-da79dbbe5c50","resolution":{"observed_at":"2026-08-07T15:36:52.440433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:52.060167Z","title":null,"venue":null,"work_id":"15c129df-09c3-46b5-85c8-d8577039d8e8","year":null},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-07T18:35:24.185731Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:41.232581Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:8fe56bfcfb1f2d84d421ed7b693f4c3aec9a2d5e10e95e69c937cf31f8c58960","observation_id":"24be95c4-b49a-460b-b670-fa9d1c2ba676","resolution":{"observed_at":"2026-08-07T15:36:52.213664Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:51.775149Z","title":null,"venue":null,"work_id":"76ec1a31-5c2d-4d1a-851d-8facdaed5f97","year":null},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-07T18:35:24.185731Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:41.364786Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:99f9396046a36111d144e34010770a3fe3dfadbddbc8a170251bd3f16fa552a4","observation_id":"8e225647-b7d9-4597-9a81-c995d783fc67","resolution":{"observed_at":"2026-08-07T15:36:51.919616Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:51.456015Z","title":null,"venue":null,"work_id":"dd19b632-6306-4902-bd90-c80f92432de0","year":null},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-07T18:35:24.185731Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:41.471072Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:96d1583d735d16147342a44c069606983ad110e2d2f3da6a900c11a5633435bd","observation_id":"2073e341-ac4e-420d-a8c5-69758a47bf76","resolution":{"observed_at":"2026-08-07T15:36:51.608579Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:51.156818Z","title":null,"venue":null,"work_id":"2076bd99-c992-4e17-99d0-8e5d6c518bcb","year":null},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-07T18:35:24.185731Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:41.550800Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:c87e35964b975b05ee0f77beacd265be7671951a6dd6506ef28f5d46f82cd746","observation_id":"3bd6c800-6965-417d-a7ae-ccea8cbdb256","resolution":{"observed_at":"2026-08-07T15:36:51.301505Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-07T18:35:24.185731Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14470","snapshot_observed_at":"2026-08-07T15:36:41.638006Z","title":"Acoustic tokenizersaim to compress speech into discrete rep- arXiv:2505.14470v2 [cs.SD] 4 Jun 2025 resentations optimized for high-fidelity reconstruction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-07T18:35:24.185731Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:41.638006Z"},"links":{"cited_paper":"/paper/2505.14470","citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:99cc89b85649a50ee82425ca5f2405c87142820f713c644e170b929ca3df7d51","observation_id":"fd002efa-0613-4dbf-80fe-94327ad589b8","resolution":{"observed_at":"2026-08-07T15:36:41.638006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:50.883903Z","title":"Problem Setup Our model is composed of three main components: Encoder, Quantizer, and Decoder","venue":null,"work_id":"7ef7240b-f8dd-49e4-b86d-8b071f9438e3","year":null},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-07T18:35:24.185731Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:41.730614Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:4e32590be638e1ff15ca37b53bd593241ac52329f3f12393d3fe0755db08f19a","observation_id":"5a9ed943-e7c3-4768-ad3c-9a6b1bb4955c","resolution":{"observed_at":"2026-08-07T15:36:51.009788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:43.064970Z","title":"Soundstream: An end-to-end neural audio codec,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-07T18:35:24.185731Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:43.064970Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:ee6f8e65b09b2d1cb4f133eeaf6f8faad7dc10a058ab2e3bc7e35c3427cae27a","observation_id":"51300dc2-8046-4718-b918-da187b26b91a","resolution":{"observed_at":"2026-08-07T15:36:43.064970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:50.475244Z","title":"Data We use all training subsets of LibriSpeech [29] and TIMIT [30] for our training set, yielding a total of965hours of raw audio","venue":null,"work_id":"4ca59370-68d3-4901-bab6-3cdc047eff13","year":null},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-07T18:35:24.185731Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:41.861572Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:fea38bc15ddfa79f032fcb509bcff8be8dc45043ff206b544db7995a5af5a4a7","observation_id":"92fd0231-a65c-4b49-8483-1dddd9a223bd","resolution":{"observed_at":"2026-08-07T15:36:50.579406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:50.295740Z","title":"Baseline Comparison We compare PAST with two baseline hybrid models, Speech- Tokenizer and X-Codec, on both reconstruction and phonetic information metrics","venue":null,"work_id":"329e2af4-903d-448a-b31e-fbba599635f0","year":null},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-07T18:35:24.185731Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:41.954031Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:d18f6b9faabaa1a8a86caa5f6c8fbbe0a71f914bee9ff227c95c4749663783ea","observation_id":"a4d1ca86-875f-44c2-b182-6aeb909450aa","resolution":{"observed_at":"2026-08-07T15:36:50.396232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:50.134538Z","title":null,"venue":null,"work_id":"b310425e-8bd0-4ebd-a996-8903fcafe284","year":null},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-07T18:35:24.185731Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:42.029656Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:fcf5aa8f161b1db801ee45d87c28268c86367f2a797f7d6267085c2b421f881f","observation_id":"6e8e1277-a058-4f74-b933-60c5cf533c7b","resolution":{"observed_at":"2026-08-07T15:36:50.215266Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:49.990963Z","title":"Generative spoken language model based on continuous word-sized audio tokens,","venue":null,"work_id":"0755805a-b3b0-4eef-ae5a-670b6dd77266","year":2023},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-07T18:35:24.185731Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:42.157713Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:23e85fc62b85ddcd572ab5b60e00bb0c90be3027e8f25fa87a0a352edb8c3f10","observation_id":"c69020ab-9cb6-4e28-ae47-4ad8073d2623","resolution":{"observed_at":"2026-08-07T15:36:50.067667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:49.840360Z","title":"Textless acoustic model with self-supervised distillation for noise-robust expressive speech-to-speech transla- tion,","venue":null,"work_id":"bbad9a97-5168-4fb4-9bef-1aaf5ac6840b","year":2024},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-07T18:35:24.185731Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:42.293050Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:faefd17d016667821b5c1839e80fec689649fc31966b9579de1c3aa142b44b11","observation_id":"91225a23-a38d-4679-a578-fe8950aea761","resolution":{"observed_at":"2026-08-07T15:36:49.907843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:49.681640Z","title":"Audiolm: a language modeling approach to au- dio generation,","venue":null,"work_id":"f26db381-3eab-474a-91cd-3da6a1437b29","year":2023},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-07T18:35:24.185731Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:42.467128Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:cf3631e3c110fbc7a708fe5a84de8bdb4b23ec2a77543a02c8d88300fd2b79ad","observation_id":"2b67d8cf-cf05-4e28-820a-7ef18474dfc2","resolution":{"observed_at":"2026-08-07T15:36:49.760241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:49.501681Z","title":"Text-free prosody-aware generative spoken language modeling,","venue":null,"work_id":"c571e26f-0265-4dd6-a7d4-601586eae1bb","year":2022},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-07T18:35:24.185731Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:42.590165Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:901e0e2430cbf7716ae7c19832598bf03a0fe74687d8439e34f9884ca72c377f","observation_id":"c14e6a54-8a6b-4e38-ac5d-5e1881a85c0b","resolution":{"observed_at":"2026-08-07T15:36:49.588890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:49.355527Z","title":"On generative spoken language modeling from raw audio,","venue":null,"work_id":"6b5323bd-b380-405e-b9b8-922b1f6c48ec","year":2021},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-07T18:35:24.185731Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:42.723486Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:b51a3a8e18befaad3c966817a6e3288c4f0c731f084b7fbfed681422d8d5f0db","observation_id":"9ae9b94b-4759-4cd1-bf42-0a0da3dece75","resolution":{"observed_at":"2026-08-07T15:36:49.409764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:49.218729Z","title":"Textually pretrained speech language mod- els,","venue":null,"work_id":"320bf366-db21-4f76-86a6-a46ebaae7189","year":2024},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-07T18:35:24.185731Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:42.863861Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:4fb2dd81a631ac4f190855a0ec8012408a682405ecc9ba46e58eff640ee4d0a7","observation_id":"c37f05e4-a93e-4275-bdd8-d56991b118f6","resolution":{"observed_at":"2026-08-07T15:36:49.263010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-03T16:47:47.192907Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-07T15:36:42.972992Z","title":"High fidelity neural audio compression,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-07T18:35:24.185731Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:42.972992Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:216b61f4b7ee7cd1163c2e752b831e49de17086af7908f259074e45a90d5cb98","observation_id":"093fc44b-671b-450c-b501-926022514b33","resolution":{"observed_at":"2026-08-07T15:36:42.972992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:48.109115Z","title":"Pyramidcodec: Hierarchical codec for long-form music generation in audio domain,","venue":null,"work_id":"f4a65b55-fe6e-4ad4-a210-f2d5fdf7e446","year":2024},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-07T18:35:24.185731Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:44.394744Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:7f5e74016698de68cc81b936d6db6ecc7135cbdeb54a49a5a5930d23838305f8","observation_id":"9ad809f5-5aec-45ed-9b29-cc3bc56237f8","resolution":{"observed_at":"2026-08-07T15:36:48.210900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:43.217290Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech repre- sentations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-07T18:35:24.185731Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:43.217290Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:6e798312fe3008340ceb177efd5b0369f6cfa0e51ca54388608552f7af1f66c8","observation_id":"41a88ea8-e634-44c9-a273-a8d22177ed8b","resolution":{"observed_at":"2026-08-07T15:36:43.217290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:43.335300Z","title":"Hubert: Self-supervised speech represen- tation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-07T18:35:24.185731Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:43.335300Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:104b581ab994a2f5534e50989ce28dc55de28f09ba4f9bad8212d20581af2563","observation_id":"c6552382-832e-4c72-bdb3-c74f93108585","resolution":{"observed_at":"2026-08-07T15:36:43.335300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:49.085317Z","title":"Analysing discrete self supervised speech representation for spoken language modeling,","venue":null,"work_id":"bed79abf-9161-4067-8d1d-4d633ea08801","year":2023},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-07T18:35:24.185731Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:43.431637Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:2c160d2b4e48051720016100ae04767531499156c7c4ee2e7b55afa27ca95314","observation_id":"f4541b15-f6fc-48f2-a527-dd324dc16ca4","resolution":{"observed_at":"2026-08-07T15:36:49.132860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:43.497780Z","title":"Hifi-gan: Generative adversarial net- works for efficient and high fidelity speech synthesis,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-07T18:35:24.185731Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:43.497780Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:98e53db3494ffc568a2684f2ad27e4e0207562bf9387e8b41b9c9f0ee8f536c8","observation_id":"fce9e7a6-b01d-4b23-badc-691f7bf72840","resolution":{"observed_at":"2026-08-07T15:36:43.497780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:43.576586Z","title":"Speechtok- enizer: Unified speech tokenizer for speech language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-07T18:35:24.185731Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:43.576586Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:5e2604e9ec846f978ea8f08d7bb74efd047b335323c5c719a1033837528a0585","observation_id":"5ea204e1-eb42-41a0-a676-61cebaea42d3","resolution":{"observed_at":"2026-08-07T15:36:43.576586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.17175","last_updated":"2024-11-27T11:47:45Z","snapshot_observed_at":"2026-07-06T19:08:09.037019Z","submitted_at":"2024-08-30T10:24:07Z","title":"Codec Does Matter: Exploring the Semantic Shortcoming of Codec for Audio Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.17175","snapshot_observed_at":"2026-08-07T15:36:43.700479Z","title":"Codec does matter: Exploring the semantic short- coming of codec for audio language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-07T18:35:24.185731Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:43.700479Z"},"links":{"cited_paper":"/paper/2408.17175","citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:bdb41490f63846e85cb44892b8e8a317c0e105df6065a3444cf3951cb61ba9cd","observation_id":"65286334-7429-4af7-a48b-ad9146096970","resolution":{"observed_at":"2026-08-07T15:36:43.700479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:48.842562Z","title":"Moshi: a speech-text foundation model for real-time dialogue,","venue":null,"work_id":"bcebe38b-8b9a-4686-82c8-363dc36ca984","year":2024},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-07T18:35:24.185731Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:43.818074Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:fb88dc92d211c2c318b333e05b9ada20e231230f2a0ae7b966ac6d78a6123b85","observation_id":"bbf55102-cca8-4a26-b575-518bf7a68b9d","resolution":{"observed_at":"2026-08-07T15:36:48.972558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:48.558039Z","title":"Wavlm: Large-scale self-supervised pre-training for full stack speech processing,","venue":null,"work_id":"185ca240-4e8f-4156-ba47-c43181dcad2d","year":2022},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-07T18:35:24.185731Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:43.938820Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:06bb93eeafcd728d61a353b7d3cd9984a4b1d4d88df1e841d58831eba69e0663","observation_id":"356517eb-c842-450f-85a4-0c0e666dcdab","resolution":{"observed_at":"2026-08-07T15:36:48.715687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:50.700978Z","title":null,"venue":null,"work_id":"c4eb7c19-831c-4a48-8663-49565483a01c","year":null},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-07T18:35:24.185731Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:41.796360Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:495c7467d46452fa6e02654a8176251467920ecfec3601ee1d8c4306073467d8","observation_id":"467667de-8c01-4e10-ac1f-b910263e95df","resolution":{"observed_at":"2026-08-07T15:36:50.782575Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02765","last_updated":"2023-05-07T09:22:04Z","snapshot_observed_at":"2026-08-06T10:45:04.364170Z","submitted_at":"2023-05-04T12:11:13Z","title":"HiFi-Codec: Group-residual Vector quantization for High Fidelity Audio Codec","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02765","snapshot_observed_at":"2026-08-07T15:36:44.119792Z","title":"Hifi- codec: Group-residual vector quantization for high fidelity audio codec,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-07T18:35:24.185731Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:44.119792Z"},"links":{"cited_paper":"/paper/2305.02765","citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:e4aab43ff2b3855d8e4ded538dc2fe5b79350e647a1751de6863f63bfdb4c38b","observation_id":"ae2a569d-ba4b-42a9-a956-bcf254094187","resolution":{"observed_at":"2026-08-07T15:36:44.119792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:48.321218Z","title":"High fidelity neural audio compression,","venue":null,"work_id":"19dabeb3-184e-4abd-9378-8c7be6d3d08e","year":2023},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-07T18:35:24.185731Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:44.241497Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:78f9081daa9acf734b5df98a2cd0072f48ae81e5ee7ddd91f923b2100750fb28","observation_id":"a7c73625-ae79-45d1-9199-36b2bc83944a","resolution":{"observed_at":"2026-08-07T15:36:48.445553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:47.869318Z","title":"Audiodec: An open-source streaming high- fidelity neural audio codec,","venue":null,"work_id":"a1e3b363-1bdb-4e37-8dcd-3936c287b1ae","year":2023},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-07T18:35:24.185731Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:44.527302Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:d1714bc860f17cd23675ac6657cc4e64d155835cb5326627e70db6599672f019","observation_id":"722f6378-a58a-4deb-81f4-32f4f5f10418","resolution":{"observed_at":"2026-08-07T15:36:47.971760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:44.656266Z","title":"Funcodec: A funda- mental, reproducible and integrable open-source toolkit for neural speech codec,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-07T18:35:24.185731Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:44.656266Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:261cea34f102597b0e0882ec4fdc54b2d6325d865dad7710320e7400e9b4aa95","observation_id":"3945ee03-0863-472a-9fb8-29c097240400","resolution":{"observed_at":"2026-08-07T15:36:44.656266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:47.571083Z","title":"Wavtokenizer: an efficient acoustic discrete codec tokenizer for audio language modeling,","venue":null,"work_id":"40466bd8-38fa-4e3b-a78c-273c45c02328","year":2024},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-07T18:35:24.185731Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:44.766303Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:61a1a088fca801648afbbd07a9873d9570983e3b82dab0c496e3ca9721e90d46","observation_id":"5e8865d9-12f2-4ef8-872f-9f91f8d12791","resolution":{"observed_at":"2026-08-07T15:36:47.689975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17607","last_updated":"2024-12-02T16:13:24Z","snapshot_observed_at":"2026-08-07T11:31:39.220259Z","submitted_at":"2024-11-26T17:19:09Z","title":"Scaling Speech-Text Pre-training with Synthetic Interleaved Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17607","snapshot_observed_at":"2026-08-07T15:36:44.886879Z","title":"Scaling speech-text pre-training with synthetic interleaved data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-07T18:35:24.185731Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:44.886879Z"},"links":{"cited_paper":"/paper/2411.17607","citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:68b218063a636566be64dd9be86e326dc32660c9b914ba945b8f6fa80d76a179","observation_id":"35126764-2f60-4e9d-8e58-84d1b7e60eeb","resolution":{"observed_at":"2026-08-07T15:36:44.886879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:44.992730Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-07T18:35:24.185731Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:44.992730Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:e246415ea6aa25558267231d7f78566c0902db7990f546aceb30377d2df0e160","observation_id":"5a62e195-0f55-469f-a96c-04642d3a81fe","resolution":{"observed_at":"2026-08-07T15:36:44.992730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03701","last_updated":"2024-09-10T14:45:15Z","snapshot_observed_at":"2026-07-06T19:11:09.921186Z","submitted_at":"2024-09-05T16:57:39Z","title":"LAST: Language Model Aware Speech Tokenization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03701","snapshot_observed_at":"2026-08-07T15:36:45.112795Z","title":"Last: Language model aware speech tokenization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-07T18:35:24.185731Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:45.112795Z"},"links":{"cited_paper":"/paper/2409.03701","citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:1d8069ef43e6bb54e74b2009cee89baa08871052be36ca11214a67375c4ae444","observation_id":"9b62e96f-ebfd-4928-8e66-23090e9c5428","resolution":{"observed_at":"2026-08-07T15:36:45.112795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11037","last_updated":"2024-06-16T18:20:45Z","snapshot_observed_at":"2026-07-06T18:31:49.437336Z","submitted_at":"2024-06-16T18:20:45Z","title":"NAST: Noise Aware Speech Tokenization for Speech Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11037","snapshot_observed_at":"2026-08-07T15:36:45.240767Z","title":"Nast: Noise aware speech tokenization for speech language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-07T18:35:24.185731Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:45.240767Z"},"links":{"cited_paper":"/paper/2406.11037","citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:75b31b051119f5ef0707de9fb4279062fca7cc89d37ff4d4de0fdd41df1e7333","observation_id":"2f90e1a3-4ff1-4f91-9f46-27076370343f","resolution":{"observed_at":"2026-08-07T15:36:45.240767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:47.282454Z","title":"A systematic compar- ison of phonetic aware techniques for speech enhancement,","venue":null,"work_id":"4b30463e-742e-433c-aace-aebf8f326c64","year":2022},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-07T18:35:24.185731Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:45.347084Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:591a3e807d1159a4e3ce746076f3c613c1b3c87c9ccf5e6209764a451d61cd65","observation_id":"9620259b-327c-4042-8f3c-652536fdf4b1","resolution":{"observed_at":"2026-08-07T15:36:47.409472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:45.445023Z","title":"Con- nectionist temporal classification: labelling unsegmented se- quence data with recurrent neural networks,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-07T18:35:24.185731Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:45.445023Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:799a6dd4a381f675cebbc70defdf5a40d453ced5a92c69033329d73fec106341","observation_id":"cc04afe2-3599-4af3-8073-c2bfb689ab90","resolution":{"observed_at":"2026-08-07T15:36:45.445023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:45.562599Z","title":"Lib- rispeech: An asr corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-07T18:35:24.185731Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:45.562599Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:134e69aca2e20e10d994cc5b87faa98415a4b176fa6c85494e0eb6cf60946598","observation_id":"ef3f6159-93f0-405c-8250-5d7ade4b97f2","resolution":{"observed_at":"2026-08-07T15:36:45.562599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:47.058369Z","title":"Timit acoustic-phonetic continuous speech corpus,","venue":null,"work_id":"ffc2fc19-7b35-4319-a8b0-94275bbd7aae","year":1992},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-07T18:35:24.185731Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:45.656172Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:8fbc6dfffe814146c516f40e64ca4087fb684e4447443beaa4e9d8c488ea6774","observation_id":"839a24ed-933d-4929-8277-66023614f503","resolution":{"observed_at":"2026-08-07T15:36:47.162559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:45.725481Z","title":"Visqol v3: An open source production ready objec- tive speech and audio metric,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-07T18:35:24.185731Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:45.725481Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:dbf74e040669c5483325487cbed7b5de9e36809ab896d7cc3b6b08883471590c","observation_id":"154029ea-b6bf-4d81-9854-c7ae7695950e","resolution":{"observed_at":"2026-08-07T15:36:45.725481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:45.788652Z","title":"Perceptual eval- uation of speech quality (pesq)-a new method for speech quality assessment of telephone networks and codecs,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-07T18:35:24.185731Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:45.788652Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:7f5e1c43df4edac3b16a34b1d632dc22d0a30dd55bc394385fed3999c629c8f3","observation_id":"bb65a8c7-94e0-44ae-9425-442ed6a4016d","resolution":{"observed_at":"2026-08-07T15:36:45.788652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:46.745347Z","title":"Evaluating speech features with the minimal- pair abx task: analysis of the classical mfc/plp pipeline,","venue":null,"work_id":"88b36fe3-1d8c-41be-8476-84978ee1860e","year":2013},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-07T18:35:24.185731Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:45.874985Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:0022de635f33555da09ef52dba53fbf7b44d34993d3c81028fb32968aefddd09","observation_id":"01192191-8782-4dca-8efc-a5b90cce4364","resolution":{"observed_at":"2026-08-07T15:36:46.884652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14294","snapshot_observed_at":"2026-08-07T15:36:45.931571Z","title":"Dasb - discrete audio and speech benchmark,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-07T18:35:24.185731Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:45.931571Z"},"links":{"cited_paper":"/paper/2406.14294","citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:ff93d808359cfefd6453bb4eef8c4e04e75f7c43cacffafae2c7656c12c8cc6d","observation_id":"1be950b0-83c3-403c-b17f-6ace2183e66e","resolution":{"observed_at":"2026-08-07T15:36:45.931571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-07T16:54:38.689558Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-07T15:36:46.052253Z","title":"Audiogen: Textually guided audio generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-07T18:35:24.185731Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:46.052253Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:c25c770fd9b65168769e4d3e1a996bb35f3d4f24114f29650700a25f9e78f1e9","observation_id":"7a95b9ff-de8a-497d-8d58-def212839c4e","resolution":{"observed_at":"2026-08-07T15:36:46.052253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:46.546835Z","title":"Simple and controllable music gen- eration,","venue":null,"work_id":"efe0b8b7-6296-42f7-a66b-590ff9a78424","year":2024},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-07T18:35:24.185731Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:46.148093Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:a1b2da5b02830baa9e233dfbe64e73c93af538f7797a00726e0088350fef7a0e","observation_id":"1909cf34-ad72-475b-b8b3-427cf0d212b2","resolution":{"observed_at":"2026-08-07T15:36:46.626989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:46.456636Z","title":"The zero resource speech benchmark 2021: Metrics and baselines for unsupervised spoken language model- ing,","venue":null,"work_id":"ef4a0871-fb18-46d1-91ff-748e0ec751e2","year":2021},"citing_paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","snapshot_observed_at":"2026-08-07T18:35:24.185731Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:46.248344Z"},"links":{"citing_paper":"/paper/2505.14470"},"observation_digest":"sha256:ae59eaef2eac7d75a5b4611c022dded7794455fabb5a6dfc66bb38bdea34d74c","observation_id":"f5e42fd6-873a-4829-94b9-d8e497fbe07f","resolution":{"observed_at":"2026-08-07T15:36:46.529710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.14470","last_updated":"2025-06-04T08:23:18Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T18:35:24.185731Z","submitted_at":"2025-05-20T15:05:14Z","title":"PAST: Phonetic-Acoustic Speech Tokenizer"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":0,"verified_fuzzy":22},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 2 inbound Pith citation observations for arXiv:2505.14470."}