{"as_of":"2026-08-08T21:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4d9cdbbac8afe10552fd9ca3af5ec50767aa646b6ced73f68a4065fb199b7ef7","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:43:07.274864Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T10:13:57.724078Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.17076","last_updated":"2025-06-13T17:21:25Z","snapshot_observed_at":"2026-08-07T23:08:52.484966Z","submitted_at":"2025-05-20T06:01:19Z","title":"Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17076","snapshot_observed_at":"2026-08-03T10:13:57.724078Z","title":"arXiv preprint arXiv:2505.17076 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29279","last_updated":"2026-07-31T10:50:14Z","snapshot_observed_at":"2026-08-06T04:02:53.771607Z","submitted_at":"2026-07-31T10:50:14Z","title":"ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:57.724078Z"},"links":{"cited_paper":"/paper/2505.17076","citing_paper":"/paper/2607.29279"},"observation_digest":"sha256:a1634ab720bacfa8eb74602b62f921dfbc8a0be1cf51921c3387e29afa34ffb0","observation_id":"d6e5ce31-033b-4fde-86cd-ac72e05ad0a5","resolution":{"observed_at":"2026-08-03T10:13:57.724078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.17076/citation-record","integrity":"/paper/2505.17076/integrity","json":"/paper/2505.17076/citation-record.json","paper":"/paper/2505.17076"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-07T15:43:04.468219Z","title":"Neural codec language models are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17076","last_updated":"2025-06-13T17:21:25Z","snapshot_observed_at":"2026-08-07T23:08:52.484966Z","submitted_at":"2025-05-20T06:01:19Z","title":"Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:04.468219Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2505.17076"},"observation_digest":"sha256:96d23b2fb34fb76c745a843667fc0b8bdf0c46e4ce06909bdddd8dcc81aa97c2","observation_id":"21a846d2-cdd2-4376-9909-a4cf5715e0bd","resolution":{"observed_at":"2026-08-07T15:43:04.468219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-07-06T18:42:34.958119Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-07T15:43:04.525438Z","title":"CosyV oice: A Scalable Multilingual Zero-shot Text- to-speech Synthesizer based on Supervised Semantic Tokens,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17076","last_updated":"2025-06-13T17:21:25Z","snapshot_observed_at":"2026-08-07T23:08:52.484966Z","submitted_at":"2025-05-20T06:01:19Z","title":"Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:04.525438Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2505.17076"},"observation_digest":"sha256:a74ddee86b66619153b8d32e059b000da2bb89d3e6fbb8a0cbf6ed83c2f6129f","observation_id":"98c1dfae-e363-4fb1-98d3-790361e9d7d3","resolution":{"observed_at":"2026-08-07T15:43:04.525438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-07T15:43:04.596328Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Pretraining,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17076","last_updated":"2025-06-13T17:21:25Z","snapshot_observed_at":"2026-08-07T23:08:52.484966Z","submitted_at":"2025-05-20T06:01:19Z","title":"Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:04.596328Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2505.17076"},"observation_digest":"sha256:e01fce68dfababc2a63d4b65b943754b2a398354ed8da6a171da055b682fda46","observation_id":"79864f0f-c893-49f5-802e-3d94cdd45593","resolution":{"observed_at":"2026-08-07T15:43:04.596328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-07T15:43:04.765618Z","title":"Moshi: a speech-text foundation model for real-time dialogue,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17076","last_updated":"2025-06-13T17:21:25Z","snapshot_observed_at":"2026-08-07T23:08:52.484966Z","submitted_at":"2025-05-20T06:01:19Z","title":"Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:04.765618Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2505.17076"},"observation_digest":"sha256:84e4bfe50ee0fce71ed46dc8611f989f3fa26b4f4da7e4478d0a8a967e1821e3","observation_id":"d402c68d-3c50-4cf1-a39d-17d51ce622ae","resolution":{"observed_at":"2026-08-07T15:43:04.765618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12608","last_updated":"2024-12-17T06:55:00Z","snapshot_observed_at":"2026-08-03T20:23:50.626793Z","submitted_at":"2024-10-16T14:24:55Z","title":"Not All Votes Count! Programs as Verifiers Improve Self-Consistency of Language Models for Math Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12608","snapshot_observed_at":"2026-08-07T15:43:04.876754Z","title":"GLM-4-V oice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17076","last_updated":"2025-06-13T17:21:25Z","snapshot_observed_at":"2026-08-07T23:08:52.484966Z","submitted_at":"2025-05-20T06:01:19Z","title":"Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:04.876754Z"},"links":{"cited_paper":"/paper/2410.12608","citing_paper":"/paper/2505.17076"},"observation_digest":"sha256:0feb0469b8d1d73ea9d08a981a85035badf38b9c478d94ec5c1ab39cd97a154a","observation_id":"c9344925-fe3d-47f6-9de6-681c54e09ec3","resolution":{"observed_at":"2026-08-07T15:43:04.876754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2501.03046","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:07.951371Z","title":"GenSE: A Series of Audio Generation Models,","venue":null,"work_id":"39b1185c-c10f-488f-ba92-35e29b4a1679","year":2025},"citing_paper":{"arxiv_id":"2505.17076","last_updated":"2025-06-13T17:21:25Z","snapshot_observed_at":"2026-08-07T23:08:52.484966Z","submitted_at":"2025-05-20T06:01:19Z","title":"Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:04.967838Z"},"links":{"citing_paper":"/paper/2505.17076"},"observation_digest":"sha256:4821f8334976af247c502132bcf4db5a865e4b6d22c3b05713d967a60d9db934","observation_id":"140e13e9-533c-4fda-9fae-710e5bec802b","resolution":{"observed_at":"2026-08-07T15:43:08.046518Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-07T15:43:05.080883Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17076","last_updated":"2025-06-13T17:21:25Z","snapshot_observed_at":"2026-08-07T23:08:52.484966Z","submitted_at":"2025-05-20T06:01:19Z","title":"Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:05.080883Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2505.17076"},"observation_digest":"sha256:c88d153c5fe1e6fa5816969673186a85315681ca7ec14092f88df830427271f2","observation_id":"44c14ae2-aab0-4e07-b60d-3d12d1b66ed7","resolution":{"observed_at":"2026-08-07T15:43:05.080883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16692","last_updated":"2024-01-23T01:56:57Z","snapshot_observed_at":"2026-08-07T03:22:13.424379Z","submitted_at":"2023-08-31T12:53:09Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16692","snapshot_observed_at":"2026-08-07T15:43:05.226422Z","title":"SpeechTokenizer: Unified Speech Tokenizer for Speech Large Language Models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17076","last_updated":"2025-06-13T17:21:25Z","snapshot_observed_at":"2026-08-07T23:08:52.484966Z","submitted_at":"2025-05-20T06:01:19Z","title":"Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:05.226422Z"},"links":{"cited_paper":"/paper/2308.16692","citing_paper":"/paper/2505.17076"},"observation_digest":"sha256:98201d4034daef8fc13f60aa9b8acc8c853f3cf0c4a2f177a5d86d2ba17cd3d9","observation_id":"b4435bc8-5bbf-4d90-8269-6431442dd77c","resolution":{"observed_at":"2026-08-07T15:43:05.226422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16532","last_updated":"2025-02-25T11:45:12Z","snapshot_observed_at":"2026-08-07T23:06:05.723893Z","submitted_at":"2024-08-29T13:43:36Z","title":"WavTokenizer: an Efficient Acoustic Discrete Codec Tokenizer for Audio Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16532","snapshot_observed_at":"2026-08-07T15:43:05.374927Z","title":"WavTokenizer: an Efficient Acoustic Discrete Codec Tok- enizer for Audio Language Modeling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17076","last_updated":"2025-06-13T17:21:25Z","snapshot_observed_at":"2026-08-07T23:08:52.484966Z","submitted_at":"2025-05-20T06:01:19Z","title":"Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:05.374927Z"},"links":{"cited_paper":"/paper/2408.16532","citing_paper":"/paper/2505.17076"},"observation_digest":"sha256:83a62ebe6b265abb19f3b34a621fa5e57444edfc22148ef2440b26a6ce2c0dfa","observation_id":"78e6ee6c-90dc-4461-9a1c-c0fdbf86a18d","resolution":{"observed_at":"2026-08-07T15:43:05.374927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02094","last_updated":"2025-01-09T19:50:57Z","snapshot_observed_at":"2026-07-06T20:16:27.318761Z","submitted_at":"2025-01-03T20:43:57Z","title":"SMTL: A Stratified Logic for Expressive Multi-Level Temporal Specifications","version":2},"cited_work":{"arxiv_id":"2501.02094","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.02094","snapshot_observed_at":"2026-08-07T15:43:07.671611Z","title":"SMTL: A Stratified Logic for Expressive Multi-Level Temporal Specifications","venue":"eess.SY","work_id":"786f6498-9e52-46c1-9da1-f8d77cb6c240","year":2025},"citing_paper":{"arxiv_id":"2505.17076","last_updated":"2025-06-13T17:21:25Z","snapshot_observed_at":"2026-08-07T23:08:52.484966Z","submitted_at":"2025-05-20T06:01:19Z","title":"Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:05.456608Z"},"links":{"cited_paper":"/paper/2501.02094","citing_paper":"/paper/2505.17076"},"observation_digest":"sha256:afb17b4992a90bef458018a51feb23a53a8c5a0795f20459c3cd4a6eecb77c77","observation_id":"56e0ad82-5987-481e-82ac-daea9cbf5b87","resolution":{"observed_at":"2026-08-07T15:43:07.764249Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-03T16:47:47.192907Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-07T15:43:05.546290Z","title":"High fidelity neural audio compression,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17076","last_updated":"2025-06-13T17:21:25Z","snapshot_observed_at":"2026-08-07T23:08:52.484966Z","submitted_at":"2025-05-20T06:01:19Z","title":"Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:05.546290Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2505.17076"},"observation_digest":"sha256:36395d5feb345029245cf977c73525f42954e4241125e633fc1450585454bbb1","observation_id":"89177396-e7e2-43c4-932e-ec319e1bbae8","resolution":{"observed_at":"2026-08-07T15:43:05.546290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:10.004883Z","title":"SoundStream: An End-to-End Neural Audio Codec,","venue":null,"work_id":"1b1415ef-27da-489e-87fd-62f9cc5e88e5","year":2022},"citing_paper":{"arxiv_id":"2505.17076","last_updated":"2025-06-13T17:21:25Z","snapshot_observed_at":"2026-08-07T23:08:52.484966Z","submitted_at":"2025-05-20T06:01:19Z","title":"Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:05.683087Z"},"links":{"citing_paper":"/paper/2505.17076"},"observation_digest":"sha256:c734e98a27148533a3b8e7b108dac85525d10283cfabd6831aa546bd6f23b606","observation_id":"cd29d5e4-fd7e-42a2-b6cb-6238da7c5199","resolution":{"observed_at":"2026-08-07T15:43:10.078581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:09.799663Z","title":"Attention is all you need,","venue":null,"work_id":"8d8e31f0-b675-4a52-a599-5b6e244f947f","year":2017},"citing_paper":{"arxiv_id":"2505.17076","last_updated":"2025-06-13T17:21:25Z","snapshot_observed_at":"2026-08-07T23:08:52.484966Z","submitted_at":"2025-05-20T06:01:19Z","title":"Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:05.915626Z"},"links":{"citing_paper":"/paper/2505.17076"},"observation_digest":"sha256:9095ea7e5089fd19af4c04d0fee29791f92453418f533de28fdf04331f179564","observation_id":"28d695fd-43d7-46ff-8a3d-090e9a4fe551","resolution":{"observed_at":"2026-08-07T15:43:09.890487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:09.550741Z","title":"Neural discrete representation learning,","venue":null,"work_id":"7ffd40f1-0d2f-479f-9f04-eeaebde95462","year":2017},"citing_paper":{"arxiv_id":"2505.17076","last_updated":"2025-06-13T17:21:25Z","snapshot_observed_at":"2026-08-07T23:08:52.484966Z","submitted_at":"2025-05-20T06:01:19Z","title":"Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:06.049554Z"},"links":{"citing_paper":"/paper/2505.17076"},"observation_digest":"sha256:72c7cb0ece0fcdcb8d016cd5b9c1e4b8a40250ec0628c91c0b132deb16ff1ec4","observation_id":"77b97ef8-a72e-4b57-bb9d-3e6fa480b3ad","resolution":{"observed_at":"2026-08-07T15:43:09.705553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:09.284868Z","title":"Connectionist temporal classification: labelling unseg- mented sequence data with recurrent neural networks,","venue":null,"work_id":"e03a62b0-de2b-4a39-b28f-404c50f33a69","year":2006},"citing_paper":{"arxiv_id":"2505.17076","last_updated":"2025-06-13T17:21:25Z","snapshot_observed_at":"2026-08-07T23:08:52.484966Z","submitted_at":"2025-05-20T06:01:19Z","title":"Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:06.241092Z"},"links":{"citing_paper":"/paper/2505.17076"},"observation_digest":"sha256:8c6c7701ce83b53d022944f74a7e6058ddf43ed59f1cb0f1e8adcaafe22b2aee","observation_id":"bd8c011f-56fb-40f6-8a36-6a36de94f288","resolution":{"observed_at":"2026-08-07T15:43:09.409285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.10583","last_updated":"2018-09-13T02:45:27Z","snapshot_observed_at":"2026-08-08T09:58:28.265461Z","submitted_at":"2018-08-31T03:11:08Z","title":"AISHELL-2: Transforming Mandarin ASR Research Into Industrial Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.10583","snapshot_observed_at":"2026-08-07T15:43:06.340117Z","title":"AISHELL-2: Transforming Mandarin ASR Research Into Industrial Scale,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.17076","last_updated":"2025-06-13T17:21:25Z","snapshot_observed_at":"2026-08-07T23:08:52.484966Z","submitted_at":"2025-05-20T06:01:19Z","title":"Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:06.340117Z"},"links":{"cited_paper":"/paper/1808.10583","citing_paper":"/paper/2505.17076"},"observation_digest":"sha256:a8c43bd4233342e4b53bee06d96560101597efbf24329d8aa4090f9ef2176b77","observation_id":"7d4b39c0-8e81-496f-92b7-eccef56ee622","resolution":{"observed_at":"2026-08-07T15:43:06.340117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:09.127505Z","title":"Librispeech: an ASR corpus based on public do- main audio books,","venue":null,"work_id":"8f6961a5-29d3-45b1-9a9e-a26605af0931","year":2015},"citing_paper":{"arxiv_id":"2505.17076","last_updated":"2025-06-13T17:21:25Z","snapshot_observed_at":"2026-08-07T23:08:52.484966Z","submitted_at":"2025-05-20T06:01:19Z","title":"Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:06.554819Z"},"links":{"citing_paper":"/paper/2505.17076"},"observation_digest":"sha256:575463f07babfb81cbdc7174f5bf8b6b7c2bb6d170299cf38216a34ffb3d6203","observation_id":"2eb5f9e9-09aa-4949-8b99-a6e9bb932388","resolution":{"observed_at":"2026-08-07T15:43:09.208049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:08.831972Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":"09f75d68-7dcd-430e-bd42-78337bdb365f","year":2023},"citing_paper":{"arxiv_id":"2505.17076","last_updated":"2025-06-13T17:21:25Z","snapshot_observed_at":"2026-08-07T23:08:52.484966Z","submitted_at":"2025-05-20T06:01:19Z","title":"Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:06.713635Z"},"links":{"citing_paper":"/paper/2505.17076"},"observation_digest":"sha256:4e3c04698cdbe31ca0364c9e50fddaaef1278912af59c3feba7a77e5549944d6","observation_id":"d8aafd0a-cd3c-4a4b-85cd-d208cb1617ae","resolution":{"observed_at":"2026-08-07T15:43:08.971715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:08.639916Z","title":"StepAudio: A framework for pre-trained au- dio models training and reasoning,","venue":null,"work_id":"af9199d0-2847-438e-b847-688a365a1376","year":2024},"citing_paper":{"arxiv_id":"2505.17076","last_updated":"2025-06-13T17:21:25Z","snapshot_observed_at":"2026-08-07T23:08:52.484966Z","submitted_at":"2025-05-20T06:01:19Z","title":"Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:06.864778Z"},"links":{"citing_paper":"/paper/2505.17076"},"observation_digest":"sha256:73592120be2920932fa3d48b2328af9c0fde6bf226784bdb06c61251a6e5e034","observation_id":"ba1d2e57-1294-46e5-82ce-83a13c71c556","resolution":{"observed_at":"2026-08-07T15:43:08.726633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10543","last_updated":"2024-04-16T13:11:02Z","snapshot_observed_at":"2026-07-06T18:00:57.091811Z","submitted_at":"2024-04-16T13:11:02Z","title":"Characterizing Polkadot's Transactions Ecosystem: methodology, tools, and insights","version":1},"cited_work":{"arxiv_id":"2404.10543","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.10543","snapshot_observed_at":"2026-08-07T15:43:07.420044Z","title":"Characterizing Polkadot's Transactions Ecosystem: methodology, tools, and insights","venue":"cs.CR","work_id":"7ba1e8fe-f045-4cbd-8785-4d6830e0c31b","year":2024},"citing_paper":{"arxiv_id":"2505.17076","last_updated":"2025-06-13T17:21:25Z","snapshot_observed_at":"2026-08-07T23:08:52.484966Z","submitted_at":"2025-05-20T06:01:19Z","title":"Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:06.984573Z"},"links":{"cited_paper":"/paper/2404.10543","citing_paper":"/paper/2505.17076"},"observation_digest":"sha256:019a2d08b982589cf89b09ae28789dcae6b91c44f0e9c7d7f7f21ee9443d0eb7","observation_id":"b997a9c4-edb4-44f9-80d3-942ff55a5ebb","resolution":{"observed_at":"2026-08-07T15:43:07.563131Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:08.440501Z","title":"A three-layered model for expressive speech perception,","venue":null,"work_id":"0de1cb0a-2bea-4b0d-aabe-4ddbce5cb35c","year":2013},"citing_paper":{"arxiv_id":"2505.17076","last_updated":"2025-06-13T17:21:25Z","snapshot_observed_at":"2026-08-07T23:08:52.484966Z","submitted_at":"2025-05-20T06:01:19Z","title":"Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:07.126002Z"},"links":{"citing_paper":"/paper/2505.17076"},"observation_digest":"sha256:3e517dd315fe0a8e71ecfbf15e539baaca713d7b518c126c0de44b047df26498","observation_id":"33c999dd-1326-467f-86e1-1f932a255f1e","resolution":{"observed_at":"2026-08-07T15:43:08.525743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:43:08.194515Z","title":"Tone recognition in Mandarin Chinese using convolutional neural networks,","venue":null,"work_id":"62cfebef-0358-4afc-b0b8-0f9468f02a9d","year":2022},"citing_paper":{"arxiv_id":"2505.17076","last_updated":"2025-06-13T17:21:25Z","snapshot_observed_at":"2026-08-07T23:08:52.484966Z","submitted_at":"2025-05-20T06:01:19Z","title":"Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:07.274864Z"},"links":{"citing_paper":"/paper/2505.17076"},"observation_digest":"sha256:7e97027fbbbc4bd8289d0b1524ca763198285283c65e6f7cdc71fa95d4bd0f57","observation_id":"63460d8c-dfcf-4b75-813b-993897525a1b","resolution":{"observed_at":"2026-08-07T15:43:08.297050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.17076","last_updated":"2025-06-13T17:21:25Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T23:08:52.484966Z","submitted_at":"2025-05-20T06:01:19Z","title":"Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":10,"verified_exact":2,"verified_fuzzy":9},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 1 inbound Pith citation observation for arXiv:2505.17076."}