{"as_of":"2026-08-10T04:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f21876e4c2f1797c9799d4e76fe69581715a6b69d7bfbf3c4988c5bda85de876","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-07T21:48:16.190698Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.05250/citation-record","integrity":"/paper/2607.05250/integrity","json":"/paper/2607.05250/citation-record.json","paper":"/paper/2607.05250"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T21:54:08.070628Z","title":"Sound- stream: An end-to-end neural audio codec,","venue":null,"work_id":"dcabcdc4-14e9-4fd6-9ff3-838e3cde5825","year":2021},"citing_paper":{"arxiv_id":"2607.05250","last_updated":"2026-07-06T15:57:49Z","snapshot_observed_at":"2026-08-09T23:07:26.322530Z","submitted_at":"2026-07-06T15:57:49Z","title":"Streaming Neural Speech Codecs through Time-Invariant Representations","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-07T21:48:16.190698Z"},"links":{"citing_paper":"/paper/2607.05250"},"observation_digest":"sha256:8a48ed85be81f522e22632e3feb6db7ab522c179bce98dabd0a87646527bde8e","observation_id":"6849589c-c30b-4e99-9e4b-53081c61f036","resolution":{"observed_at":"2026-07-07T21:54:08.074657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-09T07:12:13.721596Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":"2210.13438","doi":"10.48550/arxiv.2210.13438","metadata_source":"pith","pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"High Fidelity Neural Audio Compression","venue":"eess.AS","work_id":"bc645d2d-e9f2-4cb8-9a6d-bd557bc7a258","year":2022},"citing_paper":{"arxiv_id":"2607.05250","last_updated":"2026-07-06T15:57:49Z","snapshot_observed_at":"2026-08-09T23:07:26.322530Z","submitted_at":"2026-07-06T15:57:49Z","title":"Streaming Neural Speech Codecs through Time-Invariant Representations","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-07T21:48:16.190698Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2607.05250"},"observation_digest":"sha256:9afcbf7cd2aded5cea6beb9df47f9d00b9b6da3a158f74ed2a5588a2897aaf87","observation_id":"78c86203-f501-4e74-a872-0f4a01d41b19","resolution":{"observed_at":"2026-07-07T21:54:08.069398Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-05-19T16:22:25.658509+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T16:22:25.658509+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T21:54:08.122956Z","title":"High-fidelity audio compression with improved rvqgan,","venue":null,"work_id":"44f7d328-37d6-42df-9a0b-0607c3492336","year":2023},"citing_paper":{"arxiv_id":"2607.05250","last_updated":"2026-07-06T15:57:49Z","snapshot_observed_at":"2026-08-09T23:07:26.322530Z","submitted_at":"2026-07-06T15:57:49Z","title":"Streaming Neural Speech Codecs through Time-Invariant Representations","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-07T21:48:16.190698Z"},"links":{"citing_paper":"/paper/2607.05250"},"observation_digest":"sha256:c865f8eac6fbac7aeef329056d3f0670831835929764a31ed53321f4a19ab034","observation_id":"be4136e8-11d0-4dd0-8ccc-d962206e0e8b","resolution":{"observed_at":"2026-07-07T21:54:08.132492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T21:54:08.147869Z","title":"Audiolm: a language modeling approach to audio generation,","venue":null,"work_id":"ab022ff7-25ca-4292-b2ae-0fd5f8488acc","year":2023},"citing_paper":{"arxiv_id":"2607.05250","last_updated":"2026-07-06T15:57:49Z","snapshot_observed_at":"2026-08-09T23:07:26.322530Z","submitted_at":"2026-07-06T15:57:49Z","title":"Streaming Neural Speech Codecs through Time-Invariant Representations","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-07T21:48:16.190698Z"},"links":{"citing_paper":"/paper/2607.05250"},"observation_digest":"sha256:d826038405133cff15a287fea5061e1e8453ef26791afc486550f8918dc4ebed","observation_id":"c59295a2-bd93-4612-a9fd-66c72afd31c0","resolution":{"observed_at":"2026-07-07T21:54:08.150077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T21:54:08.080152Z","title":"Text-free prosody-aware generative spoken language modeling,","venue":null,"work_id":"a4a75128-6bd5-4b94-b529-0511df561451","year":2022},"citing_paper":{"arxiv_id":"2607.05250","last_updated":"2026-07-06T15:57:49Z","snapshot_observed_at":"2026-08-09T23:07:26.322530Z","submitted_at":"2026-07-06T15:57:49Z","title":"Streaming Neural Speech Codecs through Time-Invariant Representations","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-07T21:48:16.190698Z"},"links":{"citing_paper":"/paper/2607.05250"},"observation_digest":"sha256:f5565d7476d55df44c1da9c648ac3da8df28ccd7ac199d702444d98492d99e47","observation_id":"fab15ee6-9b62-46db-8766-9b4052239170","resolution":{"observed_at":"2026-07-07T21:54:08.082110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":"2301.02111","doi":"10.48550/arxiv.2301.02111","metadata_source":"pith","pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","venue":"cs.CL","work_id":"de8fb688-dd63-4942-92f6-66d98d5b6db2","year":2023},"citing_paper":{"arxiv_id":"2607.05250","last_updated":"2026-07-06T15:57:49Z","snapshot_observed_at":"2026-08-09T23:07:26.322530Z","submitted_at":"2026-07-06T15:57:49Z","title":"Streaming Neural Speech Codecs through Time-Invariant Representations","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-07T21:48:16.190698Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2607.05250"},"observation_digest":"sha256:476d45acf47332f68216793ee0b90c214f08088d08e72406b2bc9960d0900457","observation_id":"dcc5ce31-16dc-4aff-a1ad-50e7ead15444","resolution":{"observed_at":"2026-07-07T21:54:08.050084Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T21:54:08.085977Z","title":"Voicebox: Text-guided multilingual universal speech generation at scale,","venue":null,"work_id":"88804048-7a4c-43c9-acf8-8584564f0a46","year":2023},"citing_paper":{"arxiv_id":"2607.05250","last_updated":"2026-07-06T15:57:49Z","snapshot_observed_at":"2026-08-09T23:07:26.322530Z","submitted_at":"2026-07-06T15:57:49Z","title":"Streaming Neural Speech Codecs through Time-Invariant Representations","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-07T21:48:16.190698Z"},"links":{"citing_paper":"/paper/2607.05250"},"observation_digest":"sha256:1a52c1b35ffd42f65bbed1302b6671d9014247b90cd7e298ac62f0dd954e7e75","observation_id":"e1b89ce9-937c-44b8-86a6-07168a63a81a","resolution":{"observed_at":"2026-07-07T21:54:08.088285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T21:54:08.151493Z","title":"Naturalspeech 3: zero-shot speech synthesis with factorized codec and diffusion models,","venue":null,"work_id":"0fe17206-5960-4010-bc7b-5be736c695de","year":2024},"citing_paper":{"arxiv_id":"2607.05250","last_updated":"2026-07-06T15:57:49Z","snapshot_observed_at":"2026-08-09T23:07:26.322530Z","submitted_at":"2026-07-06T15:57:49Z","title":"Streaming Neural Speech Codecs through Time-Invariant Representations","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-07T21:48:16.190698Z"},"links":{"citing_paper":"/paper/2607.05250"},"observation_digest":"sha256:d7d5a74e285f2105f4d30328ed6657cdbe4f1ae86899368aa36a3851581cb23c","observation_id":"0453ff9d-64a3-4eb4-aa09-49d67e6126ed","resolution":{"observed_at":"2026-07-07T21:54:08.153703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T21:54:08.076530Z","title":"Fewer-token neural speech codec with time-invariant codes,","venue":null,"work_id":"e7ab2830-ac90-41a6-92b8-7d2ee8cc32b9","year":2024},"citing_paper":{"arxiv_id":"2607.05250","last_updated":"2026-07-06T15:57:49Z","snapshot_observed_at":"2026-08-09T23:07:26.322530Z","submitted_at":"2026-07-06T15:57:49Z","title":"Streaming Neural Speech Codecs through Time-Invariant Representations","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-07T21:48:16.190698Z"},"links":{"citing_paper":"/paper/2607.05250"},"observation_digest":"sha256:f3859ccb4dffb3cf76106c326b824e1ff324a08d88e02a3756cd36795e1eb157","observation_id":"e43c97b1-6d6a-4f52-9a81-99ab19ff2e45","resolution":{"observed_at":"2026-07-07T21:54:08.079235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T21:54:08.154601Z","title":"Voxceleb: Large-scale speaker verification in the wild,","venue":null,"work_id":"111005ab-e652-4f55-9dd9-715b6224c397","year":2020},"citing_paper":{"arxiv_id":"2607.05250","last_updated":"2026-07-06T15:57:49Z","snapshot_observed_at":"2026-08-09T23:07:26.322530Z","submitted_at":"2026-07-06T15:57:49Z","title":"Streaming Neural Speech Codecs through Time-Invariant Representations","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-07T21:48:16.190698Z"},"links":{"citing_paper":"/paper/2607.05250"},"observation_digest":"sha256:3c4d4f53bfaf7b505e4f34311bf9bca19a5e47006731c951dbb5a3a8d97328d9","observation_id":"8982a116-943c-414b-a523-2911e3702c8d","resolution":{"observed_at":"2026-07-07T21:54:08.156563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.09840","last_updated":"2018-10-11T12:42:28Z","snapshot_observed_at":"2026-07-06T06:52:21.185384Z","submitted_at":"2018-07-25T20:27:55Z","title":"A multi-device dataset for urban acoustic scene classification","version":2},"cited_work":{"arxiv_id":"1807.09840","doi":null,"metadata_source":"pith","pith_arxiv_id":"1807.09840","snapshot_observed_at":"2026-07-07T21:54:08.053008Z","title":"A multi-device dataset for urban acoustic scene classification","venue":"eess.AS","work_id":"33200ad6-15f5-489b-b109-4dfec7a323ec","year":2018},"citing_paper":{"arxiv_id":"2607.05250","last_updated":"2026-07-06T15:57:49Z","snapshot_observed_at":"2026-08-09T23:07:26.322530Z","submitted_at":"2026-07-06T15:57:49Z","title":"Streaming Neural Speech Codecs through Time-Invariant Representations","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-07T21:48:16.190698Z"},"links":{"cited_paper":"/paper/1807.09840","citing_paper":"/paper/2607.05250"},"observation_digest":"sha256:bc6d2e8343f496cfaefc915d5b0aaa7d6b5ba7350c40249fc40cf376ef0bc0a1","observation_id":"eb208972-c090-4373-9e54-af31c0cbd41d","resolution":{"observed_at":"2026-07-07T21:54:08.055552Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T21:54:08.089115Z","title":"Meld: A multimodal multi-party dataset for emotion recognition in conversations,","venue":null,"work_id":"0f3b2c1d-a441-4cf7-bc23-6fc915dce009","year":2019},"citing_paper":{"arxiv_id":"2607.05250","last_updated":"2026-07-06T15:57:49Z","snapshot_observed_at":"2026-08-09T23:07:26.322530Z","submitted_at":"2026-07-06T15:57:49Z","title":"Streaming Neural Speech Codecs through Time-Invariant Representations","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-07T21:48:16.190698Z"},"links":{"citing_paper":"/paper/2607.05250"},"observation_digest":"sha256:6426e2179b4b47694894ca67c8a61fa59683d9351ca8b4340f9775545acf3305","observation_id":"46242ae5-9ddb-498b-938a-fe153b2aab14","resolution":{"observed_at":"2026-07-07T21:54:08.091351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T21:54:08.112328Z","title":"Common voice: A massively-multilingual speech corpus","venue":null,"work_id":"c68915ab-2787-4742-b6db-2eebd2d3899f","year":2020},"citing_paper":{"arxiv_id":"2607.05250","last_updated":"2026-07-06T15:57:49Z","snapshot_observed_at":"2026-08-09T23:07:26.322530Z","submitted_at":"2026-07-06T15:57:49Z","title":"Streaming Neural Speech Codecs through Time-Invariant Representations","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-07T21:48:16.190698Z"},"links":{"citing_paper":"/paper/2607.05250"},"observation_digest":"sha256:c60fda51cf6175ab6a69d1f219d742a239ddd1e70ea70e41926ed98d0281903b","observation_id":"6657d6c3-88e3-4d5f-b942-4bed9a19ce91","resolution":{"observed_at":"2026-07-07T21:54:08.121905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.03209","last_updated":"2018-04-09T19:58:17Z","snapshot_observed_at":"2026-07-06T06:32:32.083176Z","submitted_at":"2018-04-09T19:58:17Z","title":"Speech Commands: A Dataset for Limited-Vocabulary Speech Recognition","version":1},"cited_work":{"arxiv_id":"1804.03209","doi":"10.48550/arxiv.1804.03209","metadata_source":"pith","pith_arxiv_id":"1804.03209","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Speech Commands: A Dataset for Limited-Vocabulary Speech Recognition","venue":"cs.CL","work_id":"f4d53a51-5741-47e1-b328-d6503065d1bd","year":2018},"citing_paper":{"arxiv_id":"2607.05250","last_updated":"2026-07-06T15:57:49Z","snapshot_observed_at":"2026-08-09T23:07:26.322530Z","submitted_at":"2026-07-06T15:57:49Z","title":"Streaming Neural Speech Codecs through Time-Invariant Representations","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-07T21:48:16.190698Z"},"links":{"cited_paper":"/paper/1804.03209","citing_paper":"/paper/2607.05250"},"observation_digest":"sha256:99abe858b2e7c3721a5a5a9fe0236ede17bb8b0cafd7a106f1b39e48daedf597","observation_id":"8f66738f-fff3-4ab0-b563-2e7ebaaaff1f","resolution":{"observed_at":"2026-07-07T21:54:08.064118Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T21:54:08.082829Z","title":"Libritts: A corpus derived from librispeech for text-to-speech,","venue":null,"work_id":"1aad8c85-ca12-4a20-9298-eb8cc6ab3575","year":2019},"citing_paper":{"arxiv_id":"2607.05250","last_updated":"2026-07-06T15:57:49Z","snapshot_observed_at":"2026-08-09T23:07:26.322530Z","submitted_at":"2026-07-06T15:57:49Z","title":"Streaming Neural Speech Codecs through Time-Invariant Representations","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-07T21:48:16.190698Z"},"links":{"citing_paper":"/paper/2607.05250"},"observation_digest":"sha256:939e943416c8f36145be33b3250f6560697aaf9c09813b12682903d529fa1db0","observation_id":"b68d61df-a0e8-4828-9410-17114b733321","resolution":{"observed_at":"2026-07-07T21:54:08.085034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T21:54:08.136936Z","title":"Librispeech: an asr corpus based on public domain audio books,","venue":null,"work_id":"d95201ed-cdbb-495d-b754-f294e4d6c88b","year":2015},"citing_paper":{"arxiv_id":"2607.05250","last_updated":"2026-07-06T15:57:49Z","snapshot_observed_at":"2026-08-09T23:07:26.322530Z","submitted_at":"2026-07-06T15:57:49Z","title":"Streaming Neural Speech Codecs through Time-Invariant Representations","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-07T21:48:16.190698Z"},"links":{"citing_paper":"/paper/2607.05250"},"observation_digest":"sha256:f9aa565f7baecf08c2291cacee1965b984820739dfbf922a35d362d7074114f8","observation_id":"92ff019a-cd92-4b03-be42-662a0dc68772","resolution":{"observed_at":"2026-07-07T21:54:08.139053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T21:54:08.092183Z","title":"Cstr vctk corpus: English multi- speaker corpus for cstr voice cloning toolkit,","venue":null,"work_id":"0e4fe105-69b0-4d36-927b-cb2269203348","year":2017},"citing_paper":{"arxiv_id":"2607.05250","last_updated":"2026-07-06T15:57:49Z","snapshot_observed_at":"2026-08-09T23:07:26.322530Z","submitted_at":"2026-07-06T15:57:49Z","title":"Streaming Neural Speech Codecs through Time-Invariant Representations","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-07T21:48:16.190698Z"},"links":{"citing_paper":"/paper/2607.05250"},"observation_digest":"sha256:4d40296b5aec00a2ed988e2300630b611ad479bfb1ca18cbeb4a7f4724fd8afd","observation_id":"ef1fb1e5-725b-4b93-8930-8f83393fb3d0","resolution":{"observed_at":"2026-07-07T21:54:08.095817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T21:54:08.143918Z","title":"Emilia: An extensive, multilingual, and diverse speech dataset for large- scale speech generation,","venue":null,"work_id":"8fa42c7d-6b81-45d5-86f8-d0f7170f345f","year":2024},"citing_paper":{"arxiv_id":"2607.05250","last_updated":"2026-07-06T15:57:49Z","snapshot_observed_at":"2026-08-09T23:07:26.322530Z","submitted_at":"2026-07-06T15:57:49Z","title":"Streaming Neural Speech Codecs through Time-Invariant Representations","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-07T21:48:16.190698Z"},"links":{"citing_paper":"/paper/2607.05250"},"observation_digest":"sha256:409ad46619355f3fef042e9ebfc874fbb345189f1efbf0d3179496211dce68f1","observation_id":"aebc5aff-f4c4-4e6f-b2ef-6258ce01bd88","resolution":{"observed_at":"2026-07-07T21:54:08.146661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T21:54:08.139933Z","title":"Visqol v3: An open source production ready objective speech and audio metric,","venue":null,"work_id":"b1606f29-8e64-48f8-83ee-a506da465667","year":null},"citing_paper":{"arxiv_id":"2607.05250","last_updated":"2026-07-06T15:57:49Z","snapshot_observed_at":"2026-08-09T23:07:26.322530Z","submitted_at":"2026-07-06T15:57:49Z","title":"Streaming Neural Speech Codecs through Time-Invariant Representations","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-07T21:48:16.190698Z"},"links":{"citing_paper":"/paper/2607.05250"},"observation_digest":"sha256:7ddc8e3df296cdb8cdbf44a442d781383873121b98d8d66b5ed886ef4088fc3b","observation_id":"52622d88-a962-44ca-9052-5ef07a58dc80","resolution":{"observed_at":"2026-07-07T21:54:08.142840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.09584","last_updated":"2020-04-20T19:19:26Z","snapshot_observed_at":"2026-08-05T04:43:49.261929Z","submitted_at":"2020-04-20T19:19:26Z","title":"ViSQOL v3: An Open Source Production Ready Objective Speech and Audio Metric","version":1},"cited_work":{"arxiv_id":"2004.09584","doi":null,"metadata_source":"pith","pith_arxiv_id":"2004.09584","snapshot_observed_at":"2026-07-07T21:54:08.057502Z","title":"ViSQOL v3: An Open Source Production Ready Objective Speech and Audio Metric","venue":"eess.AS","work_id":"af02c0f9-99f4-469c-8030-c802657e2d37","year":2020},"citing_paper":{"arxiv_id":"2607.05250","last_updated":"2026-07-06T15:57:49Z","snapshot_observed_at":"2026-08-09T23:07:26.322530Z","submitted_at":"2026-07-06T15:57:49Z","title":"Streaming Neural Speech Codecs through Time-Invariant Representations","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-07T21:48:16.190698Z"},"links":{"cited_paper":"/paper/2004.09584","citing_paper":"/paper/2607.05250"},"observation_digest":"sha256:2b1a96e8fdfdf1278b0bd8a620e66af9dddd023c14e51350501c3e94e5b74870","observation_id":"0b78137b-71b7-46ca-aa55-3d8743543fe5","resolution":{"observed_at":"2026-07-07T21:54:08.059960Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T21:54:08.133662Z","title":"Perceptual evaluation of speech quality (pesq)-a new method for speech quality assessment of telephone networks and codecs,","venue":null,"work_id":"4d5eb253-1022-401b-870c-eb6b29b02dc2","year":2001},"citing_paper":{"arxiv_id":"2607.05250","last_updated":"2026-07-06T15:57:49Z","snapshot_observed_at":"2026-08-09T23:07:26.322530Z","submitted_at":"2026-07-06T15:57:49Z","title":"Streaming Neural Speech Codecs through Time-Invariant Representations","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-07T21:48:16.190698Z"},"links":{"citing_paper":"/paper/2607.05250"},"observation_digest":"sha256:93fe365ffa429d91c90dcca7fb167fc1c86d51808c23d8df0a904524335c934d","observation_id":"e0e86f0f-3330-474b-b7dc-85c2868b54b7","resolution":{"observed_at":"2026-07-07T21:54:08.135969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T21:54:08.097067Z","title":"An algorithm for intel- ligibility prediction of time–frequency weighted noisy speech,","venue":null,"work_id":"eabd9137-ab92-4126-89e9-2ed7a60d7277","year":2011},"citing_paper":{"arxiv_id":"2607.05250","last_updated":"2026-07-06T15:57:49Z","snapshot_observed_at":"2026-08-09T23:07:26.322530Z","submitted_at":"2026-07-06T15:57:49Z","title":"Streaming Neural Speech Codecs through Time-Invariant Representations","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-07T21:48:16.190698Z"},"links":{"citing_paper":"/paper/2607.05250"},"observation_digest":"sha256:c8a6f0b683f3e9f84ff5f6db59a7de1c64d4fdce671b408d585db382e7b8708f","observation_id":"95d1be5e-f152-4144-b8ea-d745241a06a3","resolution":{"observed_at":"2026-07-07T21:54:08.099575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T21:54:08.102360Z","title":"Mel-cepstral distance measure for objective speech quality assess- ment,","venue":null,"work_id":"8efae39d-a68d-4d6b-96c6-556ea8676325","year":1993},"citing_paper":{"arxiv_id":"2607.05250","last_updated":"2026-07-06T15:57:49Z","snapshot_observed_at":"2026-08-09T23:07:26.322530Z","submitted_at":"2026-07-06T15:57:49Z","title":"Streaming Neural Speech Codecs through Time-Invariant Representations","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-07T21:48:16.190698Z"},"links":{"citing_paper":"/paper/2607.05250"},"observation_digest":"sha256:23a7c15932a04684028b43616a106a6ca48f709ac53a50e7266c6ef138e70231","observation_id":"1c1e85c2-67a1-4052-9fae-e14661be0e2d","resolution":{"observed_at":"2026-07-07T21:54:08.111036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.05250","last_updated":"2026-07-06T15:57:49Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T23:07:26.322530Z","submitted_at":"2026-07-06T15:57:49Z","title":"Streaming Neural Speech Codecs through Time-Invariant Representations"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":4,"verified_fuzzy":18},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 0 inbound Pith citation observations for arXiv:2607.05250."}