{"as_of":"2026-08-16T08:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:49f0559f38456134e6ec9049608ecf5f6a110d86d1a291d16f028d40ca410beb","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:37:36.656380Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:37:36.420218Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-12T00:15:23.475461Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.19033","last_updated":"2026-07-21T12:19:38Z","snapshot_observed_at":"2026-08-15T23:29:03.641340Z","submitted_at":"2026-07-21T12:19:38Z","title":"Content is What Remains: Invariant Speech Tokenization from Parallel Utterances","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.19033","snapshot_observed_at":"2026-08-15T15:37:36.420218Z","title":"Discrete speech tokenization extends this premise to audio, supporting LM-based speech generation, di- alogue, and cross-modal reasoning [1, 2, 3, 4]","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19033","last_updated":"2026-07-21T12:19:38Z","snapshot_observed_at":"2026-08-15T23:29:03.641340Z","submitted_at":"2026-07-21T12:19:38Z","title":"Content is What Remains: Invariant Speech Tokenization from Parallel Utterances","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T15:37:36.420218Z"},"links":{"cited_paper":"/paper/2607.19033","citing_paper":"/paper/2607.19033"},"observation_digest":"sha256:877cd3ca45e75bfc52031f0f613dff2875d2e1ffbec1d16067039dfa28b52d9e","observation_id":"b2af3fbb-4cc0-42f9-ace0-8327fc1aeac3","resolution":{"observed_at":"2026-08-15T15:37:36.420218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.19033","last_updated":"2026-07-21T12:19:38Z","snapshot_observed_at":"2026-08-15T23:29:03.641340Z","submitted_at":"2026-07-21T12:19:38Z","title":"Content is What Remains: Invariant Speech Tokenization from Parallel Utterances","version":1},"cited_work":{"arxiv_id":"2607.19033","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.19033","snapshot_observed_at":"2026-08-12T00:15:23.475461Z","title":"Content is What Remains: Invariant Speech Tokenization from Parallel Utterances","venue":"cs.CL","work_id":"aa187c95-b501-44e3-a22a-8e9de2ff3257","year":2026},"citing_paper":{"arxiv_id":"2608.08286","last_updated":"2026-08-08T18:35:10Z","snapshot_observed_at":"2026-08-16T03:25:37.304842Z","submitted_at":"2026-08-08T18:35:10Z","title":"ReLMCodec: Designing Predictable Speech Tokens from Pre-Quantization Phoneme Structure","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T00:15:23.039683Z"},"links":{"cited_paper":"/paper/2607.19033","citing_paper":"/paper/2608.08286"},"observation_digest":"sha256:3ec8e4e8cdce435fef2ba58878beb6c15dd0e12e651fbb3e50a70d43199b0dad","observation_id":"8f600229-0b91-43ba-9765-7dbfcefa954f","resolution":{"observed_at":"2026-08-12T00:15:23.478725Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2607.19033/citation-record","integrity":"/paper/2607.19033/integrity","json":"/paper/2607.19033/citation-record.json","paper":"/paper/2607.19033"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.19033","last_updated":"2026-07-21T12:19:38Z","snapshot_observed_at":"2026-08-15T23:29:03.641340Z","submitted_at":"2026-07-21T12:19:38Z","title":"Content is What Remains: Invariant Speech Tokenization from Parallel Utterances","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.19033","snapshot_observed_at":"2026-08-15T15:37:36.420218Z","title":"Discrete speech tokenization extends this premise to audio, supporting LM-based speech generation, di- alogue, and cross-modal reasoning [1, 2, 3, 4]","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19033","last_updated":"2026-07-21T12:19:38Z","snapshot_observed_at":"2026-08-15T23:29:03.641340Z","submitted_at":"2026-07-21T12:19:38Z","title":"Content is What Remains: Invariant Speech Tokenization from Parallel Utterances","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T15:37:36.420218Z"},"links":{"cited_paper":"/paper/2607.19033","citing_paper":"/paper/2607.19033"},"observation_digest":"sha256:877cd3ca45e75bfc52031f0f613dff2875d2e1ffbec1d16067039dfa28b52d9e","observation_id":"b2af3fbb-4cc0-42f9-ace0-8327fc1aeac3","resolution":{"observed_at":"2026-08-15T15:37:36.420218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:37:37.768406Z","title":null,"venue":null,"work_id":"f6513626-71ae-4dc1-ab3b-3d246bd329bb","year":null},"citing_paper":{"arxiv_id":"2607.19033","last_updated":"2026-07-21T12:19:38Z","snapshot_observed_at":"2026-08-15T23:29:03.641340Z","submitted_at":"2026-07-21T12:19:38Z","title":"Content is What Remains: Invariant Speech Tokenization from Parallel Utterances","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T15:37:36.426600Z"},"links":{"citing_paper":"/paper/2607.19033"},"observation_digest":"sha256:8c739ce486ce7fd57e2bc19d81984da2fda4f27adba246cab14b96f6ecb6794b","observation_id":"36122b67-fcf0-4c05-b518-26339874cf68","resolution":{"observed_at":"2026-08-15T15:37:37.773073Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:37:37.752826Z","title":"Further we evaluate the downstream compres- sion benefit unlocked by the above","venue":null,"work_id":"be86dbe2-7a26-41bc-a227-b86522f8a07f","year":null},"citing_paper":{"arxiv_id":"2607.19033","last_updated":"2026-07-21T12:19:38Z","snapshot_observed_at":"2026-08-15T23:29:03.641340Z","submitted_at":"2026-07-21T12:19:38Z","title":"Content is What Remains: Invariant Speech Tokenization from Parallel Utterances","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T15:37:36.431802Z"},"links":{"citing_paper":"/paper/2607.19033"},"observation_digest":"sha256:6fef89a7df6d283093920fee73b3b095c652ca69f2748b785133b004e62b1ce7","observation_id":"314f73bb-bf00-4cba-84c2-caa1eccad9cc","resolution":{"observed_at":"2026-08-15T15:37:37.757774Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:37:37.737952Z","title":null,"venue":null,"work_id":"476957e1-eb2a-41f2-8dbc-c98d52117a84","year":null},"citing_paper":{"arxiv_id":"2607.19033","last_updated":"2026-07-21T12:19:38Z","snapshot_observed_at":"2026-08-15T23:29:03.641340Z","submitted_at":"2026-07-21T12:19:38Z","title":"Content is What Remains: Invariant Speech Tokenization from Parallel Utterances","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T15:37:36.436685Z"},"links":{"citing_paper":"/paper/2607.19033"},"observation_digest":"sha256:5b157b7d11c576bdb9716596d62b6c7b22c80f64eaa57139584e96ea6c17fde9","observation_id":"e619767f-ffcb-42b7-92b3-ccf4b6312d00","resolution":{"observed_at":"2026-08-15T15:37:37.742427Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:37:37.721953Z","title":"The experiments were run manually and results were manually verified","venue":null,"work_id":"fc39ee3e-28ea-4b9f-8b01-8d8c5d1fd9fd","year":null},"citing_paper":{"arxiv_id":"2607.19033","last_updated":"2026-07-21T12:19:38Z","snapshot_observed_at":"2026-08-15T23:29:03.641340Z","submitted_at":"2026-07-21T12:19:38Z","title":"Content is What Remains: Invariant Speech Tokenization from Parallel Utterances","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T15:37:36.441464Z"},"links":{"citing_paper":"/paper/2607.19033"},"observation_digest":"sha256:3d3b77650efb530f2d81e22a3d92103807c632450f59fd62dd082d9b7440db51","observation_id":"f6d5b190-beab-4257-8444-22f4875b90b3","resolution":{"observed_at":"2026-08-15T15:37:37.726711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:37:37.706362Z","title":"AudioLM: a language modeling approach to audio generation,","venue":null,"work_id":"ad7929e1-1f51-4809-b490-f483000976ac","year":2023},"citing_paper":{"arxiv_id":"2607.19033","last_updated":"2026-07-21T12:19:38Z","snapshot_observed_at":"2026-08-15T23:29:03.641340Z","submitted_at":"2026-07-21T12:19:38Z","title":"Content is What Remains: Invariant Speech Tokenization from Parallel Utterances","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T15:37:36.446270Z"},"links":{"citing_paper":"/paper/2607.19033"},"observation_digest":"sha256:ef323d97215cc7d7a2f9d8cc236c8aa2fcf9cc7a7dde2f3946a0e1c8cd29065e","observation_id":"de499ba7-9b34-418c-9973-674a7badd1cc","resolution":{"observed_at":"2026-08-15T15:37:37.710583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:37:37.691117Z","title":"SpeechGPT: Empowering large language models with intrinsic cross-modal conversational abilities,","venue":null,"work_id":"4865fec3-d1b4-460e-9b5f-d2b7462d3fff","year":2023},"citing_paper":{"arxiv_id":"2607.19033","last_updated":"2026-07-21T12:19:38Z","snapshot_observed_at":"2026-08-15T23:29:03.641340Z","submitted_at":"2026-07-21T12:19:38Z","title":"Content is What Remains: Invariant Speech Tokenization from Parallel Utterances","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T15:37:36.450990Z"},"links":{"citing_paper":"/paper/2607.19033"},"observation_digest":"sha256:71675c35ea7cf7eebfb85960fc9c5cac83fe0af78a0b493c67483735e84c78e2","observation_id":"fc188f6a-54ef-425d-9b17-b5e03b654f03","resolution":{"observed_at":"2026-08-15T15:37:37.696744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-15T15:37:36.456476Z","title":"Moshi: a speech- text foundation model for real-time dialogue,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19033","last_updated":"2026-07-21T12:19:38Z","snapshot_observed_at":"2026-08-15T23:29:03.641340Z","submitted_at":"2026-07-21T12:19:38Z","title":"Content is What Remains: Invariant Speech Tokenization from Parallel Utterances","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T15:37:36.456476Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2607.19033"},"observation_digest":"sha256:1df8fe081a5f9a7c3a359118e6b0a0a1d55eaa0f92da7fd2061d18ec1ee8808b","observation_id":"33894dc6-3747-4fd1-9516-1c6b297ca72e","resolution":{"observed_at":"2026-08-15T15:37:36.456476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16107","last_updated":"2023-05-25T14:39:47Z","snapshot_observed_at":"2026-08-14T22:08:37.138719Z","submitted_at":"2023-05-25T14:39:47Z","title":"VioLA: Unified Codec Language Models for Speech Recognition, Synthesis, and Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16107","snapshot_observed_at":"2026-08-15T15:37:36.461335Z","title":"Viola: Unified codec language models for speech recognition, synthesis, and translation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19033","last_updated":"2026-07-21T12:19:38Z","snapshot_observed_at":"2026-08-15T23:29:03.641340Z","submitted_at":"2026-07-21T12:19:38Z","title":"Content is What Remains: Invariant Speech Tokenization from Parallel Utterances","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T15:37:36.461335Z"},"links":{"cited_paper":"/paper/2305.16107","citing_paper":"/paper/2607.19033"},"observation_digest":"sha256:f591ce968c5b495c566dd5f6dc0d9c401663344bf64ea8fc8a388f67aeea7850","observation_id":"63a33f02-57d5-4c38-ba68-5d94e182fff3","resolution":{"observed_at":"2026-08-15T15:37:36.461335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:37:37.675427Z","title":"SpeechTok- enizer: Unified speech tokenizer for speech language models,","venue":null,"work_id":"319b5880-d6b8-437d-aed0-d1636bc95921","year":2024},"citing_paper":{"arxiv_id":"2607.19033","last_updated":"2026-07-21T12:19:38Z","snapshot_observed_at":"2026-08-15T23:29:03.641340Z","submitted_at":"2026-07-21T12:19:38Z","title":"Content is What Remains: Invariant Speech Tokenization from Parallel Utterances","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T15:37:36.466266Z"},"links":{"citing_paper":"/paper/2607.19033"},"observation_digest":"sha256:04ec51f599de0ed91eaa5d6f48d61f863f2ce40fc241d2f1e61dfc652545f1d3","observation_id":"8ee4ab36-a958-40c1-a6f9-d0f6bd0ea221","resolution":{"observed_at":"2026-08-15T15:37:37.681063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:37:37.659890Z","title":"AudioDec: An open-source streaming high-fidelity neural audio codec,","venue":null,"work_id":"55d9f0fe-7901-42b0-a6fc-c7088be8c437","year":2023},"citing_paper":{"arxiv_id":"2607.19033","last_updated":"2026-07-21T12:19:38Z","snapshot_observed_at":"2026-08-15T23:29:03.641340Z","submitted_at":"2026-07-21T12:19:38Z","title":"Content is What Remains: Invariant Speech Tokenization from Parallel Utterances","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T15:37:36.470649Z"},"links":{"citing_paper":"/paper/2607.19033"},"observation_digest":"sha256:be97d280fdd9e8e09b395592b3b4465e22a2dda076dd8d124fe6c0abe40528dc","observation_id":"ef9bd97c-7591-4b86-a813-f90d20517ba1","resolution":{"observed_at":"2026-08-15T15:37:37.664857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:37:36.474582Z","title":"Hubert: Self-supervised speech rep- resentation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.19033","last_updated":"2026-07-21T12:19:38Z","snapshot_observed_at":"2026-08-15T23:29:03.641340Z","submitted_at":"2026-07-21T12:19:38Z","title":"Content is What Remains: Invariant Speech Tokenization from Parallel Utterances","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T15:37:36.474582Z"},"links":{"citing_paper":"/paper/2607.19033"},"observation_digest":"sha256:641e33114a2a3173428a9c11365656f297f68233238393c1f2cf6d6ff6b17340","observation_id":"1cbd49f7-3425-4cf6-9c55-a96ff4db9109","resolution":{"observed_at":"2026-08-15T15:37:36.474582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:37:36.478614Z","title":"Wavlm: Large-scale self-supervised pre-training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.19033","last_updated":"2026-07-21T12:19:38Z","snapshot_observed_at":"2026-08-15T23:29:03.641340Z","submitted_at":"2026-07-21T12:19:38Z","title":"Content is What Remains: Invariant Speech Tokenization from Parallel Utterances","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T15:37:36.478614Z"},"links":{"citing_paper":"/paper/2607.19033"},"observation_digest":"sha256:ccd7be3233ed55490b797aa4923ecb21341d12e4598627c1ba8155db901fc106","observation_id":"6e300fcc-ab13-44cf-9cad-b4d7168681a6","resolution":{"observed_at":"2026-08-15T15:37:36.478614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:37:36.486606Z","title":"ContentVec: An improved self-supervised speech representation by disentangling speakers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.19033","last_updated":"2026-07-21T12:19:38Z","snapshot_observed_at":"2026-08-15T23:29:03.641340Z","submitted_at":"2026-07-21T12:19:38Z","title":"Content is What Remains: Invariant Speech Tokenization from Parallel Utterances","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T15:37:36.486606Z"},"links":{"citing_paper":"/paper/2607.19033"},"observation_digest":"sha256:4854367f3ff49a6e12c443974efc62d3dd19f0c10de933457b3eb0913988690d","observation_id":"7799387e-c3bd-4bd1-9ae7-8f47588a0dcd","resolution":{"observed_at":"2026-08-15T15:37:36.486606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:37:37.616408Z","title":"Estimating the completeness of discrete speech units,","venue":null,"work_id":"98986e44-c108-438e-872c-8db77e34f9d4","year":2024},"citing_paper":{"arxiv_id":"2607.19033","last_updated":"2026-07-21T12:19:38Z","snapshot_observed_at":"2026-08-15T23:29:03.641340Z","submitted_at":"2026-07-21T12:19:38Z","title":"Content is What Remains: Invariant Speech Tokenization from Parallel Utterances","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T15:37:36.490350Z"},"links":{"citing_paper":"/paper/2607.19033"},"observation_digest":"sha256:eb3946179fba3b73544b0c8781ab181d28c8085ef8c41b9fe311bbfe8bb89e04","observation_id":"faba2e41-4dfc-4b35-a2dd-931154e42af9","resolution":{"observed_at":"2026-08-15T15:37:37.620815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:37:37.600921Z","title":"Augmentation invariant discrete representation for generative spoken language modeling,","venue":null,"work_id":"639dff85-bf0e-4188-9eed-9d4bc1722d1a","year":2023},"citing_paper":{"arxiv_id":"2607.19033","last_updated":"2026-07-21T12:19:38Z","snapshot_observed_at":"2026-08-15T23:29:03.641340Z","submitted_at":"2026-07-21T12:19:38Z","title":"Content is What Remains: Invariant Speech Tokenization from Parallel Utterances","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T15:37:36.494023Z"},"links":{"citing_paper":"/paper/2607.19033"},"observation_digest":"sha256:292d3b46eebc60eeb04ce8b081227ceca94fd585d4d56e1f3a5468a8ea289735","observation_id":"1aff2f3f-d144-43b1-9ae7-26d7c0194291","resolution":{"observed_at":"2026-08-15T15:37:37.606133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.22220","last_updated":"2026-04-13T11:56:11Z","snapshot_observed_at":"2026-08-11T16:37:46.886811Z","submitted_at":"2025-09-26T11:32:51Z","title":"StableToken: A Noise-Robust Semantic Speech Tokenizer for Resilient SpeechLLMs","version":2},"cited_work":{"arxiv_id":"2509.22220","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.22220","snapshot_observed_at":"2026-08-15T15:37:37.075835Z","title":"StableToken: A Noise-Robust Semantic Speech Tokenizer for Resilient SpeechLLMs","venue":"cs.CL","work_id":"673ccf62-b730-4444-814c-0fd808323e99","year":2025},"citing_paper":{"arxiv_id":"2607.19033","last_updated":"2026-07-21T12:19:38Z","snapshot_observed_at":"2026-08-15T23:29:03.641340Z","submitted_at":"2026-07-21T12:19:38Z","title":"Content is What Remains: Invariant Speech Tokenization from Parallel Utterances","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T15:37:36.531979Z"},"links":{"cited_paper":"/paper/2509.22220","citing_paper":"/paper/2607.19033"},"observation_digest":"sha256:5f0c8dfcc85aaf7e0643c20fc0516a95bc76f9fc9977f1e2d97d835b84d8f3aa","observation_id":"88d4a449-ca1f-4533-bce0-993379af8834","resolution":{"observed_at":"2026-08-15T15:37:37.080968Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02384","last_updated":"2024-09-04T02:20:59Z","snapshot_observed_at":"2026-08-14T19:55:40.996254Z","submitted_at":"2024-09-04T02:20:59Z","title":"STAB: Speech Tokenizer Assessment Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02384","snapshot_observed_at":"2026-08-15T15:37:36.502980Z","title":"Stab: Speech tokenizer assessment benchmark,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19033","last_updated":"2026-07-21T12:19:38Z","snapshot_observed_at":"2026-08-15T23:29:03.641340Z","submitted_at":"2026-07-21T12:19:38Z","title":"Content is What Remains: Invariant Speech Tokenization from Parallel Utterances","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T15:37:36.502980Z"},"links":{"cited_paper":"/paper/2409.02384","citing_paper":"/paper/2607.19033"},"observation_digest":"sha256:ba9e56e7b7b040ecc8158a3c156696347a5afc4de194d0ca1c6ebcf15d802aba","observation_id":"788381a9-7117-4f0a-8075-db053f96d105","resolution":{"observed_at":"2026-08-15T15:37:36.502980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:37:37.572831Z","title":"Dc- spin: A speaker-invariant speech tokenizer for spoken language models,","venue":null,"work_id":"bd86008c-5a77-4e7c-80a5-70495d884b71","year":2025},"citing_paper":{"arxiv_id":"2607.19033","last_updated":"2026-07-21T12:19:38Z","snapshot_observed_at":"2026-08-15T23:29:03.641340Z","submitted_at":"2026-07-21T12:19:38Z","title":"Content is What Remains: Invariant Speech Tokenization from Parallel Utterances","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T15:37:36.507781Z"},"links":{"citing_paper":"/paper/2607.19033"},"observation_digest":"sha256:ee0e92ea7cce3607bc2184569f7a515c9f8af20690dba771be923a076127293d","observation_id":"7ac573bf-c9f7-4578-9aff-11cb22ddf585","resolution":{"observed_at":"2026-08-15T15:37:37.577027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:37:37.559058Z","title":"Rethinking discrete speech representation tokens for accent generation,","venue":null,"work_id":"c1238ffe-376c-41f3-88c3-6dfc89cdcbff","year":null},"citing_paper":{"arxiv_id":"2607.19033","last_updated":"2026-07-21T12:19:38Z","snapshot_observed_at":"2026-08-15T23:29:03.641340Z","submitted_at":"2026-07-21T12:19:38Z","title":"Content is What Remains: Invariant Speech Tokenization from Parallel Utterances","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T15:37:36.512769Z"},"links":{"citing_paper":"/paper/2607.19033"},"observation_digest":"sha256:a3413e5378b00ca7c599d00b84506e13dc9b787ad9051c6a65b5ddb336b6748d","observation_id":"bac9b4da-0f77-450a-a7af-a908838c7e47","resolution":{"observed_at":"2026-08-15T15:37:37.563488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-08-15T12:11:16.120794Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-15T15:37:36.555809Z","title":"Robust speech recognition via large- scale weak supervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.19033","last_updated":"2026-07-21T12:19:38Z","snapshot_observed_at":"2026-08-15T23:29:03.641340Z","submitted_at":"2026-07-21T12:19:38Z","title":"Content is What Remains: Invariant Speech Tokenization from Parallel Utterances","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T15:37:36.555809Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2607.19033"},"observation_digest":"sha256:2be5b4fbba40e4e6c66589cc3d7d42bf2b45b10e72b53223a6d79a88a6c53324","observation_id":"a0a54f54-523e-406b-90c0-9dee637fb615","resolution":{"observed_at":"2026-08-15T15:37:36.555809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07243","last_updated":"2025-02-11T04:18:33Z","snapshot_observed_at":"2026-08-16T04:12:04.826819Z","submitted_at":"2025-02-11T04:18:33Z","title":"Vevo: Controllable Zero-Shot Voice Imitation with Self-Supervised Disentanglement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07243","snapshot_observed_at":"2026-08-15T15:37:36.522433Z","title":"Vevo: Controllable zero-shot voice imitation with self- supervised disentanglement,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19033","last_updated":"2026-07-21T12:19:38Z","snapshot_observed_at":"2026-08-15T23:29:03.641340Z","submitted_at":"2026-07-21T12:19:38Z","title":"Content is What Remains: Invariant Speech Tokenization from Parallel Utterances","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T15:37:36.522433Z"},"links":{"cited_paper":"/paper/2502.07243","citing_paper":"/paper/2607.19033"},"observation_digest":"sha256:525b7b77238b6ac773573e1f54e631a9fa1c9c57dbe2a9b87262e90360c5fd27","observation_id":"86d3fbae-e589-4fea-8288-7939cd8d6701","resolution":{"observed_at":"2026-08-15T15:37:36.522433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11037","last_updated":"2024-06-16T18:20:45Z","snapshot_observed_at":"2026-08-12T23:41:39.101089Z","submitted_at":"2024-06-16T18:20:45Z","title":"NAST: Noise Aware Speech Tokenization for Speech Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11037","snapshot_observed_at":"2026-08-15T15:37:36.527205Z","title":"Nast: Noise aware speech tokenization for speech language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19033","last_updated":"2026-07-21T12:19:38Z","snapshot_observed_at":"2026-08-15T23:29:03.641340Z","submitted_at":"2026-07-21T12:19:38Z","title":"Content is What Remains: Invariant Speech Tokenization from Parallel Utterances","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T15:37:36.527205Z"},"links":{"cited_paper":"/paper/2406.11037","citing_paper":"/paper/2607.19033"},"observation_digest":"sha256:8430089a9079e39fd2caec5793ed157510ac9e76d9b77135cc6b420eecd4ec14","observation_id":"1f13b3ec-36bc-437f-a1e3-c157d76e754b","resolution":{"observed_at":"2026-08-15T15:37:36.527205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:37:37.501455Z","title":"The ryerson audio-visual database of emotional speech and song (ravdess): A dynamic, multimodal set of facial and vocal expressions in north american english,","venue":null,"work_id":"ba5d6563-571b-452e-b885-473770ad36ad","year":2018},"citing_paper":{"arxiv_id":"2607.19033","last_updated":"2026-07-21T12:19:38Z","snapshot_observed_at":"2026-08-15T23:29:03.641340Z","submitted_at":"2026-07-21T12:19:38Z","title":"Content is What Remains: Invariant Speech Tokenization from Parallel Utterances","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T15:37:36.573839Z"},"links":{"citing_paper":"/paper/2607.19033"},"observation_digest":"sha256:6b830fcf00f5b58fe4481e06bebadfc21807122c039d48ff659e7b27b0fb781b","observation_id":"3c456030-231e-48df-b613-ed6a1f945cb7","resolution":{"observed_at":"2026-08-15T15:37:37.506664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:37:36.537592Z","title":"Dualcodec: A low-frame-rate, semantically-enhanced neural audio codec for speech generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19033","last_updated":"2026-07-21T12:19:38Z","snapshot_observed_at":"2026-08-15T23:29:03.641340Z","submitted_at":"2026-07-21T12:19:38Z","title":"Content is What Remains: Invariant Speech Tokenization from Parallel Utterances","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T15:37:36.537592Z"},"links":{"citing_paper":"/paper/2607.19033"},"observation_digest":"sha256:9b086d655762a0c8e50bddc33a70a74c082e808aacd6beac89ae804568af744f","observation_id":"82920521-3379-497c-9f60-eed4e20f0fba","resolution":{"observed_at":"2026-08-15T15:37:36.537592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23325","last_updated":"2025-07-09T17:40:35Z","snapshot_observed_at":"2026-08-13T18:27:51.812424Z","submitted_at":"2025-06-29T16:51:50Z","title":"XY-Tokenizer: Mitigating the Semantic-Acoustic Conflict in Low-Bitrate Speech Codecs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23325","snapshot_observed_at":"2026-08-15T15:37:36.541957Z","title":"Xy-tokenizer: Mitigating the semantic-acoustic conflict in low-bitrate speech codecs,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19033","last_updated":"2026-07-21T12:19:38Z","snapshot_observed_at":"2026-08-15T23:29:03.641340Z","submitted_at":"2026-07-21T12:19:38Z","title":"Content is What Remains: Invariant Speech Tokenization from Parallel Utterances","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T15:37:36.541957Z"},"links":{"cited_paper":"/paper/2506.23325","citing_paper":"/paper/2607.19033"},"observation_digest":"sha256:5a5bfaa2f7d53dd352d8cdcfb44edc6e0d98a93ce1063ddcd2cd063c09c0a93d","observation_id":"ecb525e6-c774-4269-aad9-03ca55301624","resolution":{"observed_at":"2026-08-15T15:37:36.541957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:37:37.545634Z","title":"Sac: Neural speech codec with semantic-acoustic dual-stream quantization,","venue":null,"work_id":"4024e93d-7aaa-40a7-a872-d96b1cdad106","year":null},"citing_paper":{"arxiv_id":"2607.19033","last_updated":"2026-07-21T12:19:38Z","snapshot_observed_at":"2026-08-15T23:29:03.641340Z","submitted_at":"2026-07-21T12:19:38Z","title":"Content is What Remains: Invariant Speech Tokenization from Parallel Utterances","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T15:37:36.546380Z"},"links":{"citing_paper":"/paper/2607.19033"},"observation_digest":"sha256:2353ee5004e6b5a132162112d49b6909a54a2830d23a5c8e9aa92f96d0ebec1e","observation_id":"53c8d88c-fbf8-44e6-be24-86d970fdba9e","resolution":{"observed_at":"2026-08-15T15:37:37.549691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:37:37.440062Z","title":"The chains corpus: Characterizing individual speakers,","venue":null,"work_id":"74b89f28-12ad-405d-bb1b-b4ad9cd9af14","year":2006},"citing_paper":{"arxiv_id":"2607.19033","last_updated":"2026-07-21T12:19:38Z","snapshot_observed_at":"2026-08-15T23:29:03.641340Z","submitted_at":"2026-07-21T12:19:38Z","title":"Content is What Remains: Invariant Speech Tokenization from Parallel Utterances","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T15:37:36.591693Z"},"links":{"citing_paper":"/paper/2607.19033"},"observation_digest":"sha256:b4d670d27689f18bc5a0344d2f41358ddc743ec4f2516d85446d2525bc019de5","observation_id":"da88886d-b705-43c7-ab98-b0ecb3e04f3d","resolution":{"observed_at":"2026-08-15T15:37:37.444811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:37:36.596071Z","title":"CSTR VCTK Corpus: English multi-speaker corpus for CSTR voice cloning toolkit (version 0.92),","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.19033","last_updated":"2026-07-21T12:19:38Z","snapshot_observed_at":"2026-08-15T23:29:03.641340Z","submitted_at":"2026-07-21T12:19:38Z","title":"Content is What Remains: Invariant Speech Tokenization from Parallel Utterances","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T15:37:36.596071Z"},"links":{"citing_paper":"/paper/2607.19033"},"observation_digest":"sha256:2474857608e6ee58251d405bdc938f681c20dcfed63d73418da74c57b5c81340","observation_id":"8fd06ec6-4823-49f3-a1ab-76f6db781d33","resolution":{"observed_at":"2026-08-15T15:37:36.596071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:37:37.531528Z","title":"W2v-bert: Combining contrastive learning and masked language modeling for self-supervised speech pre-training,","venue":null,"work_id":"265ae879-eac7-4442-899b-b91ca20f0aa3","year":null},"citing_paper":{"arxiv_id":"2607.19033","last_updated":"2026-07-21T12:19:38Z","snapshot_observed_at":"2026-08-15T23:29:03.641340Z","submitted_at":"2026-07-21T12:19:38Z","title":"Content is What Remains: Invariant Speech Tokenization from Parallel Utterances","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T15:37:36.560362Z"},"links":{"citing_paper":"/paper/2607.19033"},"observation_digest":"sha256:4ac025c5f170af8d7a24d7d17a739a5e9c0daee399d1a2b8c2694beb44294b2c","observation_id":"0513336b-4b7e-4198-a1d4-69a8f94e2445","resolution":{"observed_at":"2026-08-15T15:37:37.536085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:37:37.408736Z","title":"Seen and unseen emo- tional style transfer for voice conversion with a new emotional speech dataset,","venue":null,"work_id":"3394115e-4be6-4375-b634-d987070e18b2","year":2021},"citing_paper":{"arxiv_id":"2607.19033","last_updated":"2026-07-21T12:19:38Z","snapshot_observed_at":"2026-08-15T23:29:03.641340Z","submitted_at":"2026-07-21T12:19:38Z","title":"Content is What Remains: Invariant Speech Tokenization from Parallel Utterances","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T15:37:36.604243Z"},"links":{"citing_paper":"/paper/2607.19033"},"observation_digest":"sha256:24843f15c7d42c30406fd28c0d7d048612ec9dbfcd8d4a9e49b9e27925d10925","observation_id":"23478bcb-0e67-4a27-b311-d4e27796c0a7","resolution":{"observed_at":"2026-08-15T15:37:37.413903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:37:37.517133Z","title":"Kokoro-82m,","venue":null,"work_id":"4be598de-f060-4aac-aecf-1137e258f90c","year":2024},"citing_paper":{"arxiv_id":"2607.19033","last_updated":"2026-07-21T12:19:38Z","snapshot_observed_at":"2026-08-15T23:29:03.641340Z","submitted_at":"2026-07-21T12:19:38Z","title":"Content is What Remains: Invariant Speech Tokenization from Parallel Utterances","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T15:37:36.569307Z"},"links":{"citing_paper":"/paper/2607.19033"},"observation_digest":"sha256:cb85b5681ac14d165d5cba5666e256d01f6fe7553e223239833bfb4d9b3295f6","observation_id":"36c02c41-c9f7-4d4e-91b8-9ff7888675b9","resolution":{"observed_at":"2026-08-15T15:37:37.521724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:37:36.612873Z","title":"Darpa timit acoustic phonetic con- tinuous speech corpus cdrom,","venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2607.19033","last_updated":"2026-07-21T12:19:38Z","snapshot_observed_at":"2026-08-15T23:29:03.641340Z","submitted_at":"2026-07-21T12:19:38Z","title":"Content is What Remains: Invariant Speech Tokenization from Parallel Utterances","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T15:37:36.612873Z"},"links":{"citing_paper":"/paper/2607.19033"},"observation_digest":"sha256:d2ebc424cf5e184382268c37ace9e82bf1e40316edbb5b53eb8b2d493c2b9c2d","observation_id":"249fdd17-c16b-4c20-801b-f1fc4f7f76cc","resolution":{"observed_at":"2026-08-15T15:37:36.612873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:37:37.484470Z","title":"Learning sound event classifiers from web audio with noisy labels,","venue":null,"work_id":"2b0c774a-2b79-40f1-9c0e-a5ca4223c913","year":2019},"citing_paper":{"arxiv_id":"2607.19033","last_updated":"2026-07-21T12:19:38Z","snapshot_observed_at":"2026-08-15T23:29:03.641340Z","submitted_at":"2026-07-21T12:19:38Z","title":"Content is What Remains: Invariant Speech Tokenization from Parallel Utterances","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T15:37:36.578405Z"},"links":{"citing_paper":"/paper/2607.19033"},"observation_digest":"sha256:3dcfec7beec07e6932a67e84429867b2d4067f8a96d5366e4b09b7787058a018","observation_id":"202ec8d5-3725-495b-b14e-ff0d587c5921","resolution":{"observed_at":"2026-08-15T15:37:37.490573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:37:37.469020Z","title":"Montreal forced aligner: Trainable text-speech align- ment using kaldi,","venue":null,"work_id":"bd016fe0-6cff-440b-b85a-5dce35a788c8","year":2017},"citing_paper":{"arxiv_id":"2607.19033","last_updated":"2026-07-21T12:19:38Z","snapshot_observed_at":"2026-08-15T23:29:03.641340Z","submitted_at":"2026-07-21T12:19:38Z","title":"Content is What Remains: Invariant Speech Tokenization from Parallel Utterances","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T15:37:36.582751Z"},"links":{"citing_paper":"/paper/2607.19033"},"observation_digest":"sha256:2a9528627fe1bdcc571f4fd07c938f3ffd33d69744c70c9b7fd55a4fa29029dd","observation_id":"5d8b0ac3-d261-4242-b2a6-0d84029a0fd8","resolution":{"observed_at":"2026-08-15T15:37:37.473348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:37:37.455036Z","title":"The cmu arctic speech databases,","venue":null,"work_id":"88d7a5f6-d310-4214-82d4-658e79d95aa1","year":2004},"citing_paper":{"arxiv_id":"2607.19033","last_updated":"2026-07-21T12:19:38Z","snapshot_observed_at":"2026-08-15T23:29:03.641340Z","submitted_at":"2026-07-21T12:19:38Z","title":"Content is What Remains: Invariant Speech Tokenization from Parallel Utterances","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T15:37:36.587397Z"},"links":{"citing_paper":"/paper/2607.19033"},"observation_digest":"sha256:7f69305d12d49794acbabeca4bac40eb2516f7c770d3321feb54cede421de22c","observation_id":"b4983d30-63a2-4b2c-9469-83fc06b98bbb","resolution":{"observed_at":"2026-08-15T15:37:37.459318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:37:37.357222Z","title":"Con- nectionist temporal classification: Labelling unsegmented se- quence data with recurrent neural networks,","venue":null,"work_id":"d96890e2-50c9-453f-a276-7b25568760b9","year":2006},"citing_paper":{"arxiv_id":"2607.19033","last_updated":"2026-07-21T12:19:38Z","snapshot_observed_at":"2026-08-15T23:29:03.641340Z","submitted_at":"2026-07-21T12:19:38Z","title":"Content is What Remains: Invariant Speech Tokenization from Parallel Utterances","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T15:37:36.629857Z"},"links":{"citing_paper":"/paper/2607.19033"},"observation_digest":"sha256:406db313051f1664f611be05f9dfc9db8ebc06c485a243d509e0edfe0cb3ff4d","observation_id":"d5f5f318-0d7e-400b-a3b6-fd88c3fa8697","resolution":{"observed_at":"2026-08-15T15:37:37.362800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:37:37.340298Z","title":"Soft-dtw: a differentiable loss func- tion for time-series,","venue":null,"work_id":"75b659cf-f481-42a1-917b-03602147c4bc","year":2017},"citing_paper":{"arxiv_id":"2607.19033","last_updated":"2026-07-21T12:19:38Z","snapshot_observed_at":"2026-08-15T23:29:03.641340Z","submitted_at":"2026-07-21T12:19:38Z","title":"Content is What Remains: Invariant Speech Tokenization from Parallel Utterances","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T15:37:36.634292Z"},"links":{"citing_paper":"/paper/2607.19033"},"observation_digest":"sha256:3b0631c36fab09567b41528cb3c79094db2c733244bd90e1e2e2bf442ca8f325","observation_id":"522fa691-bc23-42c5-a351-dc5f53aab19e","resolution":{"observed_at":"2026-08-15T15:37:37.345344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:37:37.424630Z","title":"Open-source multi-speaker corpora of the English accents in the British isles,","venue":null,"work_id":"d900a33a-0a22-4ec2-a136-58444e8ca2ba","year":2020},"citing_paper":{"arxiv_id":"2607.19033","last_updated":"2026-07-21T12:19:38Z","snapshot_observed_at":"2026-08-15T23:29:03.641340Z","submitted_at":"2026-07-21T12:19:38Z","title":"Content is What Remains: Invariant Speech Tokenization from Parallel Utterances","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T15:37:36.600245Z"},"links":{"citing_paper":"/paper/2607.19033"},"observation_digest":"sha256:95de6cd7e43090afe326e42235b182f32c65bd0f322014a4822ed47c77688fc8","observation_id":"5574bffc-00ab-4c3f-a271-54df18374705","resolution":{"observed_at":"2026-08-15T15:37:37.429609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:37:37.308223Z","title":"Mean teachers are better role models: Weight-averaged consistency targets improve semi- supervised deep learning results,","venue":null,"work_id":"130f8753-f1f7-428e-849c-512dbb4731ed","year":2017},"citing_paper":{"arxiv_id":"2607.19033","last_updated":"2026-07-21T12:19:38Z","snapshot_observed_at":"2026-08-15T23:29:03.641340Z","submitted_at":"2026-07-21T12:19:38Z","title":"Content is What Remains: Invariant Speech Tokenization from Parallel Utterances","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T15:37:36.642925Z"},"links":{"citing_paper":"/paper/2607.19033"},"observation_digest":"sha256:dc920c3619db86cbb09064c6695602cd5ac91a76d35f25e2d03f93e91b79d835","observation_id":"82939289-67ef-4a9f-9fdf-fbf74550678d","resolution":{"observed_at":"2026-08-15T15:37:37.312918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03389","last_updated":"2025-01-11T06:05:41Z","snapshot_observed_at":"2026-08-13T05:33:02.491375Z","submitted_at":"2023-11-04T04:54:17Z","title":"Learning Disentangled Speech Representations","version":4},"cited_work":{"arxiv_id":"2311.03389","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.03389","snapshot_observed_at":"2026-08-15T15:37:36.886112Z","title":"Learning Disentangled Speech Representations","venue":"eess.AS","work_id":"b9121d80-4d70-4cef-9f2a-bab9cdb378aa","year":2023},"citing_paper":{"arxiv_id":"2607.19033","last_updated":"2026-07-21T12:19:38Z","snapshot_observed_at":"2026-08-15T23:29:03.641340Z","submitted_at":"2026-07-21T12:19:38Z","title":"Content is What Remains: Invariant Speech Tokenization from Parallel Utterances","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T15:37:36.608319Z"},"links":{"cited_paper":"/paper/2311.03389","citing_paper":"/paper/2607.19033"},"observation_digest":"sha256:e24752f68d5fe959264f3b486e694883b8178ed06e066e42a74b8c2cdf7bd121","observation_id":"329955bc-1630-41c4-b757-18b1d5e1a461","resolution":{"observed_at":"2026-08-15T15:37:36.892990Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:37:37.292380Z","title":"Evaluating speech features with the minimal-pair ABX task: Analysis of the classical MFC/PLP pipeline,","venue":null,"work_id":"89ddfc19-95dc-42e4-8a7d-977f43a9ae95","year":2013},"citing_paper":{"arxiv_id":"2607.19033","last_updated":"2026-07-21T12:19:38Z","snapshot_observed_at":"2026-08-15T23:29:03.641340Z","submitted_at":"2026-07-21T12:19:38Z","title":"Content is What Remains: Invariant Speech Tokenization from Parallel Utterances","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T15:37:36.651768Z"},"links":{"citing_paper":"/paper/2607.19033"},"observation_digest":"sha256:80ac42ded314351893af2d77c366a3e60ce1c680a5241fec4630bc737dc54db7","observation_id":"05f03d3a-5db6-4f46-992a-1b274dd7c4fd","resolution":{"observed_at":"2026-08-15T15:37:37.297591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:37:36.617067Z","title":"Lib- rispeech: an asr corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.19033","last_updated":"2026-07-21T12:19:38Z","snapshot_observed_at":"2026-08-15T23:29:03.641340Z","submitted_at":"2026-07-21T12:19:38Z","title":"Content is What Remains: Invariant Speech Tokenization from Parallel Utterances","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T15:37:36.617067Z"},"links":{"citing_paper":"/paper/2607.19033"},"observation_digest":"sha256:dc199be1c28837b1f58d34a7185a83ced9b0ab1cf9614bcac881ec7f36ed85f2","observation_id":"d4590b98-b95a-4637-87c8-9ba486d5eae0","resolution":{"observed_at":"2026-08-15T15:37:36.617067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:37:37.373396Z","title":"Ted-lium 3: Twice as much data and corpus repartition for experiments on speaker adaptation,","venue":null,"work_id":"74f04e7d-a224-4086-b5ee-269dffe3c77b","year":2018},"citing_paper":{"arxiv_id":"2607.19033","last_updated":"2026-07-21T12:19:38Z","snapshot_observed_at":"2026-08-15T23:29:03.641340Z","submitted_at":"2026-07-21T12:19:38Z","title":"Content is What Remains: Invariant Speech Tokenization from Parallel Utterances","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T15:37:36.621152Z"},"links":{"citing_paper":"/paper/2607.19033"},"observation_digest":"sha256:3cc17f67722e7ed6082addad70a2df5e7c5b4ea7df119ad11b4c0cd6c97804b8","observation_id":"7e20d7c1-efd6-4333-8d97-b160364a448f","resolution":{"observed_at":"2026-08-15T15:37:37.378582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:37:36.625423Z","title":"Libri-light: A benchmark for asr with limited or no supervision,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.19033","last_updated":"2026-07-21T12:19:38Z","snapshot_observed_at":"2026-08-15T23:29:03.641340Z","submitted_at":"2026-07-21T12:19:38Z","title":"Content is What Remains: Invariant Speech Tokenization from Parallel Utterances","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T15:37:36.625423Z"},"links":{"citing_paper":"/paper/2607.19033"},"observation_digest":"sha256:07909a017012f8240f3f50a0094a11c5065eec5bc87e577307b591669487ef40","observation_id":"eaf1e97c-3c83-40af-8879-2ae53a5176df","resolution":{"observed_at":"2026-08-15T15:37:36.625423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:37:37.324719Z","title":"Textless speech-to-speech translation on real data,","venue":null,"work_id":"f7e36646-eac6-496b-b2f9-f76c9572f4fd","year":2022},"citing_paper":{"arxiv_id":"2607.19033","last_updated":"2026-07-21T12:19:38Z","snapshot_observed_at":"2026-08-15T23:29:03.641340Z","submitted_at":"2026-07-21T12:19:38Z","title":"Content is What Remains: Invariant Speech Tokenization from Parallel Utterances","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T15:37:36.638543Z"},"links":{"citing_paper":"/paper/2607.19033"},"observation_digest":"sha256:fb6aad640fd2c303bf1fc5c1cd86e2758ee5672a81749aff7914ffea350e6d87","observation_id":"598fdfe8-c382-4126-aeac-c811a3627b47","resolution":{"observed_at":"2026-08-15T15:37:37.329727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07525","last_updated":"2023-06-15T15:19:22Z","snapshot_observed_at":"2026-08-13T13:21:09.763698Z","submitted_at":"2022-12-14T22:13:11Z","title":"Efficient Self-supervised Learning with Contextualized Target Representations for Vision, Speech and Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.07525","snapshot_observed_at":"2026-08-15T15:37:36.647187Z","title":"Efficient self- supervised learning with contextualized target representations for vision, speech and language,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19033","last_updated":"2026-07-21T12:19:38Z","snapshot_observed_at":"2026-08-15T23:29:03.641340Z","submitted_at":"2026-07-21T12:19:38Z","title":"Content is What Remains: Invariant Speech Tokenization from Parallel Utterances","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T15:37:36.647187Z"},"links":{"cited_paper":"/paper/2212.07525","citing_paper":"/paper/2607.19033"},"observation_digest":"sha256:755e147e6d3cb1e3e73c8205a747acc9bfa3284f9593dcf62bb3eb767ee17798","observation_id":"99d84a0e-d1f6-4749-aed6-5d6fce1da5a9","resolution":{"observed_at":"2026-08-15T15:37:36.647187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:37:37.276215Z","title":"X-vectors: Robust dnn embeddings for speaker recognition,","venue":null,"work_id":"7b9c3548-2004-4cc4-94b7-f846fc339a5e","year":2018},"citing_paper":{"arxiv_id":"2607.19033","last_updated":"2026-07-21T12:19:38Z","snapshot_observed_at":"2026-08-15T23:29:03.641340Z","submitted_at":"2026-07-21T12:19:38Z","title":"Content is What Remains: Invariant Speech Tokenization from Parallel Utterances","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T15:37:36.656380Z"},"links":{"citing_paper":"/paper/2607.19033"},"observation_digest":"sha256:96d32d0d3bd296e7f22e580aeab5e7d59f0dac0e436d021206535c806e985e59","observation_id":"c145d71b-3f7a-490b-9298-274e2256af8f","resolution":{"observed_at":"2026-08-15T15:37:37.281487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:37:37.586343Z","title":"Available: https://aclanthology.org/2023.iwslt-1","venue":null,"work_id":"52c22b0e-2c91-4805-a5b6-2fe9c98a03a0","year":2023},"citing_paper":{"arxiv_id":"2607.19033","last_updated":"2026-07-21T12:19:38Z","snapshot_observed_at":"2026-08-15T23:29:03.641340Z","submitted_at":"2026-07-21T12:19:38Z","title":"Content is What Remains: Invariant Speech Tokenization from Parallel Utterances","version":1},"reference_index":477,"source":"pdf_text","source_observed_at":"2026-08-15T15:37:36.498516Z"},"links":{"citing_paper":"/paper/2607.19033"},"observation_digest":"sha256:c8afbf9a7ef8607b82818a6e3f695d256e6a5e2e3eed2511032b696c76d6fbcd","observation_id":"f0fcf3c6-851d-4378-8a71-0801f38f29b2","resolution":{"observed_at":"2026-08-15T15:37:37.591389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.06209","last_updated":"2021-09-13T18:29:12Z","snapshot_observed_at":"2026-08-15T23:28:16.034194Z","submitted_at":"2021-08-07T06:29:36Z","title":"W2v-BERT: Combining Contrastive Learning and Masked Language Modeling for Self-Supervised Speech Pre-Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.06209","snapshot_observed_at":"2026-08-15T15:37:36.564661Z","title":"Available: https://arxiv.org/abs/2108.06209","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19033","last_updated":"2026-07-21T12:19:38Z","snapshot_observed_at":"2026-08-15T23:29:03.641340Z","submitted_at":"2026-07-21T12:19:38Z","title":"Content is What Remains: Invariant Speech Tokenization from Parallel Utterances","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-15T15:37:36.564661Z"},"links":{"cited_paper":"/paper/2108.06209","citing_paper":"/paper/2607.19033"},"observation_digest":"sha256:4215e2a5c64f341aa41d6304427fe0ccf1c36f92d780b81a4fec98d84345b765","observation_id":"623f462a-0fe4-4be0-9f4e-bf8f3c8b2a43","resolution":{"observed_at":"2026-08-15T15:37:36.564661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:37:36.551536Z","title":"Available: https://arxiv.org/abs/2510.16841","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19033","last_updated":"2026-07-21T12:19:38Z","snapshot_observed_at":"2026-08-15T23:29:03.641340Z","submitted_at":"2026-07-21T12:19:38Z","title":"Content is What Remains: Invariant Speech Tokenization from Parallel Utterances","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-15T15:37:36.551536Z"},"links":{"citing_paper":"/paper/2607.19033"},"observation_digest":"sha256:53c84ab50b1dd8f79f16637304ea2e0a37e7998ff5a6f10bc4be761b4ce8af22","observation_id":"bd2e5f66-ea7e-40f2-b825-38d5ceec6c26","resolution":{"observed_at":"2026-08-15T15:37:36.551536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.19786","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:37:37.177393Z","title":"Available: https://arxiv.org/abs/2601.19786","venue":null,"work_id":"74578179-50c3-4cf4-a50f-e81a89f78546","year":null},"citing_paper":{"arxiv_id":"2607.19033","last_updated":"2026-07-21T12:19:38Z","snapshot_observed_at":"2026-08-15T23:29:03.641340Z","submitted_at":"2026-07-21T12:19:38Z","title":"Content is What Remains: Invariant Speech Tokenization from Parallel Utterances","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-15T15:37:36.517410Z"},"links":{"citing_paper":"/paper/2607.19033"},"observation_digest":"sha256:5fa3867d7c9047d09404332fae4fe9aaf16f50c39efd57ec7c6117e57dcbc209","observation_id":"b7c1552a-d0ca-4218-83b3-dbcf5865334b","resolution":{"observed_at":"2026-08-15T15:37:37.184946Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.19033","last_updated":"2026-07-21T12:19:38Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-15T23:29:03.641340Z","submitted_at":"2026-07-21T12:19:38Z","title":"Content is What Remains: Invariant Speech Tokenization from Parallel Utterances"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":3,"verified_fuzzy":27},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 2 inbound Pith citation observations for arXiv:2607.19033."}