{"as_of":"2026-08-21T15:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d503f3df0c017f345afc47354a42fee5d178b8e46ae912153ff1aca0b801d01e","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T00:08:00.302195Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T00:07:54.620862Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.26350","last_updated":"2026-07-28T23:46:37Z","snapshot_observed_at":"2026-08-14T20:00:15.829601Z","submitted_at":"2026-07-28T23:46:37Z","title":"Dissecting Sensitivity to Training Language in Self-Supervised Speech Learning Using Neural Audio Codec Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.26350","snapshot_observed_at":"2026-08-01T00:07:54.620862Z","title":"ESPnet-Codec provided a unified benchmark for training and evaluating NACs arXiv:2607.26350v1 [cs.SD] 28 Jul 2026 and offered early empirical studies of codec-based SSL [8]","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26350","last_updated":"2026-07-28T23:46:37Z","snapshot_observed_at":"2026-08-14T20:00:15.829601Z","submitted_at":"2026-07-28T23:46:37Z","title":"Dissecting Sensitivity to Training Language in Self-Supervised Speech Learning Using Neural Audio Codec Tokens","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T00:07:54.620862Z"},"links":{"cited_paper":"/paper/2607.26350","citing_paper":"/paper/2607.26350"},"observation_digest":"sha256:05d4c6d71005e0da9c1008fe49100930ece8380f4822da5f0c2334887ecffb73","observation_id":"eb3db4b6-a994-48be-80c2-7a75965a72fd","resolution":{"observed_at":"2026-08-01T00:07:54.620862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2607.26350/citation-record","integrity":"/paper/2607.26350/integrity","json":"/paper/2607.26350/citation-record.json","paper":"/paper/2607.26350"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:07:54.507488Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26350","last_updated":"2026-07-28T23:46:37Z","snapshot_observed_at":"2026-08-14T20:00:15.829601Z","submitted_at":"2026-07-28T23:46:37Z","title":"Dissecting Sensitivity to Training Language in Self-Supervised Speech Learning Using Neural Audio Codec Tokens","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T00:07:54.507488Z"},"links":{"citing_paper":"/paper/2607.26350"},"observation_digest":"sha256:320031a26427bd6d563730e279639383970896fa5df35ab5f91b479e2b34ec4c","observation_id":"fefd3f96-61bc-463c-910b-6f7750066bb9","resolution":{"observed_at":"2026-08-01T00:07:54.507488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.26350","last_updated":"2026-07-28T23:46:37Z","snapshot_observed_at":"2026-08-14T20:00:15.829601Z","submitted_at":"2026-07-28T23:46:37Z","title":"Dissecting Sensitivity to Training Language in Self-Supervised Speech Learning Using Neural Audio Codec Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.26350","snapshot_observed_at":"2026-08-01T00:07:54.620862Z","title":"ESPnet-Codec provided a unified benchmark for training and evaluating NACs arXiv:2607.26350v1 [cs.SD] 28 Jul 2026 and offered early empirical studies of codec-based SSL [8]","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26350","last_updated":"2026-07-28T23:46:37Z","snapshot_observed_at":"2026-08-14T20:00:15.829601Z","submitted_at":"2026-07-28T23:46:37Z","title":"Dissecting Sensitivity to Training Language in Self-Supervised Speech Learning Using Neural Audio Codec Tokens","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T00:07:54.620862Z"},"links":{"cited_paper":"/paper/2607.26350","citing_paper":"/paper/2607.26350"},"observation_digest":"sha256:05d4c6d71005e0da9c1008fe49100930ece8380f4822da5f0c2334887ecffb73","observation_id":"eb3db4b6-a994-48be-80c2-7a75965a72fd","resolution":{"observed_at":"2026-08-01T00:07:54.620862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:07:54.762971Z","title":"Experimental Design The experiments are designed to decouple language sensitiv- ity in codec-based SSL across the NAC and the SSL pre- training stage (Fig","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26350","last_updated":"2026-07-28T23:46:37Z","snapshot_observed_at":"2026-08-14T20:00:15.829601Z","submitted_at":"2026-07-28T23:46:37Z","title":"Dissecting Sensitivity to Training Language in Self-Supervised Speech Learning Using Neural Audio Codec Tokens","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T00:07:54.762971Z"},"links":{"citing_paper":"/paper/2607.26350"},"observation_digest":"sha256:cd864f0aac2932f56f5136286fa618d17932440e74627376b757c6f586e34840","observation_id":"33331adb-dd85-4fbf-b055-7f9ddb8ca43c","resolution":{"observed_at":"2026-08-01T00:07:54.762971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:07:54.860169Z","title":"Comparison across NACs To answer RQ1, we examined language sensitivity on NAC- reconstructed waveforms using the setup in Section 3","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26350","last_updated":"2026-07-28T23:46:37Z","snapshot_observed_at":"2026-08-14T20:00:15.829601Z","submitted_at":"2026-07-28T23:46:37Z","title":"Dissecting Sensitivity to Training Language in Self-Supervised Speech Learning Using Neural Audio Codec Tokens","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T00:07:54.860169Z"},"links":{"citing_paper":"/paper/2607.26350"},"observation_digest":"sha256:45f8cf376c76d6335740495cd3773e0e27dc67de3b1927bf2fa1f7164a3b7a17","observation_id":"4ee3d976-48f4-4e09-adc0-f46b77ddf50b","resolution":{"observed_at":"2026-08-01T00:07:54.860169Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:07:55.020198Z","title":"Experimental Setup We now analyze the language sensitivity within codec-based SSLs to answer RQ2 and RQ3","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26350","last_updated":"2026-07-28T23:46:37Z","snapshot_observed_at":"2026-08-14T20:00:15.829601Z","submitted_at":"2026-07-28T23:46:37Z","title":"Dissecting Sensitivity to Training Language in Self-Supervised Speech Learning Using Neural Audio Codec Tokens","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T00:07:55.020198Z"},"links":{"citing_paper":"/paper/2607.26350"},"observation_digest":"sha256:3dd6657b9e5ecce325b17e7e9c0538fc5cfb621fc37d8ebe45726e9ee39829d6","observation_id":"e7e649af-3eee-4fd8-8246-8ab180a74159","resolution":{"observed_at":"2026-08-01T00:07:55.020198Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:07:55.186719Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26350","last_updated":"2026-07-28T23:46:37Z","snapshot_observed_at":"2026-08-14T20:00:15.829601Z","submitted_at":"2026-07-28T23:46:37Z","title":"Dissecting Sensitivity to Training Language in Self-Supervised Speech Learning Using Neural Audio Codec Tokens","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T00:07:55.186719Z"},"links":{"citing_paper":"/paper/2607.26350"},"observation_digest":"sha256:c891e076ea1f02ed08d7b5d5a2afbb8153b68a97fd687d390c978991852e090e","observation_id":"f71cac89-cabe-4cb3-89fa-7a8bcdb0fd0d","resolution":{"observed_at":"2026-08-01T00:07:55.186719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:07:55.352502Z","title":"This study is also supported by AIST policy-based bud- get project ’R&D on Generative AI Foundation Models for the Physical Domain’","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26350","last_updated":"2026-07-28T23:46:37Z","snapshot_observed_at":"2026-08-14T20:00:15.829601Z","submitted_at":"2026-07-28T23:46:37Z","title":"Dissecting Sensitivity to Training Language in Self-Supervised Speech Learning Using Neural Audio Codec Tokens","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T00:07:55.352502Z"},"links":{"citing_paper":"/paper/2607.26350"},"observation_digest":"sha256:22ae121dc84b1bc732c4506b0be4924988ab37c92b336a87146e439a503698dd","observation_id":"0cb6a1f5-e635-434d-99b0-086182f22111","resolution":{"observed_at":"2026-08-01T00:07:55.352502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:07:55.518867Z","title":"The authors reviewed and edited the out- put as needed and take full responsibility for the content of the manuscript","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26350","last_updated":"2026-07-28T23:46:37Z","snapshot_observed_at":"2026-08-14T20:00:15.829601Z","submitted_at":"2026-07-28T23:46:37Z","title":"Dissecting Sensitivity to Training Language in Self-Supervised Speech Learning Using Neural Audio Codec Tokens","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T00:07:55.518867Z"},"links":{"citing_paper":"/paper/2607.26350"},"observation_digest":"sha256:f1ec82d3186ca56ea699310ecfba5b9cf856faa15ae011ab0ab9c38175700660","observation_id":"654c1652-bb83-4fd0-8f40-d23bed737b20","resolution":{"observed_at":"2026-08-01T00:07:55.518867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:07:55.625354Z","title":"Self-supervised speech representation learning: A review,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.26350","last_updated":"2026-07-28T23:46:37Z","snapshot_observed_at":"2026-08-14T20:00:15.829601Z","submitted_at":"2026-07-28T23:46:37Z","title":"Dissecting Sensitivity to Training Language in Self-Supervised Speech Learning Using Neural Audio Codec Tokens","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T00:07:55.625354Z"},"links":{"citing_paper":"/paper/2607.26350"},"observation_digest":"sha256:bbb4a8a702949b6109f0bc56006b57bf9f0b4018068af74087548de13c528057","observation_id":"116b993c-19a8-4929-aea9-3a6ab0d76741","resolution":{"observed_at":"2026-08-01T00:07:55.625354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:07:55.847196Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representa- tions,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.26350","last_updated":"2026-07-28T23:46:37Z","snapshot_observed_at":"2026-08-14T20:00:15.829601Z","submitted_at":"2026-07-28T23:46:37Z","title":"Dissecting Sensitivity to Training Language in Self-Supervised Speech Learning Using Neural Audio Codec Tokens","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T00:07:55.847196Z"},"links":{"citing_paper":"/paper/2607.26350"},"observation_digest":"sha256:48453438627bb5bbe7c869329f278ca59f1cedb7cfb2649e2a5e6695a09f7d77","observation_id":"2ed1b349-ae89-427d-af2a-83680ffe99a1","resolution":{"observed_at":"2026-08-01T00:07:55.847196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:07:56.064595Z","title":"HuBERT: Self-supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.26350","last_updated":"2026-07-28T23:46:37Z","snapshot_observed_at":"2026-08-14T20:00:15.829601Z","submitted_at":"2026-07-28T23:46:37Z","title":"Dissecting Sensitivity to Training Language in Self-Supervised Speech Learning Using Neural Audio Codec Tokens","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T00:07:56.064595Z"},"links":{"citing_paper":"/paper/2607.26350"},"observation_digest":"sha256:5989f5925945d8d99b5d2449aca0b35f5bee215002ffebc44dc3d98756644c20","observation_id":"cfc751a2-5be8-47e8-88b5-15cad692abb7","resolution":{"observed_at":"2026-08-01T00:07:56.064595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:07:56.226999Z","title":"Reducing barriers to self-supervised learning: HuBERT pre- training with academic compute,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26350","last_updated":"2026-07-28T23:46:37Z","snapshot_observed_at":"2026-08-14T20:00:15.829601Z","submitted_at":"2026-07-28T23:46:37Z","title":"Dissecting Sensitivity to Training Language in Self-Supervised Speech Learning Using Neural Audio Codec Tokens","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T00:07:56.226999Z"},"links":{"citing_paper":"/paper/2607.26350"},"observation_digest":"sha256:214c7706112d9a1fdfecef08c45272e12a1722cd94e288977f3c0fcb9c2eae49","observation_id":"20ff284d-9fef-4890-a716-69a8cdf30068","resolution":{"observed_at":"2026-08-01T00:07:56.226999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:07:56.392868Z","title":"Fast- HuBERT: An efficient training framework for self-supervised speech representation learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26350","last_updated":"2026-07-28T23:46:37Z","snapshot_observed_at":"2026-08-14T20:00:15.829601Z","submitted_at":"2026-07-28T23:46:37Z","title":"Dissecting Sensitivity to Training Language in Self-Supervised Speech Learning Using Neural Audio Codec Tokens","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T00:07:56.392868Z"},"links":{"citing_paper":"/paper/2607.26350"},"observation_digest":"sha256:6cc131839986673c79bdb75847281ad5e60c192ce5c89740a7b971eea29b6aaf","observation_id":"2c654289-a547-4374-b8a4-5c0faf2ba60e","resolution":{"observed_at":"2026-08-01T00:07:56.392868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:07:56.519582Z","title":"Towards efficient self-supervised repre- sentation learning in speech processing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26350","last_updated":"2026-07-28T23:46:37Z","snapshot_observed_at":"2026-08-14T20:00:15.829601Z","submitted_at":"2026-07-28T23:46:37Z","title":"Dissecting Sensitivity to Training Language in Self-Supervised Speech Learning Using Neural Audio Codec Tokens","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T00:07:56.519582Z"},"links":{"citing_paper":"/paper/2607.26350"},"observation_digest":"sha256:9645c13e77205ad337859df7089b54f01b66f31d7af2ce7ed4459e278f2aea7b","observation_id":"620ad765-d904-44c2-9b68-cb330072536d","resolution":{"observed_at":"2026-08-01T00:07:56.519582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:07:56.665696Z","title":"Efficient training of self-supervised speech foundation models on a com- pute budget,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26350","last_updated":"2026-07-28T23:46:37Z","snapshot_observed_at":"2026-08-14T20:00:15.829601Z","submitted_at":"2026-07-28T23:46:37Z","title":"Dissecting Sensitivity to Training Language in Self-Supervised Speech Learning Using Neural Audio Codec Tokens","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T00:07:56.665696Z"},"links":{"citing_paper":"/paper/2607.26350"},"observation_digest":"sha256:54d7f9d2370195d22097c2546706a631725a79d1bff91def234bbcbb3761bb5a","observation_id":"cbc64806-f355-4762-91e5-a04a7e306ac9","resolution":{"observed_at":"2026-08-01T00:07:56.665696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:07:56.869304Z","title":"ESPnet-Codec: Comprehensive training and eval- uation of neural codecs for audio, music, and speech,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26350","last_updated":"2026-07-28T23:46:37Z","snapshot_observed_at":"2026-08-14T20:00:15.829601Z","submitted_at":"2026-07-28T23:46:37Z","title":"Dissecting Sensitivity to Training Language in Self-Supervised Speech Learning Using Neural Audio Codec Tokens","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T00:07:56.869304Z"},"links":{"citing_paper":"/paper/2607.26350"},"observation_digest":"sha256:1d659bc1bbe1ed914da11929a3f92f3680ced903fcf75a9ceaca62911acddee1","observation_id":"16408a39-76be-4957-8ca3-9a824474e5ca","resolution":{"observed_at":"2026-08-01T00:07:56.869304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:07:57.054584Z","title":"Codec2Vec: Self-supervised speech representation learning using neural speech codecs,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26350","last_updated":"2026-07-28T23:46:37Z","snapshot_observed_at":"2026-08-14T20:00:15.829601Z","submitted_at":"2026-07-28T23:46:37Z","title":"Dissecting Sensitivity to Training Language in Self-Supervised Speech Learning Using Neural Audio Codec Tokens","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T00:07:57.054584Z"},"links":{"citing_paper":"/paper/2607.26350"},"observation_digest":"sha256:84bd9b9446e87baf4fb8a9552938807158fdb1a201c60c90e36bb10c2abd889d","observation_id":"824c96ac-360a-4039-b480-a6302559ecf8","resolution":{"observed_at":"2026-08-01T00:07:57.054584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:07:57.223360Z","title":"Discrete audio tokens: More than a survey!","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26350","last_updated":"2026-07-28T23:46:37Z","snapshot_observed_at":"2026-08-14T20:00:15.829601Z","submitted_at":"2026-07-28T23:46:37Z","title":"Dissecting Sensitivity to Training Language in Self-Supervised Speech Learning Using Neural Audio Codec Tokens","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T00:07:57.223360Z"},"links":{"citing_paper":"/paper/2607.26350"},"observation_digest":"sha256:72422def7054d666711a7043a2a5fe9019d4e7d13ff5f6d6c30ff22ed89f4abe","observation_id":"53fbc980-ea4b-4bee-bdd9-0dbe2918c7ca","resolution":{"observed_at":"2026-08-01T00:07:57.223360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:07:57.385923Z","title":"Exploration of language dependency for Japanese self-supervised speech rep- resentation models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26350","last_updated":"2026-07-28T23:46:37Z","snapshot_observed_at":"2026-08-14T20:00:15.829601Z","submitted_at":"2026-07-28T23:46:37Z","title":"Dissecting Sensitivity to Training Language in Self-Supervised Speech Learning Using Neural Audio Codec Tokens","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T00:07:57.385923Z"},"links":{"citing_paper":"/paper/2607.26350"},"observation_digest":"sha256:e5cf08d74e5c05d4ffecffbb9dbfb4b28cb5d4f56dafc26ef6b0f8f96f23a024","observation_id":"ca62793e-fc67-4180-9204-8d1fd72d8f4a","resolution":{"observed_at":"2026-08-01T00:07:57.385923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:07:57.394568Z","title":"Evaluating self- supervised speech models on a Taiwanese Hokkien corpus,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26350","last_updated":"2026-07-28T23:46:37Z","snapshot_observed_at":"2026-08-14T20:00:15.829601Z","submitted_at":"2026-07-28T23:46:37Z","title":"Dissecting Sensitivity to Training Language in Self-Supervised Speech Learning Using Neural Audio Codec Tokens","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T00:07:57.394568Z"},"links":{"citing_paper":"/paper/2607.26350"},"observation_digest":"sha256:51e184ca9aafa4ff137a2d78624998d1a07191d12a4297d321a7f7a58c00af44","observation_id":"20041a20-15a1-4834-bbf5-5f7627ca08bc","resolution":{"observed_at":"2026-08-01T00:07:57.394568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18217","last_updated":"2025-01-05T13:07:32Z","snapshot_observed_at":"2026-08-17T11:30:20.987636Z","submitted_at":"2024-11-27T10:51:00Z","title":"How to Learn a New Language? An Efficient Solution for Self-Supervised Learning Models Unseen Languages Adaption in Low-Resource Scenario","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.18217","snapshot_observed_at":"2026-08-01T00:07:57.438397Z","title":"How to learn a new language? An efficient solution for self-supervised learning mod- els unseen languages adaption in low-resource scenario,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26350","last_updated":"2026-07-28T23:46:37Z","snapshot_observed_at":"2026-08-14T20:00:15.829601Z","submitted_at":"2026-07-28T23:46:37Z","title":"Dissecting Sensitivity to Training Language in Self-Supervised Speech Learning Using Neural Audio Codec Tokens","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T00:07:57.438397Z"},"links":{"cited_paper":"/paper/2411.18217","citing_paper":"/paper/2607.26350"},"observation_digest":"sha256:fea7347bcc25255a827ec772be8ee25a6bfb5b8be9ccba4999939f0d4d6c6941","observation_id":"123dbe17-1647-43f9-b7ba-2018ec1e0df5","resolution":{"observed_at":"2026-08-01T00:07:57.438397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:07:57.551072Z","title":"On the language and gen- der biases in PSTN, V oIP and neural audio codecs,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26350","last_updated":"2026-07-28T23:46:37Z","snapshot_observed_at":"2026-08-14T20:00:15.829601Z","submitted_at":"2026-07-28T23:46:37Z","title":"Dissecting Sensitivity to Training Language in Self-Supervised Speech Learning Using Neural Audio Codec Tokens","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T00:07:57.551072Z"},"links":{"citing_paper":"/paper/2607.26350"},"observation_digest":"sha256:db648d12da38c42d6e8cb38d0c0cfdc13ca6c43625f197da2dd34b36eec25d69","observation_id":"1aa9b57f-c5ea-464c-b6fd-bb8a15dbfbd2","resolution":{"observed_at":"2026-08-01T00:07:57.551072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:07:57.641516Z","title":"Do neural codecs generalize? A controlled study across unseen languages and non-speech tasks,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26350","last_updated":"2026-07-28T23:46:37Z","snapshot_observed_at":"2026-08-14T20:00:15.829601Z","submitted_at":"2026-07-28T23:46:37Z","title":"Dissecting Sensitivity to Training Language in Self-Supervised Speech Learning Using Neural Audio Codec Tokens","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T00:07:57.641516Z"},"links":{"citing_paper":"/paper/2607.26350"},"observation_digest":"sha256:6d7725398f099fdb4f33fccac12c44f9cabaf64a7230fc60f810ba5ea1fd9bce","observation_id":"75521c40-7764-40ad-bac1-ede9ac8d62af","resolution":{"observed_at":"2026-08-01T00:07:57.641516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:07:57.751129Z","title":"High-fidelity audio compression with improved RVQGAN,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26350","last_updated":"2026-07-28T23:46:37Z","snapshot_observed_at":"2026-08-14T20:00:15.829601Z","submitted_at":"2026-07-28T23:46:37Z","title":"Dissecting Sensitivity to Training Language in Self-Supervised Speech Learning Using Neural Audio Codec Tokens","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T00:07:57.751129Z"},"links":{"citing_paper":"/paper/2607.26350"},"observation_digest":"sha256:e2e2e0e10116c2eb950daa1dc9800801a4b315aaee6941db7d9da3411ec22ae0","observation_id":"899c98ec-650b-486b-86dc-e2b13b1ffb3c","resolution":{"observed_at":"2026-08-01T00:07:57.751129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:07:57.879132Z","title":"Libri-Light: A benchmark for ASR with limited or no supervi- sion,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.26350","last_updated":"2026-07-28T23:46:37Z","snapshot_observed_at":"2026-08-14T20:00:15.829601Z","submitted_at":"2026-07-28T23:46:37Z","title":"Dissecting Sensitivity to Training Language in Self-Supervised Speech Learning Using Neural Audio Codec Tokens","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T00:07:57.879132Z"},"links":{"citing_paper":"/paper/2607.26350"},"observation_digest":"sha256:4bbcb4591a6b285197378d4fae74a2d535e7446ab9e50221b995df044b209c0a","observation_id":"78fe2f8c-8ccd-4a78-95bd-55cb252a4fd8","resolution":{"observed_at":"2026-08-01T00:07:57.879132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:07:58.012150Z","title":"Construction of a large-scale Japanese ASR corpus on TV recordings,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.26350","last_updated":"2026-07-28T23:46:37Z","snapshot_observed_at":"2026-08-14T20:00:15.829601Z","submitted_at":"2026-07-28T23:46:37Z","title":"Dissecting Sensitivity to Training Language in Self-Supervised Speech Learning Using Neural Audio Codec Tokens","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T00:07:58.012150Z"},"links":{"citing_paper":"/paper/2607.26350"},"observation_digest":"sha256:ece6fdd84070bff5ee770b8ead72eae9f8f4a1a4b21995ed29c05197467a7bfc","observation_id":"ff02645c-fa42-47db-bc6b-985f522ad149","resolution":{"observed_at":"2026-08-01T00:07:58.012150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:07:58.137496Z","title":"WenetSpeech: A 10000+ hours multi-domain Mandarin corpus for speech recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.26350","last_updated":"2026-07-28T23:46:37Z","snapshot_observed_at":"2026-08-14T20:00:15.829601Z","submitted_at":"2026-07-28T23:46:37Z","title":"Dissecting Sensitivity to Training Language in Self-Supervised Speech Learning Using Neural Audio Codec Tokens","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T00:07:58.137496Z"},"links":{"citing_paper":"/paper/2607.26350"},"observation_digest":"sha256:4bd5d4a820f70142ca7bae0a1b4b4f55fdb00d77a775e98fc2a869e65e8da560","observation_id":"d64d086b-2a8b-4181-a2f9-a7806a94e7a9","resolution":{"observed_at":"2026-08-01T00:07:58.137496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:07:58.313953Z","title":"AISHELL-1: An open-source Mandarin speech corpus and a speech recognition baseline,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.26350","last_updated":"2026-07-28T23:46:37Z","snapshot_observed_at":"2026-08-14T20:00:15.829601Z","submitted_at":"2026-07-28T23:46:37Z","title":"Dissecting Sensitivity to Training Language in Self-Supervised Speech Learning Using Neural Audio Codec Tokens","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T00:07:58.313953Z"},"links":{"citing_paper":"/paper/2607.26350"},"observation_digest":"sha256:d6e90a8042e6db7a29abbf0577044a0fc697c87c99ae56203a5af898d3228dc9","observation_id":"dcc94430-e5e7-4e6c-9722-0bae2b72b9eb","resolution":{"observed_at":"2026-08-01T00:07:58.313953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:07:58.465638Z","title":"Lib- riSpeech: An ASR corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.26350","last_updated":"2026-07-28T23:46:37Z","snapshot_observed_at":"2026-08-14T20:00:15.829601Z","submitted_at":"2026-07-28T23:46:37Z","title":"Dissecting Sensitivity to Training Language in Self-Supervised Speech Learning Using Neural Audio Codec Tokens","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T00:07:58.465638Z"},"links":{"citing_paper":"/paper/2607.26350"},"observation_digest":"sha256:8a6a08c2b1de799ac00bbdd58a2b30d36d382b63a032ca9558968a3d9d2956f2","observation_id":"8ab7c911-91d5-4b9d-bd27-dc836da2e61a","resolution":{"observed_at":"2026-08-01T00:07:58.465638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:07:58.628318Z","title":"Corpus of spontaneous Japanese: Its design and evaluation,","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2607.26350","last_updated":"2026-07-28T23:46:37Z","snapshot_observed_at":"2026-08-14T20:00:15.829601Z","submitted_at":"2026-07-28T23:46:37Z","title":"Dissecting Sensitivity to Training Language in Self-Supervised Speech Learning Using Neural Audio Codec Tokens","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T00:07:58.628318Z"},"links":{"citing_paper":"/paper/2607.26350"},"observation_digest":"sha256:780365dd5b4ac678b2224c1d04f02135cd43f112e5781e3abb9a4ebe4df0790f","observation_id":"bc2a30f2-c2ba-40d4-8404-0e896ace18aa","resolution":{"observed_at":"2026-08-01T00:07:58.628318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:07:58.798813Z","title":"Cor- pus of Japanese dialects (COJADS),","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.26350","last_updated":"2026-07-28T23:46:37Z","snapshot_observed_at":"2026-08-14T20:00:15.829601Z","submitted_at":"2026-07-28T23:46:37Z","title":"Dissecting Sensitivity to Training Language in Self-Supervised Speech Learning Using Neural Audio Codec Tokens","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T00:07:58.798813Z"},"links":{"citing_paper":"/paper/2607.26350"},"observation_digest":"sha256:c104ff9586245451e8b2e628c43b395abc05bc52b6af44152e0c9d1883830c18","observation_id":"432b14b2-abcc-4377-ad85-ffcc13358107","resolution":{"observed_at":"2026-08-01T00:07:58.798813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:07:58.954773Z","title":"IEMOCAP: Interactive emotional dyadic motion capture database,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2607.26350","last_updated":"2026-07-28T23:46:37Z","snapshot_observed_at":"2026-08-14T20:00:15.829601Z","submitted_at":"2026-07-28T23:46:37Z","title":"Dissecting Sensitivity to Training Language in Self-Supervised Speech Learning Using Neural Audio Codec Tokens","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T00:07:58.954773Z"},"links":{"citing_paper":"/paper/2607.26350"},"observation_digest":"sha256:e89e17aeb982c960d05f45a19cddb3ab794a6004fb59580106f43d5f3ccecfe2","observation_id":"811a1fee-a857-49c3-bff6-edc2c4593b22","resolution":{"observed_at":"2026-08-01T00:07:58.954773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:07:59.087574Z","title":"Construction and anal- ysis of phonetically and prosodically balanced emotional speech database,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.26350","last_updated":"2026-07-28T23:46:37Z","snapshot_observed_at":"2026-08-14T20:00:15.829601Z","submitted_at":"2026-07-28T23:46:37Z","title":"Dissecting Sensitivity to Training Language in Self-Supervised Speech Learning Using Neural Audio Codec Tokens","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T00:07:59.087574Z"},"links":{"citing_paper":"/paper/2607.26350"},"observation_digest":"sha256:3934f93eab4d9d82e72e5173b6bbe0f1918154e867ee2f714a521899f5f1d581","observation_id":"0c9d8b01-6992-49f1-9d37-5c711f8398e8","resolution":{"observed_at":"2026-08-01T00:07:59.087574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23018","last_updated":"2025-06-25T09:38:19Z","snapshot_observed_at":"2026-08-15T07:12:54.973301Z","submitted_at":"2025-05-29T02:56:08Z","title":"EmotionTalk: An Interactive Chinese Multimodal Emotion Dataset With Rich Annotations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23018","snapshot_observed_at":"2026-08-01T00:07:59.254037Z","title":"EmotionTalk: An interactive chinese multimodal emotion dataset with rich an- notations,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26350","last_updated":"2026-07-28T23:46:37Z","snapshot_observed_at":"2026-08-14T20:00:15.829601Z","submitted_at":"2026-07-28T23:46:37Z","title":"Dissecting Sensitivity to Training Language in Self-Supervised Speech Learning Using Neural Audio Codec Tokens","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T00:07:59.254037Z"},"links":{"cited_paper":"/paper/2505.23018","citing_paper":"/paper/2607.26350"},"observation_digest":"sha256:b22b6f3a8025a9bb54c5e543321b3aed355a2108d0716d9abccec7140b1ba662","observation_id":"d97eaa6b-fd42-4689-aa42-08d964e68376","resolution":{"observed_at":"2026-08-01T00:07:59.254037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:07:59.394060Z","title":"ESPnet: End-to-end speech processing toolkit,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.26350","last_updated":"2026-07-28T23:46:37Z","snapshot_observed_at":"2026-08-14T20:00:15.829601Z","submitted_at":"2026-07-28T23:46:37Z","title":"Dissecting Sensitivity to Training Language in Self-Supervised Speech Learning Using Neural Audio Codec Tokens","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T00:07:59.394060Z"},"links":{"citing_paper":"/paper/2607.26350"},"observation_digest":"sha256:6952c7e9a148ec33a075e653758c615593002a29be7f02cd71c6cc16e492dca0","observation_id":"343991d8-db76-4fd9-837e-6844cfdbc008","resolution":{"observed_at":"2026-08-01T00:07:59.394060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:07:59.519709Z","title":"SUPERB: Speech processing universal performance benchmark,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.26350","last_updated":"2026-07-28T23:46:37Z","snapshot_observed_at":"2026-08-14T20:00:15.829601Z","submitted_at":"2026-07-28T23:46:37Z","title":"Dissecting Sensitivity to Training Language in Self-Supervised Speech Learning Using Neural Audio Codec Tokens","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T00:07:59.519709Z"},"links":{"citing_paper":"/paper/2607.26350"},"observation_digest":"sha256:a5d313f2990a26282314a4b5b96531ebe3cb500ef2802bbf5f01732bd36101cd","observation_id":"5414aac1-0c07-4715-983f-32b2ecd520f1","resolution":{"observed_at":"2026-08-01T00:07:59.519709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:07:59.710658Z","title":"High fidelity neural audio compression,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26350","last_updated":"2026-07-28T23:46:37Z","snapshot_observed_at":"2026-08-14T20:00:15.829601Z","submitted_at":"2026-07-28T23:46:37Z","title":"Dissecting Sensitivity to Training Language in Self-Supervised Speech Learning Using Neural Audio Codec Tokens","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T00:07:59.710658Z"},"links":{"citing_paper":"/paper/2607.26350"},"observation_digest":"sha256:5345f5ed5f8749b672d7845fb1c6578864dfaaa0cb25a0eb58fcc5cb61a473d1","observation_id":"5b4d489e-88e2-4808-99a7-308fd40b85d7","resolution":{"observed_at":"2026-08-01T00:07:59.710658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:07:59.839603Z","title":"SpeechTok- enizer: Unified speech tokenizer for speech language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26350","last_updated":"2026-07-28T23:46:37Z","snapshot_observed_at":"2026-08-14T20:00:15.829601Z","submitted_at":"2026-07-28T23:46:37Z","title":"Dissecting Sensitivity to Training Language in Self-Supervised Speech Learning Using Neural Audio Codec Tokens","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T00:07:59.839603Z"},"links":{"citing_paper":"/paper/2607.26350"},"observation_digest":"sha256:a7825eea56857aed5c95c50aacaa99621320b38e96692ce17d3478c9960ebfee","observation_id":"6f50c16f-5142-4df0-8c02-cfa3ae832091","resolution":{"observed_at":"2026-08-01T00:07:59.839603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:07:59.998830Z","title":"Codec does matter: Ex- ploring the semantic shortcoming of codec for audio language model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26350","last_updated":"2026-07-28T23:46:37Z","snapshot_observed_at":"2026-08-14T20:00:15.829601Z","submitted_at":"2026-07-28T23:46:37Z","title":"Dissecting Sensitivity to Training Language in Self-Supervised Speech Learning Using Neural Audio Codec Tokens","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T00:07:59.998830Z"},"links":{"citing_paper":"/paper/2607.26350"},"observation_digest":"sha256:daef4d5649c393baac256894e0007ec5035988dc1e0051e2ba5aa03232b1a30c","observation_id":"49ad40c1-7a5b-4958-8dec-b39d0d4ef851","resolution":{"observed_at":"2026-08-01T00:07:59.998830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:08:00.125419Z","title":"PAST: Phonetic-acoustic speech tokenizer,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26350","last_updated":"2026-07-28T23:46:37Z","snapshot_observed_at":"2026-08-14T20:00:15.829601Z","submitted_at":"2026-07-28T23:46:37Z","title":"Dissecting Sensitivity to Training Language in Self-Supervised Speech Learning Using Neural Audio Codec Tokens","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T00:08:00.125419Z"},"links":{"citing_paper":"/paper/2607.26350"},"observation_digest":"sha256:f3631934858f74f5c10c96b44a5f8c620709b6732b29b9ad994690c3be54d90f","observation_id":"8dc59031-9f1d-4b0c-865a-2881df3972ea","resolution":{"observed_at":"2026-08-01T00:08:00.125419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:08:00.302195Z","title":"fairseq: A fast, extensible toolkit for sequence modeling,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.26350","last_updated":"2026-07-28T23:46:37Z","snapshot_observed_at":"2026-08-14T20:00:15.829601Z","submitted_at":"2026-07-28T23:46:37Z","title":"Dissecting Sensitivity to Training Language in Self-Supervised Speech Learning Using Neural Audio Codec Tokens","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T00:08:00.302195Z"},"links":{"citing_paper":"/paper/2607.26350"},"observation_digest":"sha256:25d2ac1369859fb36ac94aa956970b60097ab832f8fc2b998ab1365f42772e3e","observation_id":"3c2d0a7c-e5c6-4540-8c54-4dcb1f8b53cf","resolution":{"observed_at":"2026-08-01T00:08:00.302195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.26350","last_updated":"2026-07-28T23:46:37Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-14T20:00:15.829601Z","submitted_at":"2026-07-28T23:46:37Z","title":"Dissecting Sensitivity to Training Language in Self-Supervised Speech Learning Using Neural Audio Codec Tokens"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 1 inbound Pith citation observation for arXiv:2607.26350."}