{"as_of":"2026-08-07T12:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:907d41933f5a4c989895e88bf51e1283f15e5c45173415be08ce98a0002a2db7","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:25:28.605102Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.21712/citation-record","integrity":"/paper/2506.21712/integrity","json":"/paper/2506.21712/citation-record.json","paper":"/paper/2506.21712"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:25:34.594744Z","title":"Effec- tiveness of Self-Supervised Pre-Training for ASR","venue":null,"work_id":"689d358e-9273-49ab-be39-adaa0187282a","year":2020},"citing_paper":{"arxiv_id":"2506.21712","last_updated":"2025-06-26T18:54:26Z","snapshot_observed_at":"2026-08-06T22:18:18.856525Z","submitted_at":"2025-06-26T18:54:26Z","title":"Identifying Speaker Information in Feed-Forward Layers of Self-Supervised Speech Transformers","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:25:25.702637Z"},"links":{"citing_paper":"/paper/2506.21712"},"observation_digest":"sha256:15cb6c42c9399f7e305f11ffa7c8be6efc4d1b320337dcf9c4137f456b3484fa","observation_id":"309ee90f-0bb9-4dd5-91ac-7cbbfd341046","resolution":{"observed_at":"2026-08-06T22:25:34.695109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:25:34.384747Z","title":"data2vec: A General Framework for Self-supervised Learning in Speech, Vision and Language","venue":null,"work_id":"46fc0b3e-65a9-4431-a6b7-dbb4619ed991","year":2022},"citing_paper":{"arxiv_id":"2506.21712","last_updated":"2025-06-26T18:54:26Z","snapshot_observed_at":"2026-08-06T22:18:18.856525Z","submitted_at":"2025-06-26T18:54:26Z","title":"Identifying Speaker Information in Feed-Forward Layers of Self-Supervised Speech Transformers","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:25:25.787411Z"},"links":{"citing_paper":"/paper/2506.21712"},"observation_digest":"sha256:25c5fd2904e917b9c125782c7c9f056c6881720c6030e046e258f16ea19d8cd2","observation_id":"3ddf8954-34c3-4fa8-a90a-dc46b61fb615","resolution":{"observed_at":"2026-08-06T22:25:34.481655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:25:34.174916Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations","venue":null,"work_id":"3c3351a4-df15-49d7-b67f-29b466f6572a","year":2020},"citing_paper":{"arxiv_id":"2506.21712","last_updated":"2025-06-26T18:54:26Z","snapshot_observed_at":"2026-08-06T22:18:18.856525Z","submitted_at":"2025-06-26T18:54:26Z","title":"Identifying Speaker Information in Feed-Forward Layers of Self-Supervised Speech Transformers","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:25:25.913313Z"},"links":{"citing_paper":"/paper/2506.21712"},"observation_digest":"sha256:c3e661ec8ba72f4c07a20a6128c353002f2a1be9741324b956871afaf4217192","observation_id":"68ed416b-399e-4e94-9bfb-0ae96881ba0d","resolution":{"observed_at":"2026-08-06T22:25:34.273477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:25:33.966103Z","title":"Information-Theoretic Understanding of Population Risk Improvement with Model Com- pression","venue":null,"work_id":"480beaeb-a428-4234-958d-32149751bf8a","year":2020},"citing_paper":{"arxiv_id":"2506.21712","last_updated":"2025-06-26T18:54:26Z","snapshot_observed_at":"2026-08-06T22:18:18.856525Z","submitted_at":"2025-06-26T18:54:26Z","title":"Identifying Speaker Information in Feed-Forward Layers of Self-Supervised Speech Transformers","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:25:26.056743Z"},"links":{"citing_paper":"/paper/2506.21712"},"observation_digest":"sha256:ab0f1c21e9dda7d5164fc73f97925be7a5fbc0d8447dc5db034d4de832d010fd","observation_id":"7222a896-e7be-4a43-9e46-bc8c1cde2a48","resolution":{"observed_at":"2026-08-06T22:25:34.029574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:25:33.757776Z","title":"WavLM: Large-scale self- supervised pre-training for full stack speech process- ing","venue":null,"work_id":"4a85ab62-7f61-4c18-9dbf-6eae2ac4b69f","year":2022},"citing_paper":{"arxiv_id":"2506.21712","last_updated":"2025-06-26T18:54:26Z","snapshot_observed_at":"2026-08-06T22:18:18.856525Z","submitted_at":"2025-06-26T18:54:26Z","title":"Identifying Speaker Information in Feed-Forward Layers of Self-Supervised Speech Transformers","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:25:26.298623Z"},"links":{"citing_paper":"/paper/2506.21712"},"observation_digest":"sha256:ea9aea933dd912353c96c9ca09236d5eb7329b3c28c2c420e5f09e11021da02d","observation_id":"64d61391-68ae-42b2-8eb7-7f1c9d6fefc5","resolution":{"observed_at":"2026-08-06T22:25:33.865763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:25:33.547813Z","title":"Large-scale self-supervised speech representation learning for automatic speaker verification","venue":null,"work_id":"6359ddd2-15e3-45b8-9063-e474574adf81","year":2022},"citing_paper":{"arxiv_id":"2506.21712","last_updated":"2025-06-26T18:54:26Z","snapshot_observed_at":"2026-08-06T22:18:18.856525Z","submitted_at":"2025-06-26T18:54:26Z","title":"Identifying Speaker Information in Feed-Forward Layers of Self-Supervised Speech Transformers","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:25:26.555826Z"},"links":{"citing_paper":"/paper/2506.21712"},"observation_digest":"sha256:f0bae7d4455f4090e2c5cb21b4df557a99afba58f335ca2c642c583b0d5905eb","observation_id":"ffe9b5ed-b656-43ca-94de-cbe2ae68bf94","resolution":{"observed_at":"2026-08-06T22:25:33.639412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:25:33.329003Z","title":"Self-Supervised Speech Rep- resentations are More Phonetic than Semantic","venue":null,"work_id":"3ac9d5fb-3cd7-4a56-8b9b-9d100f4c9028","year":2024},"citing_paper":{"arxiv_id":"2506.21712","last_updated":"2025-06-26T18:54:26Z","snapshot_observed_at":"2026-08-06T22:18:18.856525Z","submitted_at":"2025-06-26T18:54:26Z","title":"Identifying Speaker Information in Feed-Forward Layers of Self-Supervised Speech Transformers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:25:26.727302Z"},"links":{"citing_paper":"/paper/2506.21712"},"observation_digest":"sha256:48147ba0d825ebfc9eda46bcc34b5a5705c67fa8dc833df63ea51d1077005305","observation_id":"dc7f348d-a99a-482b-bc40-33fb7ae902e1","resolution":{"observed_at":"2026-08-06T22:25:33.454549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:25:33.091186Z","title":"What do end-to-end speech models learn about speaker, language and channel information? A layer- wise and neuron-level analysis","venue":null,"work_id":"a649d3a6-f438-4bca-ab32-055854451cfa","year":2024},"citing_paper":{"arxiv_id":"2506.21712","last_updated":"2025-06-26T18:54:26Z","snapshot_observed_at":"2026-08-06T22:18:18.856525Z","submitted_at":"2025-06-26T18:54:26Z","title":"Identifying Speaker Information in Feed-Forward Layers of Self-Supervised Speech Transformers","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:25:26.925304Z"},"links":{"citing_paper":"/paper/2506.21712"},"observation_digest":"sha256:197afd047f697e4a3ce86702cc3ee60254b05787921a183d11a857eebe22851d","observation_id":"3cf3216e-e0d4-41a9-a62c-df6d1a535d66","resolution":{"observed_at":"2026-08-06T22:25:33.210026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:25:32.895720Z","title":"An unsupervised autoregressive model for speech representation learning","venue":null,"work_id":"a7f89157-084b-48cc-9cec-86cbc54c4b04","year":2019},"citing_paper":{"arxiv_id":"2506.21712","last_updated":"2025-06-26T18:54:26Z","snapshot_observed_at":"2026-08-06T22:18:18.856525Z","submitted_at":"2025-06-26T18:54:26Z","title":"Identifying Speaker Information in Feed-Forward Layers of Self-Supervised Speech Transformers","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:25:26.982957Z"},"links":{"citing_paper":"/paper/2506.21712"},"observation_digest":"sha256:a44d37c76c18f503aef045c9fdd4fa50cedfd87de5525f18fcfe73f853909742","observation_id":"b3a7cc86-5281-4db4-aaa1-da37c3604975","resolution":{"observed_at":"2026-08-06T22:25:32.970654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:25:32.738227Z","title":"Front-End Factor Analysis for Speaker Verification","venue":null,"work_id":"d7379d9c-bf40-4f62-8cf1-fd5c1281e40c","year":2011},"citing_paper":{"arxiv_id":"2506.21712","last_updated":"2025-06-26T18:54:26Z","snapshot_observed_at":"2026-08-06T22:18:18.856525Z","submitted_at":"2025-06-26T18:54:26Z","title":"Identifying Speaker Information in Feed-Forward Layers of Self-Supervised Speech Transformers","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:25:27.045700Z"},"links":{"citing_paper":"/paper/2506.21712"},"observation_digest":"sha256:cc40dcff80a60e7228896225db07a1b34b65c276e30b98b0201ce2995e0cdad3","observation_id":"9ebbc98f-483c-46b0-9fbd-b49d5e49653d","resolution":{"observed_at":"2026-08-06T22:25:32.807836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:25:32.536102Z","title":"Exploring wav2vec 2.0 on speaker verification and language identification","venue":null,"work_id":"4acdc835-c3f6-4bdb-8b80-f7c7fb16bca6","year":2021},"citing_paper":{"arxiv_id":"2506.21712","last_updated":"2025-06-26T18:54:26Z","snapshot_observed_at":"2026-08-06T22:18:18.856525Z","submitted_at":"2025-06-26T18:54:26Z","title":"Identifying Speaker Information in Feed-Forward Layers of Self-Supervised Speech Transformers","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:25:27.101061Z"},"links":{"citing_paper":"/paper/2506.21712"},"observation_digest":"sha256:88fdab0d5e4cff2507d72ec2dafd6b7e157b02e5727ebc3b4ef71505245dfa1a","observation_id":"8ceeafcb-5853-424c-ac2b-397d8e6d7bbc","resolution":{"observed_at":"2026-08-06T22:25:32.617615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:25:32.310182Z","title":"The lottery ticket hypothesis: Finding sparse, trainable neural net- works","venue":null,"work_id":"0fcafc46-5c04-4dcd-90f2-70282eaf8569","year":2018},"citing_paper":{"arxiv_id":"2506.21712","last_updated":"2025-06-26T18:54:26Z","snapshot_observed_at":"2026-08-06T22:18:18.856525Z","submitted_at":"2025-06-26T18:54:26Z","title":"Identifying Speaker Information in Feed-Forward Layers of Self-Supervised Speech Transformers","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:25:27.148299Z"},"links":{"citing_paper":"/paper/2506.21712"},"observation_digest":"sha256:bb8d6fad6085c5399a7b157d72016abed75f1bd8d1556aaca83a3c4e836baba1","observation_id":"07ba2303-83fc-444c-8ce9-dabb139b775e","resolution":{"observed_at":"2026-08-06T22:25:32.444932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:25:32.092653Z","title":"Self-supervised pre-training for attention-based encoder-decoder asr model","venue":null,"work_id":"45a45e7e-b7ff-476a-a428-a7321e174a8a","year":2022},"citing_paper":{"arxiv_id":"2506.21712","last_updated":"2025-06-26T18:54:26Z","snapshot_observed_at":"2026-08-06T22:18:18.856525Z","submitted_at":"2025-06-26T18:54:26Z","title":"Identifying Speaker Information in Feed-Forward Layers of Self-Supervised Speech Transformers","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:25:27.214246Z"},"links":{"citing_paper":"/paper/2506.21712"},"observation_digest":"sha256:d83684a2b3561a44c1573803b34d318e0f5a337e72b360e7edc9cae2ab3aec74","observation_id":"13dede3f-60be-42ca-b2fe-796140333089","resolution":{"observed_at":"2026-08-06T22:25:32.200397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:25:31.876641Z","title":"Transformer feed-forward layers are key-value memories","venue":null,"work_id":"0a3c1118-bc1a-439a-98dd-bff7e196ac5c","year":2021},"citing_paper":{"arxiv_id":"2506.21712","last_updated":"2025-06-26T18:54:26Z","snapshot_observed_at":"2026-08-06T22:18:18.856525Z","submitted_at":"2025-06-26T18:54:26Z","title":"Identifying Speaker Information in Feed-Forward Layers of Self-Supervised Speech Transformers","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:25:27.279541Z"},"links":{"citing_paper":"/paper/2506.21712"},"observation_digest":"sha256:fdbd723e9e37727581af0bff23acae00a2218eeb72991e1125a719cdf932d4c3","observation_id":"0986ef52-c63b-48b5-85b9-eafa5f65e781","resolution":{"observed_at":"2026-08-06T22:25:31.989063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:25:31.668882Z","title":"Learning both Weights and Connec- tions for Efficient Neural Network","venue":null,"work_id":"fd8dc7ba-cd52-4c72-9f3d-68ac16d14a24","year":2015},"citing_paper":{"arxiv_id":"2506.21712","last_updated":"2025-06-26T18:54:26Z","snapshot_observed_at":"2026-08-06T22:18:18.856525Z","submitted_at":"2025-06-26T18:54:26Z","title":"Identifying Speaker Information in Feed-Forward Layers of Self-Supervised Speech Transformers","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:25:27.344523Z"},"links":{"citing_paper":"/paper/2506.21712"},"observation_digest":"sha256:5b3702055b620f34d8ac3f0ec4e1c3436106b652093ded9d121616826c49f9d8","observation_id":"b4074e4b-03e7-43cb-bba9-0ee889ef45ed","resolution":{"observed_at":"2026-08-06T22:25:31.765812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:25:31.450384Z","title":"HuBERT: Self-supervised speech representation learning by masked prediction of hidden units","venue":null,"work_id":"2ef3a116-7d32-4a10-b2d5-6d94dd149755","year":2021},"citing_paper":{"arxiv_id":"2506.21712","last_updated":"2025-06-26T18:54:26Z","snapshot_observed_at":"2026-08-06T22:18:18.856525Z","submitted_at":"2025-06-26T18:54:26Z","title":"Identifying Speaker Information in Feed-Forward Layers of Self-Supervised Speech Transformers","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:25:27.406715Z"},"links":{"citing_paper":"/paper/2506.21712"},"observation_digest":"sha256:8868025c71088ab3f755edf9a78114b8645fb7cee9ed99d499fbaa5ae52a2455","observation_id":"a19828d9-e5df-428f-a2bf-e6a783218b50","resolution":{"observed_at":"2026-08-06T22:25:31.562831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:25:31.297176Z","title":"SNIP: Single-shot Network Pruning based on Connection Sensitivity","venue":null,"work_id":"83b112c7-5867-4204-bcab-be3e94979ce1","year":2019},"citing_paper":{"arxiv_id":"2506.21712","last_updated":"2025-06-26T18:54:26Z","snapshot_observed_at":"2026-08-06T22:18:18.856525Z","submitted_at":"2025-06-26T18:54:26Z","title":"Identifying Speaker Information in Feed-Forward Layers of Self-Supervised Speech Transformers","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:25:27.469531Z"},"links":{"citing_paper":"/paper/2506.21712"},"observation_digest":"sha256:d8348afcfba8e219a50aca98a817bd5301ec1a05caac36bd88ab060993c597ba","observation_id":"f1f97ec8-0a38-4470-9fa6-864f987b4e8c","resolution":{"observed_at":"2026-08-06T22:25:31.356232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:25:31.111295Z","title":"MelHu- BERT: A simplified HuBERT on Mel spectrograms","venue":null,"work_id":"e8909f38-44f4-4e0c-86f8-86edde5ddb94","year":2023},"citing_paper":{"arxiv_id":"2506.21712","last_updated":"2025-06-26T18:54:26Z","snapshot_observed_at":"2026-08-06T22:18:18.856525Z","submitted_at":"2025-06-26T18:54:26Z","title":"Identifying Speaker Information in Feed-Forward Layers of Self-Supervised Speech Transformers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:25:27.557079Z"},"links":{"citing_paper":"/paper/2506.21712"},"observation_digest":"sha256:8384502e1a7d19139cd338d674c2ca91596921fdeb01d584823171ec8c0a8c20","observation_id":"f50e7c19-32fa-48f0-b194-f0a7be1052f6","resolution":{"observed_at":"2026-08-06T22:25:31.197081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09949","last_updated":"2025-08-17T11:06:06Z","snapshot_observed_at":"2026-07-25T23:21:21.604406Z","submitted_at":"2022-11-17T23:53:52Z","title":"Is Smaller Always Faster? Tradeoffs in Compressing Self-Supervised Speech Transformers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09949","snapshot_observed_at":"2026-08-06T22:25:27.612020Z","title":"Compressing transformer-based self-supervised models for speech processing","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21712","last_updated":"2025-06-26T18:54:26Z","snapshot_observed_at":"2026-08-06T22:18:18.856525Z","submitted_at":"2025-06-26T18:54:26Z","title":"Identifying Speaker Information in Feed-Forward Layers of Self-Supervised Speech Transformers","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:25:27.612020Z"},"links":{"cited_paper":"/paper/2211.09949","citing_paper":"/paper/2506.21712"},"observation_digest":"sha256:1c45a9dca1a6f97c85cff7c2dc708ddc3d9073a58b483ddae67c7994535b51be","observation_id":"a3dfc27b-f5da-47c9-bbfd-bf9722da0206","resolution":{"observed_at":"2026-08-06T22:25:27.612020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:25:30.957517Z","title":"Property Neurons in Self- Supervised Speech Transformers","venue":null,"work_id":"36141bb5-8d82-4ed6-b1ed-1b5b038387f8","year":2024},"citing_paper":{"arxiv_id":"2506.21712","last_updated":"2025-06-26T18:54:26Z","snapshot_observed_at":"2026-08-06T22:18:18.856525Z","submitted_at":"2025-06-26T18:54:26Z","title":"Identifying Speaker Information in Feed-Forward Layers of Self-Supervised Speech Transformers","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:25:27.664671Z"},"links":{"citing_paper":"/paper/2506.21712"},"observation_digest":"sha256:758c7cdd79dc35e13c9077f8cdb5ee50fa72f36ef7ae49baa9d8fed6ac1d4cb8","observation_id":"c7c75aa7-13d6-48b2-8623-056e24c84396","resolution":{"observed_at":"2026-08-06T22:25:31.015998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.06659","last_updated":"2020-12-11T22:07:23Z","snapshot_observed_at":"2026-08-07T03:40:18.580356Z","submitted_at":"2020-12-11T22:07:23Z","title":"DeCoAR 2.0: Deep Contextualized Acoustic Representations with Vector Quantization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.06659","snapshot_observed_at":"2026-08-06T22:25:27.747596Z","title":"DeCoAR 2.0: Deep Contextualized Acoustic Representations with Vector Quantization","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.21712","last_updated":"2025-06-26T18:54:26Z","snapshot_observed_at":"2026-08-06T22:18:18.856525Z","submitted_at":"2025-06-26T18:54:26Z","title":"Identifying Speaker Information in Feed-Forward Layers of Self-Supervised Speech Transformers","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:25:27.747596Z"},"links":{"cited_paper":"/paper/2012.06659","citing_paper":"/paper/2506.21712"},"observation_digest":"sha256:a496749d0eae69f2e1e173aa59247a11fa166c56775f8b925403271f1cc95a66","observation_id":"ebc7b7de-f594-46cd-9f0d-a05eb86275a0","resolution":{"observed_at":"2026-08-06T22:25:27.747596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:25:30.768605Z","title":"DinoSR: Self-Distillation and Online Clustering for Self-supervised Speech Represen- tation Learning","venue":null,"work_id":"5cd2d389-895c-4bb8-9f5e-0a6dc6b4ee36","year":2024},"citing_paper":{"arxiv_id":"2506.21712","last_updated":"2025-06-26T18:54:26Z","snapshot_observed_at":"2026-08-06T22:18:18.856525Z","submitted_at":"2025-06-26T18:54:26Z","title":"Identifying Speaker Information in Feed-Forward Layers of Self-Supervised Speech Transformers","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:25:27.834256Z"},"links":{"citing_paper":"/paper/2506.21712"},"observation_digest":"sha256:57516bff1c9c722d90fbb281b4a13793d45eb7cfbb06f8f62b8ee363f5b37c11","observation_id":"4d562693-ff0a-4a8f-bb98-cc2fff0492bc","resolution":{"observed_at":"2026-08-06T22:25:30.860601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:25:30.578737Z","title":"TERA: Self-Supervised Learning of Transformer Encoder Rep- resentation for Speech","venue":null,"work_id":"de85d54c-05ce-4f95-90ed-628a26289797","year":2021},"citing_paper":{"arxiv_id":"2506.21712","last_updated":"2025-06-26T18:54:26Z","snapshot_observed_at":"2026-08-06T22:18:18.856525Z","submitted_at":"2025-06-26T18:54:26Z","title":"Identifying Speaker Information in Feed-Forward Layers of Self-Supervised Speech Transformers","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:25:27.887074Z"},"links":{"citing_paper":"/paper/2506.21712"},"observation_digest":"sha256:af7bec8aa3dd82ecca048d4de004674ad231b7cf04360ea2bb2408be31c3adc5","observation_id":"ddfb904e-523e-4e91-9581-d6612894ffe4","resolution":{"observed_at":"2026-08-06T22:25:30.673851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:25:30.400948Z","title":"Introducing phonetic information to speaker embedding for speaker verification","venue":null,"work_id":"7e63735a-da68-4cdf-b0b6-14e1e9e96e08","year":2019},"citing_paper":{"arxiv_id":"2506.21712","last_updated":"2025-06-26T18:54:26Z","snapshot_observed_at":"2026-08-06T22:18:18.856525Z","submitted_at":"2025-06-26T18:54:26Z","title":"Identifying Speaker Information in Feed-Forward Layers of Self-Supervised Speech Transformers","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:25:27.967325Z"},"links":{"citing_paper":"/paper/2506.21712"},"observation_digest":"sha256:a9133fd2d3664cbb0d1e4ed26fcb8f59fc4dc4f92e7f34584fcf19528baa96c7","observation_id":"64e2457b-a11c-4e53-9ae8-099756df9ba0","resolution":{"observed_at":"2026-08-06T22:25:30.483418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:25:30.207999Z","title":"Speaker embedding extraction with pho- netic information","venue":null,"work_id":"ba63c529-3cea-440e-b7a0-f7be98e63319","year":2018},"citing_paper":{"arxiv_id":"2506.21712","last_updated":"2025-06-26T18:54:26Z","snapshot_observed_at":"2026-08-06T22:18:18.856525Z","submitted_at":"2025-06-26T18:54:26Z","title":"Identifying Speaker Information in Feed-Forward Layers of Self-Supervised Speech Transformers","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:25:28.035813Z"},"links":{"citing_paper":"/paper/2506.21712"},"observation_digest":"sha256:fa9253fde5a7a9143f7527a7eaa6fd4b9a277ab3ca458bdbe9dce06398a9815e","observation_id":"c86fa06b-c217-4c73-9c42-ce5bd79f5706","resolution":{"observed_at":"2026-08-06T22:25:30.292776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:25:30.010551Z","title":"Probing self-supervised speech models for phonetic and phonemic information: a case study in aspiration","venue":null,"work_id":"032374dc-c102-4687-a37e-d241df1da06c","year":2023},"citing_paper":{"arxiv_id":"2506.21712","last_updated":"2025-06-26T18:54:26Z","snapshot_observed_at":"2026-08-06T22:18:18.856525Z","submitted_at":"2025-06-26T18:54:26Z","title":"Identifying Speaker Information in Feed-Forward Layers of Self-Supervised Speech Transformers","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:25:28.118083Z"},"links":{"citing_paper":"/paper/2506.21712"},"observation_digest":"sha256:04809ba7da19eff66ce460a9829bfe18a1caddd0c4f6defdf2f82005b25c0001","observation_id":"aa943e3d-74b7-4ca0-885d-a4344b5a9330","resolution":{"observed_at":"2026-08-06T22:25:30.107050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:25:29.751713Z","title":"Towards Supervised Performance on Speaker Verification with Self-Supervised Learning by Leveraging Large-Scale ASR Models","venue":null,"work_id":"307997c5-5847-46e1-8314-faf85f4f63a5","year":2024},"citing_paper":{"arxiv_id":"2506.21712","last_updated":"2025-06-26T18:54:26Z","snapshot_observed_at":"2026-08-06T22:18:18.856525Z","submitted_at":"2025-06-26T18:54:26Z","title":"Identifying Speaker Information in Feed-Forward Layers of Self-Supervised Speech Transformers","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:25:28.185382Z"},"links":{"citing_paper":"/paper/2506.21712"},"observation_digest":"sha256:9904ae7b77085a99c9935c2499d67b3347831df669001e293e73090d1cec0978","observation_id":"c6667708-0aee-4183-8c1f-7c638c3b8602","resolution":{"observed_at":"2026-08-06T22:25:29.895646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:25:29.481022Z","title":"Orthogonality and isotropy of speaker and phonetic information in self-supervised speech representations","venue":null,"work_id":"f016b299-02f1-4f08-b65b-cf4c5981cf67","year":2024},"citing_paper":{"arxiv_id":"2506.21712","last_updated":"2025-06-26T18:54:26Z","snapshot_observed_at":"2026-08-06T22:18:18.856525Z","submitted_at":"2025-06-26T18:54:26Z","title":"Identifying Speaker Information in Feed-Forward Layers of Self-Supervised Speech Transformers","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T22:25:28.269241Z"},"links":{"citing_paper":"/paper/2506.21712"},"observation_digest":"sha256:70cd19ed8f1d2279f08249c61e4ec5bb6983d2f091fe753cc894c0d8c86379f3","observation_id":"91ea8285-57f5-4b53-89e4-15c1d0ee3a42","resolution":{"observed_at":"2026-08-06T22:25:29.629155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:25:29.158229Z","title":"X-vectors: Robust dnn embeddings for speaker recognition","venue":null,"work_id":"43434646-2652-4d18-a65e-f6c3dcdb6393","year":2018},"citing_paper":{"arxiv_id":"2506.21712","last_updated":"2025-06-26T18:54:26Z","snapshot_observed_at":"2026-08-06T22:18:18.856525Z","submitted_at":"2025-06-26T18:54:26Z","title":"Identifying Speaker Information in Feed-Forward Layers of Self-Supervised Speech Transformers","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T22:25:28.351123Z"},"links":{"citing_paper":"/paper/2506.21712"},"observation_digest":"sha256:6525a5b74294d5f3ddd0ef0da25a5557d46af8df12857c81c6899eb02ed8b346","observation_id":"de6d4b23-0ae2-4c9d-8705-d10d5bd3bf4c","resolution":{"observed_at":"2026-08-06T22:25:29.294991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02735","last_updated":"2022-10-03T20:50:54Z","snapshot_observed_at":"2026-07-06T12:05:22.076764Z","submitted_at":"2021-11-04T10:39:06Z","title":"A Fine-tuned Wav2vec 2.0/HuBERT Benchmark For Speech Emotion Recognition, Speaker Verification and Spoken Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02735","snapshot_observed_at":"2026-08-06T22:25:28.434258Z","title":"A fine-tuned wav2vec 2.0/HuBERT benchmark for speech emotion recognition, speaker verification and spoken language understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21712","last_updated":"2025-06-26T18:54:26Z","snapshot_observed_at":"2026-08-06T22:18:18.856525Z","submitted_at":"2025-06-26T18:54:26Z","title":"Identifying Speaker Information in Feed-Forward Layers of Self-Supervised Speech Transformers","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:25:28.434258Z"},"links":{"cited_paper":"/paper/2111.02735","citing_paper":"/paper/2506.21712"},"observation_digest":"sha256:434c3d4e247cb2c11b7f076ffa545ce852ef94851aa1a9cfaf62076f2810ca69","observation_id":"8d87a066-029c-4c5f-908a-7b80a81e2f22","resolution":{"observed_at":"2026-08-06T22:25:28.434258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:25:28.883500Z","title":"Phonetic analysis of self-supervised representations of english speech","venue":null,"work_id":"16707a43-f44e-4695-aba4-6d35168090de","year":2022},"citing_paper":{"arxiv_id":"2506.21712","last_updated":"2025-06-26T18:54:26Z","snapshot_observed_at":"2026-08-06T22:18:18.856525Z","submitted_at":"2025-06-26T18:54:26Z","title":"Identifying Speaker Information in Feed-Forward Layers of Self-Supervised Speech Transformers","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T22:25:28.519396Z"},"links":{"citing_paper":"/paper/2506.21712"},"observation_digest":"sha256:9f6794c354382c2f84e4c6014f00ef0b77c5ab766f33bdf5c99e75d839e225f3","observation_id":"cae911fe-2c5e-4d70-a2b7-c9696eb18e3a","resolution":{"observed_at":"2026-08-06T22:25:28.985298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:25:28.772833Z","title":"SUPERB: Speech processing Universal PERformance Benchmark","venue":null,"work_id":"b9fe4bd8-d84b-4248-aa64-b8763ae0c5c9","year":2021},"citing_paper":{"arxiv_id":"2506.21712","last_updated":"2025-06-26T18:54:26Z","snapshot_observed_at":"2026-08-06T22:18:18.856525Z","submitted_at":"2025-06-26T18:54:26Z","title":"Identifying Speaker Information in Feed-Forward Layers of Self-Supervised Speech Transformers","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T22:25:28.605102Z"},"links":{"citing_paper":"/paper/2506.21712"},"observation_digest":"sha256:fa92fbf5c724fb6b6f7a316a911b2a9d34e3b3f5fe1ea978b60c7d5e8d7f8832","observation_id":"c7a6832a-d7b6-4b86-8040-7b8a2a746618","resolution":{"observed_at":"2026-08-06T22:25:28.837619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.21712","last_updated":"2025-06-26T18:54:26Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T22:18:18.856525Z","submitted_at":"2025-06-26T18:54:26Z","title":"Identifying Speaker Information in Feed-Forward Layers of Self-Supervised Speech Transformers"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":3,"verified_exact":0,"verified_fuzzy":29},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 0 inbound Pith citation observations for arXiv:2506.21712."}