{"as_of":"2026-08-22T07:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5844712749f4de869572f5df173d27310dd9325d3d80cdfab91d60b958c1cb31","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:13:03.252303Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:12:59.655958Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T13:13:03.654764Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.22487","last_updated":"2025-05-28T15:36:44Z","snapshot_observed_at":"2026-08-17T19:42:42.366961Z","submitted_at":"2025-05-28T15:36:44Z","title":"Effective Context in Neural Speech Models","version":1},"cited_work":{"arxiv_id":"2505.22487","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.22487","snapshot_observed_at":"2026-08-07T13:13:03.654764Z","title":"Effective Context in Neural Speech Models","venue":"cs.SD","work_id":"af69ceab-d650-453d-ace2-e0a462f4e542","year":2025},"citing_paper":{"arxiv_id":"2505.22487","last_updated":"2025-05-28T15:36:44Z","snapshot_observed_at":"2026-08-17T19:42:42.366961Z","submitted_at":"2025-05-28T15:36:44Z","title":"Effective Context in Neural Speech Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:59.655958Z"},"links":{"cited_paper":"/paper/2505.22487","citing_paper":"/paper/2505.22487"},"observation_digest":"sha256:f88835dde768b9aca6c52697106fdf543e4c8a7486d9c5415d11713022322d26","observation_id":"0bb1a129-6b93-4923-8146-3a7a0ee9ad9a","resolution":{"observed_at":"2026-08-07T13:13:03.746631Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.22487/citation-record","integrity":"/paper/2505.22487/integrity","json":"/paper/2505.22487/citation-record.json","paper":"/paper/2505.22487"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:10.857730Z","title":"Various speech tasks benefit from contextualized speech embeddings learned with self-supervision [1–5]","venue":null,"work_id":"8f0c8d96-ab2e-421e-a197-b1383ec614cf","year":null},"citing_paper":{"arxiv_id":"2505.22487","last_updated":"2025-05-28T15:36:44Z","snapshot_observed_at":"2026-08-17T19:42:42.366961Z","submitted_at":"2025-05-28T15:36:44Z","title":"Effective Context in Neural Speech Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:59.582785Z"},"links":{"citing_paper":"/paper/2505.22487"},"observation_digest":"sha256:1dd84819b81a138b3e233760cc5e508d2cc8516a40fa4cb5b355b73851b6614a","observation_id":"a2b95d58-3104-41f6-8de8-0b40d13db15a","resolution":{"observed_at":"2026-08-07T13:13:10.964238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22487","last_updated":"2025-05-28T15:36:44Z","snapshot_observed_at":"2026-08-17T19:42:42.366961Z","submitted_at":"2025-05-28T15:36:44Z","title":"Effective Context in Neural Speech Models","version":1},"cited_work":{"arxiv_id":"2505.22487","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.22487","snapshot_observed_at":"2026-08-07T13:13:03.654764Z","title":"Effective Context in Neural Speech Models","venue":"cs.SD","work_id":"af69ceab-d650-453d-ace2-e0a462f4e542","year":2025},"citing_paper":{"arxiv_id":"2505.22487","last_updated":"2025-05-28T15:36:44Z","snapshot_observed_at":"2026-08-17T19:42:42.366961Z","submitted_at":"2025-05-28T15:36:44Z","title":"Effective Context in Neural Speech Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:59.655958Z"},"links":{"cited_paper":"/paper/2505.22487","citing_paper":"/paper/2505.22487"},"observation_digest":"sha256:f88835dde768b9aca6c52697106fdf543e4c8a7486d9c5415d11713022322d26","observation_id":"0bb1a129-6b93-4923-8146-3a7a0ee9ad9a","resolution":{"observed_at":"2026-08-07T13:13:03.746631Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:10.576155Z","title":"In this section, we select a few models to analyze and showcase the utility of our approach","venue":null,"work_id":"0d9c6845-8e65-4972-9318-478447b4ddd3","year":null},"citing_paper":{"arxiv_id":"2505.22487","last_updated":"2025-05-28T15:36:44Z","snapshot_observed_at":"2026-08-17T19:42:42.366961Z","submitted_at":"2025-05-28T15:36:44Z","title":"Effective Context in Neural Speech Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:59.709068Z"},"links":{"citing_paper":"/paper/2505.22487"},"observation_digest":"sha256:740e5ec4d74a5176bfb7eb27fae95ff379d3f2b793765aab5a5121b19f0898d2","observation_id":"005a99e2-7950-4620-b375-48b941704549","resolution":{"observed_at":"2026-08-07T13:13:10.701876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:10.315310Z","title":"This would give us a streaming representation extractor","venue":null,"work_id":"eef9b414-a9df-4962-8413-03f420e99903","year":null},"citing_paper":{"arxiv_id":"2505.22487","last_updated":"2025-05-28T15:36:44Z","snapshot_observed_at":"2026-08-17T19:42:42.366961Z","submitted_at":"2025-05-28T15:36:44Z","title":"Effective Context in Neural Speech Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:59.788628Z"},"links":{"citing_paper":"/paper/2505.22487"},"observation_digest":"sha256:29581c8dfb40b3512c5311aaa2e4247255daa35b4786ed9a528d70fbfb931816","observation_id":"4929fe95-9750-4cc1-9e59-66cec61fa861","resolution":{"observed_at":"2026-08-07T13:13:10.431829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:09.940848Z","title":null,"venue":null,"work_id":"ca0fce48-30b8-4b6f-bbdd-30f83c44cc3c","year":null},"citing_paper":{"arxiv_id":"2505.22487","last_updated":"2025-05-28T15:36:44Z","snapshot_observed_at":"2026-08-17T19:42:42.366961Z","submitted_at":"2025-05-28T15:36:44Z","title":"Effective Context in Neural Speech Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:59.868073Z"},"links":{"citing_paper":"/paper/2505.22487"},"observation_digest":"sha256:62d840257126ca9147d5ade03d0c532eac8a2b23029ca4abdba3fcdfcb9f266e","observation_id":"334048f3-3cf5-4258-beff-e1ba4185e3de","resolution":{"observed_at":"2026-08-07T13:13:10.066451Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:09.672363Z","title":"An unsuper- vised autoregressive model for speech representation learning,","venue":null,"work_id":"079a1d2d-af33-416b-9bad-8d126073c60b","year":2019},"citing_paper":{"arxiv_id":"2505.22487","last_updated":"2025-05-28T15:36:44Z","snapshot_observed_at":"2026-08-17T19:42:42.366961Z","submitted_at":"2025-05-28T15:36:44Z","title":"Effective Context in Neural Speech Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:59.974843Z"},"links":{"citing_paper":"/paper/2505.22487"},"observation_digest":"sha256:5bafc16a143ba42a77376260332710d79d1379a401a4c2f872f426241a2da59c","observation_id":"392cee48-b74c-4c67-b396-e65f61b7ad30","resolution":{"observed_at":"2026-08-07T13:13:09.796435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-08-14T18:53:38.574749Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-07T13:13:00.070045Z","title":"Representation learning with contrastive predictive coding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.22487","last_updated":"2025-05-28T15:36:44Z","snapshot_observed_at":"2026-08-17T19:42:42.366961Z","submitted_at":"2025-05-28T15:36:44Z","title":"Effective Context in Neural Speech Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:00.070045Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2505.22487"},"observation_digest":"sha256:8da74f8a9330ae712ee115c0b509d2f15789028db2f693410466e6ba8fbe5ca6","observation_id":"616dd3d7-f2d5-42dd-bef9-6d5cc3570fd2","resolution":{"observed_at":"2026-08-07T13:13:00.070045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:09.368560Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":"96a0f5a5-ec4e-480a-8036-31a21e3c27a2","year":2020},"citing_paper":{"arxiv_id":"2505.22487","last_updated":"2025-05-28T15:36:44Z","snapshot_observed_at":"2026-08-17T19:42:42.366961Z","submitted_at":"2025-05-28T15:36:44Z","title":"Effective Context in Neural Speech Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:00.131396Z"},"links":{"citing_paper":"/paper/2505.22487"},"observation_digest":"sha256:ad99b63e497a7153983e8d53dc2ca92c24947e2d383baac3cb943d6264a0524e","observation_id":"d2a1f4c4-7333-4f08-840b-85439ba4f4b9","resolution":{"observed_at":"2026-08-07T13:13:09.521817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:09.089452Z","title":"Hubert: Self-supervised speech representa- tion learning by masked prediction of hidden units,","venue":null,"work_id":"3ee537e4-8ecb-4adb-b151-43d03c92b033","year":2021},"citing_paper":{"arxiv_id":"2505.22487","last_updated":"2025-05-28T15:36:44Z","snapshot_observed_at":"2026-08-17T19:42:42.366961Z","submitted_at":"2025-05-28T15:36:44Z","title":"Effective Context in Neural Speech Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:00.193758Z"},"links":{"citing_paper":"/paper/2505.22487"},"observation_digest":"sha256:9a63718a3de017c094b9771a0b2038acd51e143fdc559e80ac1503931d0d7c7a","observation_id":"e141feba-71f3-47af-a6ac-0e706271db33","resolution":{"observed_at":"2026-08-07T13:13:09.210532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:08.820179Z","title":"Wavlm: Large-scale self-supervised pre-training for full stack speech processing,","venue":null,"work_id":"8a6cd83f-defe-4088-a655-8e23f871476d","year":2022},"citing_paper":{"arxiv_id":"2505.22487","last_updated":"2025-05-28T15:36:44Z","snapshot_observed_at":"2026-08-17T19:42:42.366961Z","submitted_at":"2025-05-28T15:36:44Z","title":"Effective Context in Neural Speech Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:00.260884Z"},"links":{"citing_paper":"/paper/2505.22487"},"observation_digest":"sha256:49360f0f6997fd0ea9a2a6642c6e9625433c658a8462f8c80fe28b69a5dbb054","observation_id":"ca5d2263-335b-4706-80a8-e0b68e0b1fc7","resolution":{"observed_at":"2026-08-07T13:13:08.942901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:08.580654Z","title":"Transformer- Based Long-Context End-to-End Speech Recognition,","venue":null,"work_id":"05983423-9743-4ab9-90f5-b7770706cf55","year":2020},"citing_paper":{"arxiv_id":"2505.22487","last_updated":"2025-05-28T15:36:44Z","snapshot_observed_at":"2026-08-17T19:42:42.366961Z","submitted_at":"2025-05-28T15:36:44Z","title":"Effective Context in Neural Speech Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:00.361103Z"},"links":{"citing_paper":"/paper/2505.22487"},"observation_digest":"sha256:464bf4dd3a3985a89f35259dc949748c6dc022f6492a8ce08272307d6da0b66e","observation_id":"29939668-2a42-4b4d-b31f-557a3bdf9b72","resolution":{"observed_at":"2026-08-07T13:13:08.675610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:08.437770Z","title":"Large context end-to-end automatic speech recognition via extension of hierarchical recurrent encoder-decoder models,","venue":null,"work_id":"20a3ab9f-33cc-4cf2-9f69-f11c6af90479","year":2019},"citing_paper":{"arxiv_id":"2505.22487","last_updated":"2025-05-28T15:36:44Z","snapshot_observed_at":"2026-08-17T19:42:42.366961Z","submitted_at":"2025-05-28T15:36:44Z","title":"Effective Context in Neural Speech Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:00.480128Z"},"links":{"citing_paper":"/paper/2505.22487"},"observation_digest":"sha256:aa4a90eadda93fde74e06535d87da0f3d5eca7e5069dad01b0b4c7dc066d9a53","observation_id":"16eaf46b-c4ae-43d1-84be-e21fc83322ee","resolution":{"observed_at":"2026-08-07T13:13:08.504141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:08.302119Z","title":"How much context does my attention- based asr system need?","venue":null,"work_id":"fc5ba78d-866a-4e3b-9405-335d3369093e","year":2024},"citing_paper":{"arxiv_id":"2505.22487","last_updated":"2025-05-28T15:36:44Z","snapshot_observed_at":"2026-08-17T19:42:42.366961Z","submitted_at":"2025-05-28T15:36:44Z","title":"Effective Context in Neural Speech Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:00.538477Z"},"links":{"citing_paper":"/paper/2505.22487"},"observation_digest":"sha256:33d67614bf0f0ea042f125bafd6ab6c74a1d8c12764c3ce2d84cd9ccb4675fc5","observation_id":"e7146c4e-5d47-4d88-bf17-acc732145c2a","resolution":{"observed_at":"2026-08-07T13:13:08.362663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:08.091649Z","title":"Transformer-xl: Attentive language models beyond a fixed- length context,","venue":null,"work_id":"e040d5e3-4be5-4123-85a0-557b36ffc57e","year":2019},"citing_paper":{"arxiv_id":"2505.22487","last_updated":"2025-05-28T15:36:44Z","snapshot_observed_at":"2026-08-17T19:42:42.366961Z","submitted_at":"2025-05-28T15:36:44Z","title":"Effective Context in Neural Speech Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:00.633529Z"},"links":{"citing_paper":"/paper/2505.22487"},"observation_digest":"sha256:735fa85bc3d964b7f0ec9adae4823f172ea7836c4ab28a1e566dbf9aa12a68e6","observation_id":"5596c74c-6fda-4ae4-a0fd-781c7f9e9897","resolution":{"observed_at":"2026-08-07T13:13:08.222136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07143","last_updated":"2024-08-09T22:37:25Z","snapshot_observed_at":"2026-08-22T03:42:45.815038Z","submitted_at":"2024-04-10T16:18:42Z","title":"Leave No Context Behind: Efficient Infinite Context Transformers with Infini-attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07143","snapshot_observed_at":"2026-08-07T13:13:00.712227Z","title":"Leave no context behind: Efficient infinite context transformers with infini-attention,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22487","last_updated":"2025-05-28T15:36:44Z","snapshot_observed_at":"2026-08-17T19:42:42.366961Z","submitted_at":"2025-05-28T15:36:44Z","title":"Effective Context in Neural Speech Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:00.712227Z"},"links":{"cited_paper":"/paper/2404.07143","citing_paper":"/paper/2505.22487"},"observation_digest":"sha256:649e015fc8f5e9e217dc617f55b54bb80bca2281506630d863f886b5596414cc","observation_id":"41ab1751-7ae8-420a-9638-f7bab6833526","resolution":{"observed_at":"2026-08-07T13:13:00.712227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:07.955794Z","title":"Landmark attention: Random- access infinite context length for transformers,","venue":null,"work_id":"2be338ff-2881-40c6-8cf2-1b1c0ca23e71","year":2023},"citing_paper":{"arxiv_id":"2505.22487","last_updated":"2025-05-28T15:36:44Z","snapshot_observed_at":"2026-08-17T19:42:42.366961Z","submitted_at":"2025-05-28T15:36:44Z","title":"Effective Context in Neural Speech Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:00.801522Z"},"links":{"citing_paper":"/paper/2505.22487"},"observation_digest":"sha256:161ac33fe3c065fbaea5947f9c42f0e838fc69e4db1a6300855974bbf7a0ca3b","observation_id":"0638e044-5611-4241-b369-d501853b316c","resolution":{"observed_at":"2026-08-07T13:13:08.004223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:07.830377Z","title":"On training recurrent networks with trun- cated backpropagation through time in speech recognition,","venue":null,"work_id":"c500658e-6f52-486b-937e-166b224ba75b","year":2018},"citing_paper":{"arxiv_id":"2505.22487","last_updated":"2025-05-28T15:36:44Z","snapshot_observed_at":"2026-08-17T19:42:42.366961Z","submitted_at":"2025-05-28T15:36:44Z","title":"Effective Context in Neural Speech Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:00.889163Z"},"links":{"citing_paper":"/paper/2505.22487"},"observation_digest":"sha256:369128ffacf6117cd7f43cb54a8026cd48805252784306422355d9fc5957a600","observation_id":"64fcf7c8-5e84-41ba-b721-cfe349558de0","resolution":{"observed_at":"2026-08-07T13:13:07.919944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:07.609084Z","title":"On the usefulness of self-attention for automatic speech recognition with transformers,","venue":null,"work_id":"ba82b89d-2b75-4fe8-960f-393f38d60a28","year":2021},"citing_paper":{"arxiv_id":"2505.22487","last_updated":"2025-05-28T15:36:44Z","snapshot_observed_at":"2026-08-17T19:42:42.366961Z","submitted_at":"2025-05-28T15:36:44Z","title":"Effective Context in Neural Speech Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:00.983667Z"},"links":{"citing_paper":"/paper/2505.22487"},"observation_digest":"sha256:7481d6fc2b27c9e55ac4b7c3d25c06a3b4d9ee59852847df82b2b2ad97677904","observation_id":"33bd9470-69f6-414a-a6b8-58a398ef5c69","resolution":{"observed_at":"2026-08-07T13:13:07.707373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:07.394843Z","title":"Branchformer: Parallel mlp-attention architectures to capture local and global context for speech recognition and understanding,","venue":null,"work_id":"c9a82933-8b0a-4509-8358-ef51b32e159b","year":2022},"citing_paper":{"arxiv_id":"2505.22487","last_updated":"2025-05-28T15:36:44Z","snapshot_observed_at":"2026-08-17T19:42:42.366961Z","submitted_at":"2025-05-28T15:36:44Z","title":"Effective Context in Neural Speech Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:01.061987Z"},"links":{"citing_paper":"/paper/2505.22487"},"observation_digest":"sha256:e63578d50848f1868372b96deb11049c20d40399dc0badb3237a1b508c5fd8d9","observation_id":"0d5c833a-8eef-4d65-9001-16adfb888ee4","resolution":{"observed_at":"2026-08-07T13:13:07.505593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:07.104748Z","title":"Sum- former: A linear-complexity alternative to self-attention for speech recognition,","venue":null,"work_id":"8c9119b5-c477-484d-936b-ea1c694fa979","year":2024},"citing_paper":{"arxiv_id":"2505.22487","last_updated":"2025-05-28T15:36:44Z","snapshot_observed_at":"2026-08-17T19:42:42.366961Z","submitted_at":"2025-05-28T15:36:44Z","title":"Effective Context in Neural Speech Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:01.178965Z"},"links":{"citing_paper":"/paper/2505.22487"},"observation_digest":"sha256:9c13873fa4560c3eb95cfa753c9829ec18d1c41e0fbe986ea7880377363c5c3f","observation_id":"8269ea2f-966d-44e5-b977-27407010e94d","resolution":{"observed_at":"2026-08-07T13:13:07.259229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:06.809320Z","title":"Understanding the role of self attention for efficient speech recognition,","venue":null,"work_id":"a89b9e7c-9d7d-4398-bc52-0dbe28957c51","year":2022},"citing_paper":{"arxiv_id":"2505.22487","last_updated":"2025-05-28T15:36:44Z","snapshot_observed_at":"2026-08-17T19:42:42.366961Z","submitted_at":"2025-05-28T15:36:44Z","title":"Effective Context in Neural Speech Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:01.275517Z"},"links":{"citing_paper":"/paper/2505.22487"},"observation_digest":"sha256:29ccc238d337773d90da6422e0d19e5a536042c45a292142a781f28c24b23876","observation_id":"a70da8f1-06ae-49c3-8aa6-eca8da973126","resolution":{"observed_at":"2026-08-07T13:13:06.954279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:01.335885Z","title":"Layer-wise analysis of a self-supervised speech representation model,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.22487","last_updated":"2025-05-28T15:36:44Z","snapshot_observed_at":"2026-08-17T19:42:42.366961Z","submitted_at":"2025-05-28T15:36:44Z","title":"Effective Context in Neural Speech Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:01.335885Z"},"links":{"citing_paper":"/paper/2505.22487"},"observation_digest":"sha256:aa79025fa58cd0c4884980a60687e777c5e49478ee93a304b7df36a244832aa0","observation_id":"b4783fca-b3a0-4739-af17-09a0f04a7b8e","resolution":{"observed_at":"2026-08-07T13:13:01.335885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:01.400582Z","title":"Comparative layer-wise analysis of self-supervised speech models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22487","last_updated":"2025-05-28T15:36:44Z","snapshot_observed_at":"2026-08-17T19:42:42.366961Z","submitted_at":"2025-05-28T15:36:44Z","title":"Effective Context in Neural Speech Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:01.400582Z"},"links":{"citing_paper":"/paper/2505.22487"},"observation_digest":"sha256:b732526d6ad4e9e4f11d84186be0268ff1a362beb135e3b5964fa2f788499e43","observation_id":"1f1ddcbf-34d2-47dc-9cce-548b56f01132","resolution":{"observed_at":"2026-08-07T13:13:01.400582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:06.584877Z","title":"What do self- supervised speech models know about words?","venue":null,"work_id":"5abe8b0a-88fc-4afc-82ed-8a8e48d9d724","year":2023},"citing_paper":{"arxiv_id":"2505.22487","last_updated":"2025-05-28T15:36:44Z","snapshot_observed_at":"2026-08-17T19:42:42.366961Z","submitted_at":"2025-05-28T15:36:44Z","title":"Effective Context in Neural Speech Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:01.505061Z"},"links":{"citing_paper":"/paper/2505.22487"},"observation_digest":"sha256:14ed8038ddbd73952c60f5e12d676fa8788ac6765e924a850815b0463b0ec3ad","observation_id":"c3159dae-08a8-4f4d-998c-b1b1fb371ab3","resolution":{"observed_at":"2026-08-07T13:13:06.647316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:06.410313Z","title":"Probing phoneme, language and speaker information in unsupervised speech representations,","venue":null,"work_id":"186a5217-5fab-44db-a8f8-6ab2cb946b58","year":2022},"citing_paper":{"arxiv_id":"2505.22487","last_updated":"2025-05-28T15:36:44Z","snapshot_observed_at":"2026-08-17T19:42:42.366961Z","submitted_at":"2025-05-28T15:36:44Z","title":"Effective Context in Neural Speech Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:01.594066Z"},"links":{"citing_paper":"/paper/2505.22487"},"observation_digest":"sha256:46e9c666e91a9dd6f0a48f10afe7702018b586b2adbd99345c2874c8f34620ea","observation_id":"f5569d12-e175-4013-ad33-7852dfa0c70f","resolution":{"observed_at":"2026-08-07T13:13:06.485925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:06.165176Z","title":"Self-supervised speech representations are more phonetic than semantic,","venue":null,"work_id":"535654b4-1003-4c65-8cad-5b86bdac077f","year":2024},"citing_paper":{"arxiv_id":"2505.22487","last_updated":"2025-05-28T15:36:44Z","snapshot_observed_at":"2026-08-17T19:42:42.366961Z","submitted_at":"2025-05-28T15:36:44Z","title":"Effective Context in Neural Speech Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:01.704108Z"},"links":{"citing_paper":"/paper/2505.22487"},"observation_digest":"sha256:37b7d39e02e3d47d3d6298151593a358eb7945a4d8e82225a44eeaefbfd63604","observation_id":"d491e674-9043-4036-ae02-4084d4aa6147","resolution":{"observed_at":"2026-08-07T13:13:06.313506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:05.970201Z","title":"Sharp nearby, fuzzy far away: How neural language models use context,","venue":null,"work_id":"e8cef315-f2b2-4901-952a-11316acfa7af","year":2018},"citing_paper":{"arxiv_id":"2505.22487","last_updated":"2025-05-28T15:36:44Z","snapshot_observed_at":"2026-08-17T19:42:42.366961Z","submitted_at":"2025-05-28T15:36:44Z","title":"Effective Context in Neural Speech Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:01.786073Z"},"links":{"citing_paper":"/paper/2505.22487"},"observation_digest":"sha256:d8624c5bf2fcd5b7d2c6af0caf039fd09ce70f03326162591da16be35b8f1f7d","observation_id":"adead31a-6851-44bf-9072-0abd24ad8456","resolution":{"observed_at":"2026-08-07T13:13:06.041864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:05.831600Z","title":"What context features can trans- former language models use?","venue":null,"work_id":"a5884942-f039-4826-821f-676f721668b3","year":2021},"citing_paper":{"arxiv_id":"2505.22487","last_updated":"2025-05-28T15:36:44Z","snapshot_observed_at":"2026-08-17T19:42:42.366961Z","submitted_at":"2025-05-28T15:36:44Z","title":"Effective Context in Neural Speech Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:01.884279Z"},"links":{"citing_paper":"/paper/2505.22487"},"observation_digest":"sha256:85a4e1bc32decadc42e838ac6d2921775d4d74db42f67c176ee7dee6fc4b6e3a","observation_id":"5c670d2a-eae2-4432-becf-3fd5efef1796","resolution":{"observed_at":"2026-08-07T13:13:05.874176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:05.710688Z","title":"Same task, more tokens: the impact of input length on the reasoning performance of large language models,","venue":null,"work_id":"5442ef47-8447-47a2-a436-3650d785fb80","year":2024},"citing_paper":{"arxiv_id":"2505.22487","last_updated":"2025-05-28T15:36:44Z","snapshot_observed_at":"2026-08-17T19:42:42.366961Z","submitted_at":"2025-05-28T15:36:44Z","title":"Effective Context in Neural Speech Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:02.000787Z"},"links":{"citing_paper":"/paper/2505.22487"},"observation_digest":"sha256:494c649d9a5d74266493baef4029f6f678532bf8b221b56f09408c3e116a13f7","observation_id":"1a05d3e7-8c2d-4aa3-872a-54c9999eed90","resolution":{"observed_at":"2026-08-07T13:13:05.758043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:05.562953Z","title":"Deep inside con- volutional networks: Visualising image classification models and saliency maps,","venue":null,"work_id":"e3ee38b2-b1b8-463c-b11b-3c9ff0a5bd9c","year":2014},"citing_paper":{"arxiv_id":"2505.22487","last_updated":"2025-05-28T15:36:44Z","snapshot_observed_at":"2026-08-17T19:42:42.366961Z","submitted_at":"2025-05-28T15:36:44Z","title":"Effective Context in Neural Speech Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:02.096673Z"},"links":{"citing_paper":"/paper/2505.22487"},"observation_digest":"sha256:4593f1049004afbe68c0ec2c4eebe9bf76b22eb10b8dfdf37a05da6028c949b8","observation_id":"344f9c3a-27d0-44a9-b0cc-8a12c6750c02","resolution":{"observed_at":"2026-08-07T13:13:05.620990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:02.180276Z","title":"” why should i trust you?","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.22487","last_updated":"2025-05-28T15:36:44Z","snapshot_observed_at":"2026-08-17T19:42:42.366961Z","submitted_at":"2025-05-28T15:36:44Z","title":"Effective Context in Neural Speech Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:02.180276Z"},"links":{"citing_paper":"/paper/2505.22487"},"observation_digest":"sha256:5537ceb56369356391248234f8c7b7484ac235f7eeb960b8435d97a5e0512bbe","observation_id":"9a8110d1-3fd5-4076-93ad-1caa689a1d11","resolution":{"observed_at":"2026-08-07T13:13:02.180276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:05.332332Z","title":"A unified approach to interpreting model predic- tions,","venue":null,"work_id":"c84a5127-f1f1-4c9c-8411-7d6e42867d36","year":2017},"citing_paper":{"arxiv_id":"2505.22487","last_updated":"2025-05-28T15:36:44Z","snapshot_observed_at":"2026-08-17T19:42:42.366961Z","submitted_at":"2025-05-28T15:36:44Z","title":"Effective Context in Neural Speech Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:02.278465Z"},"links":{"citing_paper":"/paper/2505.22487"},"observation_digest":"sha256:e562d697ad8b3a415b64e0519863487ddbbf7bf03d0120ecac40ab4f680604b1","observation_id":"1892ea1f-12a6-457a-b43f-9a06ce7ddb08","resolution":{"observed_at":"2026-08-07T13:13:05.429914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:05.146584Z","title":"Autore- gressive predictive coding: A comprehensive study,","venue":null,"work_id":"afd47016-e04d-4f01-ae15-e488c683815d","year":2022},"citing_paper":{"arxiv_id":"2505.22487","last_updated":"2025-05-28T15:36:44Z","snapshot_observed_at":"2026-08-17T19:42:42.366961Z","submitted_at":"2025-05-28T15:36:44Z","title":"Effective Context in Neural Speech Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:02.356432Z"},"links":{"citing_paper":"/paper/2505.22487"},"observation_digest":"sha256:70670b9a22569a52314b5b5646bf2ff3a12dacf85ad00cf402ac1146c8ddadda","observation_id":"2119951c-ef13-4b1e-9555-483632a80632","resolution":{"observed_at":"2026-08-07T13:13:05.234971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:04.884299Z","title":"Pyin: A fundamental frequency estima- tor using probabilistic threshold distributions,","venue":null,"work_id":"cc83af80-11af-428f-ada0-1a8a9552f515","year":2014},"citing_paper":{"arxiv_id":"2505.22487","last_updated":"2025-05-28T15:36:44Z","snapshot_observed_at":"2026-08-17T19:42:42.366961Z","submitted_at":"2025-05-28T15:36:44Z","title":"Effective Context in Neural Speech Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:02.469649Z"},"links":{"citing_paper":"/paper/2505.22487"},"observation_digest":"sha256:b103157ebb52d4c501eabe97502dc8ded097e4c6ebdd346cc85f706af3ba515f","observation_id":"ad052d79-0bfe-4584-980b-e3a7d5bfee51","resolution":{"observed_at":"2026-08-07T13:13:05.015610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:04.700289Z","title":"fairseq: A fast, extensible toolkit for sequence modeling,","venue":null,"work_id":"41a5101b-73da-48bc-98b9-54e07fa5ea68","year":2019},"citing_paper":{"arxiv_id":"2505.22487","last_updated":"2025-05-28T15:36:44Z","snapshot_observed_at":"2026-08-17T19:42:42.366961Z","submitted_at":"2025-05-28T15:36:44Z","title":"Effective Context in Neural Speech Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:02.576827Z"},"links":{"citing_paper":"/paper/2505.22487"},"observation_digest":"sha256:3ef0c0c9d273090f4ddee1a65fdc90a75b85dc59e57530bb6cc1a34ddba70c9c","observation_id":"fb1b55f1-078c-4f69-9660-f4ccd86e1bbc","resolution":{"observed_at":"2026-08-07T13:13:04.789475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:04.512822Z","title":"Orthogo- nality and isotropy of speaker and phonetic information in self- supervised speech representations,","venue":null,"work_id":"d5ab0b4d-f3b0-4f79-a465-097b05063b36","year":2024},"citing_paper":{"arxiv_id":"2505.22487","last_updated":"2025-05-28T15:36:44Z","snapshot_observed_at":"2026-08-17T19:42:42.366961Z","submitted_at":"2025-05-28T15:36:44Z","title":"Effective Context in Neural Speech Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:02.707795Z"},"links":{"citing_paper":"/paper/2505.22487"},"observation_digest":"sha256:c25e9e708b349bac03dcb01b240fea044d04ebd45e40d15e67eee936f68c961b","observation_id":"774dc330-f1d5-4020-91d3-5d622ab4e9ed","resolution":{"observed_at":"2026-08-07T13:13:04.577573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:04.362978Z","title":"Dual-mode asr: Unify and improve streaming asr with full-context modeling,","venue":null,"work_id":"c5f41272-1385-4f8b-ae24-a4fe5b73cf2e","year":2020},"citing_paper":{"arxiv_id":"2505.22487","last_updated":"2025-05-28T15:36:44Z","snapshot_observed_at":"2026-08-17T19:42:42.366961Z","submitted_at":"2025-05-28T15:36:44Z","title":"Effective Context in Neural Speech Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:02.841186Z"},"links":{"citing_paper":"/paper/2505.22487"},"observation_digest":"sha256:5ef8213afbdf672f08efc1453fa1e0bc1b2fb43261943ea46aea1c767fd6aa7d","observation_id":"9a5b8b44-b7c0-40cc-a119-1e010b54b35e","resolution":{"observed_at":"2026-08-07T13:13:04.431650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:04.213565Z","title":"Efficient cascaded streaming asr system via frame rate reduction,","venue":null,"work_id":"32ef3221-1014-4af4-9ff9-613bdaa53351","year":2023},"citing_paper":{"arxiv_id":"2505.22487","last_updated":"2025-05-28T15:36:44Z","snapshot_observed_at":"2026-08-17T19:42:42.366961Z","submitted_at":"2025-05-28T15:36:44Z","title":"Effective Context in Neural Speech Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:02.945491Z"},"links":{"citing_paper":"/paper/2505.22487"},"observation_digest":"sha256:9e37037f9014f20487b3b16488d500019368df15d21a08c2af73a33e1a3ab2d2","observation_id":"aa4a4455-00f2-47f8-aa7b-14216bfe5daf","resolution":{"observed_at":"2026-08-07T13:13:04.266556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:04.057676Z","title":"Improving stream- ing automatic speech recognition with non-streaming model distil- lation on unsupervised data,","venue":null,"work_id":"98abe17a-5b6d-41f1-8301-14e6d7d9b2f3","year":2021},"citing_paper":{"arxiv_id":"2505.22487","last_updated":"2025-05-28T15:36:44Z","snapshot_observed_at":"2026-08-17T19:42:42.366961Z","submitted_at":"2025-05-28T15:36:44Z","title":"Effective Context in Neural Speech Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:03.012374Z"},"links":{"citing_paper":"/paper/2505.22487"},"observation_digest":"sha256:86f3696b5bffe172ce7eb3526ef176ba465bbf71f788f5439b968ea286894f43","observation_id":"8cf92f74-dabd-4b79-a92b-f2c329074d06","resolution":{"observed_at":"2026-08-07T13:13:04.102164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04439","last_updated":"2024-10-08T11:23:42Z","snapshot_observed_at":"2026-08-19T19:03:11.026053Z","submitted_at":"2024-07-05T11:41:11Z","title":"XLSR-Transducer: Streaming ASR for Self-Supervised Pretrained Models","version":2},"cited_work":{"arxiv_id":"2407.04439","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.04439","snapshot_observed_at":"2026-08-07T13:13:03.431872Z","title":"XLSR-Transducer: Streaming ASR for Self-Supervised Pretrained Models","venue":"eess.AS","work_id":"a897bcee-4b67-43b6-8225-7c5956ca3c86","year":2024},"citing_paper":{"arxiv_id":"2505.22487","last_updated":"2025-05-28T15:36:44Z","snapshot_observed_at":"2026-08-17T19:42:42.366961Z","submitted_at":"2025-05-28T15:36:44Z","title":"Effective Context in Neural Speech Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:03.116125Z"},"links":{"cited_paper":"/paper/2407.04439","citing_paper":"/paper/2505.22487"},"observation_digest":"sha256:cd3abafd36d774d7361e42a11c3ee514b4f7fa5a03d37484e3c66dde486b37fb","observation_id":"cc3569bc-7b55-47c5-b099-9c3612791b1c","resolution":{"observed_at":"2026-08-07T13:13:03.509031Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:03.851755Z","title":"Ecapa-tdnn: Emphasized channel attention, propagation and aggregation in tdnn based speaker verification,","venue":null,"work_id":"60a60987-094a-4337-abf6-a645b2bd51f8","year":2020},"citing_paper":{"arxiv_id":"2505.22487","last_updated":"2025-05-28T15:36:44Z","snapshot_observed_at":"2026-08-17T19:42:42.366961Z","submitted_at":"2025-05-28T15:36:44Z","title":"Effective Context in Neural Speech Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:03.187477Z"},"links":{"citing_paper":"/paper/2505.22487"},"observation_digest":"sha256:d79ea4941ba4c2565a28dc3564b75584ecb6b83e273ed740bf9db9ec778d7bd6","observation_id":"d1eb4ca2-f45c-4b4b-8807-497659c0e26a","resolution":{"observed_at":"2026-08-07T13:13:03.933161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:03.252303Z","title":"Robust speech recognition via large-scale weak su- pervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.22487","last_updated":"2025-05-28T15:36:44Z","snapshot_observed_at":"2026-08-17T19:42:42.366961Z","submitted_at":"2025-05-28T15:36:44Z","title":"Effective Context in Neural Speech Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:03.252303Z"},"links":{"citing_paper":"/paper/2505.22487"},"observation_digest":"sha256:cf474684d8b56f7f577bf97f1bd03cc11951a5cdf58fa72b2a3b84caf493b784","observation_id":"80026132-2bf7-4e73-b2a3-5ad7ad9058df","resolution":{"observed_at":"2026-08-07T13:13:03.252303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.22487","last_updated":"2025-05-28T15:36:44Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-17T19:42:42.366961Z","submitted_at":"2025-05-28T15:36:44Z","title":"Effective Context in Neural Speech Models"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":7,"verified_exact":1,"verified_fuzzy":33},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 1 inbound Pith citation observation for arXiv:2505.22487."}