{"as_of":"2026-08-06T10:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7d1e5f34f302d6848d01e3ca52e780e22165c27fd4987c49440907e8703a50b7","coverage":[{"denominator":100,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T20:31:48.143276Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.10456/citation-record","integrity":"/paper/2508.10456/integrity","json":"/paper/2508.10456/citation-record.json","paper":"/paper/2508.10456"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:39.040946Z","title":"Connectionist temporal classification: labelling unsegmented sequence data with recurrent neural networks,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:39.040946Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:55298c50d0270ba0918f00580167b12e595ee11c215610421cf4118f5e5234bc","observation_id":"11db9d7c-8e3b-4198-a6bc-1b8e5fffbb68","resolution":{"observed_at":"2026-08-05T20:31:39.040946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:39.145089Z","title":"Hybrid ctc/attention architecture for end-to-end speech recognition,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:39.145089Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:123a3f44d7c9989b1c38dabe2a84cd72f97b9379baea09ae81929bd8780d19d6","observation_id":"f7f1ea8e-1476-4043-9d28-2b0aa8db8904","resolution":{"observed_at":"2026-08-05T20:31:39.145089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:39.228233Z","title":"Listen, attend and spell: A neural network for large vocabulary conversational speech recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:39.228233Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:17da5c729e670a9336667d451f608c11c2f7c3d8c3d45cb8f04f7a9a307c3d8c","observation_id":"2095d3b1-e8d6-49e8-afab-564009151f8f","resolution":{"observed_at":"2026-08-05T20:31:39.228233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:39.340737Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:39.340737Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:1435b300dea131ae19e8d317a65298ce087044d6e47fb82ffa384e61244e31f3","observation_id":"b4c69068-b269-4da4-9bc8-7ac0012145a2","resolution":{"observed_at":"2026-08-05T20:31:39.340737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:39.447669Z","title":"Speech-transformer: a no-recurrence sequence-to- sequence model for speech recognition,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:39.447669Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:46fa93706e4684df16f7d8bc7e6cc828be2b81904a04d0fd54c94da8027f88d2","observation_id":"ab75db89-276c-470b-9458-8c626c82fc0f","resolution":{"observed_at":"2026-08-05T20:31:39.447669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:39.537168Z","title":"A comparative study on transformer vs rnn in speech applications,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:39.537168Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:3e38a745d96706fab832580587254d2c76b3eacadaee8784aeabf1b5d2d06995","observation_id":"e1fd1b12-f44a-4d9d-bafc-2a70d90e6f47","resolution":{"observed_at":"2026-08-05T20:31:39.537168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:39.633846Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:39.633846Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:0a933ae80c9231ba2f53347972b4f09c8e85c2e8eb770e227cb74860a05399fe","observation_id":"4bee5d7f-62eb-48c2-82d2-5097c1aac52e","resolution":{"observed_at":"2026-08-05T20:31:39.633846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:39.712245Z","title":"Recent developments on espnet toolkit boosted by conformer,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:39.712245Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:d1106d5a59906bd6723ee3044695c675ff73b45cd85e08ef0875df846a52ab25","observation_id":"d2390ca1-8927-4b0a-acd4-f2140f2dfb33","resolution":{"observed_at":"2026-08-05T20:31:39.712245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1211.3711","last_updated":"2012-11-14T19:25:21Z","snapshot_observed_at":"2026-07-06T02:59:58.238741Z","submitted_at":"2012-11-14T19:25:21Z","title":"Sequence Transduction with Recurrent Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1211.3711","snapshot_observed_at":"2026-08-05T20:31:39.796983Z","title":"Sequence transduction with recurrent neural networks,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:39.796983Z"},"links":{"cited_paper":"/paper/1211.3711","citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:7d9f9f34088a98052e094c9f947cf9df92d002dedfaf824c6903f16bd618006c","observation_id":"e7c11225-302e-4ce8-bc5e-05b7baf6788f","resolution":{"observed_at":"2026-08-05T20:31:39.796983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:39.914416Z","title":"Recurrent neural networks,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:39.914416Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:1b816ed3f71de82a4d526ae38f29a860b434a5061839cde5eda94f2084a5bde3","observation_id":"047e0586-806e-42cd-81aa-7574d9fa98cd","resolution":{"observed_at":"2026-08-05T20:31:39.914416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1402.1128","last_updated":"2014-02-05T19:01:51Z","snapshot_observed_at":"2026-07-06T03:35:13.381526Z","submitted_at":"2014-02-05T19:01:51Z","title":"Long Short-Term Memory Based Recurrent Neural Network Architectures for Large Vocabulary Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1402.1128","snapshot_observed_at":"2026-08-05T20:31:40.032849Z","title":"Long short-term memory based recurrent neural network architectures for large vocabulary speech recognition,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:40.032849Z"},"links":{"cited_paper":"/paper/1402.1128","citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:6cc47a9f4988c81a02a82030bbbc67f3d6ff2c55e3ee7463dc3932174e5b41fe","observation_id":"3c41ce41-2d7b-4270-a270-7a0ebda4a6d8","resolution":{"observed_at":"2026-08-05T20:31:40.032849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:40.112682Z","title":"Efficient training of neural transducer for speech recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:40.112682Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:2f5441864ceed0ed28fa243ce2c855eadd26deaf575dc7c02ab4b17a1fb451ea","observation_id":"6d4faef4-48f6-4892-a2c7-dc86704e821e","resolution":{"observed_at":"2026-08-05T20:31:40.112682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:40.213383Z","title":"On the limit of english conversational speech recog- nition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:40.213383Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:8f733eac3bb4f9365c377278cefbb5d2015f99a052c0310cf5c7e5812ed34155","observation_id":"995b2255-cb3e-47ef-98d0-352f5904b3aa","resolution":{"observed_at":"2026-08-05T20:31:40.213383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:40.327114Z","title":"Improving the training recipe for a robust conformer-based hybrid model,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:40.327114Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:37c85ba21448dcff15b3163aada03bb92cefbe6b48046ce48bd182d2e5954367","observation_id":"7146709b-3bbc-4ffe-be3a-99477a6906f5","resolution":{"observed_at":"2026-08-05T20:31:40.327114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:40.415984Z","title":"Confidence score based conformer speaker adaptation for speech recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:40.415984Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:c14859b49479013437fd068919dbfa6a225697e61da21ced2cfecb0db8cc0313","observation_id":"9cd39ca8-bd36-4e63-9213-3cfcdf89c110","resolution":{"observed_at":"2026-08-05T20:31:40.415984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.14120","last_updated":"2023-02-27T20:08:36Z","snapshot_observed_at":"2026-07-06T14:56:31.902968Z","submitted_at":"2023-02-27T20:08:36Z","title":"Diagonal State Space Augmented Transformers for Speech Recognition","version":1},"cited_work":{"arxiv_id":"2302.14120","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.14120","snapshot_observed_at":"2026-08-05T20:31:51.151579Z","title":"Diagonal State Space Augmented Transformers for Speech Recognition","venue":"eess.AS","work_id":"9e919a8e-a54a-4583-9c6a-421e15ee2be5","year":2023},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:40.515370Z"},"links":{"cited_paper":"/paper/2302.14120","citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:f00da51c22dd5b9ee1daf9c9ce279d70d2f73ddc7145ff5a14489d9932451cca","observation_id":"00bb68b6-2a8c-4174-b0bf-d35ecab8dbb3","resolution":{"observed_at":"2026-08-05T20:31:51.243108Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:40.601112Z","title":"Recent advances in end-to-end automatic speech recog- nition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:40.601112Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:b500140dfe4c444b1b9d0e910297bce84c36f333ec281f83682e95af2b045271","observation_id":"0617d538-d4e0-42ce-b3bd-101d1af0fe27","resolution":{"observed_at":"2026-08-05T20:31:40.601112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00883","last_updated":"2022-07-02T17:17:47Z","snapshot_observed_at":"2026-07-06T13:27:11.251713Z","submitted_at":"2022-07-02T17:17:47Z","title":"Improving Transformer-based Conversational ASR by Inter-Sentential Attention Mechanism","version":1},"cited_work":{"arxiv_id":"2207.00883","doi":null,"metadata_source":"pith","pith_arxiv_id":"2207.00883","snapshot_observed_at":"2026-08-05T20:31:50.852399Z","title":"Improving Transformer-based Conversational ASR by Inter-Sentential Attention Mechanism","venue":"cs.SD","work_id":"2b2b1b9a-4369-4654-a5af-6226105cc4af","year":2022},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:40.689037Z"},"links":{"cited_paper":"/paper/2207.00883","citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:e7c0b824118c9de92d2ef63af10f01ea68406dc33f0715ac3d30fcd5ccfc44e6","observation_id":"0bcb61f5-291a-410e-b19c-38ee77418444","resolution":{"observed_at":"2026-08-05T20:31:51.028105Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:40.773045Z","title":"Improving asr contextual biasing with guided attention,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:40.773045Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:61558c347d8b987b43c667069de7eacb92a1c0e445c6c4d2d3d59f0e55cf0ef8","observation_id":"ec1cfdea-1210-4095-8423-246400ab3e25","resolution":{"observed_at":"2026-08-05T20:31:40.773045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:40.851093Z","title":"Optimizing byte-level representation for end-to-end asr,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:40.851093Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:49ea49ccdab3187b387b7d746bc1ab8f8386ee4e1f90006ab5e0cd20692a4fd2","observation_id":"0d3c780a-92b5-4b2b-8207-abaff055228d","resolution":{"observed_at":"2026-08-05T20:31:40.851093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:40.979654Z","title":"Contextual modeling for document-level asr error correction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:40.979654Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:22efe681be36332011d48c9b633f853cf6c59ec7801286268832debef2d8203c","observation_id":"d9907ec3-f172-4699-9634-6a4165bf1ed9","resolution":{"observed_at":"2026-08-05T20:31:40.979654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:41.065159Z","title":"Promptasr for contextualized asr with controllable style,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:41.065159Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:b11df8994d1556897013c3706c9119c81bde1b98b43236bce7643d0910e8f0f9","observation_id":"9c199e58-a953-4b7a-9239-740734c6c521","resolution":{"observed_at":"2026-08-05T20:31:41.065159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:41.143119Z","title":"Conversational speech recognition by learning audio- textual cross-modal contextual representation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:41.143119Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:ab61d76b6ae9e189d0248a8b32bd77b76706f1de430219e1c45f8f851507a6fc","observation_id":"6f881a35-e3a6-4ae2-80d2-cd350f18f212","resolution":{"observed_at":"2026-08-05T20:31:41.143119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:41.229606Z","title":"Dual-mode nam: Effective top-k context injection for end-to-end asr,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:41.229606Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:ad3f416e0f5d455172a21bb864d0810611a0afa40425aa50833d8f5306397086","observation_id":"5efe2905-0318-4095-96cc-99e8f0f248b1","resolution":{"observed_at":"2026-08-05T20:31:41.229606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.07413","last_updated":"2023-09-21T03:02:27Z","snapshot_observed_at":"2026-07-06T16:18:17.458740Z","submitted_at":"2023-09-14T03:40:14Z","title":"CPPF: A contextual and post-processing-free model for automatic speech recognition","version":2},"cited_work":{"arxiv_id":"2309.07413","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.07413","snapshot_observed_at":"2026-08-05T20:31:50.649121Z","title":"CPPF: A contextual and post-processing-free model for automatic speech recognition","venue":"cs.CL","work_id":"462244e5-9d1f-47ad-ba4f-1148e509bbfd","year":2023},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:41.333464Z"},"links":{"cited_paper":"/paper/2309.07413","citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:092f49ca97218da7442495f66a7fae86457a7ad4aef425bc9d1d798c436c2f1c","observation_id":"3e8e1dbc-1089-4d79-ab86-e7db061ad785","resolution":{"observed_at":"2026-08-05T20:31:50.766549Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.12459","last_updated":"2023-05-21T13:32:19Z","snapshot_observed_at":"2026-07-06T15:30:14.400809Z","submitted_at":"2023-05-21T13:32:19Z","title":"CASA-ASR: Context-Aware Speaker-Attributed ASR","version":1},"cited_work":{"arxiv_id":"2305.12459","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.12459","snapshot_observed_at":"2026-08-05T20:31:50.439220Z","title":"CASA-ASR: Context-Aware Speaker-Attributed ASR","venue":"eess.AS","work_id":"fc02ee6b-843d-4857-8bfd-ca825ff6e408","year":2023},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:41.404760Z"},"links":{"cited_paper":"/paper/2305.12459","citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:d76b616930f681070cab49b06a7aa10bae16bb87dd14638628c7614647cab22b","observation_id":"71a14c27-013a-4ac2-9140-e92a55b71557","resolution":{"observed_at":"2026-08-05T20:31:50.531977Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02736","last_updated":"2023-01-06T22:32:50Z","snapshot_observed_at":"2026-08-06T10:06:35.216333Z","submitted_at":"2023-01-06T22:32:50Z","title":"Using External Off-Policy Speech-To-Text Mappings in Contextual End-To-End Automated Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02736","snapshot_observed_at":"2026-08-05T20:31:41.493267Z","title":"Using external off-policy speech-to-text mappings in contextual end-to-end automated speech recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:41.493267Z"},"links":{"cited_paper":"/paper/2301.02736","citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:5bf2f79c9a9e8292376f08e6b97ad2a958a57c5aaa47213f4e76dea69c6903e1","observation_id":"593b9995-e5c3-43dc-8322-202f0bcb9e72","resolution":{"observed_at":"2026-08-05T20:31:41.493267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:01.145127Z","title":"Bring dialogue-context into rnn-t for streaming asr,","venue":null,"work_id":"ef6538c3-7163-4a7b-b890-f8bf0ed17082","year":2022},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:41.598588Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:ad27feb724bf8836a801a80887b29da6b9706a56af5ad14467162e6f42a901f3","observation_id":"461d666f-6e32-4906-83d4-166bd3dec097","resolution":{"observed_at":"2026-08-05T20:32:01.257605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.12839","last_updated":"2024-05-27T06:35:36Z","snapshot_observed_at":"2026-07-06T15:30:30.381545Z","submitted_at":"2023-05-22T09:03:11Z","title":"CopyNE: Better Contextual ASR by Copying Named Entities","version":2},"cited_work":{"arxiv_id":"2305.12839","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.12839","snapshot_observed_at":"2026-08-05T20:31:50.141909Z","title":"CopyNE: Better Contextual ASR by Copying Named Entities","venue":"cs.CL","work_id":"38d6757e-cb0f-444c-9b6b-0cbdf561b2af","year":2023},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:41.707826Z"},"links":{"cited_paper":"/paper/2305.12839","citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:f5c0ecb0c89f6c75fb7d4e7d5bac94a8b32f237fd4faaa598be172984989f3b0","observation_id":"74b8dca5-c583-4fd1-acbd-7016962c5497","resolution":{"observed_at":"2026-08-05T20:31:50.264086Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10303","last_updated":"2024-07-14T19:32:33Z","snapshot_observed_at":"2026-08-06T07:23:30.774713Z","submitted_at":"2024-07-14T19:32:33Z","title":"Improving Neural Biasing for Contextual Speech Recognition by Early Context Injection and Text Perturbation","version":1},"cited_work":{"arxiv_id":"2407.10303","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.10303","snapshot_observed_at":"2026-08-05T20:31:49.944924Z","title":"Improving Neural Biasing for Contextual Speech Recognition by Early Context Injection and Text Perturbation","venue":"eess.AS","work_id":"986f12f8-38e2-463e-a14d-6834de22bea8","year":2024},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:41.805565Z"},"links":{"cited_paper":"/paper/2407.10303","citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:22109abb0b08d7161619ddf6ed9fb47096cccb844a217794c5306436c6cfae33","observation_id":"08faf3b5-bde3-4fae-a1fe-1c067bc2b645","resolution":{"observed_at":"2026-08-05T20:31:50.050215Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:00.964214Z","title":"Training language models for long-span cross-sentence evaluation,","venue":null,"work_id":"a6dd2c64-8243-4504-beb0-3763c10f9047","year":2019},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:41.884033Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:a26b9e9fa784244fc65069fb31e56e7cad21883491fcd2b72b2eaeff8f9f7eed","observation_id":"6976842c-c120-407c-8157-c58085e3a12f","resolution":{"observed_at":"2026-08-05T20:32:01.036595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11349","last_updated":"2020-10-21T23:40:26Z","snapshot_observed_at":"2026-07-06T10:07:02.034022Z","submitted_at":"2020-10-21T23:40:26Z","title":"LSTM-LM with Long-Term History for First-Pass Decoding in Conversational Speech Recognition","version":1},"cited_work":{"arxiv_id":"2010.11349","doi":null,"metadata_source":"pith","pith_arxiv_id":"2010.11349","snapshot_observed_at":"2026-08-05T20:31:49.686003Z","title":"LSTM-LM with Long-Term History for First-Pass Decoding in Conversational Speech Recognition","venue":"cs.CL","work_id":"997a796d-649d-4bc5-9343-0bf88dc00493","year":2020},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:41.984032Z"},"links":{"cited_paper":"/paper/2010.11349","citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:06445aa0e0a52ea8ba94e33ebc794c60e143e22463e66b710f6ddc45fa9c1fa5","observation_id":"d274690e-fcbd-4c06-aefb-1596b24930c2","resolution":{"observed_at":"2026-08-05T20:31:49.827274Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:00.771072Z","title":"Session-level language modeling for conversational speech,","venue":null,"work_id":"1681a762-288a-4eb9-9a7f-3ecd76268915","year":2018},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:42.099735Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:ac264df04bcef24bbb029d3d53bb2ab70653c51cff6e9fc3f85dad8803c2d168","observation_id":"a44c5369-b7b4-4c4f-938f-b250fe31b8f0","resolution":{"observed_at":"2026-08-05T20:32:00.851580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:00.447451Z","title":"Transformer-xl: attentive language models beyond a fixed-length context,","venue":null,"work_id":"c2e1913c-ac8f-4774-a6b3-b3f028edd8a7","year":2019},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:42.175833Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:757d760802e7d323ef71c60d8ed6ee30708458ab0630f91d94f5a095a6ae988c","observation_id":"1a018f5b-d065-4fb8-9e11-3bc6c34ad837","resolution":{"observed_at":"2026-08-05T20:32:00.636395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:32:00.062920Z","title":"End-to-end speech recognition on conversations,","venue":null,"work_id":"5a3347b3-3d1a-4d9d-a18a-9765942293cf","year":2019},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:42.289439Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:86af840c45d8527ad843fb7fdd2607e24fbb9dc345fba582546e9d74c6dfbeca","observation_id":"de503af8-0a5f-4b5b-8e64-72b83282e881","resolution":{"observed_at":"2026-08-05T20:32:00.225580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:59.702981Z","title":"Contextualizing ASR lattice rescoring with hybrid pointer network language model,","venue":null,"work_id":"fec24a10-7a04-4a70-8ceb-d55da33a6770","year":2020},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:42.363244Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:be77727dfbc1a33acedd9856b0a6d76283ceed00c955f3c070c1c724d3a86c49","observation_id":"20aad9f9-3f85-4409-9fd3-f433b7213289","resolution":{"observed_at":"2026-08-05T20:31:59.827745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:59.600997Z","title":"Use of contexts in language model interpolation and adaptation,","venue":null,"work_id":"ca8a1deb-5b0b-4666-a8f7-e95160a5c439","year":2013},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:42.455433Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:2319d35ff183bcafe3f7cccfee4f9f1d3ce7d27816bdc599b173485d28009970","observation_id":"893e0851-d763-4751-9ca6-b08b2789e449","resolution":{"observed_at":"2026-08-05T20:31:59.689635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-05T20:31:42.516968Z","title":"Longformer: the long-document transformer,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:42.516968Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:fac408e778f8e40ab753b34cdf5db84b100e6462c1682cd09f092cfc996f0797","observation_id":"4a711db4-3544-43ce-89b3-b878233fdb68","resolution":{"observed_at":"2026-08-05T20:31:42.516968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:59.453609Z","title":"Transformer language models with lstm-based cross- utterance information representation,","venue":null,"work_id":"15aed1f6-5904-41ae-b186-bf2346e9af16","year":2021},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:42.603756Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:2e22fa50528bd403f05ed179ff99eef512a2d5c6edd1653fb9be5ce3b44d3669","observation_id":"29dfea9b-e96d-4063-8f0c-75fe30248ea4","resolution":{"observed_at":"2026-08-05T20:31:59.523332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:59.276839Z","title":"Ctc-assisted llm-based contextual asr,","venue":null,"work_id":"61df261f-042b-4921-af8c-a4cc74798447","year":2024},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:42.670064Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:d8b67f72e5510c30e07b3c9894aa5098ca594df641c2524ac33564d25765bab7","observation_id":"9d5d7fc7-5001-4462-9ccb-d1aa6801088e","resolution":{"observed_at":"2026-08-05T20:31:59.365324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04675","last_updated":"2024-07-10T09:01:17Z","snapshot_observed_at":"2026-07-06T18:42:05.670928Z","submitted_at":"2024-07-05T17:38:03Z","title":"Seed-ASR: Understanding Diverse Speech and Contexts with LLM-based Speech Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04675","snapshot_observed_at":"2026-08-05T20:31:42.749315Z","title":"Seed-asr: Understanding diverse speech and contexts with llm-based speech recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:42.749315Z"},"links":{"cited_paper":"/paper/2407.04675","citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:f50207be4dfc91308889fa0706fbd99c804578a9c155ae70ae85a9482677ac73","observation_id":"49e04d82-0591-4a2b-bcfa-165cee1248a3","resolution":{"observed_at":"2026-08-05T20:31:42.749315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:59.107172Z","title":"Contextual asr error handling with llms augmentation for goal-oriented conversational ai,","venue":null,"work_id":"d412c0b4-6e42-47eb-8cdd-3ab37c78cb54","year":2025},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:42.859181Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:b17caf01f46de6d474e6e114f57e79d9be2691d7826862b7c2a442fa2d02a2c4","observation_id":"40e7f0d3-ce42-4085-9876-cddf36846caf","resolution":{"observed_at":"2026-08-05T20:31:59.195690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:58.945314Z","title":"Towards asr robust spoken language understanding through in-context learning with word confusion networks,","venue":null,"work_id":"aea767de-08d4-4ae1-936a-6296a15859fd","year":2024},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:42.920140Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:5b5b334dc1564c617e110ba0ccb935fe8fb9df76310ec891eff6dd3c44fe785e","observation_id":"091432e8-62b9-48a7-86de-4e49e62bfb26","resolution":{"observed_at":"2026-08-05T20:31:59.005515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:58.816094Z","title":"Contextualization of asr with llm using phonetic retrieval- based augmentation,","venue":null,"work_id":"3e3fa4c8-60ad-4988-943f-27108b220536","year":2025},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:43.000136Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:f45821a8bd4a054f960f288baca2afff8e6fbad2185e30aeb72779ecf4045b25","observation_id":"14d87e6b-ea9c-43bd-a846-96e9386cd530","resolution":{"observed_at":"2026-08-05T20:31:58.856857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:58.673008Z","title":"End-to-end speech recognition contextualization with large language models,","venue":null,"work_id":"0da5fb43-6db9-40f8-84fb-906487ca436b","year":2024},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:43.104408Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:2c27b10b662d8a6d0773f2ca04ce28edb4fb853edbb4c8a6f7b2b0e23263ffd2","observation_id":"fd7b20e2-e5d2-4c48-8491-71acd464f171","resolution":{"observed_at":"2026-08-05T20:31:58.746831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:58.503317Z","title":"Improving domain-specific asr with llm-generated contextual descriptions,","venue":null,"work_id":"9d40e7b6-3e24-474d-b142-4ee721f10d30","year":2024},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:43.219288Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:81b0c28f5c6540eba971471850147354cd4de3538ca82a4449bf5452be428b75","observation_id":"91402f0c-236e-4798-b02d-1be9e1a24467","resolution":{"observed_at":"2026-08-05T20:31:58.599667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05839","last_updated":"2024-06-13T07:50:40Z","snapshot_observed_at":"2026-07-06T18:27:50.189771Z","submitted_at":"2024-06-09T16:00:00Z","title":"MaLa-ASR: Multimedia-Assisted LLM-Based ASR","version":2},"cited_work":{"arxiv_id":"2406.05839","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.05839","snapshot_observed_at":"2026-08-05T20:31:49.402658Z","title":"MaLa-ASR: Multimedia-Assisted LLM-Based ASR","venue":"eess.AS","work_id":"fda83a26-a1ca-47a4-8118-17a5b8d74d02","year":2024},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:43.295375Z"},"links":{"cited_paper":"/paper/2406.05839","citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:0aab997746ffa0840fc03314500c2ef9636b6dc7aea747fc87149a07c01ad09b","observation_id":"e5436655-70a5-4320-af73-a6360e8e52d1","resolution":{"observed_at":"2026-08-05T20:31:49.498400Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:58.317552Z","title":"Contextualized speech recognition: rethinking second- pass rescoring with generative large language models,","venue":null,"work_id":"737a6709-64e6-487e-affb-d8838645730a","year":2024},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:43.373827Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:5af0bf5e2116452ac15d39a82900bf37a18fde72eb38b2e05a302a781348a516","observation_id":"fde25a80-3665-471e-971e-2ca0bdc51efe","resolution":{"observed_at":"2026-08-05T20:31:58.403844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:58.186759Z","title":"Improving speech recognition with prompt-based contextualized asr and llm-based re-predictor,","venue":null,"work_id":"2bdafeef-b122-4977-a024-2f4615954fb8","year":2024},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:43.456893Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:8c37e77a7dbfcb04be4737511c37e415ce06fd9113e19cb1c7ae3a1a4cf556e9","observation_id":"4eecbe69-a9bd-41d0-9f06-79167b1a6412","resolution":{"observed_at":"2026-08-05T20:31:58.237641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11382","last_updated":"2024-06-06T05:39:50Z","snapshot_observed_at":"2026-08-06T01:59:28.262628Z","submitted_at":"2024-01-21T03:15:05Z","title":"Using Large Language Model for End-to-End Chinese ASR and NER","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.11382","snapshot_observed_at":"2026-08-05T20:31:43.555162Z","title":"Using large language model for end-to-end chinese asr and ner,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:43.555162Z"},"links":{"cited_paper":"/paper/2401.11382","citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:1fb98391ddd3669db7f9b4bd98c7aa64b0aa91aa1812b166304c21df2249b3d9","observation_id":"af0de628-c71a-4cc2-94db-f74b2e7f04d3","resolution":{"observed_at":"2026-08-05T20:31:43.555162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-05T20:31:43.616971Z","title":"Compressive Transformers for Long-range Sequence Modelling,","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:43.616971Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:1a089b0f780139bbf8b348c8f532dee5f27a0e6b7f324c823d01f368fb310532","observation_id":"cdcaf6aa-a5b6-4586-b7a8-9ab090614695","resolution":{"observed_at":"2026-08-05T20:31:43.616971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:58.015310Z","title":"Speaker-aware Speech-transformer,","venue":null,"work_id":"82c65679-8d62-49c0-8259-3a2fd665558d","year":2019},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:43.710776Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:f577091a3339fccd2be193218bf93793713913fc375dcda515cb6631c4342ab1","observation_id":"4d49d666-82cd-4600-a11c-daaf11c69055","resolution":{"observed_at":"2026-08-05T20:31:58.090493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:57.881707Z","title":"Transformer ASR with Contextual Block Process- ing,","venue":null,"work_id":"c5ce6e45-8525-4424-b42b-3b8473b27bde","year":2019},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:43.789641Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:ff4872d12b8ca9e9284d1ad942f3005fe7576787039608000fe6d39cca4ca696","observation_id":"a151e8a4-7ff0-434a-9d7a-4e0a24c7906e","resolution":{"observed_at":"2026-08-05T20:31:57.946512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:57.750553Z","title":"Transformer-based long-context end-to-end speech recognition","venue":null,"work_id":"c5bdb0d2-dd0c-423e-a3f5-d3bb7dd86b4a","year":2020},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:43.856177Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:d6f6aa8ce04f4bbe46b7983782fe89d68bb9c9dcca22d1b671cd42bd18be4e60","observation_id":"c9307482-10d9-4ae7-bc12-dbcab7aa9904","resolution":{"observed_at":"2026-08-05T20:31:57.806972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:57.596791Z","title":"Advanced long-context end-to-end speech recognition using context-expanded transformers,","venue":null,"work_id":"fd30fa84-486c-4d25-a837-89bd67735b32","year":2021},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:43.939035Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:8be9494ac8ebbf7689820d9c30784a03d049d5de51394cecc6cdef83988a55eb","observation_id":"24bdc12b-946d-40df-a2f9-8cf21cc5a672","resolution":{"observed_at":"2026-08-05T20:31:57.684237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:57.473641Z","title":"Context-aware end-to-end asr using self-attentive embedding and tensor fusion,","venue":null,"work_id":"bdded32b-6df0-4490-86a3-d5ae1c04132b","year":2023},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:44.010039Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:10175c386e9942ff76bdcdc079953604eb4d3eee023692f1d556f195775a0ee6","observation_id":"89b091be-dc99-4f00-a415-0b62fc89a353","resolution":{"observed_at":"2026-08-05T20:31:57.527917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:57.286208Z","title":"Longfnt: Long-form speech recognition with factorized neural transducer,","venue":null,"work_id":"dff48a50-7728-4486-83a2-7e912fa9c8cf","year":2023},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:44.107285Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:c5b10788f34bf7e24662d2241caa2da9e519a60973316c2fe6870148f520dc63","observation_id":"97cf2b87-6708-4372-9ff2-d8c13f6f46ce","resolution":{"observed_at":"2026-08-05T20:31:57.374355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:57.132168Z","title":"Advanced long-content speech recognition with factorized neural transducer,","venue":null,"work_id":"a902e153-3d4c-4608-a85a-0cb6f75f1d8e","year":2024},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:44.172636Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:0c17d8d25d729a9c490c66712568eff19046df225e5a953c105c7be60d7c10dc","observation_id":"9bf31ccf-200c-406b-bb7e-aaf0ef13288c","resolution":{"observed_at":"2026-08-05T20:31:57.213167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.11604","last_updated":"2019-06-27T13:10:37Z","snapshot_observed_at":"2026-07-06T08:03:14.995336Z","submitted_at":"2019-06-27T13:10:37Z","title":"Gated Embeddings in End-to-End Speech Recognition for Conversational-Context Fusion","version":1},"cited_work":{"arxiv_id":"1906.11604","doi":null,"metadata_source":"pith","pith_arxiv_id":"1906.11604","snapshot_observed_at":"2026-08-05T20:31:49.055486Z","title":"Gated Embeddings in End-to-End Speech Recognition for Conversational-Context Fusion","venue":"cs.CL","work_id":"577114c2-209c-4369-89e3-7a43fd1479e6","year":2019},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:44.256170Z"},"links":{"cited_paper":"/paper/1906.11604","citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:6011f576eecd9e910d82916d0be6948221e874d2b21ad06fa95139020cb50d03","observation_id":"288a580c-37a1-4974-87da-c5a9a22e0703","resolution":{"observed_at":"2026-08-05T20:31:49.180696Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:56.976083Z","title":"Dialog-context aware end-to-end speech recognition,","venue":null,"work_id":"5e31b82c-a56b-4160-afa6-30c5e0cdf2b4","year":2018},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:44.339765Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:38900fd7d6faa63557217919274689598c2eab813845bf943d7217f527aad9ea","observation_id":"dace3c57-6b23-4716-b1f7-579469cae9fa","resolution":{"observed_at":"2026-08-05T20:31:57.039618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.10538","last_updated":"2021-06-15T15:49:49Z","snapshot_observed_at":"2026-08-06T07:22:24.804206Z","submitted_at":"2020-11-20T18:16:04Z","title":"Improving RNN-T ASR Accuracy Using Context Audio","version":3},"cited_work":{"arxiv_id":"2011.10538","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.10538","snapshot_observed_at":"2026-08-05T20:31:48.705165Z","title":"Improving RNN-T ASR Accuracy Using Context Audio","venue":"eess.AS","work_id":"bdc75459-87fe-40cf-8d0b-abbbe52d9203","year":2020},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:44.437262Z"},"links":{"cited_paper":"/paper/2011.10538","citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:bfcc6ddf4234048e3d480d164d41ecf443b2f314c4f9ad911222380b1e3ad8af","observation_id":"500088fc-abbc-4dc7-970a-27a59f22f618","resolution":{"observed_at":"2026-08-05T20:31:48.854090Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:56.835490Z","title":"Large-context automatic speech recognition based on rnn transducer,","venue":null,"work_id":"7a4a5d4c-e94c-49f0-b5af-686d6d0fa75b","year":2021},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:44.553967Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:bc3d3fc24d1de20e7347c11bda9a6ad5f00a6f2a88cf60fa06ad8bdc31748629","observation_id":"58ce565f-11bf-4f36-af09-e80c3f164fc3","resolution":{"observed_at":"2026-08-05T20:31:56.894247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:56.680280Z","title":"Phoneme-aware encoding for prefix-tree-based contextual asr,","venue":null,"work_id":"c5adf6b5-3ab8-403e-be75-a6c32f865416","year":2024},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:44.635612Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:1f21b3659b3a13ffd7b51bda442c7fa747945d9d1b8e1de9b57abdf8be9b5114","observation_id":"15b7a962-8d94-426f-92b8-22bd2eff6411","resolution":{"observed_at":"2026-08-05T20:31:56.762269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10180","last_updated":"2024-04-23T13:43:26Z","snapshot_observed_at":"2026-07-06T18:00:39.863947Z","submitted_at":"2024-04-15T23:28:13Z","title":"Deferred NAM: Low-latency Top-K Context Injection via Deferred Context Encoding for Non-Streaming ASR","version":2},"cited_work":{"arxiv_id":"2404.10180","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.10180","snapshot_observed_at":"2026-08-05T20:31:48.395519Z","title":"Deferred NAM: Low-latency Top-K Context Injection via Deferred Context Encoding for Non-Streaming ASR","venue":"cs.CL","work_id":"0556daa6-9005-442f-abc4-7382760622b2","year":2024},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:44.729117Z"},"links":{"cited_paper":"/paper/2404.10180","citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:cfdcabc6017ef012dd9acdc5d6d9e7e7a8f00303ff14fca18e8a014d1ca86a59","observation_id":"35ac3e39-c498-464b-8d23-00baa8686d08","resolution":{"observed_at":"2026-08-05T20:31:48.551140Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:56.553702Z","title":"Contextualized end-to-end speech recognition with contextual phrase prediction network,","venue":null,"work_id":"49c28724-571c-4772-8800-53991c74fdc0","year":2023},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:44.809319Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:e7dde43ab6ede05d0d6c5735e002ff342be698dad3fd3a9e52acc37e7d8b7dd4","observation_id":"93f9e98f-fa5e-4f4c-a78a-0cc1a17b62a3","resolution":{"observed_at":"2026-08-05T20:31:56.611543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:56.398074Z","title":"Semi-autoregressive streaming asr with label context,","venue":null,"work_id":"1e84bc5d-d97f-4d24-9ef4-2daf472438a5","year":2024},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:44.893812Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:94ad2bad7a8c92a6d037e400d953b588c44928ee8d1cdead4de6e28711763a95","observation_id":"90f4525e-4987-4c89-9d6d-2f4f2e527839","resolution":{"observed_at":"2026-08-05T20:31:56.459164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:56.263063Z","title":"Context-aware transformer transducer for speech recognition,","venue":null,"work_id":"cf73c02a-2dac-4957-a389-bb4eb025610d","year":2021},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:44.983848Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:899d573744925d73c82ca5fb600be039ac7283a4253930c4686be5cfd76e688a","observation_id":"8e0f3d92-8326-49b5-b0de-56fd29b0fb72","resolution":{"observed_at":"2026-08-05T20:31:56.309374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:56.129861Z","title":"Towards effective and compact contextual representation for conformer transducer speech recognition systems,","venue":null,"work_id":"c3efe5b0-7b9a-4e82-96bd-b919f33a5180","year":2023},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:45.047116Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:098b1bc6ae5ca7080c3f9ab953c8a683a68a7d132742868aee8a53d563205820","observation_id":"10454637-34e0-4bc5-a807-76b2982a8845","resolution":{"observed_at":"2026-08-05T20:31:56.180065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:55.972105Z","title":"Wav2vec 2.0: a framework for self-supervised learning of speech representations,","venue":null,"work_id":"8d90b876-ee9c-4ebb-9dbf-150ffaf15efb","year":2020},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:45.119425Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:dc01c8c210e7aced8cfe4c0fecc5fb3b5159fd56b95969488050a2ce3d777e2a","observation_id":"3c8d4152-b711-4728-aacd-1b96368900e8","resolution":{"observed_at":"2026-08-05T20:31:56.044753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:55.837081Z","title":"Wavlm: large-scale self-supervised pre-training for full stack speech processing,","venue":null,"work_id":"092e822b-8743-44a3-bb34-1822ff610ae5","year":2022},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:45.187611Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:ce269588fe92ebda66360b39dbeb801b97498663ff912c88dbad641b0281818c","observation_id":"5701ae8b-ddff-49f9-80a5-e7d78d2fd852","resolution":{"observed_at":"2026-08-05T20:31:55.898704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:55.633463Z","title":"Hubert: Self-supervised speech representation learn- ing by masked prediction of hidden units,","venue":null,"work_id":"9faa19b2-e64c-4d15-8470-3b35c8ffa15e","year":2021},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:45.269084Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:cdfc3f445d2562ca31d432e1582f871983aa5e7818182a79cf33af01c3a9a659","observation_id":"3816819a-e1c4-41b2-91fc-8eda76b5cfc6","resolution":{"observed_at":"2026-08-05T20:31:55.727367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:55.462778Z","title":"data2vec: A General Framework for Self-supervised Learning in Speech, Vision and Language,","venue":null,"work_id":"2257f352-3761-4469-9bc9-8141729abb3c","year":2022},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:45.364942Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:5d253ca0fd13dd5d02399913a8238ef16898652771af1d82bd113c25e69aa526","observation_id":"d25de274-8d78-40ef-8a6c-2c55cd28f302","resolution":{"observed_at":"2026-08-05T20:31:55.559832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:55.308105Z","title":"XLS-R: Self-supervised Cross-lingual Speech Repre- sentation Learning at Scale,","venue":null,"work_id":"9357c9bb-9fbc-4348-b5ff-3b6594cd20ab","year":2022},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:45.431578Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:9d8f077157bd075f70991919d657a35fe96c3c326bebdd25b0b6c27a7e996d79","observation_id":"1b8b7bd8-9bc8-49d5-8bcf-a14c1f119d77","resolution":{"observed_at":"2026-08-05T20:31:55.366817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:55.130820Z","title":"Data2vec: A general framework for self-supervised learning in speech, vision and language,","venue":null,"work_id":"ce855120-6839-4242-86cc-ef873ba0e7ef","year":2022},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:45.508204Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:cd030dd91f8d554cb42208b9089460e8dd40f05df65be0e7dc266fa6d2f92ca5","observation_id":"6d1bce3b-7bed-4b95-a086-62e88057544f","resolution":{"observed_at":"2026-08-05T20:31:55.203752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:54.941333Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":"9a377e82-567b-454f-9603-7bc84ffb9142","year":2023},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:45.576141Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:8baf696522055f95ac81b78c4348c765f3df7d6a364b6583dc51192ed352e30a","observation_id":"2f732a3c-5b53-4682-ad90-78c29eb96669","resolution":{"observed_at":"2026-08-05T20:31:55.018209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.01038","last_updated":"2019-04-01T18:05:02Z","snapshot_observed_at":"2026-08-06T00:26:50.886840Z","submitted_at":"2019-04-01T18:05:02Z","title":"fairseq: A Fast, Extensible Toolkit for Sequence Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.01038","snapshot_observed_at":"2026-08-05T20:31:45.668112Z","title":"Fairseq: A fast, extensible toolkit for sequence model- ing,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:45.668112Z"},"links":{"cited_paper":"/paper/1904.01038","citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:826602e783e3e7a1ba0a174a4f47fc213d92ef2a154b71afb01dba40af997c31","observation_id":"d1bf3b75-9894-4e2f-9d00-f8bb23dc60eb","resolution":{"observed_at":"2026-08-05T20:31:45.668112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11230","last_updated":"2024-04-10T02:35:38Z","snapshot_observed_at":"2026-07-06T16:34:31.299748Z","submitted_at":"2023-10-17T13:01:10Z","title":"Zipformer: A faster and better encoder for automatic speech recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11230","snapshot_observed_at":"2026-08-05T20:31:45.751156Z","title":"Zipformer: A faster and better encoder for automatic speech recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:45.751156Z"},"links":{"cited_paper":"/paper/2310.11230","citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:c6efe3886de28c5e4367bddaaf69f3f488a9324870f3f8acea074ab6c97c9f09","observation_id":"e171fbec-8b85-4df6-ac32-35cbfffa24d1","resolution":{"observed_at":"2026-08-05T20:31:45.751156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:54.783421Z","title":"ESPnet: End-to-End Speech Processing Toolkit,","venue":null,"work_id":"95cb58eb-722c-4675-92dd-32d0c5000b97","year":2018},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:45.863510Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:f97c9e55bc0aa4bf8167aae655ea7a155daca3a7e806ce5a65ae14703e5fbc64","observation_id":"d7e200e4-be8f-4994-bed1-132c5b6756fa","resolution":{"observed_at":"2026-08-05T20:31:54.878240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-07-06T11:18:44.145746Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-05T20:31:45.946423Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10k hours of transcribed audio,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:45.946423Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:9ad64c9bfe20e4f56576583950d826fded3cbc4352c52ff587fcd43096f2021e","observation_id":"0a05ab93-c5b3-4b3c-9891-049835cbe534","resolution":{"observed_at":"2026-08-05T20:31:45.946423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:54.610031Z","title":"Wenetspeech: A 10000+ hours multi-domain man- darin corpus for speech recognition,","venue":null,"work_id":"5fa45e45-05ad-4c38-8f69-1c16286a0249","year":2022},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:46.004011Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:d2082f1376f767fa37f84959c52dae8e58c8f3b5c6bd63a09bb1227b989ebf21","observation_id":"bf08cde8-13d4-4769-93f2-da483918513b","resolution":{"observed_at":"2026-08-05T20:31:54.678706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:54.433640Z","title":"The natural history of alzheimer’s disease: description of study cohort and accuracy of diagnosis,","venue":null,"work_id":"e084fb15-e77e-4286-ba4b-325191f1502c","year":1994},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:46.098424Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:b788532638e3159a6168e6da8c61440741a64ab89deba183474b1bf0c251ab71","observation_id":"41321727-56bf-411a-a94d-3d2ea0de4481","resolution":{"observed_at":"2026-08-05T20:31:54.500000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:54.258302Z","title":"Speaker turn aware similarity scoring for diarization of speech-based cognitive assessments,","venue":null,"work_id":"4b0eba98-6692-4300-863d-7c49a87cf334","year":2021},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:46.188228Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:9cd88b74dbda2457996fd2479c55e37c9fff235e05989f2d617e952305dd1d1a","observation_id":"877244d9-6847-4c06-97dc-e304f44a1a21","resolution":{"observed_at":"2026-08-05T20:31:54.337853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:54.075394Z","title":"Self-supervised asr models and features for dysarthric and elderly speech recognition,","venue":null,"work_id":"a93264dd-1578-4a42-b008-8c07af2e0b2b","year":2024},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:46.265388Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:04b97436315d26282a17bef5b8f9e9f33a0bb094f0508073c37b4a25d492d388","observation_id":"f96dc9c6-d6f3-4266-81f9-4c88cbab1a89","resolution":{"observed_at":"2026-08-05T20:31:54.172237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:53.918028Z","title":"Developing real-time streaming transformer transducer for speech recognition on large-scale dataset,","venue":null,"work_id":"36f07f04-5841-4899-ace4-ec7892c0218c","year":2021},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:46.350732Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:ee2d6e1d9871834e8784fd5e1d97b4df6e183b86208531c6e4209ed81a5f6537","observation_id":"fffb07a8-d62b-4a14-b776-a01fae785d9e","resolution":{"observed_at":"2026-08-05T20:31:53.979937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:53.709182Z","title":"Transformer transducer: a streamable speech recog- nition model with transformer encoders and RNN-T loss,","venue":null,"work_id":"a5e15dd3-6c88-458b-9902-ef0645a3949b","year":2020},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:46.434543Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:456f038032f74bc989c575fc45cdbf4ef90cdae7cf28711522a83f07bbfe5eaa","observation_id":"6a90f7b1-9a5d-412f-bc2f-ffe669f11b70","resolution":{"observed_at":"2026-08-05T20:31:53.827935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.12977","last_updated":"2019-10-28T21:29:21Z","snapshot_observed_at":"2026-07-06T08:32:54.818165Z","submitted_at":"2019-10-28T21:29:21Z","title":"Transformer-Transducer: End-to-End Speech Recognition with Self-Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.12977","snapshot_observed_at":"2026-08-05T20:31:46.546745Z","title":"Transformer-transducer: end-to-end speech recogni- tion with self-attention,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:46.546745Z"},"links":{"cited_paper":"/paper/1910.12977","citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:5c3a7504bff07af91a5bc764943d578fd2a7a08619bc0f1bc731f567a5428567","observation_id":"9a4deac2-3a99-4335-b266-c56ae1695911","resolution":{"observed_at":"2026-08-05T20:31:46.546745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:53.511195Z","title":"Language modeling with gated convolutional networks,","venue":null,"work_id":"c8f1542f-9fa7-4b0e-a340-5d77efd50c3b","year":2017},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:46.629844Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:0a2f119ab65177dd120c9c46b85c0ffa01ef4bc48336b0d2dce36e1b107e723d","observation_id":"9cd3241e-12b5-4540-9b0d-224aa63924af","resolution":{"observed_at":"2026-08-05T20:31:53.598121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1602.03609","last_updated":"2016-02-11T03:06:33Z","snapshot_observed_at":"2026-08-02T16:03:57.821528Z","submitted_at":"2016-02-11T03:06:33Z","title":"Attentive Pooling Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.03609","snapshot_observed_at":"2026-08-05T20:31:46.700394Z","title":"Attentive pooling networks,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:46.700394Z"},"links":{"cited_paper":"/paper/1602.03609","citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:3b2f42eb8c6feadfb333796b414b7b7003562e914e57836c4a038bdd8f57c22a","observation_id":"ead4386f-fbc7-462c-87c3-4eb7b118fbc1","resolution":{"observed_at":"2026-08-05T20:31:46.700394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:53.357430Z","title":"Alzheimer’s Dementia Recognition Through Sponta- neous Speech: The ADReSS Challenge,","venue":null,"work_id":"20cc707f-675f-4ad5-9fe6-02b9b8281340","year":2020},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:46.810510Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:d6491eb8c79f61cb50444d40329e3adf472d2b889db1499cbddf590d3856defd","observation_id":"0ae1fd88-4d05-4373-bcbd-1ce6a34afdb4","resolution":{"observed_at":"2026-08-05T20:31:53.437465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:53.233913Z","title":"Development of the cuhk elderly speech recognition system for neurocognitive disorder detection using the dementiabank corpus,","venue":null,"work_id":"1844c2e2-2da4-4d35-89fb-05d10f67872b","year":2021},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:46.871585Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:6c2855a2593248f7675d454be76c71f0c72cac4b995cca9594a33b1c32bf11bf","observation_id":"bf71d3d1-869a-41fa-8a5f-4ea6c3ede40d","resolution":{"observed_at":"2026-08-05T20:31:53.276825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:53.041400Z","title":"Speaker Turn Aware Similarity Scoring for Diarization of Speech-Based Cognitive Assessments,","venue":null,"work_id":"facee184-f1a6-46d7-99cb-fa3f72d784fa","year":2021},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:47.037997Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:8afe3447ab3265265e50a7c577891f7acd6606cb340612cca169f8057a601718","observation_id":"0d376c8b-bcb5-424a-b8d6-1e2a86371335","resolution":{"observed_at":"2026-08-05T20:31:53.119919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:52.876542Z","title":"Speaker adaptation using spectro-temporal deep features for dysarthric and elderly speech recognition,","venue":null,"work_id":"b7b49d44-5e10-4a7c-aa55-9f208af05f90","year":2022},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:47.136299Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:4096bb86c598490182799bc7e8f6dffac6ea9bafaa514a0e40c9cdf39dbfe1e9","observation_id":"d2f7a809-7897-40ff-8f05-8ffa777f06f6","resolution":{"observed_at":"2026-08-05T20:31:52.961044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:52.718936Z","title":"Some statistical issues in the comparison of speech recognition algorithms,","venue":null,"work_id":"432927d6-133d-439e-b894-371620298ac7","year":1989},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:47.141110Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:7bb359a818ae51a42f2e96492c945fa43a565174dbc250b77c36e4bff4caaaf7","observation_id":"6b58fa7c-73a7-4d23-bdf8-1f82f5f72748","resolution":{"observed_at":"2026-08-05T20:31:52.783057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:52.539318Z","title":"SpecAugment: A Simple Data Augmentation Method for Automatic Speech Recognition,","venue":null,"work_id":"fc589bb1-eb0c-45dd-aa13-90e75544a0b0","year":2019},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:47.221732Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:fb3c470127f55433bfe7de8a7f982f8fe8831fe7defa040d924a7e692414f024","observation_id":"b9a8482f-8ffd-4bea-ac15-1162bb3c1154","resolution":{"observed_at":"2026-08-05T20:31:52.623835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:52.315259Z","title":"Tools for the analysis of benchmark speech recognition tests,","venue":null,"work_id":"1702cca7-03cb-43fa-baf7-f1bcd48075c1","year":1990},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:47.380300Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:6af7e99e4527bb221382a312edd865bcd2db67fc3974058cc3d9146d4db39f0a","observation_id":"4c969da5-5255-4ec0-93e0-c7c517cc5419","resolution":{"observed_at":"2026-08-05T20:31:52.403485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:52.113223Z","title":"Exploiting Cross-domain And Cross-Lingual Ultrasound Tongue Imaging Features For Elderly And Dysarthric Speech Recog- nition,","venue":null,"work_id":"38318c9c-f7b5-48fe-997a-d673668fd2b3","year":2023},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:47.521344Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:a3d75e314c52886c50c6cf8353f522e65d0cad36d60a41515f4074428423e0ad","observation_id":"44c0c64e-9953-4c8c-8a7e-eb64a6067c21","resolution":{"observed_at":"2026-08-05T20:31:52.219031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:51.946286Z","title":"Homogeneous speaker features for on-the-fly dysarthric and elderly speaker adaptation and speech recognition,","venue":null,"work_id":"d6772896-2229-4dea-ad31-117cec6c0028","year":2025},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:47.653179Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:926552a3c8d7ea97354bfbc8d80c75e512b3e557426b4221a31d2551aea30243","observation_id":"ff45c5f5-5b0f-4e81-8a1a-ce0dfad35a06","resolution":{"observed_at":"2026-08-05T20:31:52.029574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:51.738202Z","title":"Bayesian Parametric and Architectural Domain Adap- tation of LF-MMI Trained TDNNs for Elderly and Dysarthric Speech Recognition,","venue":null,"work_id":"a8d2d3c0-5574-4f17-9187-3d83efee6934","year":2021},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:47.808713Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:8e4256af30f042e3a6b9837902bb664d25b0c2fc2d7a50e413bd60f32194ba0d","observation_id":"bc9f7db8-6cba-4681-9c3c-de2bb60715e9","resolution":{"observed_at":"2026-08-05T20:31:51.813760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:51.527462Z","title":"Conformer Based Elderly Speech Recognition System for Alzheimer’s Disease Detection,","venue":null,"work_id":"20216d8a-509f-454c-a942-0a312e5eba46","year":2022},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:48.005043Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:affa369f488a25e7569f5a65f67cb086840621d01ba49059e723796348a868bb","observation_id":"65f23f34-7a71-4544-b5e4-7a1fe7f6ee55","resolution":{"observed_at":"2026-08-05T20:31:51.616251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:31:51.342477Z","title":"Hyper-parameter Adaptation of Conformer ASR Sys- tems for Elderly and Dysarthric Speech Recognition,","venue":null,"work_id":"4b06a506-7787-4012-a757-5c0ed90aa4b3","year":2023},"citing_paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-05T20:31:48.143276Z"},"links":{"citing_paper":"/paper/2508.10456"},"observation_digest":"sha256:4186f57e0760aabff396cba7e0f8586e0e1b323c853e14a5cc0e9022d0e18db9","observation_id":"fc64bde5-cc7b-458a-adf0-b7ea595b99f4","resolution":{"observed_at":"2026-08-05T20:31:51.418413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.10456","last_updated":"2025-08-14T08:54:01Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-06T01:59:45.774540Z","submitted_at":"2025-08-14T08:54:01Z","title":"Exploring Cross-Utterance Speech Contexts for Conformer-Transducer Speech Recognition Systems"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":11,"verified_fuzzy":57},"total_outbound_references":100},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 100 of 100 outbound references and 0 inbound Pith citation observations for arXiv:2508.10456."}